Senior Site Reliability Engineer
Guldberg GmbH · Raunheim, Hesse, Germany
Apply & track with Apply EdgeIhre Aufgaben:Koordinieren und treiben Sie Aktivitäten im Bereich Site Reliability Engineering (SRE) und Cloud-Betrieb gemeinsam mit den Entwicklungsteams und den Beteiligten voran.Stellen Sie einen stabilen, sicheren und zuverlässigen Betrieb cloudbasierter Anwendungen und Dienste über verschiedene Cloud-Plattformen hinweg (AWS, Alibaba Cloud) sicher.Übernehmen Sie die Verantwortung für kritische Vorfälle (P1/P2), leiten Sie die Ursachenanalyse (RCA) und treiben Sie nachhaltige Abhilfemaßnahmen voran.Verbesserung der Zuverlässigkeit durch Automatisierung, Observability, operative Exzellenz und proaktive Risikominderung.Definition, Überwachung und Berichterstattung von SLIs, SLOs, SLAs und operativen KPIs.Planung und Durchführung von Anwendungs- und Plattform-Updates, Releases, Middleware- und Datenbankänderungen sowie Kubernetes-basierten Bereitstellungen.Koordination und Überwachung von Testaktivitäten, einschließlich Integrations-, Regressions-, Abnahme- und Release-Verifizierungstests.Zusammenarbeit mit Entwicklungs- und Plattformteams, um produktionsreife und ausfallsichere Bereitstellungen sicherzustellen.Unterstützung von NIS2-bezogenen Initiativen in den Bereichen Betriebssicherheit, Überwachung, Vorfallmeldung und Risikomanagement.Förderung der kontinuierlichen Verbesserung in den Bereichen Automatisierung, Skalierbarkeit, Stabilität, Leistung und Zuverlässigkeit.Abstimmung mit den Bereichen Engineering, Architektur, Sicherheit, Kunden und externen Stakeholdern.Betreuung von SRE-Ingenieuren und Weitergabe von Best Practices im Betrieb.Ihre Qualifikationen:5–8+ Jahre Berufserfahrung in den Bereichen Site Reliability Engineering (SRE), Cloud-Betrieb, DevOps oder IT-Betrieb.Umfangreiche praktische Erfahrung mit Cloud-Plattformen, vorzugsweise AWS und/oder Alibaba Cloud.Fundierte Kenntnisse in Linux-Umgebungen, Docker und Kubernetes.Erfahrung mit Incident-, Problem- und Change-Management in Produktionsumgebungen.Erfahrung mit Release-Management, Application Lifecycle Management und Plattformbetrieb.Kenntnisse in den Bereichen Überwachung, Observability, Reliability Engineering und Automatisierung.Erfahrung mit Python, Bash und CI/CD-Pipelines.Fundiertes Verständnis von SLIs, SLOs, SLAs, operativen KPIs und SRE-Methoden.Erfahrung in der Koordination komplexer technischer Themen und in der Zusammenarbeit mit verschiedenen Stakeholdern.Ausgeprägte Kommunikations- und Mentoring-Fähigkeiten.Flüssige Englisch- und Deutschkenntnisse