Site Reliability Engineer - Cloud Infrastructure - STACKIT (m/w/d)
Indexed description
Bei uns arbeitest du an der Schnittstelle zwischen Agilität und Sicherheit: Du profitierst von den schnellen Entscheidungswegen, genießt echte Gestaltungsspielräume in deinen Projekten und baust dabei auf das stabile Fundament der Schwarz Gruppe.
Deine Aufgaben
- Du förderst eine Kultur der Zuverlässigkeit, indem du Engineering-Teams dabei unterstützt, resiliente Services mit minimalem manuellem Aufwand (Toil) zu betreiben.
- Du agierst als Mentor und Advisor, um die „Reliability-First“-Mentalität in den Entwicklungsteams zu verankern.
- Du steuerst das ganzheitliche Vorfallsmanagement – von der akuten Krisenkoordination als Incident Commander bis zur nachhaltigen Fehleranalyse (RCA) zur kontinuierlichen Systemverbesserung.
- Du standardisierst Operations-Prozesse und etablierst den Reliability Score, um die operative Exzellenz gemeinsam mit den Teams nachhaltig zu steigern.
- Du implementierst Werkzeuge zur Messbarkeit und Steuerung von Service Level Objectives (SLOs)
- Du verfügst über ein ausgeprägtes „Reliability-First“-Mindset und verstehst die Balance zwischen Geschwindigkeit und Stabilität.
- Du hast fundierte Erfahrung im Site Reliability Engineering (SRE) und kennst die Prinzipien von SLOs, Error Budgets und Toil-Management.
- Du bist sicher in der Durchführung von Root Cause Analyses (RCA) und der Ableitung von Maßnahmen zur Fehlervermeidung.
- Du besitzt gute Kenntnisse in der Entwicklung von Automatisierungsskripten oder internen Tools (z. B. Python, Go).
- Du hast Freude an der Zusammenarbeit mit verschiedenen Stakeholdern in einer dezentralen, europäischen Organisation.
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search