Platform Engineer (m/w/d) Industrial AI Cloud
Indexed description
Hauptaufgaben
- Betrieb & Weiterentwicklung der Kubernetes-Plattform: Aufbau, Konfiguration und Wartung von Bare-Metal-Hosts und Kubernetes-Clustern für GPU/KI-Workloads.
- Design & Betrieb des NVIDIA KI-bezogenen Software-Stacks (Slurm, Run AI)
- Bereitstellung von maßgeschneidertem Anwendungssupport für KI-bezogene Workloads
- Container-Orchestrierung & Automatisierung: Verwaltung von Helm-Charts, GitOps-Workflows, Ansible-Skripten, möglicherweise Terraform-Code und Automatisierung für die Bereitstellung von Services und KI-Workloads.
- Betrieb von Kubernetes-Workloads: Fungiere als primärer Ansprechpartner für alle Kubernetes-bezogenen Themen, einschließlich Troubleshooting, Performance-Tuning und Skalierung.
- CI/CD & GitOps: Entwicklung und Wartung von CI/CD-Pipelines mit Jenkins und GitLab; Implementierung von GitOps-Praktiken für konsistente Deployments und Infrastrukturänderungen.
- Monitoring & Observability: Betrieb und Verbesserung von Prometheus- und Grafana-Monitoring-Stacks für Bare-Metal-Hosts, Kubernetes und Plattform-Services.
- Container-Images & Registries: Erstellung, Optimierung und Absicherung von Container-Images (Docker, Podman); Verwaltung von Registries und Versionierung, Image-Scanning (Trivy).
- Object Storage & Persistent Volumes: Integration und Wartung von Object-Storage-Lösungen für KI-Workloads.
- Betrieb von KI- & HPC-Workloads: Unterstützung und Betrieb verteilter KI-Workloads in Bare-Metal-Hosts und Kubernetes-Umgebungen.
- Zusammenarbeit mit Infrastruktur- & KI-Teams: Enge Koordination mit Infrastructure Engineers, Rechenzentrumsmitarbeitern und KI-Entwicklern, um eine reibungslose Bereitstellung von Services zu gewährleisten.
- ITIL-Prozesse: Einhaltung von Incident-, Problem- und Change-Management-Workflows; Erstellung und Pflege operativer Runbooks. Einhaltung der ZERO-Outage-Richtlinien.
Dein Profil
Wir suchen einen Platform Engineer mit ausgeprägter Expertise in Kubernetes, Container-Orchestrierung, CI/CD-Automatisierung und GPU-beschleunigten AI-Workloads. Der ideale Kandidat sollte nachgewiesene Erfahrung im Betrieb großer Kubernetes-Cluster, in der Implementierung von GitOps-Praktiken und in der Unterstützung von NVIDIA AI-Software-Stacks in Produktionsumgebungen mitbringen.
Muss-Kriterien
- Kubernetes Certified Administrator (CKA) oder gleichwertige Erfahrung in Produktionsumgebungen
- Kenntnisse der NVIDIA GPU-beschleunigten Server-Plattform
- Kenntnisse in Data Engineering, Data Transformation und Data Migration Tools
- Kenntnisse des NVIDIA AI-Software-Stacks im Zusammenhang mit GPU-Orchestrierung
- Kenntnisse des GPU-basierten Cloud-Plattform-Software-Stacks einschließlich seiner Abhängigkeiten zu darunterliegenden Schichten
- Fundierte Erfahrung mit CI/CD-Tools (Jenkins, GitLab)
- Fundierte Erfahrung mit GitOps-Praktiken
- Versiert im Umgang mit Helm Charts und Kubernetes Resource Management
- Scripting/Programmierung in Python oder Bash
- Infrastructure-as-Code-Erfahrung mit Terraform
- Infrastructure-as-Code-Erfahrung mit Ansible
- Erfahrung mit Container-Images (Docker, Podman)
- Erfahrung mit Image-Scanning-Tools
- Vertrautheit mit Object-Storage-Systemen und Persistent-Volume-Management
- Kenntnisse in Monitoring- und Observability-Tools (Prometheus, Grafana)
- Verständnis für den Betrieb von AI/HPC-Workloads im großen Maßstab
- Ausgeprägte Troubleshooting- und Operational-Support-Fähigkeiten in unternehmenskritischen Umgebungen
- Certified Kubernetes Security Specialist (CKS) Zertifizierung
- Fähigkeit, sich wiederholende operative Aufgaben zu automatisieren und Self-Service-Funktionen für Entwickler aufzubauen
- Sicherheitsbewusste Haltung im täglichen Betrieb
- Ausgezeichnete Kommunikations- und teamübergreifende Koordinationsfähigkeiten
DT-ITS erhielt 2019 die Auszeichnung „Best in Educational Cooperation" von HIPA und wurde 2019 als ethischstes multinationales Unternehmen anerkannt. Das Unternehmen entwickelt kontinuierlich seine vier Standorte in Budapest, Debrecen, Pécs und Szeged weiter und sucht qualifizierte IT-Fachkräfte, die Teil des Teams werden möchten.
- Arbeite an Europas erster industrieller KI-Cloud mit modernsten Technologien
- Direkte Zusammenarbeit mit NVIDIA- und Deutsche Telekom-Experten
- Hybrides Arbeitsmodell
- Weiterbildungsmöglichkeiten
- Karriereentwicklung
Die Möglichkeit zur Remote-Arbeit besteht aufgrund europäischer Steuervorschriften nur innerhalb Ungarns.
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search