Infrastruktur-Ingenieur (m/w/d) Industrial AI Cloud
Indexed description
Hauptaufgaben
- Koordination des Betriebs mit Rechenzentrum-Teams: Koordinierung und Unterstützung von Hardware-Lifecycle-Aktivitäten (Installationen, GPU-Upgrades, Storage-Erweiterungen, Firmware-Updates) und Verwaltung von Server-/Netzwerkverbindungen und zugehöriger Dokumentation (NetBox).
- Server- & Node-Management: Bereitstellung und Wartung von Bare-Metal-Servern und GPU-Nodes (PXE-Boot, OS-Installationen, Firmware-Updates).
- Design & Betrieb der NVIDIA KI-bezogenen Infrastruktur-Stack
- Automatisierung & IaC: Entwicklung und Wartung von Ansible- und Terraform-Playbooks zur Automatisierung von Bereitstellung, Konfiguration und Deployments.
- OS- & Firmware-Management: Wartung von Debian-basierten Umgebungen, Anwendung von Patches und Verwaltung von Firmware-Upgrades im großen Maßstab.
- Identity & Access Management: Integration und Wartung von Keycloak, Entra ID / CAIMAN und AD für Benutzerauthentifizierung und -autorisierung.
- Betrieb von KI- & HPC-Workloads: Unterstützung und Betrieb verteilter KI-Workloads in Bare-Metal-Hosts und Kubernetes-Umgebungen.
- Monitoring & Observability: Betrieb von Prometheus- und Grafana-Stacks für proaktives Infrastruktur-Monitoring und Alerting.
- Storage-Administration: Verwaltung von Hochleistungs-Storage-Umgebungen (WEKA by Hitachi).
- ITIL-Prozesse: Befolgung und Verbesserung von Incident-, Problem- und Change-Management-Workflows; Dokumentation von Runbooks und Standard Operating Procedures. Einhaltung der ZERO Outage-Richtlinien.
- Beratung und Bereitstellung von Projektlieferungen zur Erfüllung des Projektumfangs mit Fokus auf den Nvidia-Technologie-Stack.
Muss-Kriterien
- Erfahrung in Hardware-Installation, Wartung und Betrieb
- Fortgeschrittene Kenntnisse in Linux (vorzugsweise Debian) in Produktionsumgebungen
- Praktische Erfahrung mit Infrastructure-as-Code (Ansible, Terraform)
- Kenntnisse der NVIDIA GPU-beschleunigten Server-Plattformen
- Kenntnisse des Nvidia AI Software-Stacks im Zusammenhang mit GPU-Orchestrierung
- Kenntnisse des GPU-basierten Cloud-Plattform-Software-Stacks einschließlich seiner Abhängigkeiten zu darunterliegenden Schichten
- Solides Verständnis von Netzwerk-Grundlagen (IP, Routing, VLANs, DNS, Firewalls und L1, L2)
- Erfahrung mit Identity- und Access-Management-Systemen (Keycloak, Entra ID, LDAP)
- Vertrautheit mit Monitoring-Stacks (Prometheus, Grafana)
- Kenntnisse von Hochleistungs-Speichersystemen
- Praktische Kenntnisse von ITIL-Prozessen (Incident, Problem, Change)
- Ausgeprägte Troubleshooting-Fähigkeiten in einer unternehmenskritischen 24/7-Umgebung
- Ausgeprägte Operational-Support-Fähigkeiten in einer unternehmenskritischen 24/7-Umgebung
- Arbeitsberechtigung in der Europäischen Union zur Erfüllung von Datensicherheits- und Datenschutzanforderungen
- Redfish-Erfahrung
- Kenntnisse von WEKA by Hitachi Speichersystemen
- Erfahrung mit großen GPU-Clustern
- Erfahrung mit HPC-Umgebungen
- Erfahrung mit Rechenzentrumsumgebungen
- Kenntnisse von Sovereign-Cloud-Anforderungen
- Kenntnisse von Datensicherheits- und Compliance-Anforderungen
- Vertrautheit mit Terraform für Infrastrukturänderungen
- Vertrautheit mit GitOps für Infrastrukturänderungen
DT-ITS erhielt 2019 die Auszeichnung „Best in Educational Cooperation" von HIPA und wurde 2019 als ethischstes multinationales Unternehmen anerkannt. Das Unternehmen entwickelt kontinuierlich seine vier Standorte in Budapest, Debrecen, Pécs und Szeged weiter und sucht qualifizierte IT-Fachkräfte, die das Team verstärken.
- Arbeit an Europas erster industrieller KI-Cloud mit modernsten Technologien
- Direkte Zusammenarbeit mit NVIDIA- und Deutsche Telekom-Experten
- Hybrides Arbeitsmodell
- Weiterbildungsmöglichkeiten
- Karriereentwicklung
- Remote-Arbeit ist aufgrund europäischer Steuervorschriften nur innerhalb Ungarns möglich
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search