Back to search
Deutsche Telekom Linkedin · Posted 4d ago

Infrastruktur-Ingenieur (m/w/d) Industrial AI Cloud

Budapest

Linkedin
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

Deine Aufgabe

NVIDIA und die Deutsche Telekom entwickeln gemeinsam die weltweit erste industrielle KI-Cloud für europäische Hersteller. Diese KI-Fabrik in Deutschland wird 10.000 GPUs auf NVIDIA DGX B200-Systemen und RTX Pro Servern hosten. Wir suchen einen Infrastructure Engineer, der die Compute-, Netzwerk- und Storage-Umgebung der Industrial AI Cloud aufbaut, automatisiert und betreibt. In dieser Rolle stellst du Server bereit und wartest sie, verwaltest Netzwerke (auf Server-OS-Ebene) und Storage, automatisierst Deployments, implementierst Monitoring und stellst den zuverlässigen täglichen Betrieb großer GPU-Cluster sicher. Du arbeitest und koordinierst zwischen mehreren Teams, um Infrastruktur-Services bereitzustellen und kontinuierlich zu verbessern, wobei du ITIL-Prozesse befolgst.

Hauptaufgaben

  • Koordination des Betriebs mit Rechenzentrum-Teams: Koordinierung und Unterstützung von Hardware-Lifecycle-Aktivitäten (Installationen, GPU-Upgrades, Storage-Erweiterungen, Firmware-Updates) und Verwaltung von Server-/Netzwerkverbindungen und zugehöriger Dokumentation (NetBox).
  • Server- & Node-Management: Bereitstellung und Wartung von Bare-Metal-Servern und GPU-Nodes (PXE-Boot, OS-Installationen, Firmware-Updates).
  • Design & Betrieb der NVIDIA KI-bezogenen Infrastruktur-Stack
  • Automatisierung & IaC: Entwicklung und Wartung von Ansible- und Terraform-Playbooks zur Automatisierung von Bereitstellung, Konfiguration und Deployments.
  • OS- & Firmware-Management: Wartung von Debian-basierten Umgebungen, Anwendung von Patches und Verwaltung von Firmware-Upgrades im großen Maßstab.
  • Identity & Access Management: Integration und Wartung von Keycloak, Entra ID / CAIMAN und AD für Benutzerauthentifizierung und -autorisierung.
  • Betrieb von KI- & HPC-Workloads: Unterstützung und Betrieb verteilter KI-Workloads in Bare-Metal-Hosts und Kubernetes-Umgebungen.
  • Monitoring & Observability: Betrieb von Prometheus- und Grafana-Stacks für proaktives Infrastruktur-Monitoring und Alerting.
  • Storage-Administration: Verwaltung von Hochleistungs-Storage-Umgebungen (WEKA by Hitachi).
  • ITIL-Prozesse: Befolgung und Verbesserung von Incident-, Problem- und Change-Management-Workflows; Dokumentation von Runbooks und Standard Operating Procedures. Einhaltung der ZERO Outage-Richtlinien.
  • Beratung und Bereitstellung von Projektlieferungen zur Erfüllung des Projektumfangs mit Fokus auf den Nvidia-Technologie-Stack.

Dein Profil

Wir suchen einen Infrastructure Engineer mit umfangreicher Erfahrung in der Linux-Systemadministration, Infrastruktur-Automatisierung und GPU-beschleunigten Computing-Umgebungen. Der ideale Kandidat verfügt über fundierte technische Expertise im Management großer Infrastrukturen, dem NVIDIA-Technologie-Stack und ITIL-Prozessen in unternehmenskritischen Umgebungen.

Muss-Kriterien

  • Erfahrung in Hardware-Installation, Wartung und Betrieb
  • Fortgeschrittene Kenntnisse in Linux (vorzugsweise Debian) in Produktionsumgebungen
  • Praktische Erfahrung mit Infrastructure-as-Code (Ansible, Terraform)
  • Kenntnisse der NVIDIA GPU-beschleunigten Server-Plattformen
  • Kenntnisse des Nvidia AI Software-Stacks im Zusammenhang mit GPU-Orchestrierung
  • Kenntnisse des GPU-basierten Cloud-Plattform-Software-Stacks einschließlich seiner Abhängigkeiten zu darunterliegenden Schichten
  • Solides Verständnis von Netzwerk-Grundlagen (IP, Routing, VLANs, DNS, Firewalls und L1, L2)
  • Erfahrung mit Identity- und Access-Management-Systemen (Keycloak, Entra ID, LDAP)
  • Vertrautheit mit Monitoring-Stacks (Prometheus, Grafana)
  • Kenntnisse von Hochleistungs-Speichersystemen
  • Praktische Kenntnisse von ITIL-Prozessen (Incident, Problem, Change)
  • Ausgeprägte Troubleshooting-Fähigkeiten in einer unternehmenskritischen 24/7-Umgebung
  • Ausgeprägte Operational-Support-Fähigkeiten in einer unternehmenskritischen 24/7-Umgebung
  • Arbeitsberechtigung in der Europäischen Union zur Erfüllung von Datensicherheits- und Datenschutzanforderungen

Von Vorteil

  • Redfish-Erfahrung
  • Kenntnisse von WEKA by Hitachi Speichersystemen
  • Erfahrung mit großen GPU-Clustern
  • Erfahrung mit HPC-Umgebungen
  • Erfahrung mit Rechenzentrumsumgebungen
  • Kenntnisse von Sovereign-Cloud-Anforderungen
  • Kenntnisse von Datensicherheits- und Compliance-Anforderungen
  • Vertrautheit mit Terraform für Infrastrukturänderungen
  • Vertrautheit mit GitOps für Infrastrukturänderungen

Über uns

Als attraktivster Arbeitgeber Ungarns 2025 (laut repräsentativer Umfrage von Randstad) ist Deutsche Telekom IT Solutions eine Tochtergesellschaft der Deutsche Telekom Gruppe. Das Unternehmen bietet mit mehr als 5300 Mitarbeitern ein breites Portfolio an IT- und Telekommunikationsdienstleistungen. Wir haben Hunderte von Großkunden und Konzernen in Deutschland und anderen europäischen Ländern.

DT-ITS erhielt 2019 die Auszeichnung „Best in Educational Cooperation" von HIPA und wurde 2019 als ethischstes multinationales Unternehmen anerkannt. Das Unternehmen entwickelt kontinuierlich seine vier Standorte in Budapest, Debrecen, Pécs und Szeged weiter und sucht qualifizierte IT-Fachkräfte, die das Team verstärken.

  • Arbeit an Europas erster industrieller KI-Cloud mit modernsten Technologien
  • Direkte Zusammenarbeit mit NVIDIA- und Deutsche Telekom-Experten
  • Hybrides Arbeitsmodell
  • Weiterbildungsmöglichkeiten
  • Karriereentwicklung

Unternehmensrichtlinien

  • Remote-Arbeit ist aufgrund europäischer Steuervorschriften nur innerhalb Ungarns möglich

Weitere Details

Du wirst in der Europäischen Union arbeiten, um die Datensicherheits- und Datenschutzanforderungen unserer Kunden zu erfüllen.

Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search