Administrateur(trice) Cluster IA
Indexed description
Ingénieur Administration Cluster IA Senior
CDI | Senior (5 à 10 ans) | Île-de-France (site client)
Contexte du poste
Alliance Services Plus (AS+) recherche un(e) Ingénieur(e) Administration Cluster IA Senior pour accompagner l’un de ses clients dans l’administration et le maintien en conditions opérationnelles d’une plateforme dédiée à l’Intelligence Artificielle.
Notre client est un acteur public majeur dans les domaines de la sûreté nucléaire, de la recherche et de l’expertise scientifique. Ses activités s’appuient notamment sur des infrastructures de calcul intensif et des plateformes dédiées aux usages IA.
Vous interviendrez sur le MCO du cluster IA, le support aux utilisateurs, la gestion des incidents et l’automatisation des opérations d’exploitation.
Missions principales
- Assurer le MCO du cluster IA : GPU, CPU, stockage et réseau
- Administrer les environnements Linux et Kubernetes
- Assurer le support aux utilisateurs et le traitement des incidents
- Gérer les ressources, quotas, priorités et jobs sur la plateforme
- Participer à la gestion des GPU NVIDIA, drivers, CUDA et MIG
- Mettre en place et maintenir l’automatisation des opérations d’exploitation
- Assurer la supervision et le monitoring de la plateforme
- Participer au suivi des incidents matériels et aux échanges avec les mainteneurs
- Contribuer à l’évolution et à l’optimisation de l’infrastructure IA
- Rédiger et maintenir la documentation et les procédures d’exploitation
Environnement technique
Systèmes : Linux Ubuntu
Orchestration : Kubernetes, Docker
GPU : NVIDIA, CUDA, MIG
Automatisation : Ansible, Bash, Python
Supervision : Prometheus, Grafana
Infrastructure : stockage haute performance, stockage objet, réseaux de clusters
Méthodes : ITIL / ITSM, gestion des incidents et des changements
Profil recherché
- Formation Bac+5 (École d’Ingénieur, Master ou équivalent)
- Expérience confirmée en administration systèmes et infrastructures
- Bonne maîtrise de Linux et Kubernetes
- Expérience sur des infrastructures GPU / IA
- Connaissance de NVIDIA, CUDA et idéalement MIG
- Bonne maîtrise d’Ansible et/ou du scripting Bash / Python
- Expérience en supervision et gestion des incidents
- Une connaissance des environnements de stockage et réseaux HPC/IA est appréciée
Qualités attendues :
- Esprit d’analyse et capacité de diagnostic
- Autonomie et rigueur
- Sens du service et orientation utilisateur
- Réactivité face aux incidents
- Aisance dans les environnements techniques complexes
- Force de proposition
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search