Back to search
Alliance Services Plus Linkedin · Posted today

Administrateur(trice) Cluster IA

France

Linkedin
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

Ingénieur Administration Cluster IA Senior

CDI | Senior (5 à 10 ans) | Île-de-France (site client)


Contexte du poste


Alliance Services Plus (AS+) recherche un(e) Ingénieur(e) Administration Cluster IA Senior pour accompagner l’un de ses clients dans l’administration et le maintien en conditions opérationnelles d’une plateforme dédiée à l’Intelligence Artificielle.


Notre client est un acteur public majeur dans les domaines de la sûreté nucléaire, de la recherche et de l’expertise scientifique. Ses activités s’appuient notamment sur des infrastructures de calcul intensif et des plateformes dédiées aux usages IA.


Vous interviendrez sur le MCO du cluster IA, le support aux utilisateurs, la gestion des incidents et l’automatisation des opérations d’exploitation.


Missions principales


  • Assurer le MCO du cluster IA : GPU, CPU, stockage et réseau
  • Administrer les environnements Linux et Kubernetes
  • Assurer le support aux utilisateurs et le traitement des incidents
  • Gérer les ressources, quotas, priorités et jobs sur la plateforme
  • Participer à la gestion des GPU NVIDIA, drivers, CUDA et MIG
  • Mettre en place et maintenir l’automatisation des opérations d’exploitation
  • Assurer la supervision et le monitoring de la plateforme
  • Participer au suivi des incidents matériels et aux échanges avec les mainteneurs
  • Contribuer à l’évolution et à l’optimisation de l’infrastructure IA
  • Rédiger et maintenir la documentation et les procédures d’exploitation


Environnement technique


Systèmes : Linux Ubuntu

Orchestration : Kubernetes, Docker

GPU : NVIDIA, CUDA, MIG

Automatisation : Ansible, Bash, Python

Supervision : Prometheus, Grafana

Infrastructure : stockage haute performance, stockage objet, réseaux de clusters

Méthodes : ITIL / ITSM, gestion des incidents et des changements


Profil recherché


  • Formation Bac+5 (École d’Ingénieur, Master ou équivalent)
  • Expérience confirmée en administration systèmes et infrastructures
  • Bonne maîtrise de Linux et Kubernetes
  • Expérience sur des infrastructures GPU / IA
  • Connaissance de NVIDIA, CUDA et idéalement MIG
  • Bonne maîtrise d’Ansible et/ou du scripting Bash / Python
  • Expérience en supervision et gestion des incidents
  • Une connaissance des environnements de stockage et réseaux HPC/IA est appréciée


Qualités attendues :


  • Esprit d’analyse et capacité de diagnostic
  • Autonomie et rigueur
  • Sens du service et orientation utilisateur
  • Réactivité face aux incidents
  • Aisance dans les environnements techniques complexes
  • Force de proposition


Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search