Back to search
OVHcloud Linkedin · Posted 3d ago

Site Reliability Engineer (F/H/N)

France

Linkedin
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

Au sein de votre équipe #OneTeam

  • Rejoindre le département IT, Technology & Product, qui conçoit, développe et opère les produits, les services et les infrastructures d'OVHcloud.
  • Intégrer l'équipe Delivery & Operations dans le Sovereign Group, en charge de la livraison industrialisée et de l'exploitation en production de trois plateformes souveraines (SNC Cloud Platform, OPCP, BMPOD SNC).


Vos principales responsabilités

  • Industrialiser et fiabiliser la livraison des plateformes (provisioning, configuration, GitOps avec FluxCD, Ansible, Terraform).
  • Maintenir et faire évoluer le socle Kubernetes ainsi que les opérateurs gérant le cycle de vie des plateformes.
  • Garantir la disponibilité, la performance et la sécurité en production en pilotant les SLI/SLO et les budgets d'erreur.
  • Déttecter, diagnostiquer et corriger les anomalies via Prometheus, Grafana et OpenTelemetry.
  • Traiter la cause racine des incidents, automatiser le BAU et participer à la rotation d'astreinte.
  • Assurer le durcissement (hardening), le patch management et participer aux audits de conformité (SecNumCloud).
  • Rédiger et versionner la documentation technique et les runbooks.
  • Intégrer et opérer avec des briques d'IA (copilotes de diagnostic, agents, RAG, triage d'alertes) pour augmenter l'équipe au quotidien.


Votre futur impact

Dans 6 mois

  • Vous maîtriserez le périmètre d'exploitation des plateformes souveraines et participerez en autonomie à la rotation d'astreinte.
  • Vous aurez contribué à l'industrialisation des livraisons d'infrastructure via nos pipelines GitOps et d'IaC.
  • Vous commencerez à utiliser et enrichir nos copilotes et outils d'IA d'exploitation au quotidien.


Et dans 1 an

  • Vous jouerez un rôle clé dans l'architecture et la fiabilité à long terme des plateformes cloud souveraines.
  • Vous serez autonome pour concevoir et déployer des agents ou workflows IA complexes améliorant l'observabilité et le self-healing.
  • Vous contribuerez activement aux démarches d'audit et de qualification de haut niveau de sécurité (SecNumCloud).


Compétences requises :

  • Vous maîtrisez les fondamentaux de Linux, du réseau (TCP/IP, DNS) et l'écosystème cloud-native.
  • Vous avez une expérience solide en gestion d'orchestrateurs de conteneurs en production (idéalement Kubernetes) et en pratiques SRE (SLI/SLO, astreintes, gestion d'incidents).
  • Vous maîtrisez les outils de CI/CD en mode GitOps (FluxCD, ArgoCD) ainsi que l'IaC et l'automatisation (Terraform, Ansible, Git).
  • Vous développez en Python et/ou en Go pour créer des outils et services robustes.
  • Vous avez des notions de durcissement d'infrastructure (hardening) et connaissez les mécanismes de sécurité réseau et système.
  • Vous utilisez au quotidien des outils d'IA pour optimiser vos opérations.
  • Vous êtes à l'aise en anglais pour évoluer dans un environnement international.
  • Vous êtes proactif, responsable, exigeant sur la qualité, team player et doté d'un esprit critique face aux résultats produits par l'IA.


C'est un +

  • Vous avez une expérience dans l'intégration de modèles de langage (RAG, prompt engineering, frameworks d'agents, MCP) ou le déploiement OpenStack / Bare Metal.
  • Vous connaissez les normes de qualification ou certification : SecNumCloud, PCI DSS, ISO 27001, HDS.
  • Vous avez opéré des charges GPU / serveurs d'inférence (vLLM, Triton) ou participé à des projets Open Source.


Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search