JobRaahGet matched free

Jobs

Site Reliability Engineer & AI SRE (F/H)

Devoteam · Levallois-Perret, IDF, France · Hybrid

Posted Sep 28, 2026

Apply with JobRaah

Sign up free: we match you to jobs like this, tailor your application and fill the form. 2 free applications every day.

💪 Vos missions principales : En tant que Site Reliability Engineer (SRE) & AI SRE, vous concevez des écosystèmes résilients, définissez la culture de fiabilité et garantissez la haute disponibilité, la sécurité et l'automatisation des infrastructures critiques et des plateformes d'IA en production pour nos clients grands comptes : Architecture & Résilience : Architecturer des socles Cloud (Landing Zones) et des plateformes distribuées haute disponibilité supportant aussi bien les applications critiques que les charges de travail d'IA (Kubernetes, GPU Scheduling, NVIDIA MIG, autoscaling). Culture SRE & Gouvernance : Définir et piloter les engagements de service (SLI/SLO, Error Budgets), promouvoir le modèle "You build it, you run it", et implémenter la gouvernance des modèles d'IA (traçabilité, gestion des biais et hallucinations). Gestion des Incidents & Chaos Engineering : Mener des analyses de causes profondes (RCA) assistées par l'AIOps lors d'incidents complexes (panne GPU, corruption de données) et éprouver les architectures via le Chaos Engineering. Sécurité & Conformité IA : Déployer les stratégies de sécurité applicatives/infra et veiller à la conformité technique aux réglementations en vigueur (AI Act, RGPD, auditabilité). Automatisation & CI/CD : Réduire la charge d'exploitation (toil) via l'automatisation et l'IaC (Terraform, Ansible, Python, Go, Bash), et moderniser les pipelines de déploiement continu (GitOps, Canary, Blue/Green). 👤 Profil recherché : 🎓 Formation & expérience : Diplômé·e Bac+5 en informatique (ou équivalent). Minimum 5 ans d'expérience globale sur des environnements de production à grande échelle, incluant une expertise reconnue en ingénierie SRE et/ou MLOps. 🧠 Compétences techniques indispensables : Infrastructures & Conteneurs : Maîtrise de Kubernetes (K8s, GPU Scheduling, MIG), du Cloud (AWS, GCP, Azure, Privé/Souverain) et des architectures de Landing Zones. Automatisation & IaC : Pratique avancée de Terraform, Ansible, GitOps (ArgoCD/Flux) et scripting (Python, Go, Bash). Fiabilité & Observabilité SRE : Maitrise de la gestion des SLI/SLO/Error Budgets, de l'AIOps, du Chaos Engineering et des processus RCA. Sécurité & Conformité IA : Connaissances des enjeux juridiques et de la sécurisation des plateformes d'IA (AI Act, RGPD, gestion des secrets et des accès aux modèles). 🤝 Qualités personnelles : Leadership, esprit de mentorat et capacité d'influence/évangélisation auprès des équipes (Dev, Ops, Data). Sens de l'analyse, rigueur éthique et grande résistance au stress en gestion de crise. Orientation résolution de problèmes et recherche d'efficacité. ⭐ Atouts appréciés : Certifications SRE & Cloud : SRE Foundation, HashiCorp Terraform Associate, AWS DevOps Engineer Pro ou Google Cloud Professional DevOps Engineer. Certifications Kubernetes : CKA (Kubernetes Administrator), CKS (Kubernetes Security Specialist). Connaissances théoriques et pratiques sur les bases "Safe…