Share this job
Responsable de : Garantir la fiabilité du service, l'excellence opérationnelle et la conformité des performances sur l'ensemble des environnements, en intégrant les pratiques SRE au sein de l'Agile Release Train et du cycle de vie de livraison du produit.
Mission Garantir la stabilité, la performance et la disponibilité des services dans les environnements de production et de non-production, tout en promouvant une culture axée sur la fiabilité au sein des équipes de delivery. Pour mener à bien cette mission, ce rôle agit comme le gardien (gatekeeper) de l'évolution du produit vers la production, en s'assurant que la qualité réponde toujours aux attentes des clients. Collaborer avec les équipes Produit, Tech et Plateforme pour maintenir le juste équilibre entre innovation, vélocité et robustesse opérationnelle.
Activités principales Définir, suivre et communiquer les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) et les budgets d'erreur sur l'ensemble des environnements afin d'assurer une fiabilité mesurable par domaine applicatif. S'assurer que des cadres solides d'observabilité, de supervision et d'alerte sont mis en œuvre et améliorés en continu. Superviser la préparation opérationnelle (operational readiness) de chaque release, en garantissant la stabilité de la production grâce à une coordination transverse avec les équipes Produit et Tech. Peut poser un veto sur la livraison d'un produit lorsque la qualité mesurée n'est pas alignée avec les attentes des clients. Gérer la réponse aux incidents, l'analyse des causes racines et les revues post-mortem pour garantir la responsabilisation et l'amélioration continue par domaine applicatif. Collaborer avec les équipes Core Platform, Observabilité & FinOps pour renforcer la résilience du système, optimiser l'efficacité des coûts et maintenir les performances de la plateforme. Rendre compte de l'état de la fiabilité, des risques et des actions d'amélioration auprès des Agile Release Managers et de la direction de domaine pour assurer l'alignement au sein des ART. Participer activement à l'Agile Release Train en tant que voix de la fiabilité et des opérations, en soutenant la cadence et la qualité des livraisons.
Candidate profile
Forte expertise en Site Reliability Engineering (SRE) au sein d'environnements SaaS ou Cloud-Native.
Compréhension approfondie des architectures d'observabilité système, d'automatisation et des frameworks de supervision.
Expérience dans la définition et la gestion des SLO, SLI et budgets d'erreur en collaboration avec les équipes d'ingénierie.
Maîtrise des pratiques DevSecOps, des pipelines CI/CD et de la surveillance continue.
Expérience solide en gestion des incidents, analyse post-mortem et préparation opérationnelle (operational readiness).
Capacité éprouvée à coordonner les initiatives de fiabilité entre les domaines Produit, Tech et Plateforme.
Strong focus on performance metrics, root cause prevention, and operational governance.
Working environment
Aucun télétravail durant les 3 premiers mois de la mission
Présence sur site requise 3 jours par semaine par la suite
Paris
Apply to this job!
Find your next career move from +8,000 jobs!
Manage your visibility
Salary, remote work... Define all the criteria that are important to you.
Get discovered
Recruiters come directly to look for their future hires in our CV library.
Join a community
Connect with like-minded tech and IT professionals on a daily basis through our forum.
Domain Manager - SRE
MEETSHAKE
