Partager cette offre
Responsable de : Garantir la fiabilité du service, l'excellence opérationnelle et la conformité des performances sur l'ensemble des environnements, en intégrant les pratiques SRE au sein de l'Agile Release Train et du cycle de vie de livraison du produit.
Mission Garantir la stabilité, la performance et la disponibilité des services dans les environnements de production et de non-production, tout en promouvant une culture axée sur la fiabilité au sein des équipes de delivery. Pour mener à bien cette mission, ce rôle agit comme le gardien (gatekeeper) de l'évolution du produit vers la production, en s'assurant que la qualité réponde toujours aux attentes des clients. Collaborer avec les équipes Produit, Tech et Plateforme pour maintenir le juste équilibre entre innovation, vélocité et robustesse opérationnelle.
Activités principales Définir, suivre et communiquer les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) et les budgets d'erreur sur l'ensemble des environnements afin d'assurer une fiabilité mesurable par domaine applicatif. S'assurer que des cadres solides d'observabilité, de supervision et d'alerte sont mis en œuvre et améliorés en continu. Superviser la préparation opérationnelle (operational readiness) de chaque release, en garantissant la stabilité de la production grâce à une coordination transverse avec les équipes Produit et Tech. Peut poser un veto sur la livraison d'un produit lorsque la qualité mesurée n'est pas alignée avec les attentes des clients. Gérer la réponse aux incidents, l'analyse des causes racines et les revues post-mortem pour garantir la responsabilisation et l'amélioration continue par domaine applicatif. Collaborer avec les équipes Core Platform, Observabilité & FinOps pour renforcer la résilience du système, optimiser l'efficacité des coûts et maintenir les performances de la plateforme. Rendre compte de l'état de la fiabilité, des risques et des actions d'amélioration auprès des Agile Release Managers et de la direction de domaine pour assurer l'alignement au sein des ART. Participer activement à l'Agile Release Train en tant que voix de la fiabilité et des opérations, en soutenant la cadence et la qualité des livraisons.
Profil recherché
Forte expertise en Site Reliability Engineering (SRE) au sein d'environnements SaaS ou Cloud-Native.
Compréhension approfondie des architectures d'observabilité système, d'automatisation et des frameworks de supervision.
Expérience dans la définition et la gestion des SLO, SLI et budgets d'erreur en collaboration avec les équipes d'ingénierie.
Maîtrise des pratiques DevSecOps, des pipelines CI/CD et de la surveillance continue.
Expérience solide en gestion des incidents, analyse post-mortem et préparation opérationnelle (operational readiness).
Capacité éprouvée à coordonner les initiatives de fiabilité entre les domaines Produit, Tech et Plateforme.
Strong focus on performance metrics, root cause prevention, and operational governance.
Environnement de travail
Aucun télétravail durant les 3 premiers mois de la mission
Présence sur site requise 3 jours par semaine par la suite
Paris
Postulez à cette offre !
Trouvez votre prochaine mission parmi +9 000 offres !
Fixez vos conditions
Rémunération, télétravail... Définissez tous les critères importants pour vous.
Faites-vous chasser
Les recruteurs viennent directement chercher leurs futurs talents dans notre CVthèque.
100% gratuit
Aucune commission prélevée sur votre mission freelance.
Domain Manager - SRE
MEETSHAKE
