Partager cette offre
Missions principales
Le Domain Manager a pour mission de garantir la stabilité, la performance et la disponibilité des services sur les environnements de production et hors production, tout en promouvant une culture orientée fiabilité au sein des équipes.
À ce titre, il :
- S'assure que les évolutions produits respectent les exigences de qualité avant leur mise en production.
- Maintient un équilibre entre innovation, rapidité de livraison et robustesse opérationnelle.
- Travaille en étroite collaboration avec les équipes Produit, Techniques et Plateforme afin d'améliorer continuellement la résilience des services.
Responsabilités
Fiabilité et observabilité
- Définir, suivre et communiquer les Service Level Objectives (SLOs).
- Mettre en place et piloter les Service Level Indicators (SLIs) et les Error Budgets.
- Garantir la mise en œuvre et l'amélioration continue des dispositifs d'observabilité, de monitoring et d'alerting sur l'ensemble du domaine applicatif.
Gouvernance des mises en production
- Superviser la préparation opérationnelle des releases.
- Assurer la stabilité de la production grâce à une coordination transverse avec les équipes Produit et Techniques.
- Disposer d'un rôle de validation finale des mises en production et pouvoir bloquer une livraison lorsque les indicateurs qualité ne sont pas alignés avec les attentes des utilisateurs.
Gestion des incidents et amélioration continue
- Piloter la gestion des incidents.
- Organiser et animer les analyses de causes racines (Root Cause Analysis).
- Conduire les revues post-mortem afin de renforcer la responsabilisation des équipes et l'amélioration continue.
Résilience et optimisation
- Collaborer avec les équipes Plateforme et les équipes spécialisées en observabilité, performance et optimisation des coûts.
- Renforcer la résilience des systèmes.
- Contribuer à l'amélioration de l'efficacité opérationnelle et à la maîtrise des coûts d'exploitation.
Pilotage et coordination
- Produire un reporting régulier sur la fiabilité des services, les risques identifiés et les plans d'amélioration.
- Fournir une visibilité claire aux responsables de programme, managers et parties prenantes métier.
- Participer activement aux cérémonies de pilotage Agile en portant les enjeux de fiabilité, de qualité et d'exploitation.
Profil recherché
Profil recherché
Compétences techniques
- Expertise confirmée en Site Reliability Engineering (SRE) dans des environnements SaaS ou cloud-native.
- Maîtrise des concepts d'observabilité, d'automatisation et des outils de supervision.
- Expérience significative dans la définition et le pilotage de SLOs, SLIs et Error Budgets en collaboration avec les équipes d'ingénierie.
- Bonne maîtrise des pratiques DevSecOps, des chaînes CI/CD et du monitoring continu.
Compétences fonctionnelles
- Solide expérience en gestion d'incidents et préparation opérationnelle.
- Capacité démontrée à coordonner des initiatives de fiabilité impliquant des équipes Produit, Techniques et Plateforme.
- Forte sensibilité aux indicateurs de performance, à la prévention des causes racines et à la gouvernance opérationnelle.
Qualités personnelles
- Esprit analytique et approche orientée données.
- Rigueur dans le suivi des indicateurs et la prise de décision.
- Excellentes capacités de coordination et de communication transverse.
- Culture de l'amélioration continue et de l'excellence opérationnelle.
Points clés à retenir
- Poste orienté SRE / fiabilité opérationnelle.
- Rôle transverse entre les équipes Produit, Tech et Plateforme.
- Responsabilité forte sur la qualité des mises en production avec un véritable pouvoir de validation.
- Pilotage des SLO/SLI, observabilité, incidents et amélioration continue.
- Environnement SaaS / Cloud Native avec forte maturité DevSecOps.
Environnement de travail
Contexte
Dans un environnement SaaS et cloud-native, le Domain Manager est garant de la fiabilité des services, de l'excellence opérationnelle et du respect des engagements de performance sur l'ensemble des environnements. Il contribue à l'intégration des pratiques Site Reliability Engineering (SRE) au sein des équipes de livraison et du cycle de vie produit.
Véritable référent de la qualité opérationnelle, il accompagne les évolutions des produits jusqu'à leur mise en production et s'assure qu'elles répondent aux standards de qualité attendus par les utilisateurs finaux.
Mission en présentiel pendant les premiers mois. Puis jusqu'à 2 jours de télétravail par semaine ensuite.
Postulez à cette offre !
Trouvez votre prochaine mission parmi +8 000 offres !
Fixez vos conditions
Rémunération, télétravail... Définissez tous les critères importants pour vous.
Faites-vous chasser
Les recruteurs viennent directement chercher leurs futurs talents dans notre CVthèque.
100% gratuit
Aucune commission prélevée sur votre mission freelance.
Domain Manager
STHREE SAS