
Share this job
Au sein d’une Direction IT et du département Production, le consultant intégrera une équipe transverse en charge de la fiabilité et de l’excellence opérationnelle des plateformes de production critiques.
La mission s’inscrit dans une démarche de transformation des pratiques d’exploitation avec pour objectif de renforcer la disponibilité, la résilience, la performance et la sécurité des services, tout en améliorant leur exploitabilité et en réduisant les risques opérationnels.
Positionné à l’interface entre les équipes Production, Développement, DevOps et Sécurité, le SRE intervient sur l’ensemble du cycle de vie des applications. Il accompagne les équipes dans l’anticipation des impacts des changements, la gestion et la prévention des incidents ainsi que dans la mise en œuvre des bonnes pratiques de production.
Une part importante de la mission concerne également le pilotage des niveaux de service (SLO), la mise en place de dispositifs de supervision, d’alerting et de tableaux de bord, ainsi que l’analyse des métriques permettant d’identifier les risques et les axes d’amélioration.
Le consultant contribuera à l’automatisation des activités de production, à la maîtrise de l’obsolescence et des risques IT/Cybersécurité ainsi qu’aux démarches d’amélioration continue. Il participera également aux analyses post-incidents, aux RETEX et à la diffusion des bonnes pratiques au sein de la communauté Production/SRE.
L’environnement est international et transverse, avec de nombreux interlocuteurs techniques et métiers et une utilisation régulière de l’anglais.
Candidate profile
Indispensables : SRE, Production IT, DevOps, ITIL, ServiceNow, gestion des incidents/problèmes/changements, monitoring & alerting, SLO, résilience, automatisation, infrastructures, risques IT / cybersécurité, anglais.
Working environment
Garantir la disponibilité et la résilience des services de production.
Définir, suivre et piloter les SLO / indicateurs de fiabilité.
Participer à la gestion des incidents critiques et à la restauration des services.
Mettre en place et améliorer monitoring, alerting et dashboards.
Analyser les métriques de production et identifier les axes d'amélioration.
Accompagner les équipes Dev dans l'exploitabilité et la mise en production des applications.
Automatiser les tâches et processus d'exploitation.
Piloter les sujets d'obsolescence, conformité et risques IT/Cybersécurité.
Contribuer aux post-mortems, RETEX et plans d'amélioration.
Maintenir la documentation et diffuser les bonnes pratiques SRE/Production.
Apply to this job!
Find your next career move from +8,000 jobs!
Manage your visibility
Salary, remote work... Define all the criteria that are important to you.
Get discovered
Recruiters come directly to look for their future hires in our CV library.
Join a community
Connect with like-minded tech and IT professionals on a daily basis through our forum.
Service Reliability Engineer (SRE)
INFOTEL CONSEIL
