
Contractor job Site Reliability Engineer (SRE) / Ingénieur Production – Observabilité & Fiabilité (H/F)
Saint-Jean-de-Braye (45)
Octopus Group
Share this job
Dans le cadre du renforcement de son pôle Observabilité & Fiabilité, un acteur majeur de la protection sociale recherche un Site Reliability Engineer (SRE) expérimenté.
Vous rejoindrez une équipe en charge de garantir la disponibilité, la performance, la résilience et l'observabilité d'un système d'information critique composé de plusieurs milliers de serveurs et de plus de 160 applications.
Vos missions :Assurer le maintien en conditions opérationnelles des plateformes et infrastructures.
Superviser les environnements de production et traiter les alertes et incidents.
Diagnostiquer les incidents complexes et coordonner leur résolution.
Réaliser les analyses post-incidents (RCA) et piloter les actions de fiabilisation.
Optimiser les tableaux de bord, métriques et règles d'alerting.
Réduire le bruit opérationnel et améliorer l'observabilité des services.
Participer aux cellules de crise et aux démarches d'amélioration continue.
Automatiser les tâches d'exploitation et contribuer aux pratiques DevOps.
Maintenir la documentation technique et les procédures d'exploitation.
Participer aux astreintes (1 semaine sur 5).
Environnement technique :Kubernetes
Docker
Prometheus
Grafana
Splunk
Tempo
Linux
Windows
PostgreSQL
MariaDB
Python
Shell Linux
Spring Boot
JBoss
VMware
DevOps
ITIL
SRE
Candidate profile
Vous justifiez d'une solide expérience en ingénierie de production ou Site Reliability Engineering.
Vous maîtrisez notamment :
les pratiques SRE et l'exploitation de plateformes critiques ;
les outils de supervision, monitoring, logs, métriques et alerting ;
Kubernetes et les environnements conteneurisés ;
les architectures distribuées et microservices ;
l'automatisation via Python ou Shell ;
la gestion des incidents majeurs et des analyses de causes racines.
Vous êtes reconnu pour votre autonomie, votre capacité d'analyse, votre sens du service et votre aptitude à travailler avec plusieurs équipes techniques.
Les + de la mission :Mission longue durée
Environnement de production critique à forte volumétrie
Technologies modernes d'observabilité
Nombreux sujets d'automatisation et d'amélioration continue
Équipe experte et environnement technique stimulant
Working environment
Discover Octopus Group
Apply to this job!
Find your next career move from +9,000 jobs!
Manage your visibility
Salary, remote work... Define all the criteria that are important to you.
Get discovered
Recruiters come directly to look for their future hires in our CV library.
Join a community
Connect with like-minded tech and IT professionals on a daily basis through our forum.
Site Reliability Engineer (SRE) / Ingénieur Production – Observabilité & Fiabilité (H/F)
Octopus Group