Le contextePour l'un de nos clients, nous recherchons un(e) Ingénieur(e) Production & SRE afin de reprendre en main la chaîne d'observabilité existante sur un périmètre applicatif critique, l'améliorer et réduire le RUN. L'objectif est de rendre les équipes dev et support autonomes et de faire baisser durablement les escalades N3. Vos missions Maintien en conditions opérationnelles de la stack Elastic (Elasticsearch, Kibana, Logstash, Filebeat) sur tous les environnements : utilisateurs et rôles, index et ILM, upgrades, pipelines d'ingestion, alerting Observabilité applicative : APM / OpenTelemetry, dashboards et alerting préventifs par composant critique, définition et suivi des SLO / SLI, tests de performance JMeter Analyse de production : lecture et corrélation des logs, détection des patterns récurrents et signaux faibles (saturation, dérives de performance, capacity) pour traiter les causes avant l'incident Post-mortems et recherche de causes racines sur les incidents majeurs, plans d'action trackés, alimentation du Problem Management Shift-left avec le support : runbooks avec le N2, dashboards exploitables par le N1 / N2 Montée en autonomie des développeurs : pairing (lecture de logs, diagnostic), kit d'autonomie dev Pilotage par la mesure : baseline et indicateurs (heures de support N3, taux d'escalade, MTTR, SLA applicatives, couverture d'alerting) Contribution à la roadmap technique fiabilité et observabilité, portée en PI Planning
Notre client, acteur majeur des services numériques de confiance, recherche un Ingénieur Production & SRE pour renforcer son équipe d'ingénierie. Vous évoluerez sur des plateformes numériques critiques, avec un objectif clair : améliorer la fiabilité, l'observabilité et la performance de la production tout en réduisant progressivement le RUN et les escalades vers le N3. 🎯 Votre missionVous serez au cœur des sujets Production, SRE et Observabilité, avec une forte dimension d'analyse et d'amélioration continue. Vos principales responsabilités : 🔹 Administrer et maintenir la stack Elastic : Elasticsearch, Kibana, Logstash, Filebeat 🔹 Mettre en place et faire évoluer les dashboards, alertes et indicateurs de supervision 🔹 Développer l'observabilité applicative avec APM / OpenTelemetry 🔹 Définir et suivre les SLO / SLI 🔹 Analyser les logs, corréler les signaux et identifier les causes racines des incidents 🔹 Détecter les patterns récurrents, signaux faibles, problèmes de capacité et dérives de performance 🔹 Réaliser les post-mortems et piloter les plans d'actions associés 🔹 Construire des runbooks et accompagner les équipes Support N1/N2 🔹 Faire monter les équipes de développement en autonomie sur le diagnostic et l'analyse de production 🔹 Automatiser les tâches récurrentes avec Python 🔹 Réaliser des tests de performance avec JMeter 🔹 Contribuer à la roadmap technique et aux démarches d'amélioration de la fiabilité 🔹 Participer aux instances Agile / SAFe / PI Planning 👉 L'objectif n'est pas d'ajouter du RUN, mais bien de reprendre l'existant, le fiabiliser, l'industrialiser et progressivement le réduire. 🛠️ Environnement technique :Observabilité / Logs : Elastic Stack, Elasticsearch, Kibana, Logstash, Filebeat, APM, OpenTelemetry Développement & automatisation : Java, Python Infrastructure : Kubernetes, environnements de production critiques Bases de données : PostgreSQL, Cassandra DevOps / CI-CD : Jenkins, SonarQube, Nexus Performance : JMeter Méthodologie : Agile / SAFe / PI Planning
- Concevoir et maintenir des dashboards Kibana complexes et performants. - Créer des visualisations, agrégations, filtres interactifs et fonctionnalités de drill-down. - Analyser et valoriser les données issues d'Elasticsearch, Filebeat, Logstash et THEIA. - Exploiter Kibana Machine Learning pour la détection d'anomalies et l'identification de tendances. - Traduire les besoins métiers/techniques en indicateurs et reportings pertinents. - Optimiser les requêtes et dashboards en collaboration avec les équipes Elasticsearch. - Automatiser les traitements avec Python. - Collaborer avec les équipes infrastructure et développement. Compétences impératives : - Kibana : Expert - Kibana ML : Expert - Elasticsearch : Confirmé - Python : Confirmé - Anglais professionnel