Contexte de la missionDans le cadre du maintien et de l'amélioration de la fiabilité des systèmes d'information, nous recherchons un(e) Site Reliability Engineer (SRE) chargé(e) de garantir les niveaux de service attendus, d'améliorer la résilience des plateformes et d'accompagner les équipes dans une démarche DevOps. Le/la SRE intervient sur l'ensemble du cycle de vie des applications et infrastructures afin d'assurer leur disponibilité, leur performance et leur capacité à évoluer. Missions principalesMaintien des niveaux de service (SLA/SLO)Garantir le respect des objectifs de niveaux de service. Assurer la disponibilité, la performance et la fiabilité des applications et infrastructures. Participer à la gestion des incidents et à l'analyse des causes racines (RCA). Mettre en place des actions préventives afin de réduire les incidents récurrents. Monitoring et supervisionConcevoir et maintenir les dispositifs de supervision. Définir et optimiser les alertes afin d'améliorer la détection proactive des incidents. Analyser les métriques de performance et de disponibilité. Exploiter les outils de monitoring et d'observabilité. Culture DevOps et automatisationParticiper à l'industrialisation des processus d'exploitation. Favoriser l'automatisation des tâches récurrentes. Collaborer avec les équipes de développement et d'infrastructure dans une démarche DevOps. Contribuer à l'amélioration continue des processus de production. Amélioration continue et montée en chargeIdentifier les axes d'optimisation des environnements techniques. Participer aux travaux de fiabilisation et de résilience. Accompagner la mise à l'échelle des plateformes. Contribuer à l'évolution des architectures et des pratiques d'exploitation. Compétences techniques requisesSystèmes et infrastructuresLinux Windows WebSphere Supervision et gestion des servicesDynatrace ServiceNow Ordonnancement et fluxAutosys CFT Bases de donnéesOracle SQL Server Conteneurisation et Infrastructure as CodeKubernetes Terraform Compétences attenduesBonne compréhension des pratiques SRE : SLI / SLO / SLA, gestion de la fiabilité, observabilité, automatisation. Culture DevOps : collaboration transverse, amélioration continue, industrialisation des opérations. Capacité d'analyse et de résolution d'incidents complexes. Sens du service et orientation production. Autonomie et rigueur.
We are seeking an experienced and proactive Site Reliability Engineer (SRE) to join a team supporting multiple data product and platform groups. This role is focused on improving the reliability, scalability, observability, and operational performance of critical data-driven platforms and services across complex production environments. The successful candidate will work closely with engineering, platform, and support teams to strengthen monitoring and alerting capabilities, improve logging and traceability, troubleshoot production incidents, support deployments, and automate operational processes wherever possible. The environment includes Kubernetes, Helm, the ELK stack, and a strong focus on modern Site Reliability Engineering practices across cloud and platform services. This is a hands-on technical role suited to someone who thrives in fast-paced operational environments and is passionate about reliability engineering, automation, and continuous improvement. The role requires strong collaboration with both client stakeholders and engineering teams to ensure platform stability, operational excellence, and high service availability
We are seeking an experienced and motivated Site Reliability Engineer (SRE) to join a high-performing team supporting multiple data product and platform groups. This role is focused on improving the reliability, scalability, observability, deployment, and operational support of critical data-driven platforms and services operating within complex production environments. The successful candidate will work closely with engineering, platform, and operational support teams to strengthen monitoring and alerting capabilities, improve logging and traceability, troubleshoot incidents, support deployments, and automate operational processes wherever possible. The environment includes Kubernetes, Helm, the ELK stack, and a broad range of modern Site Reliability Engineering and cloud platform practices. This is a hands-on technical role suited to someone who thrives in fast-paced operational environments, enjoys solving complex production issues, and is passionate about automation, platform reliability, and continuous improvement. The role requires strong collaboration with both client stakeholders and engineering teams to ensure operational excellence, platform resilience, and service availability across critical systems.
Dans le cadre du renforcement de nos équipes Cloud & DevOps, nous recherchons un(e) Expert DevOps / SRE passionné(e) par l'automatisation, le Cloud et les architectures modernes. Vous interviendrez sur des environnements critiques au sein de grands comptes, avec pour mission d'accompagner la transformation DevOps, d'industrialiser les plateformes Cloud et de garantir la disponibilité, la performance et la sécurité des infrastructures. En tant que DevOps / SRE, vous jouerez un rôle clé dans la définition et la mise en œuvre de la stratégie DevOps. À ce titre, vous serez amené(e) à : Concevoir, déployer et faire évoluer les plateformes DevOps et Cloud. Définir les bonnes pratiques DevOps et accompagner leur adoption auprès des équipes de développement et d'exploitation. Concevoir des architectures Cloud sécurisées, résilientes et hautement disponibles. Industrialiser les déploiements grâce à l'Infrastructure as Code (IaC). Développer et maintenir des pipelines CI/CD robustes et automatisés. Automatiser les processus d'exploitation, de provisioning et de configuration. Garantir la fiabilité des plateformes en appliquant les principes Site Reliability Engineering (SRE). Définir et mettre en œuvre les indicateurs SLI, SLO et SLA. Participer à la gestion des incidents critiques, aux analyses post-mortem et à l'amélioration continue. Mettre en place les solutions de supervision, de monitoring et d'observabilité. Optimiser les performances, la sécurité et la scalabilité des infrastructures. Assurer une veille technologique permanente sur les solutions Cloud Native et DevOps. Encadrer et accompagner techniquement les équipes DevOps et les profils plus juniors.