We are seeking an experienced and proactive Site Reliability Engineer (SRE) to join a team supporting multiple data product and platform groups. This role is focused on improving the reliability, scalability, observability, and operational performance of critical data-driven platforms and services across complex production environments. The successful candidate will work closely with engineering, platform, and support teams to strengthen monitoring and alerting capabilities, improve logging and traceability, troubleshoot production incidents, support deployments, and automate operational processes wherever possible. The environment includes Kubernetes, Helm, the ELK stack, and a strong focus on modern Site Reliability Engineering practices across cloud and platform services. This is a hands-on technical role suited to someone who thrives in fast-paced operational environments and is passionate about reliability engineering, automation, and continuous improvement. The role requires strong collaboration with both client stakeholders and engineering teams to ensure platform stability, operational excellence, and high service availability
We are seeking an experienced and motivated Site Reliability Engineer (SRE) to join a high-performing team supporting multiple data product and platform groups. This role is focused on improving the reliability, scalability, observability, deployment, and operational support of critical data-driven platforms and services operating within complex production environments. The successful candidate will work closely with engineering, platform, and operational support teams to strengthen monitoring and alerting capabilities, improve logging and traceability, troubleshoot incidents, support deployments, and automate operational processes wherever possible. The environment includes Kubernetes, Helm, the ELK stack, and a broad range of modern Site Reliability Engineering and cloud platform practices. This is a hands-on technical role suited to someone who thrives in fast-paced operational environments, enjoys solving complex production issues, and is passionate about automation, platform reliability, and continuous improvement. The role requires strong collaboration with both client stakeholders and engineering teams to ensure operational excellence, platform resilience, and service availability across critical systems.
Dans le cadre du renforcement de nos équipes Cloud & DevOps, nous recherchons un(e) Expert DevOps / SRE passionné(e) par l'automatisation, le Cloud et les architectures modernes. Vous interviendrez sur des environnements critiques au sein de grands comptes, avec pour mission d'accompagner la transformation DevOps, d'industrialiser les plateformes Cloud et de garantir la disponibilité, la performance et la sécurité des infrastructures. En tant que DevOps / SRE, vous jouerez un rôle clé dans la définition et la mise en œuvre de la stratégie DevOps. À ce titre, vous serez amené(e) à : Concevoir, déployer et faire évoluer les plateformes DevOps et Cloud. Définir les bonnes pratiques DevOps et accompagner leur adoption auprès des équipes de développement et d'exploitation. Concevoir des architectures Cloud sécurisées, résilientes et hautement disponibles. Industrialiser les déploiements grâce à l'Infrastructure as Code (IaC). Développer et maintenir des pipelines CI/CD robustes et automatisés. Automatiser les processus d'exploitation, de provisioning et de configuration. Garantir la fiabilité des plateformes en appliquant les principes Site Reliability Engineering (SRE). Définir et mettre en œuvre les indicateurs SLI, SLO et SLA. Participer à la gestion des incidents critiques, aux analyses post-mortem et à l'amélioration continue. Mettre en place les solutions de supervision, de monitoring et d'observabilité. Optimiser les performances, la sécurité et la scalabilité des infrastructures. Assurer une veille technologique permanente sur les solutions Cloud Native et DevOps. Encadrer et accompagner techniquement les équipes DevOps et les profils plus juniors.