Find your next tech and IT Job or contract Site Reliability Engineering (SRE)

Your search returns 35 results.
Contractor
Permanent

Job VacancyIngénieur SRE

BEEZEN
Published on
Site Reliability Engineering (SRE)

12 months
40k-50k €
400-500 €
Montreuil, Ile-de-France
Vous intégrez l'équipe APS PF en tant qu'Ingénieur SRE (Site Reliability Engineer), garant de la disponibilité, de la performance et de la résilience de la plateforme de production. Au carrefour du développement et de l'exploitation, vous portez une culture DevOps forte : vous partagez avec les équipes de développement des objectifs communs de fiabilité, vous intervenez dès les phases de cadrage des projets, et vous avez une vision de bout en bout sur l'ensemble des opérations impactant votre périmètre (incidents, mises en production, changements, obsolescence…). Votre credo : anticiper plutôt que réagir, automatiser plutôt que subir, et transformer la donnée en décision. Vos responsabilités au quotidienMaintien des objectifs de niveau de service Garant de la disponibilité, l'intégrité, la résilience et la qualité de la plateforme Pilotage de la remise en service lors d'incidents, avec mobilisation des bonnes ressources Une culture DevOps au service de l'innovation Collaboration étroite avec les équipes de développement et d'exploitation Anticipation des impacts des changements à venir sur la production Partage des contraintes opérationnelles dès l'amont des projets Monitoring & Alerting Mise en place du bon niveau de monitoring et d'alerting Construction de tableaux de bord pertinents pour éclairer la prise de décision Amélioration continue & mise à l'échelle Identification et priorisation des chantiers d'automatisation et d'industrialisation Développement de scripts et outillage des opérations, avec le souci de la maintenabilité Sécurité & gestion de l'obsolescence Pilotage de l'obsolescence et des non-conformités Priorisation budgétaire en coordination avec les équipes produit et l'IT métier Votre profil Compétences techniques Monitoring & observabilité : Prometheus, Grafana, Datadog, ELK, Dynatrace… Scripting & automatisation : Python, Bash, Ansible, Terraform CI/CD : Jenkins, GitLab CI, Azure DevOps Environnements cloud et/ou on-premise (AWS, Azure, GCP) Notions de gestion d'incidents (ITIL) et de sécurité en production Compétences transverses Sens des priorités et rigueur, notamment en gestion de crise Capacité à travailler en amont, en mode proactif Aisance relationnelle avec les équipes Dev, Ops et Métier Autonomie et esprit d'initiative Expérience 3 à 8 ans d'expérience en exploitation, production ou développement, avec une appétence marquée pour la fiabilité et l'automatisation Pourquoi nous rejoindre ? Un rôle clé à l'interface Dev/Ops, au cœur de la performance et de la résilience de la production Une équipe engagée dans une démarche SRE/DevOps mature Des projets concrets d'automatisation et d'industrialisation à fort impact Une réelle autonomie dans la priorisation et le pilotage de votre périmètre
View this job
Contractor
Permanent

Job VacancyIngénieur Fiabilité Site (SRE)

VISIAN
Published on
DevOps
Site Reliability Engineering (SRE)

1 year
Ile-de-France, France
ContexteLe bénéficiaire souhaite une prestation d'accompagnement dans l'objectif d'assurer une mission au sein de l'équipe. MissionsPartager avec les équipes de développement des objectifs communs de disponibilité et de performance de la production Maîtriser des risques et anticiper les impacts sur le SLO des services en production liés aux opérations sur votre périmètre Intégrer et participer dès le début des phases de cadrage des projets et des évolutions à venir Avoir une vision de bout en bout sur l'ensemble des opérations impactant le périmètre (incidents, mises en productions, changements, obsolescence…) Développer de la résilience, en automatisant et en outillant efficacement les opérations afin de réduire le risque d'erreur, augmenter les contrôles à la source et minimiser l'impact des pannes sur l'expérience utilisateur Utiliser de la donnée et les indicateurs de performance au quotidien pour opérer (en automatique ou en manuel à défaut). Être plus réactif en cas d'incident, et prioriser les évolutions de la plateforme afin d'accroître sa résilience Le collaborateur devra réaliser tout ou partie des activités suivantes : Maintien des objectifs de niveau de service Responsabilisation de la disponibilité, de l'intégrité, de la résilience et de la qualité de la plateforme de production Remise en service en cas d'incidents, en mobilisant les ressources adéquates si nécessaire Une culture DevOps au service de l'innovation Travail en étroite collaboration avec les équipes de développement et d'exploitation, afin d'être informé des changements prévus et d'anticiper leurs impacts sur la production Information des équipes de développement sur les sujets des environnements hors-prod afin de prendre en compte les contraintes opérationnelles au plus tôt
View this job
Contractor

Contractor jobSite Reliability Engineering (SRE)

DEV AND CONNECT
Published on
Site Reliability Engineering (SRE)

3 months
400-600 €
La Défense, Ile-de-France
👉 Contexte Nous sommes à la recherche d'un SRE pour renforcer l'équipe technique de notre client. Ce rôle stratégique implique une vision globale de l'architecture, une forte sensibilité sécurité, ainsi qu'une capacité à intervenir rapidement et efficacement sur les incidents tout en améliorant la résilience. 📍 La Défense 🏠 3 jours de télétravail par semaine 📆 Début de mission : ASAP ❌ Freelance uniquement, pas d'ESN 🚀 Missions principales Capacité, Performance et Sécurité : • Gérer la fiabilité et répondre aux incidents • Planifier la capacité (scaling horizontal/vertical). • Effectuer des tests de charge, de résilience et du chaos engineering. • Anticiper les goulets d'étranglement. • Optimiser les coûts de l'infrastructure • Veiller à ce que l'infrastructure respecte les standards en matière de sécurité Build : • Éliminer les tâches récurrentes par des scripts, pipelines, auto-healing. • Optimiser le Disaster Recovery Plan en collaboration avec l'équipe platform engineering • Concevoir et développer des solutions d'automatisation (scripts, workflows, outils opérationnels, auto-remédiation) afin de supprimer les tâches manuelles, d'améliorer la fiabilité et d'accroître l'efficacité opérationnelle. Observabilité & excellence opérationnelle : • Maintenir et améliorer la stack d'observability • Développer de nouvelles metrics et renforcer l'observabilité globale. • Améliorer les temps de détection (MTTD) et de résolution (MTTR).
View this job
Contractor
Permanent

Job VacancyDomain Manager SRE Responsable de Domaine SRE

CAT-AMANIA
Published on
CI/CD
DevSecOps
Site Reliability Engineering (SRE)

3 years
Ile-de-France, France
Mission Garantir la stabilité, la performance et la disponibilité des services dans les environnements de production et hors production, tout en développant une culture orientée fiabilité au sein des équipes de delivery. Dans ce cadre, le titulaire du poste agit comme le garant de la mise en production des évolutions produit, en veillant à ce que la qualité délivrée soit toujours conforme aux attentes des clients. Collaborer avec les équipes Produit, Technique et Plateforme afin de maintenir un équilibre optimal entre innovation, rapidité d'exécution et robustesse opérationnelle. Activités principales Définir, surveiller et communiquer les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) et les budgets d'erreur (Error Budgets) sur l'ensemble des environnements afin de garantir une fiabilité mesurable pour chaque domaine applicatif. Veiller à la mise en place et à l'amélioration continue des dispositifs d'observabilité, de supervision et d'alerting. Superviser la préparation opérationnelle des mises en production afin de garantir la stabilité des environnements de production grâce à une coordination transverse avec les équipes Produit et Technique. Disposer d'un droit de veto sur une mise en production lorsque le niveau de qualité observé ne répond pas aux attentes des clients. Piloter la gestion des incidents, les analyses des causes racines (Root Cause Analysis) et les revues post-mortem afin d'assurer la responsabilisation des équipes et l'amélioration continue sur chaque domaine applicatif. Collaborer avec les équipes Core Platform, Observability et FinOps afin d'améliorer la résilience des systèmes, optimiser les coûts et maintenir les performances de la plateforme. Communiquer l'état de la fiabilité, les risques et les plans d'amélioration aux Agile Release Managers et aux responsables de domaine afin de garantir l'alignement entre les différents ART. Participer activement à l'Agile Release Train en tant que représentant de la fiabilité et des opérations, en soutenant le rythme de livraison et la qualité des produits.
View this job
Contractor
Permanent

Job Vacancy Ingénieur de Production / Site Reliability Engineering (SRE)

RIDCHA DATA
Published on
Ansible
Docker
GitLab CI

1 year
Sophia Antipolis, Provence-Alpes-Côte d'Azur
Contexte de la missionDans le cadre de l'exploitation d'une prestation critique hébergée sur un Cloud privé, nous recherchons un Ingénieur de Production / Site Reliability Engineering (SRE) afin d'intégrer une équipe de 5 ingénieurs en charge du maintien en conditions opérationnelles (MCO) d'une plateforme stratégique pilotée par un ministère. Vous contribuerez à garantir la disponibilité, la fiabilité et la performance des applications en production tout en accompagnant la transformation vers un modèle SRE et Cloud. Vos missionsAssurer le MCO des applications et infrastructures en environnement Cloud privé. Garantir le respect des SLA et le traitement des tickets Jira. Superviser les plateformes, assurer le monitoring et l'observabilité des systèmes. Analyser les incidents, identifier les causes racines et mettre en œuvre des actions correctives durables. Automatiser les opérations d'exploitation via Ansible, scripts Bash et outils DevOps. Participer aux déploiements applicatifs et infrastructures (CI/CD, GitOps). Gérer les environnements Recette, Préproduction et Production. Administrer les plateformes Docker et Kubernetes. Optimiser les performances, la disponibilité et la résilience des services. Maintenir et enrichir la documentation d'exploitation. Collaborer avec les équipes de développement, infrastructure et Service Delivery. Compétences indispensablesAnsible Docker MySQL Observabilité / Monitoring Linux GitLab CI / GitOps Bash / scripting Kubernetes Gestion des incidents de production Français courant Compétences appréciéesZabbix Grafana OpenSearch Redis Rundeck Rancher RKE2 NGINX Vault Morpheus CMP S3 Airflow Réseau (LAN/WAN, routage, Load Balancer, TLS, PKI) ITIL ISO 27001 / ISO 9001 Soft SkillsExcellente capacité d'analyse et de résolution d'incidents. Résistance au stress et gestion des priorités. Esprit d'équipe et sens du service. Forte autonomie. Bonnes capacités de communication. Force de proposition et démarche d'amélioration continue. Capacité à évoluer dans un environnement critique. LivrablesRespect des SLA et traitement des tickets Jira. Documentation d'exploitation. Automatisation des procédures. Mise en production des évolutions. Suivi de la disponibilité et des performances des plateformes.
View this job
Contractor

Contractor jobDomain Manager - SRE

MEETSHAKE
Published on
DevSecOps
Incident Management
SaaS

6 months
Paris, France
Responsable de : Garantir la fiabilité du service, l'excellence opérationnelle et la conformité des performances sur l'ensemble des environnements, en intégrant les pratiques SRE au sein de l'Agile Release Train et du cycle de vie de livraison du produit. Mission Garantir la stabilité, la performance et la disponibilité des services dans les environnements de production et de non-production, tout en promouvant une culture axée sur la fiabilité au sein des équipes de delivery. Pour mener à bien cette mission, ce rôle agit comme le gardien (gatekeeper) de l'évolution du produit vers la production, en s'assurant que la qualité réponde toujours aux attentes des clients. Collaborer avec les équipes Produit, Tech et Plateforme pour maintenir le juste équilibre entre innovation, vélocité et robustesse opérationnelle. Activités principales Définir, suivre et communiquer les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) et les budgets d'erreur sur l'ensemble des environnements afin d'assurer une fiabilité mesurable par domaine applicatif. S'assurer que des cadres solides d'observabilité, de supervision et d'alerte sont mis en œuvre et améliorés en continu. Superviser la préparation opérationnelle (operational readiness) de chaque release, en garantissant la stabilité de la production grâce à une coordination transverse avec les équipes Produit et Tech. Peut poser un veto sur la livraison d'un produit lorsque la qualité mesurée n'est pas alignée avec les attentes des clients. Gérer la réponse aux incidents, l'analyse des causes racines et les revues post-mortem pour garantir la responsabilisation et l'amélioration continue par domaine applicatif. Collaborer avec les équipes Core Platform, Observabilité & FinOps pour renforcer la résilience du système, optimiser l'efficacité des coûts et maintenir les performances de la plateforme. Rendre compte de l'état de la fiabilité, des risques et des actions d'amélioration auprès des Agile Release Managers et de la direction de domaine pour assurer l'alignement au sein des ART. Participer activement à l'Agile Release Train en tant que voix de la fiabilité et des opérations, en soutenant la cadence et la qualité des livraisons.
View this job
Permanent

Job VacancyDevOps Engineer - CDI

BLOOMAYS
Published on
AWS Cloud
DevOps
Site Reliability Engineering (SRE)

60k-75k €
Paris, France
Votre mission : devenir la personne référente DevOps d'une plateforme SaaS B2B en production, reprendre progressivement la main sur l'infrastructure et faire évoluer l'existant avec une forte autonomie de mise en œuvre. Ce recrutement intervient dans le cadre du départ du DevOps actuel vers d'autres fonctions. Le CPTO, encore impliqué sur les sujets d'infrastructure, souhaite progressivement se recentrer sur le produit. Vous travaillez avec lui pour cadrer les priorités, puis vous portez leur exécution technique au quotidien. Intégré·e aux équipes produit et développement, vous intervenez sur une plateforme composée d'environ six microservices, utilisée par des clients grands comptes. Vous collaborez directement avec trois feature teams représentant une douzaine de développeurs. Vos principales responsabilités seront les suivantes : Reprendre la responsabilité opérationnelle de l'infrastructure AWS, entièrement administrée avec Terraform, sans ClickOps. Maintenir et faire évoluer l'environnement Kubernetes, Docker et Helm, tout en évaluant avec pragmatisme si Kubernetes reste la solution la plus adaptée à la taille de la plateforme. Simplifier et rationaliser les pipelines CI/CD construits autour de GitLab self-hosted et Helm. Identifier, chiffrer et mettre en œuvre des leviers d'optimisation des coûts cloud. Faire progresser l'observabilité, la documentation et les runbooks afin de renforcer la fiabilité et l'autonomie des équipes. Contribuer aux sujets de sécurité opérationnelle : gestion des secrets, RBAC, moindre privilège et réponses techniques aux audits clients. Les chantiers des 12 à 18 prochains mois sont concrets et ouverts : rationalisation de la CI/CD, optimisation des coûts AWS, réflexion sur une architecture plus simple que Kubernetes, renforcement de l'observabilité et éventuelle mise en place d'une approche GitOps avec Argo CD ou une solution équivalente. Vous recevez les besoins par trois canaux : le CPTO pour les sujets d'infrastructure, de stratégie et de sécurité ; les leads lors des temps d'amélioration continue ; et les développeurs au quotidien. Les sujets sont cadrés collectivement, mais leur mise en œuvre vous appartient. Vous êtes intégré·e au produit, pas positionné·e dans un silo infrastructure. Environnement technique : AWS, Terraform, Kubernetes, Docker, GitLab self-hosted, Helm, Kuma, PHP/Symfony, React et TypeScript. La plateforme connaît un rythme régulier d'une mise en production par sprint et de plusieurs dizaines de correctifs. Le SLA contractuel est de 98 % minimum, sans pics saisonniers et sans astreintes. Conditions proposées : rémunération fixe entre 60 000 € et 75 000 € selon expérience, complétée par environ 5 000 € de participation. Vous bénéficiez également de tickets restaurant, d'une mutuelle Alan et d'un MacBook avec configuration au choix. Le poste est basé à Levallois-Perret, avec deux jours de présence sur site et trois jours de télétravail par semaine. Le processus de recrutement comprend un échange RH, un entretien avec le CPTO, puis une rencontre avec les leads.
View this job
Permanent

Job VacancyIngénieur SRE / Platform Engineer (H/F)

Link Consulting
Published on
Docker
Kubernetes
Site Reliability Engineering (SRE)

45k-50k €
Toulouse, Occitania
Notre client, acteur reconnu dans le secteur bancaire, recherche son futur Ingénieur SRE / Platform Engineer (H/F) pour son site de Toulouse, dans le cadre du renforcement de sa plateforme technique et de ses pratiques d'industrialisation. Poste Intégré à une équipe transverse dédiée à la plateforme et à l'intégration, vous intervenez principalement sur des sujets Build avec pour objectif de structurer un environnement technique fiable, automatisé et orienté self-service. Votre rôle est de faciliter le travail des équipes de développement en mettant à disposition des outils et standards robustes, dans une logique de Platform Engineering, avec une forte culture Infrastructure as Code. Vous évoluerez dans un environnement hybride combinant GCP et Kubernetes On-Premise. Missions * Concevoir et maintenir des infrastructures automatisées (Terraform, Helm) * Développer des outils et templates en self-service pour les équipes applicatives * Construire et optimiser les pipelines CI/CD * Mettre en place des solutions d'observabilité (monitoring, alerting, logs) * Assurer un support avancé sur les incidents applicatifs critiques (N3) * Intégrer les exigences de sécurité dans les processus CI/CD * Collaborer étroitement avec les équipes de développement pour faciliter les déploiements * Participer à la structuration et à l'évolution de la plateforme technique Compétences techniques * Cloud : GCP (environnement principal) * Conteneurisation : Kubernetes, Docker * Infrastructure as Code : Terraform * CI/CD : GitLab CI, GitHub Actions ou Jenkins * Observabilité : Datadog, Prometheus * Environnements distribués : microservices, APIs Une expérience en développement (Node.js, Go ou Python) sera un réel atout.
View this job

Connecting Tech-Talent

Free-Work, THE platform for all IT professionals.

Free-workers
Resources
About
Recruiters area
2026 © Free-Work / AGSI SAS
Follow us