Find your next tech and IT Job or contract Site Reliability Engineering (SRE)

Your search returns 47 results.
Contractor

Contractor job[LFR] Site Reliability Engineer (SRE) à Nantes - 1825

ISUPPLIER
Published on

10 months
300-415 €
Nantes, Pays de la Loire
La mission consiste à mettre en place et développer la pratique SRE au sein du Système d'Information afin d'améliorer durablement la fiabilité, la résilience et la performance des services. Le consultant interviendra sur l'analyse des risques et fragilités du SI, l'observabilité, la cartographie des chaînes techniques et la définition d'indicateurs SRE. Il contribuera également aux études d'impact et aux changements techniques transverses complexes. Missions : - Identifier les fragilités structurelles du Système d'Information. - Analyser les risques liés à la fiabilité et à la résilience des services. - Recommander des plans d'actions visant à réduire les risques opérationnels. - Réaliser un état des lieux des données disponibles dans les outils d'observabilité. - Cartographier les chaînes techniques supportant les parcours métiers. - Définir et analyser les indicateurs SLI/SLO et identifier les éventuels manques. - Contribuer aux pratiques SRE : TOIL, Error Budget et Root Cause Analysis (RCA). - Participer aux études d'impact et aux changements techniques transverses complexes. - Présenter les analyses et synthèses aux interlocuteurs métiers et IT. - Assurer la coordination entre les équipes techniques et métiers. Profil attendu : Minimum 3 ans d'expérience sur un rôle SRE ou équivalent. Profil disposant d'une solide expertise en fiabilité et résilience des services. Expérience de l'observabilité et du monitoring dans des environnements SI complexes. Bonne compréhension des architectures SI et des problématiques d'impacts transverses. Expérience ou certification sur les processus ITIL. Formation SAFe souhaitée/attendue. Capacité à vulgariser des sujets techniques et à communiquer avec des interlocuteurs métiers et IT.
View this job
Contractor
Permanent

Job VacancyIngénieur Fiabilité Site (SRE)

VISIAN
Published on
DevOps
Site Reliability Engineering (SRE)

1 year
Ile-de-France, France
ContexteLe bénéficiaire souhaite une prestation d'accompagnement dans l'objectif d'assurer une mission au sein de l'équipe. MissionsPartager avec les équipes de développement des objectifs communs de disponibilité et de performance de la production Maîtriser des risques et anticiper les impacts sur le SLO des services en production liés aux opérations sur votre périmètre Intégrer et participer dès le début des phases de cadrage des projets et des évolutions à venir Avoir une vision de bout en bout sur l'ensemble des opérations impactant le périmètre (incidents, mises en productions, changements, obsolescence…) Développer de la résilience, en automatisant et en outillant efficacement les opérations afin de réduire le risque d'erreur, augmenter les contrôles à la source et minimiser l'impact des pannes sur l'expérience utilisateur Utiliser de la donnée et les indicateurs de performance au quotidien pour opérer (en automatique ou en manuel à défaut). Être plus réactif en cas d'incident, et prioriser les évolutions de la plateforme afin d'accroître sa résilience Le collaborateur devra réaliser tout ou partie des activités suivantes : Maintien des objectifs de niveau de service Responsabilisation de la disponibilité, de l'intégrité, de la résilience et de la qualité de la plateforme de production Remise en service en cas d'incidents, en mobilisant les ressources adéquates si nécessaire Une culture DevOps au service de l'innovation Travail en étroite collaboration avec les équipes de développement et d'exploitation, afin d'être informé des changements prévus et d'anticiper leurs impacts sur la production Information des équipes de développement sur les sujets des environnements hors-prod afin de prendre en compte les contraintes opérationnelles au plus tôt
View this job
Contractor
Permanent

Job VacancyService Reliability Engineer (SRE)

INFOTEL CONSEIL
Published on
DevOps
Incident Management
Monitoring

3 months
Paris, France
Au sein d'une Direction IT et du département Production, le consultant intégrera une équipe transverse en charge de la fiabilité et de l'excellence opérationnelle des plateformes de production critiques. La mission s'inscrit dans une démarche de transformation des pratiques d'exploitation avec pour objectif de renforcer la disponibilité, la résilience, la performance et la sécurité des services, tout en améliorant leur exploitabilité et en réduisant les risques opérationnels. Positionné à l'interface entre les équipes Production, Développement, DevOps et Sécurité, le SRE intervient sur l'ensemble du cycle de vie des applications. Il accompagne les équipes dans l'anticipation des impacts des changements, la gestion et la prévention des incidents ainsi que dans la mise en œuvre des bonnes pratiques de production. Une part importante de la mission concerne également le pilotage des niveaux de service (SLO), la mise en place de dispositifs de supervision, d'alerting et de tableaux de bord, ainsi que l'analyse des métriques permettant d'identifier les risques et les axes d'amélioration. Le consultant contribuera à l'automatisation des activités de production, à la maîtrise de l'obsolescence et des risques IT/Cybersécurité ainsi qu'aux démarches d'amélioration continue. Il participera également aux analyses post-incidents, aux RETEX et à la diffusion des bonnes pratiques au sein de la communauté Production/SRE. L'environnement est international et transverse, avec de nombreux interlocuteurs techniques et métiers et une utilisation régulière de l'anglais.
View this job
Contractor

Contractor jobIngénieur(e) Production & SRE - Nice

VISIAN
Published on
Cassandra
Elasticsearch
Filebeat

3 years
Nice, Provence-Alpes-Côte d'Azur
Le contextePour l'un de nos clients, nous recherchons un(e) Ingénieur(e) Production & SRE afin de reprendre en main la chaîne d'observabilité existante sur un périmètre applicatif critique, l'améliorer et réduire le RUN. L'objectif est de rendre les équipes dev et support autonomes et de faire baisser durablement les escalades N3. Vos missions Maintien en conditions opérationnelles de la stack Elastic (Elasticsearch, Kibana, Logstash, Filebeat) sur tous les environnements : utilisateurs et rôles, index et ILM, upgrades, pipelines d'ingestion, alerting Observabilité applicative : APM / OpenTelemetry, dashboards et alerting préventifs par composant critique, définition et suivi des SLO / SLI, tests de performance JMeter Analyse de production : lecture et corrélation des logs, détection des patterns récurrents et signaux faibles (saturation, dérives de performance, capacity) pour traiter les causes avant l'incident Post-mortems et recherche de causes racines sur les incidents majeurs, plans d'action trackés, alimentation du Problem Management Shift-left avec le support : runbooks avec le N2, dashboards exploitables par le N1 / N2 Montée en autonomie des développeurs : pairing (lecture de logs, diagnostic), kit d'autonomie dev Pilotage par la mesure : baseline et indicateurs (heures de support N3, taux d'escalade, MTTR, SLA applicatives, couverture d'alerting) Contribution à la roadmap technique fiabilité et observabilité, portée en PI Planning
View this job
Contractor
Permanent

Job VacancyINGÉNIEUR PRODUCTION & SRE

RIDCHA DATA
Published on
Agile Scrum
Cassandra
DevOps

1 year
40k-45k €
400-550 €
Sophia Antipolis, Provence-Alpes-Côte d'Azur
Notre client, acteur majeur des services numériques de confiance, recherche un Ingénieur Production & SRE pour renforcer son équipe d'ingénierie. Vous évoluerez sur des plateformes numériques critiques, avec un objectif clair : améliorer la fiabilité, l'observabilité et la performance de la production tout en réduisant progressivement le RUN et les escalades vers le N3. 🎯 Votre mission Vous serez au cœur des sujets Production, SRE et Observabilité, avec une forte dimension d'analyse et d'amélioration continue. Vos principales responsabilités : 🔹 Administrer et maintenir la stack Elastic : Elasticsearch, Kibana, Logstash, Filebeat 🔹 Mettre en place et faire évoluer les dashboards, alertes et indicateurs de supervision 🔹 Développer l'observabilité applicative avec APM / OpenTelemetry 🔹 Définir et suivre les SLO / SLI 🔹 Analyser les logs, corréler les signaux et identifier les causes racines des incidents 🔹 Détecter les patterns récurrents, signaux faibles, problèmes de capacité et dérives de performance 🔹 Réaliser les post-mortems et piloter les plans d'actions associés 🔹 Construire des runbooks et accompagner les équipes Support N1/N2 🔹 Faire monter les équipes de développement en autonomie sur le diagnostic et l'analyse de production 🔹 Automatiser les tâches récurrentes avec Python 🔹 Réaliser des tests de performance avec JMeter 🔹 Contribuer à la roadmap technique et aux démarches d'amélioration de la fiabilité 🔹 Participer aux instances Agile / SAFe / PI Planning 👉 L'objectif n'est pas d'ajouter du RUN, mais bien de reprendre l'existant, le fiabiliser, l'industrialiser et progressivement le réduire. 🛠️ Environnement technique : Observabilité / Logs : Elastic Stack, Elasticsearch, Kibana, Logstash, Filebeat, APM, OpenTelemetry Développement & automatisation : Java, Python Infrastructure : Kubernetes, environnements de production critiques Bases de données : PostgreSQL, Cassandra DevOps / CI-CD : Jenkins, SonarQube, Nexus Performance : JMeter Méthodologie : Agile / SAFe / PI Planning
View this job
Contractor

Contractor jobUn Architecte / Expert Dynatrace Managed sur Blois

Almatek
Published on
AWS Cloud
Azure
Datadog

6 months
470-530 €
Blois, Centre-Val de Loire
Almatek recherche pour l'un de ses clients, un Architecte / Expert Dynatrace Managed sur Blois. Contexte de la mission Dans le cadre du renforcement d'une démarche stratégique d'Observabilité IT et SRE, l'équipe en charge de l'Observabilité recherche un expert Dynatrace & SRE afin d'accompagner la mise en œuvre, l'industrialisation et l'évolution des pratiques d'observabilité. L'intervention couvrira les environnements Production et Hors Production, avec un fort enjeu autour de l'analyse de bout en bout, du suivi de la performance, de la fiabilité des services et de la mise en œuvre des pratiques SRE. Description de la mission: Le consultant interviendra notamment sur les activités suivantes : Réaliser des analyses et formuler des préconisations en Production et Hors Production à l'aide de Dynatrace, sur les flux TP et batch. Assurer le suivi et l'analyse de la production via Dynatrace. Intervenir en tant que référent technique et Lead lors de situations de type Task Force. Concevoir et animer des workshops et sessions de formation autour de Dynatrace. Accompagner la montée en compétence des équipes sur Dynatrace Managed, Grail et leur infrastructure. Contribuer aux projets de migration de Dynatrace Managed vers Grail ou vers une solution d'observabilité alternative. Mettre en œuvre les principes et pratiques SRE : SLO, indicateurs de fiabilité, automatisation, etc. Concevoir des tableaux de bord métier et IT de bout en bout. Assurer un support technique de niveau N2/N3 sur Dynatrace. Contribuer à l'analyse de l'expérience utilisateur (UX) et à l'identification des axes d'amélioration. Livrables attendus: Rapports d'analyse à la demande sur les environnements Production et Hors Production. Tableaux de bord métier et IT dans Dynatrace. Définition et mise en œuvre de SLO sur les KPI métier et IT. Comptes rendus de réunions et d'ateliers. Supports de formation et de workshops. Suivi de l'activité et des actions dans Jira. Documentation technique et fonctionnelle interne.
View this job
Contractor

Contractor jobIngénieur Systèmes Senior - Exploitation & Fiabilité

Actual Talent
Published on
Administration système
Ansible
API REST

6 months
300 €
Romainville, Ile-de-France
Contexte de la mission Notre client souhaite renforcer la capacité de réalisation d'IT Operations sur plusieurs chantiers d'exploitation, de fiabilisation et d'industrialisation du Run. Nous recherchons un ingénieur systèmes expérimenté, capable de prendre en charge un sujet opérationnel de bout en bout. À partir d'un environnement existant, d'un besoin ou d'un problème à résoudre, il doit pouvoir analyser la situation, proposer les actions nécessaires, les mettre en œuvre, les tester puis les documenter. Le profil recherché dispose d'un socle systèmes et exploitation solide, reste proche de la technique et sait intervenir sur des environnements variés. Il doit être suffisamment autonome pour investiguer, traiter les cas complexes et transformer progressivement les opérations récurrentes en pratiques fiables, documentées et automatisées. Objectifs et livrables Renforcer la capacité de réalisation d'IT Operations sur les chantiers de fiabilisation et d'industrialisation du Run, depuis l'analyse de l'existant jusqu'à la mise en production, l'automatisation, les tests et la documentation. Premier chantier - Migration Cloud Control : - Analyse de l'existant et qualification des VM / workloads restant à traiter. - Identification des dépendances, contraintes et cas bloquants. - Préparation et réalisation des migrations ou arrêts selon la cible retenue. - Réalisation des contrôles techniques avant et après migration. - Diagnostic et résolution des anomalies rencontrées pendant les opérations. - Scripting ou automatisation des contrôles et opérations répétitives lorsque pertinent. - Nettoyage des composants devenus inutiles et contribution à la rationalisation de l'environnement. - Documentation des opérations réalisées, des exceptions et des procédures nécessaires au Run. Chantiers suivants envisagés : Sauvegarde, restauration & PRA Montées de version des filers via MLM MCO, automatisation et fiabilité du Run
View this job
Contractor

Contractor jobData Reliability Engineer (Run) (H/F)

Cherry Pick
Published on
AWS Cloud
Data Engineering
Linux

12 months
Paris, France
En quelques motsCherry Pick est à la recherche d'un Support & Data Reliability Engineer(H/F), pour le compte de l'un de ses clients qui opère dans le domaine financier. Description🚀 Contexte de la missionAu sein du département Data Technology d'un acteur majeur de la gestion d'actifs et de la finance quantitative, vous intégrez l'équipe en tant que Support & Reliability Engineer (H/F). Votre rôle sera d'assurer la gestion, la robustesse et la fiabilité maximale des systèmes et processus de données. Vous travaillerez en étroite collaboration avec les équipes de développement, les Data Engineers, les Data Scientists et les Quantitative Developers pour garantir la disponibilité, la qualité et les performances des pipelines de données critiques. 🎯 Missions principales & Rôle1. Support Data & Opérations : Assurer le support N1 sur le périmètre Data, gérer les alertes en temps réel et résoudre les incidents durant le shift de Paris. Agir en tant que Gatekeeper pour la gestion des mises en production (Data Release Management / CMRM process) et la fiabilité des données. Définir et faire appliquer les politiques de gestion des données (sauvegarde, restauration, sécurité, conformité). 2. Automation, Monitoring & Fiabilité : Maintenir des pipelines de données fiables, performants et scalables (collecte, stockage, traitement, diffusion). Mettre en place un monitoring proactif et continu pour détecter les anomalies de qualité, d'intégrité et de consistance des données. Automatiser les tâches récurrentes pour optimiser l'efficacité opérationnelle et réduire le risque d'erreur humaine. 3. Collaboration Transverse & Conduite du Changement : Collaborer avec les développeurs quantitatifs, Data Engineers et Data Scientists pour comprendre leurs besoins et résoudre les dysfonctionnements. Promouvoir les meilleures pratiques de développement axées sur la fiabilité des données. Rédiger et maintenir la documentation technique et opérationnelle. 🏁 ObjectifsGarantir la haute disponibilité et la cohérence des pipelines de données en production. Réduire le temps moyen de résolution (MTTR) des incidents Data durant le shift de Paris. Industrialiser et automatiser les processus récurrents de maintenance et de monitoring.
View this job
Contractor
Permanent

Job VacancyINGÉNIEUR PRODUCTION & SRE

RIDCHA DATA
Published on
Agile Scrum
Cassandra
DevOps

1 year
40k-45k €
400-550 €
Sophia Antipolis, Provence-Alpes-Côte d'Azur
Notre client, acteur majeur des services numériques de confiance, recherche un Ingénieur Production & SRE pour renforcer son équipe d'ingénierie. Vous évoluerez sur des plateformes numériques critiques, avec un objectif clair : améliorer la fiabilité, l'observabilité et la performance de la production tout en réduisant progressivement le RUN et les escalades vers le N3. 🎯 Votre missionVous serez au cœur des sujets Production, SRE et Observabilité, avec une forte dimension d'analyse et d'amélioration continue. Vos principales responsabilités : 🔹 Administrer et maintenir la stack Elastic : Elasticsearch, Kibana, Logstash, Filebeat 🔹 Mettre en place et faire évoluer les dashboards, alertes et indicateurs de supervision 🔹 Développer l'observabilité applicative avec APM / OpenTelemetry 🔹 Définir et suivre les SLO / SLI 🔹 Analyser les logs, corréler les signaux et identifier les causes racines des incidents 🔹 Détecter les patterns récurrents, signaux faibles, problèmes de capacité et dérives de performance 🔹 Réaliser les post-mortems et piloter les plans d'actions associés 🔹 Construire des runbooks et accompagner les équipes Support N1/N2 🔹 Faire monter les équipes de développement en autonomie sur le diagnostic et l'analyse de production 🔹 Automatiser les tâches récurrentes avec Python 🔹 Réaliser des tests de performance avec JMeter 🔹 Contribuer à la roadmap technique et aux démarches d'amélioration de la fiabilité 🔹 Participer aux instances Agile / SAFe / PI Planning 👉 L'objectif n'est pas d'ajouter du RUN, mais bien de reprendre l'existant, le fiabiliser, l'industrialiser et progressivement le réduire. 🛠️ Environnement technique :Observabilité / Logs : Elastic Stack, Elasticsearch, Kibana, Logstash, Filebeat, APM, OpenTelemetry Développement & automatisation : Java, Python Infrastructure : Kubernetes, environnements de production critiques Bases de données : PostgreSQL, Cassandra DevOps / CI-CD : Jenkins, SonarQube, Nexus Performance : JMeter Méthodologie : Agile / SAFe / PI Planning
View this job
Contractor

Contractor jobSRE DevOps IA/MLOps Junior H/F

Le Groupe SYD
Published on
Ansible
CI/CD
ELK

12 months
450-480 €
Paris, France
🌟 Quel sera ton poste ? 🌟 💼 Poste : SRE DevOps IA/MLOps Junior H/F 📍 Lieu : Paris (75) 🏠 Télétravail : Flexible 📝 Contrat : Freelance 💸 TJM : 450€-480€ 👉 Contexte client : Tu rejoins un acteur majeur du numérique engagé dans le développement et l'industrialisation de solutions innovantes basées sur l'Intelligence Artificielle et le Machine Learning. Dans un contexte de forte accélération des usages IA, l'enjeu est de construire, fiabiliser et automatiser les plateformes techniques supportant l'entraînement, le déploiement et l'exploitation des modèles d'intelligence artificielle. Les équipes travaillent sur des environnements critiques nécessitant une forte disponibilité, une observabilité avancée et une industrialisation des processus afin d'accompagner les projets IA à grande échelle. En tant que SRE DevOps IA/MLOps Junior, tu interviens à l'interface entre les équipes Data, IA et Exploitation afin de garantir la performance, la résilience et l'automatisation des plateformes supportant les solutions de Machine Learning et d'IA générative. Tu auras pour missions de : Concevoir, déployer et maintenir les infrastructures nécessaires aux plateformes IA et Machine Learning. Participer à l'industrialisation des environnements MLOps et IA Ops. Automatiser les déploiements, l'exploitation et la supervision des services. Mettre en œuvre les bonnes pratiques Site Reliability Engineering (SRE) afin d'améliorer la fiabilité et la résilience des plateformes. Participer à l'optimisation des environnements d'entraînement et d'inférence des modèles IA. Déployer et maintenir les solutions de monitoring, d'observabilité et d'alerting. Accompagner les équipes Data Science et IA dans l'industrialisation des pipelines de développement et de déploiement. Participer à la gestion des incidents, à l'amélioration continue et à l'automatisation des processus d'exploitation. Contribuer à la mise en place et à l'exploitation de solutions d'IA générative telles que Claude. Rédiger et maintenir la documentation technique et les procédures d'exploitation. 🧰 Stack technique : DevOps & Automatisation : Git, CI/CD, Ansible, Terraform. Conteneurisation & Orchestration : Docker, Kubernetes. Observabilité : Prometheus, Grafana, ELK, Monitoring & Alerting. IA / Machine Learning : MLOps, IA Ops, plateformes d'entraînement, de déploiement et d'exploitation de modèles IA/ML, IA générative (Claude). Systèmes : Linux. Scripting : Python, Bash.
View this job
Contractor

Contractor jobIngénieur DevOps

Phaidon London- Glocomms
Published on
Ansible
DevOps
Kubernetes

12 months
700-800 €
Paris, France
Notre client recherche un Ingénieur Plateforme / DevOps expérimenté pour accompagner des projets de modernisation des plateformes et de migration vers le cloud. En étroite collaboration avec les équipes de développement, vous contribuerez à comprendre les charges applicatives, à améliorer les capacités des plateformes et à mettre en œuvre des solutions d'infrastructure automatisées et évolutives. Le candidat idéal possède une solide expérience en DevOps, ingénierie des plateformes et administration des systèmes, ainsi qu'une bonne compréhension du développement logiciel, de la configuration des applications et des environnements d'exécution. Responsabilités principalesCollaborer avec les équipes de développement afin de comprendre les architectures applicatives et les charges de travail. Participer aux projets de transformation des plateformes et de migration des infrastructures. Concevoir, déployer et maintenir des plateformes sécurisées, évolutives et hautement disponibles. Automatiser les infrastructures, les déploiements et les processus opérationnels via l'Infrastructure as Code (IaC). Optimiser les pipelines CI/CD et les pratiques de livraison logicielle. Assurer le support des déploiements applicatifs et résoudre les problèmes de performance des plateformes. Promouvoir les bonnes pratiques DevOps auprès des équipes techniques. Compétences et expérience requisesExpérience confirmée en tant qu'Ingénieur Plateforme, Ingénieur DevOps, Site Reliability Engineer (SRE) ou Ingénieur Infrastructure. Solide expertise en DevOps, automatisation et ingénierie des plateformes. Expérience couvrant à la fois les environnements d'infrastructure et les environnements applicatifs. Bonne compréhension du déploiement, de la configuration et de l'exploitation des applications. Maîtrise d'outils tels que Terraform, Ansible, Docker, Kubernetes et des pipelines CI/CD. Solides compétences en administration de systèmes Linux et/ou Windows. Expérience avec des environnements cloud tels que AWS, Azure ou GCP. Atouts supplémentairesExpérience en développement logiciel (Python, Go, Java, .NET ou équivalent). Participation à des projets de migration cloud ou de transformation des plateformes. Connaissances des outils de monitoring, d'observabilité et des pratiques DevSecOps. Une expérience dans le secteur des services financiers constitue un avantage. Profil recherchéUn ingénieur polyvalent combinant une forte expertise DevOps et plateforme, capable de travailler au plus près des équipes de développement, de comprendre les besoins applicatifs et de contribuer à la mise en place de plateformes modernes, automatisées et évolutives.
View this job
Apprenticeship

Apprenticeship offerTrainee DevOps Engineer | No experience needed (Ref: 7501)

█ █ █ ██ █ █
Published on
CI/CD
DevOps
Docker

London, England, United Kingdom

Imported from

Job from the tech market, identified automatically to give you a complete view of the opportunities.

Restricted access to the community

Join our platform to access the details of this job and get access to the best offers on the market.

View this job

Connecting Tech-Talent

Free-Work, THE platform for all IT professionals.

Free-workers
Resources
About
Recruiters area
2026 © Free-Work / AGSI SAS
Follow us