Trouvez votre prochaine offre d’emploi ou de mission freelance Site Reliability Engineering (SRE)

Votre recherche renvoie 27 résultats.
Freelance
CDI

Offre d'emploiService Reliability Engineer (SRE)

INFOTEL CONSEIL
Publiée le
DevOps
Incident Management
Monitoring

3 mois
Paris, France
Au sein d'une Direction IT et du département Production, le consultant intégrera une équipe transverse en charge de la fiabilité et de l'excellence opérationnelle des plateformes de production critiques. La mission s'inscrit dans une démarche de transformation des pratiques d'exploitation avec pour objectif de renforcer la disponibilité, la résilience, la performance et la sécurité des services, tout en améliorant leur exploitabilité et en réduisant les risques opérationnels. Positionné à l'interface entre les équipes Production, Développement, DevOps et Sécurité, le SRE intervient sur l'ensemble du cycle de vie des applications. Il accompagne les équipes dans l'anticipation des impacts des changements, la gestion et la prévention des incidents ainsi que dans la mise en œuvre des bonnes pratiques de production. Une part importante de la mission concerne également le pilotage des niveaux de service (SLO), la mise en place de dispositifs de supervision, d'alerting et de tableaux de bord, ainsi que l'analyse des métriques permettant d'identifier les risques et les axes d'amélioration. Le consultant contribuera à l'automatisation des activités de production, à la maîtrise de l'obsolescence et des risques IT/Cybersécurité ainsi qu'aux démarches d'amélioration continue. Il participera également aux analyses post-incidents, aux RETEX et à la diffusion des bonnes pratiques au sein de la communauté Production/SRE. L'environnement est international et transverse, avec de nombreux interlocuteurs techniques et métiers et une utilisation régulière de l'anglais.
Voir cette offre
Freelance

Mission freelanceIngénieur(e) Production & SRE - Nice

VISIAN
Publiée le
Cassandra
Elasticsearch
Filebeat

3 ans
Nice, Provence-Alpes-Côte d'Azur
Le contextePour l'un de nos clients, nous recherchons un(e) Ingénieur(e) Production & SRE afin de reprendre en main la chaîne d'observabilité existante sur un périmètre applicatif critique, l'améliorer et réduire le RUN. L'objectif est de rendre les équipes dev et support autonomes et de faire baisser durablement les escalades N3. Vos missions Maintien en conditions opérationnelles de la stack Elastic (Elasticsearch, Kibana, Logstash, Filebeat) sur tous les environnements : utilisateurs et rôles, index et ILM, upgrades, pipelines d'ingestion, alerting Observabilité applicative : APM / OpenTelemetry, dashboards et alerting préventifs par composant critique, définition et suivi des SLO / SLI, tests de performance JMeter Analyse de production : lecture et corrélation des logs, détection des patterns récurrents et signaux faibles (saturation, dérives de performance, capacity) pour traiter les causes avant l'incident Post-mortems et recherche de causes racines sur les incidents majeurs, plans d'action trackés, alimentation du Problem Management Shift-left avec le support : runbooks avec le N2, dashboards exploitables par le N1 / N2 Montée en autonomie des développeurs : pairing (lecture de logs, diagnostic), kit d'autonomie dev Pilotage par la mesure : baseline et indicateurs (heures de support N3, taux d'escalade, MTTR, SLA applicatives, couverture d'alerting) Contribution à la roadmap technique fiabilité et observabilité, portée en PI Planning
Voir cette offre
Freelance
CDI

Offre d'emploiINGÉNIEUR PRODUCTION & SRE

RIDCHA DATA
Publiée le
Agile Scrum
Cassandra
DevOps

1 an
40k-45k €
400-550 €
Sophia Antipolis, Provence-Alpes-Côte d'Azur
Notre client, acteur majeur des services numériques de confiance, recherche un Ingénieur Production & SRE pour renforcer son équipe d'ingénierie. Vous évoluerez sur des plateformes numériques critiques, avec un objectif clair : améliorer la fiabilité, l'observabilité et la performance de la production tout en réduisant progressivement le RUN et les escalades vers le N3. 🎯 Votre mission Vous serez au cœur des sujets Production, SRE et Observabilité, avec une forte dimension d'analyse et d'amélioration continue. Vos principales responsabilités : 🔹 Administrer et maintenir la stack Elastic : Elasticsearch, Kibana, Logstash, Filebeat 🔹 Mettre en place et faire évoluer les dashboards, alertes et indicateurs de supervision 🔹 Développer l'observabilité applicative avec APM / OpenTelemetry 🔹 Définir et suivre les SLO / SLI 🔹 Analyser les logs, corréler les signaux et identifier les causes racines des incidents 🔹 Détecter les patterns récurrents, signaux faibles, problèmes de capacité et dérives de performance 🔹 Réaliser les post-mortems et piloter les plans d'actions associés 🔹 Construire des runbooks et accompagner les équipes Support N1/N2 🔹 Faire monter les équipes de développement en autonomie sur le diagnostic et l'analyse de production 🔹 Automatiser les tâches récurrentes avec Python 🔹 Réaliser des tests de performance avec JMeter 🔹 Contribuer à la roadmap technique et aux démarches d'amélioration de la fiabilité 🔹 Participer aux instances Agile / SAFe / PI Planning 👉 L'objectif n'est pas d'ajouter du RUN, mais bien de reprendre l'existant, le fiabiliser, l'industrialiser et progressivement le réduire. 🛠️ Environnement technique : Observabilité / Logs : Elastic Stack, Elasticsearch, Kibana, Logstash, Filebeat, APM, OpenTelemetry Développement & automatisation : Java, Python Infrastructure : Kubernetes, environnements de production critiques Bases de données : PostgreSQL, Cassandra DevOps / CI-CD : Jenkins, SonarQube, Nexus Performance : JMeter Méthodologie : Agile / SAFe / PI Planning
Voir cette offre
Freelance

Mission freelanceIngénieur Systèmes Senior - Exploitation & Fiabilité

Actual Talent
Publiée le
Administration système
Ansible
API REST

6 mois
300 €
Romainville, Île-de-France
Contexte de la mission Notre client souhaite renforcer la capacité de réalisation d'IT Operations sur plusieurs chantiers d'exploitation, de fiabilisation et d'industrialisation du Run. Nous recherchons un ingénieur systèmes expérimenté, capable de prendre en charge un sujet opérationnel de bout en bout. À partir d'un environnement existant, d'un besoin ou d'un problème à résoudre, il doit pouvoir analyser la situation, proposer les actions nécessaires, les mettre en œuvre, les tester puis les documenter. Le profil recherché dispose d'un socle systèmes et exploitation solide, reste proche de la technique et sait intervenir sur des environnements variés. Il doit être suffisamment autonome pour investiguer, traiter les cas complexes et transformer progressivement les opérations récurrentes en pratiques fiables, documentées et automatisées. Objectifs et livrables Renforcer la capacité de réalisation d'IT Operations sur les chantiers de fiabilisation et d'industrialisation du Run, depuis l'analyse de l'existant jusqu'à la mise en production, l'automatisation, les tests et la documentation. Premier chantier - Migration Cloud Control : - Analyse de l'existant et qualification des VM / workloads restant à traiter. - Identification des dépendances, contraintes et cas bloquants. - Préparation et réalisation des migrations ou arrêts selon la cible retenue. - Réalisation des contrôles techniques avant et après migration. - Diagnostic et résolution des anomalies rencontrées pendant les opérations. - Scripting ou automatisation des contrôles et opérations répétitives lorsque pertinent. - Nettoyage des composants devenus inutiles et contribution à la rationalisation de l'environnement. - Documentation des opérations réalisées, des exceptions et des procédures nécessaires au Run. Chantiers suivants envisagés : Sauvegarde, restauration & PRA Montées de version des filers via MLM MCO, automatisation et fiabilité du Run
Voir cette offre
Freelance

Mission freelanceUn Architecte / Expert Dynatrace Managed sur Blois

Almatek
Publiée le
AWS Cloud
Azure
Datadog

6 mois
470-530 €
Blois, Centre-Val de Loire
Almatek recherche pour l'un de ses clients, un Architecte / Expert Dynatrace Managed sur Blois. Contexte de la mission Dans le cadre du renforcement d'une démarche stratégique d'Observabilité IT et SRE, l'équipe en charge de l'Observabilité recherche un expert Dynatrace & SRE afin d'accompagner la mise en œuvre, l'industrialisation et l'évolution des pratiques d'observabilité. L'intervention couvrira les environnements Production et Hors Production, avec un fort enjeu autour de l'analyse de bout en bout, du suivi de la performance, de la fiabilité des services et de la mise en œuvre des pratiques SRE. Description de la mission: Le consultant interviendra notamment sur les activités suivantes : Réaliser des analyses et formuler des préconisations en Production et Hors Production à l'aide de Dynatrace, sur les flux TP et batch. Assurer le suivi et l'analyse de la production via Dynatrace. Intervenir en tant que référent technique et Lead lors de situations de type Task Force. Concevoir et animer des workshops et sessions de formation autour de Dynatrace. Accompagner la montée en compétence des équipes sur Dynatrace Managed, Grail et leur infrastructure. Contribuer aux projets de migration de Dynatrace Managed vers Grail ou vers une solution d'observabilité alternative. Mettre en œuvre les principes et pratiques SRE : SLO, indicateurs de fiabilité, automatisation, etc. Concevoir des tableaux de bord métier et IT de bout en bout. Assurer un support technique de niveau N2/N3 sur Dynatrace. Contribuer à l'analyse de l'expérience utilisateur (UX) et à l'identification des axes d'amélioration. Livrables attendus: Rapports d'analyse à la demande sur les environnements Production et Hors Production. Tableaux de bord métier et IT dans Dynatrace. Définition et mise en œuvre de SLO sur les KPI métier et IT. Comptes rendus de réunions et d'ateliers. Supports de formation et de workshops. Suivi de l'activité et des actions dans Jira. Documentation technique et fonctionnelle interne.
Voir cette offre
Freelance
CDI

Offre d'emploiINGÉNIEUR PRODUCTION & SRE

RIDCHA DATA
Publiée le
Agile Scrum
Cassandra
DevOps

1 an
40k-45k €
400-550 €
Sophia Antipolis, Provence-Alpes-Côte d'Azur
Notre client, acteur majeur des services numériques de confiance, recherche un Ingénieur Production & SRE pour renforcer son équipe d'ingénierie. Vous évoluerez sur des plateformes numériques critiques, avec un objectif clair : améliorer la fiabilité, l'observabilité et la performance de la production tout en réduisant progressivement le RUN et les escalades vers le N3. 🎯 Votre missionVous serez au cœur des sujets Production, SRE et Observabilité, avec une forte dimension d'analyse et d'amélioration continue. Vos principales responsabilités : 🔹 Administrer et maintenir la stack Elastic : Elasticsearch, Kibana, Logstash, Filebeat 🔹 Mettre en place et faire évoluer les dashboards, alertes et indicateurs de supervision 🔹 Développer l'observabilité applicative avec APM / OpenTelemetry 🔹 Définir et suivre les SLO / SLI 🔹 Analyser les logs, corréler les signaux et identifier les causes racines des incidents 🔹 Détecter les patterns récurrents, signaux faibles, problèmes de capacité et dérives de performance 🔹 Réaliser les post-mortems et piloter les plans d'actions associés 🔹 Construire des runbooks et accompagner les équipes Support N1/N2 🔹 Faire monter les équipes de développement en autonomie sur le diagnostic et l'analyse de production 🔹 Automatiser les tâches récurrentes avec Python 🔹 Réaliser des tests de performance avec JMeter 🔹 Contribuer à la roadmap technique et aux démarches d'amélioration de la fiabilité 🔹 Participer aux instances Agile / SAFe / PI Planning 👉 L'objectif n'est pas d'ajouter du RUN, mais bien de reprendre l'existant, le fiabiliser, l'industrialiser et progressivement le réduire. 🛠️ Environnement technique :Observabilité / Logs : Elastic Stack, Elasticsearch, Kibana, Logstash, Filebeat, APM, OpenTelemetry Développement & automatisation : Java, Python Infrastructure : Kubernetes, environnements de production critiques Bases de données : PostgreSQL, Cassandra DevOps / CI-CD : Jenkins, SonarQube, Nexus Performance : JMeter Méthodologie : Agile / SAFe / PI Planning
Voir cette offre
Freelance

Mission freelanceData Reliability Engineer (Run) (H/F)

Cherry Pick
Publiée le
AWS Cloud
Data Engineering
Linux

12 mois
Paris, France
En quelques motsCherry Pick est à la recherche d'un Support & Data Reliability Engineer(H/F), pour le compte de l'un de ses clients qui opère dans le domaine financier. Description🚀 Contexte de la missionAu sein du département Data Technology d'un acteur majeur de la gestion d'actifs et de la finance quantitative, vous intégrez l'équipe en tant que Support & Reliability Engineer (H/F). Votre rôle sera d'assurer la gestion, la robustesse et la fiabilité maximale des systèmes et processus de données. Vous travaillerez en étroite collaboration avec les équipes de développement, les Data Engineers, les Data Scientists et les Quantitative Developers pour garantir la disponibilité, la qualité et les performances des pipelines de données critiques. 🎯 Missions principales & Rôle1. Support Data & Opérations : Assurer le support N1 sur le périmètre Data, gérer les alertes en temps réel et résoudre les incidents durant le shift de Paris. Agir en tant que Gatekeeper pour la gestion des mises en production (Data Release Management / CMRM process) et la fiabilité des données. Définir et faire appliquer les politiques de gestion des données (sauvegarde, restauration, sécurité, conformité). 2. Automation, Monitoring & Fiabilité : Maintenir des pipelines de données fiables, performants et scalables (collecte, stockage, traitement, diffusion). Mettre en place un monitoring proactif et continu pour détecter les anomalies de qualité, d'intégrité et de consistance des données. Automatiser les tâches récurrentes pour optimiser l'efficacité opérationnelle et réduire le risque d'erreur humaine. 3. Collaboration Transverse & Conduite du Changement : Collaborer avec les développeurs quantitatifs, Data Engineers et Data Scientists pour comprendre leurs besoins et résoudre les dysfonctionnements. Promouvoir les meilleures pratiques de développement axées sur la fiabilité des données. Rédiger et maintenir la documentation technique et opérationnelle. 🏁 ObjectifsGarantir la haute disponibilité et la cohérence des pipelines de données en production. Réduire le temps moyen de résolution (MTTR) des incidents Data durant le shift de Paris. Industrialiser et automatiser les processus récurrents de maintenance et de monitoring.
Voir cette offre
CDD

Offre d'emploi DevOps Engineer

LA International Computer Consultants Ltd
Publiée le

7 mois
Northampton, Angleterre, Royaume-Uni
Job title: DevOps Engineer Location: Glasgow or Northampton (Hybrid) Contract Length: 12 Months Day Rate: £336 per day IR35 Status: Inside IR35 Sector: Financial Services Overview We are seeking an experienced DevOps Engineer with AWS/.NET/C# expertise to join a leading Financial Services organisation. This role sits within an operational engineering team focused on reliability, automation, cloud infrastructure, and platform support. The position combines elements of Site Reliability Engineering (SRE), DevOps, and software development, requiring a strong AWS background alongside the ability to contribute to C# development activities. The successful candidate will work closely with development, infrastructure, and support teams to enhance platform stability, automate processes, and improve operational efficiency across cloud-based environments. Key Responsibilities * Support and enhance AWS-hosted applications and infrastructure. * Drive DevOps best practices, including CI/CD automation and Infrastructure as Code. * Contribute to Site Reliability Engineering initiatives, focusing on system resilience, monitoring, and performance. * Develop and maintain tools, services, and automation solutions using C#/.NET. * Troubleshoot production issues and identify opportunities for operational improvement. * Work collaboratively with development teams to ensure reliable and scalable deployments. * Implement monitoring, alerting, and observability solutions across cloud environments. * Participate in incident management and root cause analysis activities. Essential Skills & Experience * Strong commercial experience with AWS Cloud technologies. * Proven background in DevOps engineering and automation. * Experience with CI/CD pipelines and Infrastructure as Code. * Hands-on experience with C#/.NET development. * Understanding of Site Reliability Engineering (SRE) principles and practices. * Experience supporting production environments and resolving complex technical issues. * Minimum 5 years' recent, relevant industry experience. Desirable Skills * Experience within Financial Services environments. * Knowledge of cloud security and governance best practices. * Experience with containerisation technologies and orchestration platforms. * Familiarity with monitoring and observability tooling. Ideal Candidate You will be a technically strong AWS and DevOps professional with a passion for operational excellence and automation. While strong C# skills are preferred, candidates with exceptional AWS and DevOps expertise and some .NET development experience will also be considered. This is an excellent opportunity to join a high-performing engineering team working on critical cloud platforms within a complex Financial Services environment. LA International is an award-winning partner of choice for many of the world's most influential companies and government organisations. Holding Enhanced Government Security Accreditation, we are recognised as the European market leader in the delivery of Security Cleared talent to organisations that demand the very highest levels of security, compliance and assurance. A multiple award-winning organisation, having secured the prestigious Queens Award for Enterprise: International Trade over consecutive years. We are committed to fostering an inclusive, equitable and accessible workplace where everyone feels valued and supported. We welcome applications from all individuals, regardless of background or identity, and we encourage candidates who may not meet every listed requirement to still apply. If you require any adjustments or support during the recruitment process, please let us know and we will work with you to ensure a fair and accessible experience. Please Note: If a high volume of applications is received, only candidates shortlisted will be contacted.
Voir cette offre
Freelance
CDI

Offre d'emploiDevOps et Site Reliability Engineering pour une infrastructure d’actifs numériques réglementée

Espritek
Publiée le
Kubernetes

3 ans
Courbevoie, Île-de-France
Contexte de la mission Nous recherchons une expertise en DevOps et Site Reliability Engineering (SRE) afin de contribuer à la construction et à l'exploitation d'une plateforme sécurisée, réglementée et hautement disponible dédiée aux instruments financiers tokenisés. L'entreprise développe une nouvelle capacité autour des Digital Assets, destinée à supporter la tokenisation, les technologies de registres distribués (DLT) et la prochaine génération d'infrastructures des marchés financiers. Nous recherchons une expertise en Infrastructure as Code (IaC), Kubernetes, plateformes conteneurisées et pipelines CI/CD, afin de construire des fondations scalables et de permettre des déploiements contrôlés sans interruption de service (zero downtime). Une observabilité complète est nécessaire afin d'assurer l'exploitation d'un service disponible 24h/24 et 7j/7 : métriques, logs, traces, alerting, Service Level Objectives (SLO) et error budgets. Nous recherchons également une expertise opérationnelle sur la gestion des astreintes, la réponse aux incidents, la création de runbooks opérationnels, les postmortems et le maintien de la stabilité de la plateforme lors d'évolutions rapides des produits et technologies. La mission devra intégrer des pratiques d'infrastructure sécurisées et auditables, adaptées à des workloads réglementés, avec une collaboration étroite avec les équipes sécurité et des contrôles rigoureux concernant l'utilisation de l'IA dans les activités d'engineering. Nous recherchons également une expertise dans l'utilisation de l'AIOps pour la détection d'anomalies, le triage des alertes, la synthèse des incidents ainsi que le monitoring, l'exploitation et le rollback des services IA/ML intégrés aux produits. Objectifs et livrables L'objectif est de mettre en place une fondation opérationnelle résiliente pour une plateforme réglementée d'actifs numériques et de garantir une exploitation fiable à grande échelle. Concevoir et mettre en œuvre l'Infrastructure as Code, notamment avec Terraform, pour le provisioning et la gestion de configurations versionnées et maintenables Construire et optimiser des pipelines CI/CD sécurisés, couvrant intégration continue, déploiement continu, validations automatisées, approbations, auditabilité et mises en production sans interruption Architecturer et exploiter des workloads conteneurisés avec Kubernetes et les technologies d'orchestration associées Mettre en place une solution d'observabilité de bout en bout couvrant métriques, centralisation des logs, distributed tracing, dashboards, alerting et indicateurs de santé opérationnelle Définir et opérationnaliser les SLO, SLI et error budgets en cohérence avec les exigences de fiabilité de la plateforme Mettre en place un modèle d'astreinte 24/7 efficace, incluant procédures d'escalade, workflows de gestion des incidents, responsabilités et continuité de service Produire et maintenir des runbooks clairs et opérationnels pour les opérations récurrentes, incidents, déploiements, reprises et scénarios de panne Renforcer la sécurité de l'infrastructure : hardening, principe du moindre privilège, gestion des secrets, correction des vulnérabilités, contrôles de conformité et gestion auditable des changements Utiliser des outils d'IA pour assister l'engineering, notamment sur l'IaC et la création des pipelines, avec une revue humaine documentée et des contrôles d'approbation avant déploiement Mettre en œuvre des capacités AIOps pour la détection d'anomalies, le triage des alertes, la synthèse des incidents et la rédaction des postmortems Déployer, superviser, exploiter et effectuer des rollbacks sécurisés des services IA/ML, notamment sur les aspects performance, disponibilité et monitoring opérationnel des modèles Produire la documentation technique : décisions d'architecture, procédures opérationnelles, métriques de fiabilité et recommandations d'amélioration continue Garantir la stabilité et la disponibilité de la plateforme malgré des évolutions rapides du produit, tout en maintenant les standards imposés par un environnement réglementé et les objectifs de zero downtime
Voir cette offre

Déposez votre CV

  • Fixez vos conditions

    Rémunération, télétravail... Définissez tous les critères importants pour vous.

  • Faites-vous chasser

    Les recruteurs viennent directement chercher leurs futurs talents dans notre CVthèque.

  • 100% gratuit

    Aucune commission prélevée sur votre mission freelance.

Au service des talents IT

Free-Work est une plateforme qui s'adresse à tous les professionnels des métiers de l'informatique.

Ses contenus et son jobboard IT sont mis à disposition 100% gratuitement pour les indépendants et les salariés du secteur.

Free-workers
Ressources
A propos
Espace recruteurs
2026 © Free-Work / AGSI SAS
Suivez-nous