Trouvez votre prochaine offre d’emploi ou de mission freelance Site Reliability Engineering (SRE)

Votre recherche renvoie 31 résultats.
Freelance

Mission freelanceArchitecte Cloud / Lead Infrastructure Cloud

BEEZEN
Publiée le
Ansible
Architecture
Argo CD

12 mois
600-630 €
Montreuil, Île-de-France
Je recherche un Architecte Cloud / Lead Infrastructure Cloud afin d' intégrer l'équipe de production informatique de mon client qui gère l'environnement d'exploitation (serveurs, stockage, réseau, middleware, etc.). Le périmètre APS IFS doit accélérer sa transformation numérique : conteneurisation, Infrastructure-as-Code (IaC), DevOps, observabilité, automatisation et pratiques SRE. OBJECTIFS Garantir la stabilité et la performance des services de production tout en assurant un rôle de leadership architectural et technique, en parfaite adéquation avec l'environnement IBM DMZR. Vous définirez la vision « cloud-native », mettrez en place la gouvernance IaC, piloterez la transition vers un écosystème de production résilient, observable et automatisé, et élèverez le niveau de compétences de l'équipe de production. Missions : - Architecture opérationnelle • Piloter les revues techniques des nouvelles solutions et challenger les choix architecturaux sous l'angle de l'exploitation et de la maintenabilité. • Définir la vision architecturale « cloud-native » (microservices, architecture événementielle) et établir les normes d'exploitation. • Mettre en œuvre la gouvernance IaC (revues de PR Terraform/Helm, politiques de sécurité). - Leadership technique • Agir en tant que référent technique du domaine ; accompagner les équipes dans les arbitrages complexes. • Aligner les décisions techniques avec les Product Owners pour concilier besoins métier et contraintes techniques. • Élaborer une feuille de route d'apprentissage continu (certifications IBM Cloud, OpenShift, Terraform, Ansible, Python). • Mettre en place des communautés de pratique (IaC, Cloud-Native, AI/ML-Ops) et en suivre l'avancement. - Transformation et modernisation • Contribuer à la feuille de route Cloud/DevOps/SRE ; prioriser la gestion de la dette technique. • Identifier les opportunités d'automatisation (pipelines CI/CD, scripts Python, Ansible, Argo CD). • Piloter les initiatives de conteneurisation (Kubernetes/OpenShift) et les projets « as-code ». • Identifier des cas d'usage de l'IA à fort impact en production (détection prédictive d'anomalies, prévision de capacité, diagnostic automatisé des causes racines) et en prototyper certains. - Observabilité et opérabilité • Définir les exigences minimales de monitoring (Dynatrace, Sysdig, logs cloud). • Développer les pratiques d'observabilité (traçage, métriques, journalisation) et veiller à ce que les nouveaux services respectent les normes de monitoring. COMPÉTENCES Compétences en production : - Infrastructure : architecture, IaC/Terraform - Analyse/optimisation : SRE, analyse des risques et des causes racines - Processus : ITIL, Agile, CI/CD * Outils : - Infrastructure : Terraform, Kubernetes/Openshift, HashiCorp Vault - Automatisation/déploiement : ArgoCD, DigitalAI, Ansible (, Python) - Supervision/Alerting : Dynatrace - Cloud : Helm, Sysdig, Cloud logs - Réseau : Illumio, LAN/VLAN
Voir cette offre
Freelance
CDI

Offre d'emploiDomain Manager SRE Responsable de Domaine SRE

CAT-AMANIA
Publiée le
CI/CD
DevSecOps
Site Reliability Engineering (SRE)

3 ans
Île-de-France, France
Mission Garantir la stabilité, la performance et la disponibilité des services dans les environnements de production et hors production, tout en développant une culture orientée fiabilité au sein des équipes de delivery. Dans ce cadre, le titulaire du poste agit comme le garant de la mise en production des évolutions produit, en veillant à ce que la qualité délivrée soit toujours conforme aux attentes des clients. Collaborer avec les équipes Produit, Technique et Plateforme afin de maintenir un équilibre optimal entre innovation, rapidité d'exécution et robustesse opérationnelle. Activités principales Définir, surveiller et communiquer les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) et les budgets d'erreur (Error Budgets) sur l'ensemble des environnements afin de garantir une fiabilité mesurable pour chaque domaine applicatif. Veiller à la mise en place et à l'amélioration continue des dispositifs d'observabilité, de supervision et d'alerting. Superviser la préparation opérationnelle des mises en production afin de garantir la stabilité des environnements de production grâce à une coordination transverse avec les équipes Produit et Technique. Disposer d'un droit de veto sur une mise en production lorsque le niveau de qualité observé ne répond pas aux attentes des clients. Piloter la gestion des incidents, les analyses des causes racines (Root Cause Analysis) et les revues post-mortem afin d'assurer la responsabilisation des équipes et l'amélioration continue sur chaque domaine applicatif. Collaborer avec les équipes Core Platform, Observability et FinOps afin d'améliorer la résilience des systèmes, optimiser les coûts et maintenir les performances de la plateforme. Communiquer l'état de la fiabilité, les risques et les plans d'amélioration aux Agile Release Managers et aux responsables de domaine afin de garantir l'alignement entre les différents ART. Participer activement à l'Agile Release Train en tant que représentant de la fiabilité et des opérations, en soutenant le rythme de livraison et la qualité des produits.
Voir cette offre
Freelance

Mission freelanceUn Architecte / Expert Dynatrace Managed sur Blois

Almatek
Publiée le
AWS Cloud
Azure
Datadog

6 mois
470-530 €
Blois, Centre-Val de Loire
Almatek recherche pour l'un de ses clients, un Architecte / Expert Dynatrace Managed sur Blois. Contexte de la mission Dans le cadre du renforcement d'une démarche stratégique d'Observabilité IT et SRE, l'équipe en charge de l'Observabilité recherche un expert Dynatrace & SRE afin d'accompagner la mise en œuvre, l'industrialisation et l'évolution des pratiques d'observabilité. L'intervention couvrira les environnements Production et Hors Production, avec un fort enjeu autour de l'analyse de bout en bout, du suivi de la performance, de la fiabilité des services et de la mise en œuvre des pratiques SRE. Description de la mission: Le consultant interviendra notamment sur les activités suivantes : Réaliser des analyses et formuler des préconisations en Production et Hors Production à l'aide de Dynatrace, sur les flux TP et batch. Assurer le suivi et l'analyse de la production via Dynatrace. Intervenir en tant que référent technique et Lead lors de situations de type Task Force. Concevoir et animer des workshops et sessions de formation autour de Dynatrace. Accompagner la montée en compétence des équipes sur Dynatrace Managed, Grail et leur infrastructure. Contribuer aux projets de migration de Dynatrace Managed vers Grail ou vers une solution d'observabilité alternative. Mettre en œuvre les principes et pratiques SRE : SLO, indicateurs de fiabilité, automatisation, etc. Concevoir des tableaux de bord métier et IT de bout en bout. Assurer un support technique de niveau N2/N3 sur Dynatrace. Contribuer à l'analyse de l'expérience utilisateur (UX) et à l'identification des axes d'amélioration. Livrables attendus: Rapports d'analyse à la demande sur les environnements Production et Hors Production. Tableaux de bord métier et IT dans Dynatrace. Définition et mise en œuvre de SLO sur les KPI métier et IT. Comptes rendus de réunions et d'ateliers. Supports de formation et de workshops. Suivi de l'activité et des actions dans Jira. Documentation technique et fonctionnelle interne.
Voir cette offre
Freelance
CDI

Offre d'emploiINGÉNIEUR PRODUCTION & SRE

RIDCHA DATA
Publiée le
Agile Scrum
Cassandra
DevOps

1 an
40k-45k €
400-550 €
Sophia Antipolis, Provence-Alpes-Côte d'Azur
Notre client, acteur majeur des services numériques de confiance, recherche un Ingénieur Production & SRE pour renforcer son équipe d'ingénierie. Vous évoluerez sur des plateformes numériques critiques, avec un objectif clair : améliorer la fiabilité, l'observabilité et la performance de la production tout en réduisant progressivement le RUN et les escalades vers le N3. 🎯 Votre missionVous serez au cœur des sujets Production, SRE et Observabilité, avec une forte dimension d'analyse et d'amélioration continue. Vos principales responsabilités : 🔹 Administrer et maintenir la stack Elastic : Elasticsearch, Kibana, Logstash, Filebeat 🔹 Mettre en place et faire évoluer les dashboards, alertes et indicateurs de supervision 🔹 Développer l'observabilité applicative avec APM / OpenTelemetry 🔹 Définir et suivre les SLO / SLI 🔹 Analyser les logs, corréler les signaux et identifier les causes racines des incidents 🔹 Détecter les patterns récurrents, signaux faibles, problèmes de capacité et dérives de performance 🔹 Réaliser les post-mortems et piloter les plans d'actions associés 🔹 Construire des runbooks et accompagner les équipes Support N1/N2 🔹 Faire monter les équipes de développement en autonomie sur le diagnostic et l'analyse de production 🔹 Automatiser les tâches récurrentes avec Python 🔹 Réaliser des tests de performance avec JMeter 🔹 Contribuer à la roadmap technique et aux démarches d'amélioration de la fiabilité 🔹 Participer aux instances Agile / SAFe / PI Planning 👉 L'objectif n'est pas d'ajouter du RUN, mais bien de reprendre l'existant, le fiabiliser, l'industrialiser et progressivement le réduire. 🛠️ Environnement technique :Observabilité / Logs : Elastic Stack, Elasticsearch, Kibana, Logstash, Filebeat, APM, OpenTelemetry Développement & automatisation : Java, Python Infrastructure : Kubernetes, environnements de production critiques Bases de données : PostgreSQL, Cassandra DevOps / CI-CD : Jenkins, SonarQube, Nexus Performance : JMeter Méthodologie : Agile / SAFe / PI Planning
Voir cette offre
Freelance

Mission freelanceData Reliability Engineer (Run) (H/F)

Cherry Pick
Publiée le
AWS Cloud
Data Engineering
Linux

12 mois
Paris, France
En quelques motsCherry Pick est à la recherche d'un Support & Data Reliability Engineer(H/F), pour le compte de l'un de ses clients qui opère dans le domaine financier. Description🚀 Contexte de la missionAu sein du département Data Technology d'un acteur majeur de la gestion d'actifs et de la finance quantitative, vous intégrez l'équipe en tant que Support & Reliability Engineer (H/F). Votre rôle sera d'assurer la gestion, la robustesse et la fiabilité maximale des systèmes et processus de données. Vous travaillerez en étroite collaboration avec les équipes de développement, les Data Engineers, les Data Scientists et les Quantitative Developers pour garantir la disponibilité, la qualité et les performances des pipelines de données critiques. 🎯 Missions principales & Rôle1. Support Data & Opérations : Assurer le support N1 sur le périmètre Data, gérer les alertes en temps réel et résoudre les incidents durant le shift de Paris. Agir en tant que Gatekeeper pour la gestion des mises en production (Data Release Management / CMRM process) et la fiabilité des données. Définir et faire appliquer les politiques de gestion des données (sauvegarde, restauration, sécurité, conformité). 2. Automation, Monitoring & Fiabilité : Maintenir des pipelines de données fiables, performants et scalables (collecte, stockage, traitement, diffusion). Mettre en place un monitoring proactif et continu pour détecter les anomalies de qualité, d'intégrité et de consistance des données. Automatiser les tâches récurrentes pour optimiser l'efficacité opérationnelle et réduire le risque d'erreur humaine. 3. Collaboration Transverse & Conduite du Changement : Collaborer avec les développeurs quantitatifs, Data Engineers et Data Scientists pour comprendre leurs besoins et résoudre les dysfonctionnements. Promouvoir les meilleures pratiques de développement axées sur la fiabilité des données. Rédiger et maintenir la documentation technique et opérationnelle. 🏁 ObjectifsGarantir la haute disponibilité et la cohérence des pipelines de données en production. Réduire le temps moyen de résolution (MTTR) des incidents Data durant le shift de Paris. Industrialiser et automatiser les processus récurrents de maintenance et de monitoring.
Voir cette offre
Freelance

Mission freelanceDomain Manager - SRE

MEETSHAKE
Publiée le
DevSecOps
Incident Management
SaaS

6 mois
Paris, France
Responsable de : Garantir la fiabilité du service, l'excellence opérationnelle et la conformité des performances sur l'ensemble des environnements, en intégrant les pratiques SRE au sein de l'Agile Release Train et du cycle de vie de livraison du produit. Mission Garantir la stabilité, la performance et la disponibilité des services dans les environnements de production et de non-production, tout en promouvant une culture axée sur la fiabilité au sein des équipes de delivery. Pour mener à bien cette mission, ce rôle agit comme le gardien (gatekeeper) de l'évolution du produit vers la production, en s'assurant que la qualité réponde toujours aux attentes des clients. Collaborer avec les équipes Produit, Tech et Plateforme pour maintenir le juste équilibre entre innovation, vélocité et robustesse opérationnelle. Activités principales Définir, suivre et communiquer les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) et les budgets d'erreur sur l'ensemble des environnements afin d'assurer une fiabilité mesurable par domaine applicatif. S'assurer que des cadres solides d'observabilité, de supervision et d'alerte sont mis en œuvre et améliorés en continu. Superviser la préparation opérationnelle (operational readiness) de chaque release, en garantissant la stabilité de la production grâce à une coordination transverse avec les équipes Produit et Tech. Peut poser un veto sur la livraison d'un produit lorsque la qualité mesurée n'est pas alignée avec les attentes des clients. Gérer la réponse aux incidents, l'analyse des causes racines et les revues post-mortem pour garantir la responsabilisation et l'amélioration continue par domaine applicatif. Collaborer avec les équipes Core Platform, Observabilité & FinOps pour renforcer la résilience du système, optimiser l'efficacité des coûts et maintenir les performances de la plateforme. Rendre compte de l'état de la fiabilité, des risques et des actions d'amélioration auprès des Agile Release Managers et de la direction de domaine pour assurer l'alignement au sein des ART. Participer activement à l'Agile Release Train en tant que voix de la fiabilité et des opérations, en soutenant la cadence et la qualité des livraisons.
Voir cette offre
CDI

Offre d'emploiDevOps Engineer - CDI

BLOOMAYS
Publiée le
AWS Cloud
DevOps
Site Reliability Engineering (SRE)

60k-75k €
Paris, France
Votre mission : devenir la personne référente DevOps d'une plateforme SaaS B2B en production, reprendre progressivement la main sur l'infrastructure et faire évoluer l'existant avec une forte autonomie de mise en œuvre. Ce recrutement intervient dans le cadre du départ du DevOps actuel vers d'autres fonctions. Le CPTO, encore impliqué sur les sujets d'infrastructure, souhaite progressivement se recentrer sur le produit. Vous travaillez avec lui pour cadrer les priorités, puis vous portez leur exécution technique au quotidien. Intégré·e aux équipes produit et développement, vous intervenez sur une plateforme composée d'environ six microservices, utilisée par des clients grands comptes. Vous collaborez directement avec trois feature teams représentant une douzaine de développeurs. Vos principales responsabilités seront les suivantes : Reprendre la responsabilité opérationnelle de l'infrastructure AWS, entièrement administrée avec Terraform, sans ClickOps. Maintenir et faire évoluer l'environnement Kubernetes, Docker et Helm, tout en évaluant avec pragmatisme si Kubernetes reste la solution la plus adaptée à la taille de la plateforme. Simplifier et rationaliser les pipelines CI/CD construits autour de GitLab self-hosted et Helm. Identifier, chiffrer et mettre en œuvre des leviers d'optimisation des coûts cloud. Faire progresser l'observabilité, la documentation et les runbooks afin de renforcer la fiabilité et l'autonomie des équipes. Contribuer aux sujets de sécurité opérationnelle : gestion des secrets, RBAC, moindre privilège et réponses techniques aux audits clients. Les chantiers des 12 à 18 prochains mois sont concrets et ouverts : rationalisation de la CI/CD, optimisation des coûts AWS, réflexion sur une architecture plus simple que Kubernetes, renforcement de l'observabilité et éventuelle mise en place d'une approche GitOps avec Argo CD ou une solution équivalente. Vous recevez les besoins par trois canaux : le CPTO pour les sujets d'infrastructure, de stratégie et de sécurité ; les leads lors des temps d'amélioration continue ; et les développeurs au quotidien. Les sujets sont cadrés collectivement, mais leur mise en œuvre vous appartient. Vous êtes intégré·e au produit, pas positionné·e dans un silo infrastructure. Environnement technique : AWS, Terraform, Kubernetes, Docker, GitLab self-hosted, Helm, Kuma, PHP/Symfony, React et TypeScript. La plateforme connaît un rythme régulier d'une mise en production par sprint et de plusieurs dizaines de correctifs. Le SLA contractuel est de 98 % minimum, sans pics saisonniers et sans astreintes. Conditions proposées : rémunération fixe entre 60 000 € et 75 000 € selon expérience, complétée par environ 5 000 € de participation. Vous bénéficiez également de tickets restaurant, d'une mutuelle Alan et d'un MacBook avec configuration au choix. Le poste est basé à Levallois-Perret, avec deux jours de présence sur site et trois jours de télétravail par semaine. Le processus de recrutement comprend un échange RH, un entretien avec le CPTO, puis une rencontre avec les leads.
Voir cette offre
CDI
Freelance

Offre d'emploiSRE DevOps IA/ML H/F

Le Groupe SYD
Publiée le
Ansible
CI/CD
ELK

12 mois
45k-50k €
450-550 €
Paris, France
🌟 Quel sera ton poste ? 🌟 💼 Poste : SRE DevOps IA/ML H/F 📍 Lieu : Paris (75) ou Rennes (35) 🏠 Télétravail : Flexible 📝 Contrat : Portage ou CDI 💸Rémunération : 45k-50k 👉 Contexte client : Tu rejoins un acteur majeur du numérique engagé dans le développement et l'industrialisation de solutions innovantes basées sur l'Intelligence Artificielle et le Machine Learning. Dans un contexte de transformation technologique et d'accélération des usages IA, les enjeux portent sur la fiabilisation, l'automatisation et l'optimisation des plateformes techniques supportant les produits et services stratégiques de l'entreprise. En tant que SRE DevOps IA/ML, tu interviens au cœur d'environnements critiques où la disponibilité, la performance et la résilience des plateformes sont essentielles pour accompagner les équipes Data, IA et Développement. Tu auras pour missions de : Concevoir, déployer et maintenir les infrastructures nécessaires aux plateformes IA/ML. Industrialiser et automatiser les processus de déploiement, d'exploitation et de supervision. Garantir la disponibilité, la performance et la résilience des services critiques. Mettre en œuvre les pratiques Site Reliability Engineering (SRE) afin d'améliorer la fiabilité des plateformes. Participer à l'optimisation des environnements d'entraînement et d'exécution des modèles de Machine Learning. Déployer et maintenir les solutions de monitoring, d'observabilité et d'alerting. Collaborer avec les équipes Data Science, IA et Développement pour industrialiser les chaînes de traitement et de déploiement. Participer à la gestion et à la résolution des incidents complexes. Contribuer à l'amélioration continue des plateformes, outils et processus. Rédiger et maintenir la documentation technique et les procédures d'exploitation. 🧰 Stack technique : DevOps & Automatisation : Git, CI/CD, Ansible, Terraform. Conteneurisation & Orchestration : Docker, Kubernetes. Observabilité : Prometheus, Grafana, ELK, monitoring et alerting. IA / Machine Learning : plateformes d'entraînement, de déploiement et d'exploitation de modèles IA/ML. Systèmes : Linux. Scripting : Python, Bash.
Voir cette offre
CDI
Freelance

Offre d'emploiSRE DevOps IA/ML H/F

Le Groupe SYD
Publiée le
Ansible
CI/CD
ELK

12 mois
45k-50k €
450-550 €
Rennes, Bretagne
🌟 Quel sera ton poste ? 🌟 💼 Poste : SRE DevOps IA/ML H/F 📍 Lieu : Paris (75) ou Rennes (35) 🏠 Télétravail : Flexible 📝 Contrat : Portage ou CDI 💸Rémunération : 45k-50k 👉 Contexte client : Tu rejoins un acteur majeur du numérique engagé dans le développement et l'industrialisation de solutions innovantes basées sur l'Intelligence Artificielle et le Machine Learning. Dans un contexte de transformation technologique et d'accélération des usages IA, les enjeux portent sur la fiabilisation, l'automatisation et l'optimisation des plateformes techniques supportant les produits et services stratégiques de l'entreprise. En tant que SRE DevOps IA/ML, tu interviens au cœur d'environnements critiques où la disponibilité, la performance et la résilience des plateformes sont essentielles pour accompagner les équipes Data, IA et Développement. Tu auras pour missions de : Concevoir, déployer et maintenir les infrastructures nécessaires aux plateformes IA/ML. Industrialiser et automatiser les processus de déploiement, d'exploitation et de supervision. Garantir la disponibilité, la performance et la résilience des services critiques. Mettre en œuvre les pratiques Site Reliability Engineering (SRE) afin d'améliorer la fiabilité des plateformes. Participer à l'optimisation des environnements d'entraînement et d'exécution des modèles de Machine Learning. Déployer et maintenir les solutions de monitoring, d'observabilité et d'alerting. Collaborer avec les équipes Data Science, IA et Développement pour industrialiser les chaînes de traitement et de déploiement. Participer à la gestion et à la résolution des incidents complexes. Contribuer à l'amélioration continue des plateformes, outils et processus. Rédiger et maintenir la documentation technique et les procédures d'exploitation. 🧰 Stack technique : DevOps & Automatisation : Git, CI/CD, Ansible, Terraform. Conteneurisation & Orchestration : Docker, Kubernetes. Observabilité : Prometheus, Grafana, ELK, monitoring et alerting. IA / Machine Learning : plateformes d'entraînement, de déploiement et d'exploitation de modèles IA/ML. Systèmes : Linux. Scripting : Python, Bash.
Voir cette offre
Freelance

Mission freelanceRun Engineer N3 /Site Reliability Engineer (h/f)

emagine Consulting SARL
Publiée le

6 mois
350-600 €
75000, Paris, Île-de-France
Summary: This role involves being a level 3 Run Engineer responsible for maintaining and resolving incidents in production systems, particularly for applications built with Java and Spring. The main goal is to ensure high system availability and effective incident management while collaborating with the DevOps team. Responsibilities: Support production systems and resolve incidents efficiently. Collaborate with the DevOps team to ensure system availability and incident resolution. Oversee deployments, monitoring, and operational improvements. Handle production incident responses and conduct root cause analysis. Utilize monitoring and logging tools to ensure system performance. Participate in shift work and on-call rotation as needed. Must Haves: Strong experience with Java and Spring (Spring Boot, Spring MVC, Spring Data). Solid understanding of Kubernetes for deployment and troubleshooting. Practical experience with CI/CD tools (Bamboo/GitLab CI/ArgoCD) and Docker. Experience with monitoring and logging tools (Prometheus, Grafana, ELK/EFK, Splunk). Hands-on experience in production incident handling. Strong communication skills. Nice to Haves: Experience with service meshes (Istio, Linkerd). Background in L3 support or Site Reliability Engineering (SRE). Other Details: Education: Bachelor's degree in Computer Science or related field, or equivalent experience. Behavioural Competencies: Calm under pressure, excellent problem-solving skills, proactivity in process improvements. Work Shifts: Ability to work in shifts/on-call rotation. Location : Paris Full Time Hybrid Mode (2days on remote work/ week)
Voir cette offre
Freelance
CDI

Offre d'emploiDevOps et Site Reliability Engineering pour une infrastructure d’actifs numériques réglementée

Espritek
Publiée le
Kubernetes

3 ans
Courbevoie, Île-de-France
Contexte de la mission Nous recherchons une expertise en DevOps et Site Reliability Engineering (SRE) afin de contribuer à la construction et à l'exploitation d'une plateforme sécurisée, réglementée et hautement disponible dédiée aux instruments financiers tokenisés. L'entreprise développe une nouvelle capacité autour des Digital Assets, destinée à supporter la tokenisation, les technologies de registres distribués (DLT) et la prochaine génération d'infrastructures des marchés financiers. Nous recherchons une expertise en Infrastructure as Code (IaC), Kubernetes, plateformes conteneurisées et pipelines CI/CD, afin de construire des fondations scalables et de permettre des déploiements contrôlés sans interruption de service (zero downtime). Une observabilité complète est nécessaire afin d'assurer l'exploitation d'un service disponible 24h/24 et 7j/7 : métriques, logs, traces, alerting, Service Level Objectives (SLO) et error budgets. Nous recherchons également une expertise opérationnelle sur la gestion des astreintes, la réponse aux incidents, la création de runbooks opérationnels, les postmortems et le maintien de la stabilité de la plateforme lors d'évolutions rapides des produits et technologies. La mission devra intégrer des pratiques d'infrastructure sécurisées et auditables, adaptées à des workloads réglementés, avec une collaboration étroite avec les équipes sécurité et des contrôles rigoureux concernant l'utilisation de l'IA dans les activités d'engineering. Nous recherchons également une expertise dans l'utilisation de l'AIOps pour la détection d'anomalies, le triage des alertes, la synthèse des incidents ainsi que le monitoring, l'exploitation et le rollback des services IA/ML intégrés aux produits. Objectifs et livrables L'objectif est de mettre en place une fondation opérationnelle résiliente pour une plateforme réglementée d'actifs numériques et de garantir une exploitation fiable à grande échelle. Concevoir et mettre en œuvre l'Infrastructure as Code, notamment avec Terraform, pour le provisioning et la gestion de configurations versionnées et maintenables Construire et optimiser des pipelines CI/CD sécurisés, couvrant intégration continue, déploiement continu, validations automatisées, approbations, auditabilité et mises en production sans interruption Architecturer et exploiter des workloads conteneurisés avec Kubernetes et les technologies d'orchestration associées Mettre en place une solution d'observabilité de bout en bout couvrant métriques, centralisation des logs, distributed tracing, dashboards, alerting et indicateurs de santé opérationnelle Définir et opérationnaliser les SLO, SLI et error budgets en cohérence avec les exigences de fiabilité de la plateforme Mettre en place un modèle d'astreinte 24/7 efficace, incluant procédures d'escalade, workflows de gestion des incidents, responsabilités et continuité de service Produire et maintenir des runbooks clairs et opérationnels pour les opérations récurrentes, incidents, déploiements, reprises et scénarios de panne Renforcer la sécurité de l'infrastructure : hardening, principe du moindre privilège, gestion des secrets, correction des vulnérabilités, contrôles de conformité et gestion auditable des changements Utiliser des outils d'IA pour assister l'engineering, notamment sur l'IaC et la création des pipelines, avec une revue humaine documentée et des contrôles d'approbation avant déploiement Mettre en œuvre des capacités AIOps pour la détection d'anomalies, le triage des alertes, la synthèse des incidents et la rédaction des postmortems Déployer, superviser, exploiter et effectuer des rollbacks sécurisés des services IA/ML, notamment sur les aspects performance, disponibilité et monitoring opérationnel des modèles Produire la documentation technique : décisions d'architecture, procédures opérationnelles, métriques de fiabilité et recommandations d'amélioration continue Garantir la stabilité et la disponibilité de la plateforme malgré des évolutions rapides du produit, tout en maintenant les standards imposés par un environnement réglementé et les objectifs de zero downtime
Voir cette offre
Freelance
CDI

Offre d'emploiExpert Cloud DevOps

VISIAN
Publiée le
CI/CD
DevSecOps
Jenkins

1 an
Paris, France
Contexte Securities Services a lancé le programme de transformation QUEST (Quality, Efficiency, Stability) afin d'élever le niveau de maturité de sa production IT. Un des streams du programme porte sur l'automatisation des gestes de la production : le but est de réduire les interventions manuelles, d'améliorer la fréquence de déploiement tout en assurant une plus grande stabilité grâce aux pratiques DevOps et Cloud. L'Expert Cloud DevOps rejoindra la Core Team en charge du stream Automation, équipe incluant notamment un directeur de projet et un leader technique basés à Paris ainsi qu'une équipe de relais techniques à Chennai et Lisbonne. Missions Le chargé d'expertise Cloud DevOps intervient sur tout ou partie des activités suivantes : Développement et maintenance des standards IT permettant une meilleure expérience utilisateur pour les équipes onboardées sur les Offres de Service du Groupe (Ansible Automation Platform, Argo CD, Digital AI Release, ...) Sensibilisation de la ligne managériale Accompagnement des équipes sur leur montée en autonomie : support au travers de divers canaux (outillage, documentation, training, sessions de travail), apport du conseil et des propositions d'amélioration, s'assurer de la bonne appropriation des pratiques, de la conformité aux standards, animation de l'amélioration continue Mise en place d'une visibilité des progrès / bénéfices pour les équipes au travers de la mise en place d'indicateurs pertinents et l'organisation de retours d'expérience Interface avec l'Offre de Service du Groupe pour retour d'expérience des besoins et propositions d'amélioration Outils & Environnement DevOps / SRE : CI/CD : Jenkins, Gitlab CI, Argo CD, Ansible, Digital AI Release Infrastructure as Code : Terraform, Ansible GitOps et gestion de configuration Déploiements automatisés Cloud / Conteneurs : Openshift, Docker, Kubernetes, Helm, sécurité des conteneurs Programmation & Scripting : Python, YAML, Shell Monitoring : Dynatrace, Grafana Systèmes & BDD : Administration Linux, Oracle, PostgreSQL Méthodologies : Agile/Scrum, Site Reliability Engineering (SRE), DevSecOps, ITIL
Voir cette offre

Déposez votre CV

  • Fixez vos conditions

    Rémunération, télétravail... Définissez tous les critères importants pour vous.

  • Faites-vous chasser

    Les recruteurs viennent directement chercher leurs futurs talents dans notre CVthèque.

  • 100% gratuit

    Aucune commission prélevée sur votre mission freelance.

Au service des talents IT

Free-Work est une plateforme qui s'adresse à tous les professionnels des métiers de l'informatique.

Ses contenus et son jobboard IT sont mis à disposition 100% gratuitement pour les indépendants et les salariés du secteur.

Free-workers
Ressources
A propos
Espace recruteurs
2026 © Free-Work / AGSI SAS
Suivez-nous