Trouvez votre prochaine offre d’emploi ou de mission freelance Site Reliability Engineering (SRE)

Votre recherche renvoie 37 résultats.
CDI
Freelance

Offre d'emploiSRE DevOps IA/ML H/F

Le Groupe SYD
Publiée le
Ansible
CI/CD
ELK

12 mois
45k-50k €
450-550 €
Rennes, Bretagne
🌟 Quel sera ton poste ? 🌟 💼 Poste : SRE DevOps IA/ML H/F 📍 Lieu : Paris (75) ou Rennes (35) 🏠 Télétravail : Flexible 📝 Contrat : Portage ou CDI 💸Rémunération : 45k-50k 👉 Contexte client : Tu rejoins un acteur majeur du numérique engagé dans le développement et l'industrialisation de solutions innovantes basées sur l'Intelligence Artificielle et le Machine Learning. Dans un contexte de transformation technologique et d'accélération des usages IA, les enjeux portent sur la fiabilisation, l'automatisation et l'optimisation des plateformes techniques supportant les produits et services stratégiques de l'entreprise. En tant que SRE DevOps IA/ML, tu interviens au cœur d'environnements critiques où la disponibilité, la performance et la résilience des plateformes sont essentielles pour accompagner les équipes Data, IA et Développement. Tu auras pour missions de : Concevoir, déployer et maintenir les infrastructures nécessaires aux plateformes IA/ML. Industrialiser et automatiser les processus de déploiement, d'exploitation et de supervision. Garantir la disponibilité, la performance et la résilience des services critiques. Mettre en œuvre les pratiques Site Reliability Engineering (SRE) afin d'améliorer la fiabilité des plateformes. Participer à l'optimisation des environnements d'entraînement et d'exécution des modèles de Machine Learning. Déployer et maintenir les solutions de monitoring, d'observabilité et d'alerting. Collaborer avec les équipes Data Science, IA et Développement pour industrialiser les chaînes de traitement et de déploiement. Participer à la gestion et à la résolution des incidents complexes. Contribuer à l'amélioration continue des plateformes, outils et processus. Rédiger et maintenir la documentation technique et les procédures d'exploitation. 🧰 Stack technique : DevOps & Automatisation : Git, CI/CD, Ansible, Terraform. Conteneurisation & Orchestration : Docker, Kubernetes. Observabilité : Prometheus, Grafana, ELK, monitoring et alerting. IA / Machine Learning : plateformes d'entraînement, de déploiement et d'exploitation de modèles IA/ML. Systèmes : Linux. Scripting : Python, Bash.
Voir cette offre
Freelance

Mission freelanceRun Engineer N3 /Site Reliability Engineer (h/f)

emagine Consulting SARL
Publiée le

6 mois
350-600 €
75000, Paris, Île-de-France
Summary: This role involves being a level 3 Run Engineer responsible for maintaining and resolving incidents in production systems, particularly for applications built with Java and Spring. The main goal is to ensure high system availability and effective incident management while collaborating with the DevOps team. Responsibilities: Support production systems and resolve incidents efficiently. Collaborate with the DevOps team to ensure system availability and incident resolution. Oversee deployments, monitoring, and operational improvements. Handle production incident responses and conduct root cause analysis. Utilize monitoring and logging tools to ensure system performance. Participate in shift work and on-call rotation as needed. Must Haves: Strong experience with Java and Spring (Spring Boot, Spring MVC, Spring Data). Solid understanding of Kubernetes for deployment and troubleshooting. Practical experience with CI/CD tools (Bamboo/GitLab CI/ArgoCD) and Docker. Experience with monitoring and logging tools (Prometheus, Grafana, ELK/EFK, Splunk). Hands-on experience in production incident handling. Strong communication skills. Nice to Haves: Experience with service meshes (Istio, Linkerd). Background in L3 support or Site Reliability Engineering (SRE). Other Details: Education: Bachelor's degree in Computer Science or related field, or equivalent experience. Behavioural Competencies: Calm under pressure, excellent problem-solving skills, proactivity in process improvements. Work Shifts: Ability to work in shifts/on-call rotation. Location : Paris Full Time Hybrid Mode (2days on remote work/ week)
Voir cette offre
Freelance
CDI

Offre d'emploiDevOps et Site Reliability Engineering pour une infrastructure d’actifs numériques réglementée

Espritek
Publiée le
Kubernetes

3 ans
Courbevoie, Île-de-France
Contexte de la mission Nous recherchons une expertise en DevOps et Site Reliability Engineering (SRE) afin de contribuer à la construction et à l'exploitation d'une plateforme sécurisée, réglementée et hautement disponible dédiée aux instruments financiers tokenisés. L'entreprise développe une nouvelle capacité autour des Digital Assets, destinée à supporter la tokenisation, les technologies de registres distribués (DLT) et la prochaine génération d'infrastructures des marchés financiers. Nous recherchons une expertise en Infrastructure as Code (IaC), Kubernetes, plateformes conteneurisées et pipelines CI/CD, afin de construire des fondations scalables et de permettre des déploiements contrôlés sans interruption de service (zero downtime). Une observabilité complète est nécessaire afin d'assurer l'exploitation d'un service disponible 24h/24 et 7j/7 : métriques, logs, traces, alerting, Service Level Objectives (SLO) et error budgets. Nous recherchons également une expertise opérationnelle sur la gestion des astreintes, la réponse aux incidents, la création de runbooks opérationnels, les postmortems et le maintien de la stabilité de la plateforme lors d'évolutions rapides des produits et technologies. La mission devra intégrer des pratiques d'infrastructure sécurisées et auditables, adaptées à des workloads réglementés, avec une collaboration étroite avec les équipes sécurité et des contrôles rigoureux concernant l'utilisation de l'IA dans les activités d'engineering. Nous recherchons également une expertise dans l'utilisation de l'AIOps pour la détection d'anomalies, le triage des alertes, la synthèse des incidents ainsi que le monitoring, l'exploitation et le rollback des services IA/ML intégrés aux produits. Objectifs et livrables L'objectif est de mettre en place une fondation opérationnelle résiliente pour une plateforme réglementée d'actifs numériques et de garantir une exploitation fiable à grande échelle. Concevoir et mettre en œuvre l'Infrastructure as Code, notamment avec Terraform, pour le provisioning et la gestion de configurations versionnées et maintenables Construire et optimiser des pipelines CI/CD sécurisés, couvrant intégration continue, déploiement continu, validations automatisées, approbations, auditabilité et mises en production sans interruption Architecturer et exploiter des workloads conteneurisés avec Kubernetes et les technologies d'orchestration associées Mettre en place une solution d'observabilité de bout en bout couvrant métriques, centralisation des logs, distributed tracing, dashboards, alerting et indicateurs de santé opérationnelle Définir et opérationnaliser les SLO, SLI et error budgets en cohérence avec les exigences de fiabilité de la plateforme Mettre en place un modèle d'astreinte 24/7 efficace, incluant procédures d'escalade, workflows de gestion des incidents, responsabilités et continuité de service Produire et maintenir des runbooks clairs et opérationnels pour les opérations récurrentes, incidents, déploiements, reprises et scénarios de panne Renforcer la sécurité de l'infrastructure : hardening, principe du moindre privilège, gestion des secrets, correction des vulnérabilités, contrôles de conformité et gestion auditable des changements Utiliser des outils d'IA pour assister l'engineering, notamment sur l'IaC et la création des pipelines, avec une revue humaine documentée et des contrôles d'approbation avant déploiement Mettre en œuvre des capacités AIOps pour la détection d'anomalies, le triage des alertes, la synthèse des incidents et la rédaction des postmortems Déployer, superviser, exploiter et effectuer des rollbacks sécurisés des services IA/ML, notamment sur les aspects performance, disponibilité et monitoring opérationnel des modèles Produire la documentation technique : décisions d'architecture, procédures opérationnelles, métriques de fiabilité et recommandations d'amélioration continue Garantir la stabilité et la disponibilité de la plateforme malgré des évolutions rapides du produit, tout en maintenant les standards imposés par un environnement réglementé et les objectifs de zero downtime
Voir cette offre
CDI

Offre d'emploiAWS Cloud Engineer

█ █ █ ██ █ █
Publiée le
CI/CD
DevOps
Docker

Grand Londres, Royaume-Uni

Offre importée

Offre issue du marché tech, identifiée automatiquement pour vous donner une vue complète des opportunités.

Accès restreint à la communauté

Rejoignez notre plateforme pour accéder aux détails de cette offre et obtenir un accès aux meilleures offres du marché.

Voir cette offre
Freelance
CDI

Offre d'emploiExpert Cloud DevOps

VISIAN
Publiée le
CI/CD
DevSecOps
Jenkins

1 an
Paris, France
Contexte Securities Services a lancé le programme de transformation QUEST (Quality, Efficiency, Stability) afin d'élever le niveau de maturité de sa production IT. Un des streams du programme porte sur l'automatisation des gestes de la production : le but est de réduire les interventions manuelles, d'améliorer la fréquence de déploiement tout en assurant une plus grande stabilité grâce aux pratiques DevOps et Cloud. L'Expert Cloud DevOps rejoindra la Core Team en charge du stream Automation, équipe incluant notamment un directeur de projet et un leader technique basés à Paris ainsi qu'une équipe de relais techniques à Chennai et Lisbonne. Missions Le chargé d'expertise Cloud DevOps intervient sur tout ou partie des activités suivantes : Développement et maintenance des standards IT permettant une meilleure expérience utilisateur pour les équipes onboardées sur les Offres de Service du Groupe (Ansible Automation Platform, Argo CD, Digital AI Release, ...) Sensibilisation de la ligne managériale Accompagnement des équipes sur leur montée en autonomie : support au travers de divers canaux (outillage, documentation, training, sessions de travail), apport du conseil et des propositions d'amélioration, s'assurer de la bonne appropriation des pratiques, de la conformité aux standards, animation de l'amélioration continue Mise en place d'une visibilité des progrès / bénéfices pour les équipes au travers de la mise en place d'indicateurs pertinents et l'organisation de retours d'expérience Interface avec l'Offre de Service du Groupe pour retour d'expérience des besoins et propositions d'amélioration Outils & Environnement DevOps / SRE : CI/CD : Jenkins, Gitlab CI, Argo CD, Ansible, Digital AI Release Infrastructure as Code : Terraform, Ansible GitOps et gestion de configuration Déploiements automatisés Cloud / Conteneurs : Openshift, Docker, Kubernetes, Helm, sécurité des conteneurs Programmation & Scripting : Python, YAML, Shell Monitoring : Dynatrace, Grafana Systèmes & BDD : Administration Linux, Oracle, PostgreSQL Méthodologies : Agile/Scrum, Site Reliability Engineering (SRE), DevSecOps, ITIL
Voir cette offre

Au service des talents IT

Free-Work est une plateforme qui s'adresse à tous les professionnels des métiers de l'informatique.

Ses contenus et son jobboard IT sont mis à disposition 100% gratuitement pour les indépendants et les salariés du secteur.

Free-workers
Ressources
A propos
Espace recruteurs
2026 © Free-Work / AGSI SAS
Suivez-nous