Vous intégrez l'équipe APS PF en tant qu'Ingénieur SRE (Site Reliability Engineer), garant de la disponibilité, de la performance et de la résilience de la plateforme de production. Au carrefour du développement et de l'exploitation, vous portez une culture DevOps forte : vous partagez avec les équipes de développement des objectifs communs de fiabilité, vous intervenez dès les phases de cadrage des projets, et vous avez une vision de bout en bout sur l'ensemble des opérations impactant votre périmètre (incidents, mises en production, changements, obsolescence…). Votre credo : anticiper plutôt que réagir, automatiser plutôt que subir, et transformer la donnée en décision. Vos responsabilités au quotidienMaintien des objectifs de niveau de service Garant de la disponibilité, l'intégrité, la résilience et la qualité de la plateforme Pilotage de la remise en service lors d'incidents, avec mobilisation des bonnes ressources Une culture DevOps au service de l'innovation Collaboration étroite avec les équipes de développement et d'exploitation Anticipation des impacts des changements à venir sur la production Partage des contraintes opérationnelles dès l'amont des projets Monitoring & Alerting Mise en place du bon niveau de monitoring et d'alerting Construction de tableaux de bord pertinents pour éclairer la prise de décision Amélioration continue & mise à l'échelle Identification et priorisation des chantiers d'automatisation et d'industrialisation Développement de scripts et outillage des opérations, avec le souci de la maintenabilité Sécurité & gestion de l'obsolescence Pilotage de l'obsolescence et des non-conformités Priorisation budgétaire en coordination avec les équipes produit et l'IT métier Votre profil Compétences techniques Monitoring & observabilité : Prometheus, Grafana, Datadog, ELK, Dynatrace… Scripting & automatisation : Python, Bash, Ansible, Terraform CI/CD : Jenkins, GitLab CI, Azure DevOps Environnements cloud et/ou on-premise (AWS, Azure, GCP) Notions de gestion d'incidents (ITIL) et de sécurité en production Compétences transverses Sens des priorités et rigueur, notamment en gestion de crise Capacité à travailler en amont, en mode proactif Aisance relationnelle avec les équipes Dev, Ops et Métier Autonomie et esprit d'initiative Expérience 3 à 8 ans d'expérience en exploitation, production ou développement, avec une appétence marquée pour la fiabilité et l'automatisation Pourquoi nous rejoindre ? Un rôle clé à l'interface Dev/Ops, au cœur de la performance et de la résilience de la production Une équipe engagée dans une démarche SRE/DevOps mature Des projets concrets d'automatisation et d'industrialisation à fort impact Une réelle autonomie dans la priorisation et le pilotage de votre périmètre
En qualité de SRE, votre rôle sera de : Renforcer durablement la fiabilité et la résilience des services. • Identifier les fragilités structurelles du SI • Analyser les risques de fiabilité et de résilience • Recommander les actions de réduction des risques Activités : • Contribuer à la réalisation de l'état des lieux des informations disponibles via les outils d'observabilité ( type de données, outil, moyen d'accès,…) • Contribuer à la cartographie des chaines de liaisons techniques liés aux parcours utilisateurs métier. • Identifier les SLI et les des SLO disponibles sur les chaines de liaison techniques et identifier les manques. • Contribuer à la définition du cadre d'utilisation des notions de TOIL et de Budget d'erreur • Contribuer à la réalisation d'étude d'expertise sur des problématiques d'actualité, contribuer l'identification des root cause des problèmes complexes, contribuer à l'étude des changements transverses complexes.
Objectif visé : Contribuer à la mise en place du rôle de SRE au sein de la DQS et de la SDS BGPN Renforcer durablement la fiabilité et la résilience des services. • Identifier les fragilités structurelles du SI • Analyser les risques de fiabilité et de résilience • Recommander les actions de réduction des risques Activités : • Contribuer à la réalisation de l'état des lieux des informations disponibles via les outils d'observabilité ( type de données, outil, moyen d'accès,…) • Contribuer à la cartographie des chaines de liaisons techniques liés aux parcours utilisateurs métier. • Identifier les SLI et les des SLO disponibles sur les chaines de liaison techniques et identifier les manques. • Contribuer à la définition du cadre d'utilisation des notions de TOIL et de Budget d'erreur au sein de la BGPN • Contribuer à la réalisation d'étude d'expertise sur des problématiques d'actualité, contribuer l'identification des root cause des problèmes complexes, contribuer à l'étude des changements transverses complexes.
ContexteLe bénéficiaire souhaite une prestation d'accompagnement dans l'objectif d'assurer une mission au sein de l'équipe. MissionsPartager avec les équipes de développement des objectifs communs de disponibilité et de performance de la production Maîtriser des risques et anticiper les impacts sur le SLO des services en production liés aux opérations sur votre périmètre Intégrer et participer dès le début des phases de cadrage des projets et des évolutions à venir Avoir une vision de bout en bout sur l'ensemble des opérations impactant le périmètre (incidents, mises en productions, changements, obsolescence…) Développer de la résilience, en automatisant et en outillant efficacement les opérations afin de réduire le risque d'erreur, augmenter les contrôles à la source et minimiser l'impact des pannes sur l'expérience utilisateur Utiliser de la donnée et les indicateurs de performance au quotidien pour opérer (en automatique ou en manuel à défaut). Être plus réactif en cas d'incident, et prioriser les évolutions de la plateforme afin d'accroître sa résilience Le collaborateur devra réaliser tout ou partie des activités suivantes : Maintien des objectifs de niveau de service Responsabilisation de la disponibilité, de l'intégrité, de la résilience et de la qualité de la plateforme de production Remise en service en cas d'incidents, en mobilisant les ressources adéquates si nécessaire Une culture DevOps au service de l'innovation Travail en étroite collaboration avec les équipes de développement et d'exploitation, afin d'être informé des changements prévus et d'anticiper leurs impacts sur la production Information des équipes de développement sur les sujets des environnements hors-prod afin de prendre en compte les contraintes opérationnelles au plus tôt
🏭 Secteurs stratégiques : Banque d'investissement 🗓 Démarrage : ASAP PAS DE FULL REMOTE NI SOUS TRAITANCE MERCI 💡 Contexte /Objectifs : Mise en place des métriques pour assurer la fiabilité de l'écosystème Lire le code, le comprendre Suggérer les patchs pour les développeurs, pas d'un point de vue fonctionnel mais stabilité Suggérer des améliorations et les mettre en œuvre La personne déchargera entre autre les tâches d'administration et de production que le manager assume aujourd'hui Pas de connaissance obligée en finance (souhaitable qu'il n'en ait pas) Pas d'exigence sur l'environnement de départ
nous recherchons un architecte technique senior au sein de la direction Cloud Operations. Vous intégrez une équipe Ops en charge des plateformes e-commerce (architecture / SRE), sur un périmètre à criticité extrême avec astreinte pour couvrir la production en 24/7. Équipe existante de plus de 12 personnes, à maturité senior. Vos missions : Accompagner la conception des nouveaux composants en garantissant l'intégration de la vision production dès le build Faire respecter les standards de build et contribuer à leur évolution Challenger les Tech Leads et les architectes applicatifs sur les évolutions technologiques Automatiser les tâches d'exploitation dans une approche SRE d'amélioration continue Travailler en collaboration étroite avec les Product Teams pour accélérer le delivery Éprouver la haute disponibilité et la résilience de votre périmètre Optimiser la consommation des ressources (FinOps) Participer activement à la vie de la squad Ops : communautés, partage de connaissances, formation aux bonnes pratiques Documenter votre travail selon les standards en vigueur
👉 Contexte Nous sommes à la recherche d'un SRE pour renforcer l'équipe technique de notre client. Ce rôle stratégique implique une vision globale de l'architecture, une forte sensibilité sécurité, ainsi qu'une capacité à intervenir rapidement et efficacement sur les incidents tout en améliorant la résilience. 📍 La Défense 🏠 3 jours de télétravail par semaine 📆 Début de mission : ASAP ❌ Freelance uniquement, pas d'ESN 🚀 Missions principales Capacité, Performance et Sécurité : • Gérer la fiabilité et répondre aux incidents • Planifier la capacité (scaling horizontal/vertical). • Effectuer des tests de charge, de résilience et du chaos engineering. • Anticiper les goulets d'étranglement. • Optimiser les coûts de l'infrastructure • Veiller à ce que l'infrastructure respecte les standards en matière de sécurité Build : • Éliminer les tâches récurrentes par des scripts, pipelines, auto-healing. • Optimiser le Disaster Recovery Plan en collaboration avec l'équipe platform engineering • Concevoir et développer des solutions d'automatisation (scripts, workflows, outils opérationnels, auto-remédiation) afin de supprimer les tâches manuelles, d'améliorer la fiabilité et d'accroître l'efficacité opérationnelle. Observabilité & excellence opérationnelle : • Maintenir et améliorer la stack d'observability • Développer de nouvelles metrics et renforcer l'observabilité globale. • Améliorer les temps de détection (MTTD) et de résolution (MTTR).
Dans le cadre d'un projet en bancassurance, nous recherchons un Tech Lead DevOps pour intervenir sur une plateforme critique dédiée aux assurances de personnes. Vos missions Maintien et amélioration des pipelines CI/CD (intégration et déploiement) Gestion des environnements techniques (provisionnement, stabilité) Suivi des déploiements et coordination avec les équipes de production Monitoring des applications (logs, métriques, alertes) Gestion des incidents et analyse des causes (RCA) Rédaction de documentation technique Environnement technique Linux, Shell / PowerShell CI/CD : Jenkins, GitLab CI Outils : Jira, Confluence Contexte DevOps orienté production 📍 Localisation : PARIS 📅 Démarrage : ASAP
Mission Garantir la stabilité, la performance et la disponibilité des services dans les environnements de production et hors production, tout en développant une culture orientée fiabilité au sein des équipes de delivery. Dans ce cadre, le titulaire du poste agit comme le garant de la mise en production des évolutions produit, en veillant à ce que la qualité délivrée soit toujours conforme aux attentes des clients. Collaborer avec les équipes Produit, Technique et Plateforme afin de maintenir un équilibre optimal entre innovation, rapidité d'exécution et robustesse opérationnelle. Activités principales Définir, surveiller et communiquer les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) et les budgets d'erreur (Error Budgets) sur l'ensemble des environnements afin de garantir une fiabilité mesurable pour chaque domaine applicatif. Veiller à la mise en place et à l'amélioration continue des dispositifs d'observabilité, de supervision et d'alerting. Superviser la préparation opérationnelle des mises en production afin de garantir la stabilité des environnements de production grâce à une coordination transverse avec les équipes Produit et Technique. Disposer d'un droit de veto sur une mise en production lorsque le niveau de qualité observé ne répond pas aux attentes des clients. Piloter la gestion des incidents, les analyses des causes racines (Root Cause Analysis) et les revues post-mortem afin d'assurer la responsabilisation des équipes et l'amélioration continue sur chaque domaine applicatif. Collaborer avec les équipes Core Platform, Observability et FinOps afin d'améliorer la résilience des systèmes, optimiser les coûts et maintenir les performances de la plateforme. Communiquer l'état de la fiabilité, les risques et les plans d'amélioration aux Agile Release Managers et aux responsables de domaine afin de garantir l'alignement entre les différents ART. Participer activement à l'Agile Release Train en tant que représentant de la fiabilité et des opérations, en soutenant le rythme de livraison et la qualité des produits.
Si Kubernetes, le Cloud et l'automatisation sont pour toi une passion plus qu'une compétence, rejoins notre univers technique qui t'attend de pied ferme avec ce poste de Ingénieur Cloud Kubernetes (SRE / DevOps)! 🚀 Ton challenge si tu l'acceptes : Administrer et faire évoluer des clusters Kubernetes en environnement de production (pods, services, ingresses, namespaces, RBAC…) en garantissant leur fiabilité et leur disponibilité Assurer les opérations courantes des plateformes Kubernetes : upgrades, capacity management, gestion des incidents et plans de reprise d'activité (PRA) Accompagner les équipes applicatives dans leurs déploiements Cloud et promouvoir les bonnes pratiques de conteneurisation Concevoir et industrialiser les déploiements via une approche GitOps avec des outils comme ArgoCD et GitLab CI/CD Automatiser l'infrastructure et les opérations Cloud grâce à l'Infrastructure as Code (Terraform) et au scripting (Bash, Python ou Go) Mettre en place et améliorer l'observabilité des plateformes (monitoring, alerting, logs) avec des solutions comme Prometheus, Grafana ou Loki Participer à l'amélioration continue de la plateforme en collaboration avec les équipes SRE et les équipes produits
Contexte de la missionDans le cadre de l'exploitation d'une prestation critique hébergée sur un Cloud privé, nous recherchons un Ingénieur de Production / Site Reliability Engineering (SRE) afin d'intégrer une équipe de 5 ingénieurs en charge du maintien en conditions opérationnelles (MCO) d'une plateforme stratégique pilotée par un ministère. Vous contribuerez à garantir la disponibilité, la fiabilité et la performance des applications en production tout en accompagnant la transformation vers un modèle SRE et Cloud. Vos missionsAssurer le MCO des applications et infrastructures en environnement Cloud privé. Garantir le respect des SLA et le traitement des tickets Jira. Superviser les plateformes, assurer le monitoring et l'observabilité des systèmes. Analyser les incidents, identifier les causes racines et mettre en œuvre des actions correctives durables. Automatiser les opérations d'exploitation via Ansible, scripts Bash et outils DevOps. Participer aux déploiements applicatifs et infrastructures (CI/CD, GitOps). Gérer les environnements Recette, Préproduction et Production. Administrer les plateformes Docker et Kubernetes. Optimiser les performances, la disponibilité et la résilience des services. Maintenir et enrichir la documentation d'exploitation. Collaborer avec les équipes de développement, infrastructure et Service Delivery. Compétences indispensablesAnsible Docker MySQL Observabilité / Monitoring Linux GitLab CI / GitOps Bash / scripting Kubernetes Gestion des incidents de production Français courant Compétences appréciéesZabbix Grafana OpenSearch Redis Rundeck Rancher RKE2 NGINX Vault Morpheus CMP S3 Airflow Réseau (LAN/WAN, routage, Load Balancer, TLS, PKI) ITIL ISO 27001 / ISO 9001 Soft SkillsExcellente capacité d'analyse et de résolution d'incidents. Résistance au stress et gestion des priorités. Esprit d'équipe et sens du service. Forte autonomie. Bonnes capacités de communication. Force de proposition et démarche d'amélioration continue. Capacité à évoluer dans un environnement critique. LivrablesRespect des SLA et traitement des tickets Jira. Documentation d'exploitation. Automatisation des procédures. Mise en production des évolutions. Suivi de la disponibilité et des performances des plateformes.
Responsable de : Garantir la fiabilité du service, l'excellence opérationnelle et la conformité des performances sur l'ensemble des environnements, en intégrant les pratiques SRE au sein de l'Agile Release Train et du cycle de vie de livraison du produit. Mission Garantir la stabilité, la performance et la disponibilité des services dans les environnements de production et de non-production, tout en promouvant une culture axée sur la fiabilité au sein des équipes de delivery. Pour mener à bien cette mission, ce rôle agit comme le gardien (gatekeeper) de l'évolution du produit vers la production, en s'assurant que la qualité réponde toujours aux attentes des clients. Collaborer avec les équipes Produit, Tech et Plateforme pour maintenir le juste équilibre entre innovation, vélocité et robustesse opérationnelle. Activités principales Définir, suivre et communiquer les objectifs de niveau de service (SLO), les indicateurs de niveau de service (SLI) et les budgets d'erreur sur l'ensemble des environnements afin d'assurer une fiabilité mesurable par domaine applicatif. S'assurer que des cadres solides d'observabilité, de supervision et d'alerte sont mis en œuvre et améliorés en continu. Superviser la préparation opérationnelle (operational readiness) de chaque release, en garantissant la stabilité de la production grâce à une coordination transverse avec les équipes Produit et Tech. Peut poser un veto sur la livraison d'un produit lorsque la qualité mesurée n'est pas alignée avec les attentes des clients. Gérer la réponse aux incidents, l'analyse des causes racines et les revues post-mortem pour garantir la responsabilisation et l'amélioration continue par domaine applicatif. Collaborer avec les équipes Core Platform, Observabilité & FinOps pour renforcer la résilience du système, optimiser l'efficacité des coûts et maintenir les performances de la plateforme. Rendre compte de l'état de la fiabilité, des risques et des actions d'amélioration auprès des Agile Release Managers et de la direction de domaine pour assurer l'alignement au sein des ART. Participer activement à l'Agile Release Train en tant que voix de la fiabilité et des opérations, en soutenant la cadence et la qualité des livraisons.
Votre mission : devenir la personne référente DevOps d'une plateforme SaaS B2B en production, reprendre progressivement la main sur l'infrastructure et faire évoluer l'existant avec une forte autonomie de mise en œuvre. Ce recrutement intervient dans le cadre du départ du DevOps actuel vers d'autres fonctions. Le CPTO, encore impliqué sur les sujets d'infrastructure, souhaite progressivement se recentrer sur le produit. Vous travaillez avec lui pour cadrer les priorités, puis vous portez leur exécution technique au quotidien. Intégré·e aux équipes produit et développement, vous intervenez sur une plateforme composée d'environ six microservices, utilisée par des clients grands comptes. Vous collaborez directement avec trois feature teams représentant une douzaine de développeurs. Vos principales responsabilités seront les suivantes : Reprendre la responsabilité opérationnelle de l'infrastructure AWS, entièrement administrée avec Terraform, sans ClickOps. Maintenir et faire évoluer l'environnement Kubernetes, Docker et Helm, tout en évaluant avec pragmatisme si Kubernetes reste la solution la plus adaptée à la taille de la plateforme. Simplifier et rationaliser les pipelines CI/CD construits autour de GitLab self-hosted et Helm. Identifier, chiffrer et mettre en œuvre des leviers d'optimisation des coûts cloud. Faire progresser l'observabilité, la documentation et les runbooks afin de renforcer la fiabilité et l'autonomie des équipes. Contribuer aux sujets de sécurité opérationnelle : gestion des secrets, RBAC, moindre privilège et réponses techniques aux audits clients. Les chantiers des 12 à 18 prochains mois sont concrets et ouverts : rationalisation de la CI/CD, optimisation des coûts AWS, réflexion sur une architecture plus simple que Kubernetes, renforcement de l'observabilité et éventuelle mise en place d'une approche GitOps avec Argo CD ou une solution équivalente. Vous recevez les besoins par trois canaux : le CPTO pour les sujets d'infrastructure, de stratégie et de sécurité ; les leads lors des temps d'amélioration continue ; et les développeurs au quotidien. Les sujets sont cadrés collectivement, mais leur mise en œuvre vous appartient. Vous êtes intégré·e au produit, pas positionné·e dans un silo infrastructure. Environnement technique : AWS, Terraform, Kubernetes, Docker, GitLab self-hosted, Helm, Kuma, PHP/Symfony, React et TypeScript. La plateforme connaît un rythme régulier d'une mise en production par sprint et de plusieurs dizaines de correctifs. Le SLA contractuel est de 98 % minimum, sans pics saisonniers et sans astreintes. Conditions proposées : rémunération fixe entre 60 000 € et 75 000 € selon expérience, complétée par environ 5 000 € de participation. Vous bénéficiez également de tickets restaurant, d'une mutuelle Alan et d'un MacBook avec configuration au choix. Le poste est basé à Levallois-Perret, avec deux jours de présence sur site et trois jours de télétravail par semaine. Le processus de recrutement comprend un échange RH, un entretien avec le CPTO, puis une rencontre avec les leads.
Notre client, acteur reconnu dans le secteur bancaire, recherche son futur Ingénieur SRE / Platform Engineer (H/F) pour son site de Toulouse, dans le cadre du renforcement de sa plateforme technique et de ses pratiques d'industrialisation. Poste Intégré à une équipe transverse dédiée à la plateforme et à l'intégration, vous intervenez principalement sur des sujets Build avec pour objectif de structurer un environnement technique fiable, automatisé et orienté self-service. Votre rôle est de faciliter le travail des équipes de développement en mettant à disposition des outils et standards robustes, dans une logique de Platform Engineering, avec une forte culture Infrastructure as Code. Vous évoluerez dans un environnement hybride combinant GCP et Kubernetes On-Premise. Missions * Concevoir et maintenir des infrastructures automatisées (Terraform, Helm) * Développer des outils et templates en self-service pour les équipes applicatives * Construire et optimiser les pipelines CI/CD * Mettre en place des solutions d'observabilité (monitoring, alerting, logs) * Assurer un support avancé sur les incidents applicatifs critiques (N3) * Intégrer les exigences de sécurité dans les processus CI/CD * Collaborer étroitement avec les équipes de développement pour faciliter les déploiements * Participer à la structuration et à l'évolution de la plateforme technique Compétences techniques * Cloud : GCP (environnement principal) * Conteneurisation : Kubernetes, Docker * Infrastructure as Code : Terraform * CI/CD : GitLab CI, GitHub Actions ou Jenkins * Observabilité : Datadog, Prometheus * Environnements distribués : microservices, APIs Une expérience en développement (Node.js, Go ou Python) sera un réel atout.
L'intervenant participera au sein de l'équipe a : Instruire les demandes de changements en challengeant les émetteurs de changements pour identifier les risques et les impacts. Sécuriser les scénarios de mise en production en s'assurant que les prérequis sont bien renseignés et prévu et que les équipes OPS concernées sont bien informées. Evaluer les capacités de retour arrière en cas d'échec. Participer au CAB pour présenter les changements et répondre aux compléments d'information nécessaires. Communiquer sur les changements. Veiller à la traçabilité des actions réalisées durant le changement. Veiller au respect du processus de gestion des changements et à sa déclinaison dans le cluster BCR. Collaborer avec la gestion des incidents et des problèmes pour mettre en visibilité le lien incident/ changement et capitaliser au travers de la gestion des problèmes sur les évolutions à apporter. Contribuer à la production des reportings. Contribuer à la mise en place d'Error Budget
Nous recherchons un Ingénieur DevOps H/F pour une mission à Rennes. Missions : Mettre en œuvre l'automatisation des services réseau en s'appuyant sur les principes Infrastructure as Code. Concevoir et maintenir des modèles de configuration réseau standardisés, réutilisables et évolutifs. Développer des composants d'automatisation permettant de simplifier et d'accélérer le déploiement des services réseau. Construire et administrer les chaînes CI/CD dédiées à l'intégration, aux tests et à la livraison des évolutions infrastructure. Garantir la fiabilité des services réseau selon une démarche SRE : définition des objectifs de service, suivi des indicateurs et amélioration continue. Déployer les mécanismes d'observabilité nécessaires (supervision, alertes, métriques, logs, traces) pour assurer un suivi de bout en bout. Participer à la gestion des incidents, à l'analyse des causes racines et au renforcement de la résilience des services.