Notre client, éditeur de solutions logicielles pour les professionnels de la finance et de la gestion de patrimoine, renforce son équipe Observabilité. Le groupe s'est construit par croissance externe et mène un chantier de rationalisation autour d'une plateforme Grafana Cloud déjà déployée et validée sur deux équipes pilotes. L'enjeu est désormais de l'étendre à une dizaine d'équipes supplémentaires, sur un périmètre de 20 à 25 équipes et environ 300 ingénieurs. MissionsDéployer et fine-tuner la plateforme Grafana Cloud sur de nouvelles équipes applicatives : configuration des connecteurs, dashboards, règles d'alerting et healthchecks. Concevoir des setups standardisés et réutilisables pour industrialiser l'onboarding de chaque nouvelle équipe. Instrumenter les applications avec les équipes de développement : métriques applicatives, logs structurés, traces distribuées et suivi de l'expérience utilisateur. Définir et mettre en œuvre les processus de gestion d'incidents : règles d'alerte, routage, escalade, runbooks, et passage d'une détection passive à une détection proactive avant impact client. Définir les SLI/SLO des applications du périmètre avec les équipes, et exploiter les error budgets comme outil d'arbitrage. Réduire le bruit d'alerting et maîtriser les volumes d'ingestion (cardinalité, labellisation, rétention). Accompagner chaque équipe de bout en bout : état des lieux, configuration, tests, suivi de la montée en maturité. Faire converger les pratiques de monitoring entre les équipes et s'aligner avec la DSI sur la trajectoire globale.
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations.
Vous intervenez sur la gestion et l'administration des systèmes de gestion de données de l'entreprise, en assurant la cohérence, la qualité et la sécurité. Vous participerez à la définition et la mise en œuvre des bases de données et des progiciels retenus. Missions Administration et exploitation des bases de données · Installer, configurer, administrer et maintenir les systèmes de gestion de bases de données · Effectuer le choix d'implémentation et créer les bases en lien avec les équipes système et les chefs de projets · Mettre en exploitation les bases de données et automatiser les procédures associées · Gérer les droits d'accès et les autorisations · Mettre en œuvre les procédures de sauvegarde, de restauration, de journalisation et de reprise après incident Performance, supervision et sécurisation des bases de données · Mettre en place et exploiter les outils de supervision des bases de données · Surveiller la disponibilité, l'intégrité et le fonctionnement des bases · Analyser et optimiser les traitements, les requêtes et les paramètres des bases · Garantir la sécurité des données et la maîtrise des accès · Analyser et résoudre les incidents et problématiques techniques liés aux bases de données Evolution et support des environnements de données · Effectuer le support technique de second niveau pour l'ensemble des bases de données · Accompagner les utilisateurs et les équipes projets sur les problématiques techniques liées aux SGBD · Suivre et contrôler les montées de version des bases existantes et progiciels retenus par l'entreprise · Tester et valider techniquement les nouvelles versions avant leur mise en production · Définir et maintenir les normes, standards et procédures d'utilisation et d'exploitation des SGBD · Documenter la structure des bases et les procédures d'exploitation et de production · Assurer une veille technologique sur les SGBD et les outils associés
Dans le cadre d'un projet chez l'un de nos clients, nous sommes à la recherche d'un DevOps Cloud AWS. Vous intégrez l'équipe R&D Cloud, et serez capable de structurer et cadrer l'ensemble des activités CI/CD et observabilité. Le poste combine expertise technique, vision d'architecture et responsabilité opérationnelle. Vous êtes responsable de la fiabilité, de l'automatisation et du maintien en condition opérationnelle des plateformes Cloud. Vous intervenez sur trois axes majeurs : Structuration et fiabilisation des pipelines CI/CD Mise en place et pilotage de la stratégie d'observabilité Support technique avancé et accompagnement des équipes Vous aurez pour missions : CI/CD & Automatisation Mise en place et optimisation des pipelines CI/CD Configuration et maintien des outils TeamCity et Bitbucket Pipelines Création et maintenance des scripts et jobs de déploiement en production Développement et maintenance des scripts Terraform et Ansible Instanciation des composants nécessaires au déploiement des produits Automatisation et fiabilisation des mises en production Observabilité & MCO Définir et cadrer la stratégie d'observabilité Choisir et implémenter la stack (OpenTelemetry, Datadog, Prometheus…) Mettre en place le monitoring, l'alerting et les dashboards Définir les indicateurs de maintien en condition opérationnelle Optimiser les performances, la scalabilité et les coûts Support & Collaboration Support de niveau 3 Accompagnement de l'équipe Digital Services dans le traitement des demandes clients Gestion des accès, certificats et sujets liés à la sécurité Contribution à la stratégie Cloud et aux bonnes pratiques
Contexte Dans le cadre de projets d'innovation technologique menés chez un grand compte, nous recherchons un Ingénieur Développeur / Intégrateur spécialisé en Edge Computing. Vous rejoindrez une équipe d'experts travaillant sur la conception, l'intégration et l'expérimentation de solutions Edge destinées à des environnements industriels. Les travaux portent notamment sur des plateformes de virtualisation et de conteneurisation, l'intégration de protocoles industriels, l'automatisation des déploiements ainsi que la supervision des infrastructures. Missions Vous interviendrez notamment sur : L'intégration et la configuration de plateformes Edge Computing Le développement et l'intégration de composants techniques Le déploiement et l'administration d'environnements Linux La mise en œuvre de solutions de conteneurisation avec Docker et/ou LXC L'automatisation des déploiements et configurations avec Ansible L'intégration et la configuration de protocoles de communication industriels La réalisation de PoC et démonstrateurs techniques La préparation et l'exécution des tests d'intégration et de validation L'analyse et la résolution d'incidents techniques La mise en place et l'exploitation d'outils de monitoring et d'observabilité La documentation des architectures, configurations et procédures La participation aux réflexions autour de l'industrialisation des solutions expérimentées La prise en compte des contraintes de cybersécurité propres aux environnements industriels Environnement technique Linux Docker LXC Ansible Grafana Prometheus Edge Computing / Edge IIoT Virtualisation et conteneurisation Protocoles industriels : IEC 60870-5-104, Modbus, MQTT Réseaux et systèmes industriels Environnements IT/OT Cybersécurité industrielle
Dans un contexte où la transformation des infrastructures Cloud est un levier stratégique majeur pour les grandes organisations, l'expertise pointue sur les plateformes Cloud, notamment Google Cloud Platform (GCP), devient essentielle. Nous accompagnons un grand compte international dans l'optimisation de sa plateforme Cloud critique, avec un focus renforcé sur l'architecture réseau, la sécurisation et l'automatisation des environnements Kubernetes et Terraform. Vous interviendrez au sein d'une équipe composée de 8 à 12 experts, dans le cadre d'un programme d'évolution de la Landing Zone GCP et de son réseau Cloud à haute criticité. Concevoir, automatiser et industrialiser des infrastructures Cloud sécurisées et résilientes sur GCP. Mettre en œuvre et maintenir la Landing Zone Cloud en assurant la cohérence et la robustesse des architectures réseau. Développer et gérer les déploiements d'infrastructures en Infrastructure as Code (IaC) avec Terraform. Assurer la configuration et l'optimisation des services réseau : VPC, subnets, CIDR, routage, route tables, peering, NAT, VPN, BGP, segmentation réseau et haute disponibilité multi-zone. Implémenter et maintenir les outils de monitoring et d'observabilité : Cloud Monitoring, Cloud Logging, Managed Prometheus, SLI/SLO, runbooks et post-mortems. Gérer la sécurité réseau et l'exposition des services Cloud via firewall, DNS, ingress/egress, ainsi que les solutions proxy comme Envoy, Nginx, HAProxy ou App Gateway. Collaborer étroitement avec les Tech Leads et accompagner les profils juniors en apportant un solide support technique et méthodologique. Contribuer activement à la phase de build et de run de la plateforme pour garantir sa fiabilité et l'excellence opérationnelle. Participer à la conception et au déploiement des pipelines CI/CD (GitLab CI, Jenkins ou équivalents) pour automatiser les workflows. Intégrer le Network Connectivity Center (NCC) et en assurer la maîtrise dans l'architecture réseau Cloud. Vous évoluerez dans un environnement challengeant, au cœur des infrastructures Cloud critiques, avec des perspectives d'expertise et d'accompagnement au plus haut niveau technique.
Nous recherchons un Expert Base de Données (DBA/Database Engineer) expérimenté pour accompagner une phase charnière de notre infrastructure de données. La mission porte sur le support des cycles de vie "Build" et "Run" de nos systèmes critiques, dans un contexte de transformation technologique majeure. L'environnement actuel repose sur des architectures de haute disponibilité traditionnelles (clusters physiques sous Pacemaker, stockage via volumes SAN). Parallèlement, une stratégie de modernisation est en cours pour migrer et déployer ces services vers des environnements conteneurisés (OpenShift). Le rôle est double : assurer la stabilité et la performance de l'existant (Run) tout en participant activement à la conception et au déploiement des nouvelles architectures cibles (Build/Transformation). Rôles et Responsabilités • Gestion de l'existant (Run) : Assurer l'administration, le maintien en condition opérationnelle et la haute disponibilité des clusters PostgreSQL et Elasticsearch tournant sur des infrastructures physiques (gestion des clusters Pacemaker et des volumes SAN). • Accompagnement de la transformation (Build) : Participer à la conception et à la mise en œuvre des nouvelles architectures de bases de données pour leur migration vers des environnements OpenShift. • Optimisation & Performance : Réaliser le tuning des bases de données et l'optimisation des accès au stockage (SAN) pour garantir des performances optimales. • Automatisation : Contribuer à l'industrialisation des déploiements et des opérations de maintenance (patching, backups) pour faciliter la transition vers le modèle cible. • Résilience : Garantir les stratégies de sauvegarde, de restauration et de reprise après sinistre (DRP) sur les deux modèles d'infrastructure (physique et conteneurisé). • Expertise Conseil : Accompagner les équipes applicatives dans le choix des modèles de déploiement les plus adaptés selon la criticité de leurs données.
Contexte : Pour un grand groupe de la grande distribution, nous recherchons un DevOps / SRE senior pour renforcer une équipe Cloud Ops (8 à 12 personnes, avec Tech Leads). La mission s'inscrit dans un projet stratégique : faire évoluer le réseau de la Landing Zone GCP et industrialiser sa sécurité, avec la création de nouvelles Landing Zones. Vos missions : Concevoir l'architecture de mise en œuvre de Network Connectivity Center dans la Landing Zone existante Automatiser le déploiement, la configuration et la gestion des services de la Landing Zone avec Terraform Mettre en place et maintenir les pipelines CI/CD (GitLab CI, Jenkins…) Implémenter des tests sur l'infrastructure déployée Mettre en place le monitoring des nouveaux services (Managed Prometheus, Cloud Monitoring & Logging, SLI/SLO, error budgets) Rédiger les runbooks d'upgrade et les post-mortems Documenter les architectures, partager les bonnes pratiques et accompagner les autres équipes Infos pratiques : TJM : 550 € HT/jour max Localisation : Île-de-France Télétravail : 3 jours par semaine (2 jours sur site) Durée : 12 mois (215 jours prévus) Démarrage : 3 octobre 2026 Contrat : Régie
Vos principales responsabilités incluront : * Concevoir, implémenter et gérer des infrastructures cloud robustes et évolutives sur Google Cloud Platform (GCP). * Déployer et opérer des applications conteneurisées sur Google Kubernetes Engine (GKE). * Mettre en œuvre et maintenir des pipelines CI/CD avec GitLab. * Développer et maintenir l'infrastructure as Code (IaC) à l'aide de Terraform. * Assurer la surveillance (Monitoring) proactive de nos systèmes et applications, et mettre en place des alertes pertinentes. * Optimiser la sécurité de nos environnements GCP (IAM, VPC, Firewalls, Routage). * Travailler en étroite collaboration avec les équipes de développement pour garantir la fluidité des déploiements et l'opérabilité des applications. * Contribuer à l'amélioration continue de nos pratiques DevOps et à l'adoption de nouvelles technologies.
The Cloud Platform Engineer role involves developing, testing, debugging, and troubleshooting containerized infrastructure. Key responsibilities include building CI/CD pipeline configurations to orchestrate provisioning and deployment of both large and small-scale systems, ensuring solutions are well-engineered, maintainable, and delivered on schedule. The engineer will work with business and engineering teams to deploy new infrastructure in the Azure Platform, monitor the availability, latency, and overall system health, and troubleshoot and resolve issues in development, test, and production environments. Additional duties include communicating status and risks to the product and management teams, and helping to automate and streamline operations and processes. The role requires participation in shift and on-call rotations as per operational policy when required on a 24/7 basis.
Au cœur d'un environnement agile et collaboratif (en lien direct avec l'architecte technique, l'équipe Dev, le support et le responsable des livraisons), vous serez le garant de la fiabilité, de la sécurité et de la performance de la plateforme : 🛠️ Administration & Maintien de la plateforme : Administrer les outils internes et garantir la haute disponibilité de l'écosystème. 🔄 CI/CD & Automatisation : Faire évoluer les pipelines d'intégration et de déploiement continus, industrialiser les opérations récurrentes. 📊 Observabilité & Supervision : Enrichir la collecte de métriques, logs, traces, et concevoir les tableaux de bord ainsi que le plan d'alerting. 🚀 Déploiements & Environnements : Participer à la gestion des environnements et orchestrer les opérations de déploiement. 🔍 Résilience & Incidents : diagnostiquer et résoudre les anomalies, rédiger les post-mortems pour améliorer en continu nos pratiques. ⚙️ Passerelle IBM i / Modernité : Contribuer à l'intégration, à l'exploitation et à l'automatisation des composants IBM i selon les besoins.
Dans le cadre du lancement d'un nouveau projet de plateforme Citizen Dev développée en externe, votre objectif principal sera d'assister le Tech Lead dans le déploiement et l'intégration de cet outil. Vous serez garant du suivi de la mise en place de l'architecture informatique, du provisionnement des ressources (comptes, serveurs) et de leur configuration au sein d'un environnement "My Cloud" ou d'un environnement virtualisé (Docker). Missions principales Sous la responsabilité du Tech Lead, l'Ingénieur(e) DevOps aura pour missions de : • Ordonnancer et piloter l'installation de la nouvelle plateforme. • Assurer le déploiement applicatif en veillant au strict respect des exigences et des guidelines d'administration via les outils XL Deploy et XL Release. • Gérer et maintenir l'infrastructure pour garantir la haute disponibilité et la performance des environnements. • Garantir la sécurité de la plateforme en veillant à la mise en conformité avec les exigences de sécurité et les politiques internes de l'entreprise. Assurer l'ensemble des tâches récurrentes liées au rôle de DevOps (automatisation de pipelines CI/CD, scripting, monitoring et résolution des incidents).
ous recherchons un Ingénieur Systèmes SRE / DevOps pour intervenir au sein des équipes Systèmes & Réseaux d'un grand acteur bancaire. La mission s'inscrit dans un environnement Systèmes Monde Ouvert et porte principalement sur des problématiques de performance, d'optimisation des infrastructures Kubernetes et de conception de services IaaS/PaaS. Le consultant interviendra notamment sur : Le diagnostic et l'analyse de problèmes de performance sur les infrastructures et applications. L'analyse de la consommation des ressources et le right-sizing des environnements Kubernetes. L'assistance à la conception de services IaaS / PaaS. L'exploitation et l'analyse des métriques Prometheus. La conception et l'amélioration de dashboards Grafana ou Kibana. L'automatisation et l'industrialisation des infrastructures via Terraform et Ansible. L'utilisation et l'administration d'environnements Linux avec Python ou Windows avec PowerShell. La contribution aux démarches SRE, DevOps et Observabilité des équipes.
Au sein de l'équipe Data science & Analytics de la DSI, vous interviendrez sur un projet stratégique complexe mêlant intelligence artificielle, développement de pipelines Data, conception d'algorithmes et industrialisation de solutions. Votre rôle Modélisation prédictive, optimisation et IA générative · Cadrer les nouveaux projets avec les parties prenantes · Extraire, explorer, analyser, synthétiser et transformer les données · Créer des modèles prédictifs en garantissant leur adéquation avec le cahier des charges · Développer des traitements complexes de données, des pipelines de construction de modèles prédictifs et des algorithmes de résolution de problèmes d'optimisation · Concevoir des graphes et des harnais d'agents basés sur l'IA générative Industrialisation des modèles et pipelines Data / IA · Développer, déployer et monitorer des services numériques fiables et capables de passer à l'échelle · Intégrer, tester et maintenir les traitements, pipelines, modèles et composants développés · Identifier les solutions techniques les plus pertinentes en termes de stockage, de traitement distribué et de modélisation · Contribuer aux choix d'architecture et de technologies à court, moyen et long terme Adoption des solutions Data / IA et valorisation des résultats · Accompagner les utilisateurs avant, pendant et après les déploiements des services pour faciliter leur adoption · Présenter les résultats des études et projets à la hiérarchie, aux filiales et aux différentes communautés IT et métiers du Groupe
EXPERT KUBERNETES / IA (H/F)Contexte de la missionNous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l'exploitation, la disponibilité, la performance et la stabilité d'un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage. Le profil recherché devra également contribuer à l'automatisation de l'exploitation, au traitement des incidents et à l'amélioration continue de l'infrastructure. Missions principales Maintien en condition opérationnelle – MCO Garantir la disponibilité, la performance et la stabilité du cluster IA. Administrer les nœuds GPU/CPU, les infrastructures de stockage et les composants réseau. Assurer le suivi et l'optimisation des ressources de l'infrastructure. Piloter les opérations de maintenance et les mises à jour techniques. Administration Linux Installer, configurer et administrer les environnements Linux Ubuntu. Réaliser les opérations d'optimisation et de troubleshooting. Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés. Kubernetes Administrer et exploiter les environnements Kubernetes. Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA). Assurer le maintien en conditions opérationnelles des clusters. Piloter les mises à jour des composants Kubernetes. Gérer les problématiques liées aux ressources et à la capacité des clusters. Supervision et observabilité Mettre en place et maintenir la supervision des infrastructures. Exploiter Prometheus et Grafana pour le monitoring et l'analyse des performances. Identifier les anomalies et anticiper les incidents grâce à une approche proactive. Automatisation Automatiser les tâches d'administration et d'exploitation avec Ansible. Développer et maintenir des scripts Bash et Python. Optimiser les processus opérationnels afin de réduire les tâches manuelles. Gestion des jobs IA / GPU Assurer l'ordonnancement des tâches et jobs GPU. Gérer les quotas, priorités et ressources GPU. Optimiser l'allocation des ressources CPU/GPU. Gestion des incidents Prendre en charge les incidents techniques complexes. Réaliser les analyses de causes racines et les post-mortems. Définir et suivre les plans d'actions correctifs. Coordonner les interventions avec les différentes équipes techniques. Documentation Rédiger et maintenir la documentation d'exploitation. Formaliser les procédures techniques et les consignes de maintenance. Garantir la traçabilité et la continuité des opérations.
En quelques motsCherry Pick est à la recherche d'un Application Observability Engineer(H/F), pour le compte de l'un de ses clients qui opère dans le domaine de la High-tech. Description🚀 Contexte de la missionAu sein d'un groupe spécialisé dans les logiciels et services pour les professionnels du patrimoine et de la finance, vous rejoignez l'équipe de transformation sous la direction de l'Application Observability Lead et du Head of IT Transformation. Dans le cadre de l'harmonisation de son paysage technique (regroupant près de 300 ingénieurs répartis dans plus de 20 équipes), l'entreprise déploie son socle d'observabilité autour de Grafana Cloud (Loki, Tempo, Faro, K6, OpenTelemetry, Prometheus). Après une phase pilote sur la partie outillage, l'enjeu principal consiste désormais à déployer ce socle sur une dizaine d'équipes (dont des applications critiques) tout en instaurant une vraie culture de l'observabilité et le modèle « you build it, you run it ». Pour porter ce projet d'envergure, nous recherchons un(e) Application Observability Engineer / Tech Lead Observabilité (H/F). Votre mission combinera le déploiement technique de la plateforme et l'accompagnement des équipes dans la structuration de leurs processus de gestion d'incidents. 🎯 Missions principales & Rôle1. Standardisation & Déploiement Grafana Cloud : Définir et déployer les standards d'observabilité sur Grafana Cloud : dashboards, monitoring applicatif (Kubernetes / EKS, VMs), supervision des bases de données (RDS), définition des SLOs/SLIs, règles d'alerting, synthetic monitoring, collecte et traitement des logs/traces. Adapter la stack aux besoins spécifiques des applications tout en garantissant la cohérence globale avec les normes de l'entreprise. Collaborer avec les équipes d'infrastructure Cloud pour assurer la collecte performante des métriques, traces et logs via les collecteurs (OpenTelemetry, Prometheus). 2. Coaching, Accompagnement & Culture DevOps : Réaliser l'état des lieux des pratiques et outils existants équipe par équipe, puis définir un plan de migration structuré. Accompagner progressivement une dizaine d'équipes applicatives (cadrage, configuration, tests, suivi). Former et sensibiliser les équipes d'ingénierie aux bonnes pratiques d'observabilité pour ancrer la responsabilité du suivi en production (« you build it, you run it »). 3. Structuration des Processus de Gestion d'Incidents : Accompagner la refonte des workflows de gestion d'incidents afin d'accélérer la détection et la résolution des anomalies avant tout impact utilisateur. Faire évoluer le modèle de suivi et d'escalade des alertes entre la DSI et les équipes projets. 🏁 ObjectifsPasser d'un monitoring subi à une observabilité proactive intégrée au cycle de vie applicatif. Déployer et généraliser le socle Grafana Cloud auprès d'une dizaine d'équipes clés. Responsabiliser les équipes projets sur le suivi de leurs applications en production et optimiser les délais de résolution d'incidents (MTTR).