Le contexte Au sein d'une équipe qui fournit des offres PostgreSQL via le cloud interne du groupe, vous administrez des bases utilisées par des applications très critiques. Votre rôle : garantir leur disponibilité, leur performance et leur sécurité, et faire évoluer l'automatisation de la plateforme. Vos missions Utiliser et faire évoluer les jobs d'automatisation Ansible existants pour le provisionnement des bases PostgreSQL Piloter les migrations de bases dans le cadre de l'obsolescence des versions Qualifier les nouvelles versions majeures et mineures de PostgreSQL Superviser les environnements (Zabbix, Grafana) Accompagner les équipes applicatives dans la mise en place de leurs projets Apporter un support expert aux équipes RUN et participer aux cellules de crise Assurer le maintien de la sécurité (suivi et traitement des vulnérabilités) Rédiger et maintenir la documentation technique, les procédures d'exploitation et les bonnes pratique
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations.
Contexte : Dans le cadre de l'équipe Platform & Monitoring, notre client recherche un Intégrateur DevOps / Platform Engineer chargé de piloter l'automatisation de la chaîne CI/CD et la gestion des services d'infrastructure. La plateforme s'appuie notamment sur Kubernetes et une stack de monitoring comprenant Grafana, Loki, Mimir et Prometheus. L'objectif est de disposer d'une plateforme fortement automatisée, sécurisée, fiable et scalable. MISSIONS Concevoir et maintenir les modules Infrastructure as Code (IaC) avec Terragrunt / OpenTofu / Terraform pour des déploiements Kubernetes multi-environnements. Construire et optimiser les pipelines GitLab CI, incluant runners et auto-scaling. Gérer l'IAM avec Keycloak : OIDC, SSO, RBAC, realms, clients et fédération. Administrer le registre de conteneurs Harbor : signature d'images, réplication et analyse des vulnérabilités. Déployer et administrer l'infrastructure Cloud sur Microsoft Azure / AKS. Gérer les déploiements Kubernetes avec Helm et Flux / GitOps. Automatiser via scripting Bash, Python ou Go. Garantir la fiabilité, la sécurité et l'observabilité de la plateforme. Compétences indispensables Expertise attendue : OpenTofu / Terraform Terragrunt GitLab CI/CD Kubernetes Helm Flux / GitOps Azure / AKS Keycloak Harbor Scripting Bash, Python ou Go Linux Monitoring / Observabilité : Grafana Loki Mimir Prometheus
Vous jouerez un rôle clé dans la fiabilité et l'évolution d'applications critiques utilisées chaque jour par des milliers d'utilisateurs. Dans un contexte bancaire exigeant et sécurisé, vous contribuerez à l'automatisation des déploiements, à l'industrialisation des opérations, à la supervision avancée et à la gestion des incidents sur des plateformes à haute disponibilité. Votre rôle Volet Projet (50 %) Intégration des évolutions applicatives et techniques · Accompagner les mises en production en coordination avec les équipes Développement, Infrastructure et Sécurité (Release Management) · Participer à l'intégration des changements techniques et applicatifs sur des plateformes à fort trafic · Anticiper les risques en amont et contribuer à une stratégie de déploiement sans interruption de service Automatisation, fiabilité et outillage · Développer des scripts (Shell, Python) et des rôles Ansible · Améliorer les chaînes CI/CD (GitLab, Jenkins…) · Améliorer l'observabilité des applications (logs, métriques, alerting) Architecture, documentation et opérations techniques · Contribuer à l'évolution de l'architecture applicative avec un focus production (sécurité, résilience, performance) · Rédiger la documentation associée : runbooks, procédures d'exploitation, guides de résolution · Participer aux opérations planifiées (tests, mises en production, migrations) et aux astreintes Volet Run / Support (50 %) Maintien en conditions opérationnelles (MCO) · Assurer le support de niveau 2 des applications · Suivre les indicateurs de supervision et intervenir rapidement sur les anomalies Gestion des incidents et amélioration continue · Intervenir lors des incidents critiques : diagnostic, analyse des causes (RCA), remédiation · Proposer et mettre en œuvre des actions correctives durables · Participer aux comités techniques de suivi de problèmes
ELASTICSEARCH Expert / N3 / Freelance /3 ans de contrat initial /Eure et Loir / 3 as(H/F) Pour le compte de notre client, acteur majeur du secteur de la banque et de l'assurance, nous recherchons un(e) Expert(e) Elasticsearch N3 pour rejoindre une équipe en charge du support, de l'exploitation et de l'évolution des plateformes Elastic. Notre client fait rarement appel à la sous-traitance. Cette mission représente donc une opportunité privilégiée d'intégrer un environnement stable, structuré et stratégique, avec une visibilité sur plusieurs années. Vos missions 🔹 Administrer, exploiter et faire évoluer les plateformes Elasticsearch 🔹 Assurer le support et l'expertise de niveau 3 🔹 Participer à la généralisation et à l'industrialisation des déploiements Elastic 🔹 Intégrer et gérer plusieurs types de flux et d'événements dans Elasticsearch 🔹 Superviser les plateformes et contribuer à leur maintien en conditions opérationnelles 🔹 Participer à des projets fonctionnels et techniques 🔹 Recueillir les besoins des équipes et proposer des solutions adaptées 🔹 Mettre en place des outils de visualisation, de suivi et de reporting 🔹 Concevoir et faire évoluer des dashboards avec Grafana et les outils de la stack Elastic 🔹 Rédiger la documentation technique et accompagner les équipes dans l'utilisation des solutions
Résumé Observabilité, Supervision et Évolution des Plateformes Zabbix CONTEXTE : Au sein du Pôle Tech Foundation, la mission s'inscrit dans le Domaine d'Expertise « Automatisation et Observabilité », afin d'accompagner les projets de transformation autour des enjeux d'observabilité, de supervision et de métrologie. Dans un contexte de transformation technologique et organisationnelle, les activités portent sur l'évolution, l'industrialisation et l'amélioration continue des solutions de supervision et d'observabilité déployées à grande échelle. DETAILS : Missions : - Accompagner les projets de transformation autour de l'Observabilité (BUILD). - Contribuer à la rationalisation des solutions et technologies de supervision des environnements Open, Réseau et Natif. - Garantir l'opérabilité de la plateforme Zabbix et des pratiques de Monitoring as Code. - Contribuer à la mise en œuvre de nouveaux composants techniques industrialisés, sécurisés, packagés et automatisés (DevOps). - Veiller aux optimisations liées à l'automatisation des actes d'administration nécessaires aux choix et modèles d'implémentation des composants. - Assurer le support d'expertise en relation avec l'éditeur et les équipes de support (RUN). - Assurer une veille technologique et contribuer à l'anticipation des évolutions produit. - Veiller au contrôle qualité et à l'amélioration continue des plateformes Zabbix. Environnement technique - Supervision Open Zabbix - Métrologie & Dashboarding : Grafana, InfluxDB - Hypervision Netcool Operation Insight (NOI) - Contexte de fabrication et de production industrialisé et automatisé - Environnement à forte exigence de performance, robustesse et scalabilité - Environnement sécurisé - Périmètre d'exploitation d'environ 50 000 serveurs Compétences attendues - Maîtrise du socle technique Zabbix (architecture, intégration, corrélation, administration) - Maîtrise des sujets de métrologie, supervision et qualité de service - Connaissance de Zabbix et/ou Grafana - Pratiques DevOps et automatisation - Connaissance des solutions de supervision déployées dans des environnements grands comptes - Capacité de scripting : Perl, Shell, Python ou Java - Démarche structurée adaptée aux exigences normatives et opérationnelles - Sens du service, capacité de proposition et collaboration transverse - Anglais professionnel écrit et oral
En quelques motsCherry Pick est à la recherche d'un Application Observability Engineer(H/F), pour le compte de l'un de ses clients qui opère dans le domaine de la High-tech. Description🚀 Contexte de la missionAu sein d'un groupe spécialisé dans les logiciels et services pour les professionnels du patrimoine et de la finance, vous rejoignez l'équipe de transformation sous la direction de l'Application Observability Lead et du Head of IT Transformation. Dans le cadre de l'harmonisation de son paysage technique (regroupant près de 300 ingénieurs répartis dans plus de 20 équipes), l'entreprise déploie son socle d'observabilité autour de Grafana Cloud (Loki, Tempo, Faro, K6, OpenTelemetry, Prometheus). Après une phase pilote sur la partie outillage, l'enjeu principal consiste désormais à déployer ce socle sur une dizaine d'équipes (dont des applications critiques) tout en instaurant une vraie culture de l'observabilité et le modèle « you build it, you run it ». Pour porter ce projet d'envergure, nous recherchons un(e) Application Observability Engineer / Tech Lead Observabilité (H/F). Votre mission combinera le déploiement technique de la plateforme et l'accompagnement des équipes dans la structuration de leurs processus de gestion d'incidents. 🎯 Missions principales & Rôle1. Standardisation & Déploiement Grafana Cloud : Définir et déployer les standards d'observabilité sur Grafana Cloud : dashboards, monitoring applicatif (Kubernetes / EKS, VMs), supervision des bases de données (RDS), définition des SLOs/SLIs, règles d'alerting, synthetic monitoring, collecte et traitement des logs/traces. Adapter la stack aux besoins spécifiques des applications tout en garantissant la cohérence globale avec les normes de l'entreprise. Collaborer avec les équipes d'infrastructure Cloud pour assurer la collecte performante des métriques, traces et logs via les collecteurs (OpenTelemetry, Prometheus). 2. Coaching, Accompagnement & Culture DevOps : Réaliser l'état des lieux des pratiques et outils existants équipe par équipe, puis définir un plan de migration structuré. Accompagner progressivement une dizaine d'équipes applicatives (cadrage, configuration, tests, suivi). Former et sensibiliser les équipes d'ingénierie aux bonnes pratiques d'observabilité pour ancrer la responsabilité du suivi en production (« you build it, you run it »). 3. Structuration des Processus de Gestion d'Incidents : Accompagner la refonte des workflows de gestion d'incidents afin d'accélérer la détection et la résolution des anomalies avant tout impact utilisateur. Faire évoluer le modèle de suivi et d'escalade des alertes entre la DSI et les équipes projets. 🏁 ObjectifsPasser d'un monitoring subi à une observabilité proactive intégrée au cycle de vie applicatif. Déployer et généraliser le socle Grafana Cloud auprès d'une dizaine d'équipes clés. Responsabiliser les équipes projets sur le suivi de leurs applications en production et optimiser les délais de résolution d'incidents (MTTR).
Vos principales responsabilités incluront : * Concevoir, implémenter et gérer des infrastructures cloud robustes et évolutives sur Google Cloud Platform (GCP). * Déployer et opérer des applications conteneurisées sur Google Kubernetes Engine (GKE). * Mettre en œuvre et maintenir des pipelines CI/CD avec GitLab. * Développer et maintenir l'infrastructure as Code (IaC) à l'aide de Terraform. * Assurer la surveillance (Monitoring) proactive de nos systèmes et applications, et mettre en place des alertes pertinentes. * Optimiser la sécurité de nos environnements GCP (IAM, VPC, Firewalls, Routage). * Travailler en étroite collaboration avec les équipes de développement pour garantir la fluidité des déploiements et l'opérabilité des applications. * Contribuer à l'amélioration continue de nos pratiques DevOps et à l'adoption de nouvelles technologies.
Contexte Mission au sein de la Direction Opérations & Services IT d'un grand compte du secteur assurance / protection sociale, département qualité et exploitation des services, qui assure le support N3, l'évolution des infrastructures et contribue aux projets métiers, techniques et transversaux du système d'information. Le prestataire sera intégré à l'unité IC Unix. Le besoin s'inscrit dans un contexte de forte évolution de la plateforme Elasticsearch, avec une généralisation du déploiement des outils en cours. Rôle et responsabilités principales Contribuer à la généralisation du déploiement des outils Elasticsearch dans un contexte de forte évolution de la plateforme Contribuer à l'évolution de l'outil Elasticsearch Contribuer aux projets fonctionnels et techniques Intégration au sein de l'unité IC Unix Exploiter et faire évoluer les plateformes Elasticsearch et Grafana Intégrer des évènements dans l'outil Elasticsearch Formaliser et communiquer sur les travaux réalisés Livrables attendus Document d'intégration des données dans une plateforme Elasticsearch
ous recherchons un Ingénieur Systèmes SRE / DevOps pour intervenir au sein des équipes Systèmes & Réseaux d'un grand acteur bancaire. La mission s'inscrit dans un environnement Systèmes Monde Ouvert et porte principalement sur des problématiques de performance, d'optimisation des infrastructures Kubernetes et de conception de services IaaS/PaaS. Le consultant interviendra notamment sur : Le diagnostic et l'analyse de problèmes de performance sur les infrastructures et applications. L'analyse de la consommation des ressources et le right-sizing des environnements Kubernetes. L'assistance à la conception de services IaaS / PaaS. L'exploitation et l'analyse des métriques Prometheus. La conception et l'amélioration de dashboards Grafana ou Kibana. L'automatisation et l'industrialisation des infrastructures via Terraform et Ansible. L'utilisation et l'administration d'environnements Linux avec Python ou Windows avec PowerShell. La contribution aux démarches SRE, DevOps et Observabilité des équipes.
Dans le cadre du renforcement d'une équipe spécialisée dans la gestion des bases de données, nous recherchons un DBA SQL Server expérimenté pour intervenir sur des environnements critiques en Standalone et Haute Disponibilité. Le consultant assurera l'administration, l'optimisation, la sécurisation et la fiabilisation des environnements SQL Server afin de garantir leur disponibilité et leurs performances. Il participera aux migrations de bases liées aux obsolescences, à la qualification des nouvelles versions SQL Server et à l'accompagnement des équipes applicatives dans leurs projets. La mission comprend également une dimension d'automatisation avec la maintenance et l'évolution des jobs Ansible existants, le support aux équipes RUN, la participation ponctuelle aux cellules de crise, le traitement des vulnérabilités et la mise en place de plans d'actions permettant de maintenir le niveau de qualité de service attendu. Compétences techniquesBases de données SQL Server – Expert Administration SQL Server Environnements Standalone Haute Disponibilité Migration de bases de données Performance / optimisation Sécurisation des bases Qualification de versions SQL Server Systèmes Windows – Bonne connaissance Automatisation / DevOps Ansible – Bon niveau apprécié Red Hat Ansible Automation Platform (AAP) GitLab Monitoring Grafana Production Support RUN Gestion des vulnérabilités Résolution d'incidents Participation aux cellules de crise Documentation et procédures d'exploitation Langues Anglais opérationnel
The Cloud Platform Engineer role involves developing, testing, debugging, and troubleshooting containerized infrastructure. Key responsibilities include building CI/CD pipeline configurations to orchestrate provisioning and deployment of both large and small-scale systems, ensuring solutions are well-engineered, maintainable, and delivered on schedule. The engineer will work with business and engineering teams to deploy new infrastructure in the Azure Platform, monitor the availability, latency, and overall system health, and troubleshoot and resolve issues in development, test, and production environments. Additional duties include communicating status and risks to the product and management teams, and helping to automate and streamline operations and processes. The role requires participation in shift and on-call rotations as per operational policy when required on a 24/7 basis.
Nous recherchons un(e) Incident Manager expérimenté(e) pour piloter la gestion des incidents majeurs et coordonner la résolution des crises IT au sein de notre organisation. Ce poste, exposé et exigeant, requiert un sang-froid exemplaire, un excellent sens de la communication et une réelle capacité à fédérer des équipes techniques sous pression. Missions principales1. Gestion des incidents majeurs Coordonner la résolution rapide des incidents critiques (P1/P2), en mobilisant les équipes techniques et en assurant un retour à la normale dans les meilleurs délais. 2. Communication de crise Assurer une communication claire et régulière avec les parties prenantes (utilisateurs, direction, clients) pendant toute la durée de l'incident. 3. Analyse post-incident Conduire des analyses de causes profondes (RCA), rédiger des rapports post-mortem et proposer des actions correctives pour éviter la récurrence. 4. Suivi des indicateurs de performance Surveiller les SLA/KPI liés aux incidents, produire des tableaux de bord et participer aux comités de pilotage. 5. Amélioration continue et coordination Collaborer avec les équipes IT (support, infrastructure, développement, sécurité) pour améliorer les processus de gestion des incidents et renforcer la résilience du système.
Dans le cadre du lancement d'un nouveau projet de plateforme Citizen Dev développée en externe, votre objectif principal sera d'assister le Tech Lead dans le déploiement et l'intégration de cet outil. Vous serez garant du suivi de la mise en place de l'architecture informatique, du provisionnement des ressources (comptes, serveurs) et de leur configuration au sein d'un environnement "My Cloud" ou d'un environnement virtualisé (Docker). Missions principales Sous la responsabilité du Tech Lead, l'Ingénieur(e) DevOps aura pour missions de : • Ordonnancer et piloter l'installation de la nouvelle plateforme. • Assurer le déploiement applicatif en veillant au strict respect des exigences et des guidelines d'administration via les outils XL Deploy et XL Release. • Gérer et maintenir l'infrastructure pour garantir la haute disponibilité et la performance des environnements. • Garantir la sécurité de la plateforme en veillant à la mise en conformité avec les exigences de sécurité et les politiques internes de l'entreprise. Assurer l'ensemble des tâches récurrentes liées au rôle de DevOps (automatisation de pipelines CI/CD, scripting, monitoring et résolution des incidents).