EXPERT KUBERNETES / IA (H/F)Contexte de la missionNous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l'exploitation, la disponibilité, la performance et la stabilité d'un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage. Le profil recherché devra également contribuer à l'automatisation de l'exploitation, au traitement des incidents et à l'amélioration continue de l'infrastructure. Missions principales Maintien en condition opérationnelle – MCO Garantir la disponibilité, la performance et la stabilité du cluster IA. Administrer les nœuds GPU/CPU, les infrastructures de stockage et les composants réseau. Assurer le suivi et l'optimisation des ressources de l'infrastructure. Piloter les opérations de maintenance et les mises à jour techniques. Administration Linux Installer, configurer et administrer les environnements Linux Ubuntu. Réaliser les opérations d'optimisation et de troubleshooting. Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés. Kubernetes Administrer et exploiter les environnements Kubernetes. Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA). Assurer le maintien en conditions opérationnelles des clusters. Piloter les mises à jour des composants Kubernetes. Gérer les problématiques liées aux ressources et à la capacité des clusters. Supervision et observabilité Mettre en place et maintenir la supervision des infrastructures. Exploiter Prometheus et Grafana pour le monitoring et l'analyse des performances. Identifier les anomalies et anticiper les incidents grâce à une approche proactive. Automatisation Automatiser les tâches d'administration et d'exploitation avec Ansible. Développer et maintenir des scripts Bash et Python. Optimiser les processus opérationnels afin de réduire les tâches manuelles. Gestion des jobs IA / GPU Assurer l'ordonnancement des tâches et jobs GPU. Gérer les quotas, priorités et ressources GPU. Optimiser l'allocation des ressources CPU/GPU. Gestion des incidents Prendre en charge les incidents techniques complexes. Réaliser les analyses de causes racines et les post-mortems. Définir et suivre les plans d'actions correctifs. Coordonner les interventions avec les différentes équipes techniques. Documentation Rédiger et maintenir la documentation d'exploitation. Formaliser les procédures techniques et les consignes de maintenance. Garantir la traçabilité et la continuité des opérations.
Vos principales responsabilités incluront : * Concevoir, implémenter et gérer des infrastructures cloud robustes et évolutives sur Google Cloud Platform (GCP). * Déployer et opérer des applications conteneurisées sur Google Kubernetes Engine (GKE). * Mettre en œuvre et maintenir des pipelines CI/CD avec GitLab. * Développer et maintenir l'infrastructure as Code (IaC) à l'aide de Terraform. * Assurer la surveillance (Monitoring) proactive de nos systèmes et applications, et mettre en place des alertes pertinentes. * Optimiser la sécurité de nos environnements GCP (IAM, VPC, Firewalls, Routage). * Travailler en étroite collaboration avec les équipes de développement pour garantir la fluidité des déploiements et l'opérabilité des applications. * Contribuer à l'amélioration continue de nos pratiques DevOps et à l'adoption de nouvelles technologies.
ous recherchons un Ingénieur Systèmes SRE / DevOps pour intervenir au sein des équipes Systèmes & Réseaux d'un grand acteur bancaire. La mission s'inscrit dans un environnement Systèmes Monde Ouvert et porte principalement sur des problématiques de performance, d'optimisation des infrastructures Kubernetes et de conception de services IaaS/PaaS. Le consultant interviendra notamment sur : Le diagnostic et l'analyse de problèmes de performance sur les infrastructures et applications. L'analyse de la consommation des ressources et le right-sizing des environnements Kubernetes. L'assistance à la conception de services IaaS / PaaS. L'exploitation et l'analyse des métriques Prometheus. La conception et l'amélioration de dashboards Grafana ou Kibana. L'automatisation et l'industrialisation des infrastructures via Terraform et Ansible. L'utilisation et l'administration d'environnements Linux avec Python ou Windows avec PowerShell. La contribution aux démarches SRE, DevOps et Observabilité des équipes.
The Cloud Platform Engineer role involves developing, testing, debugging, and troubleshooting containerized infrastructure. Key responsibilities include building CI/CD pipeline configurations to orchestrate provisioning and deployment of both large and small-scale systems, ensuring solutions are well-engineered, maintainable, and delivered on schedule. The engineer will work with business and engineering teams to deploy new infrastructure in the Azure Platform, monitor the availability, latency, and overall system health, and troubleshoot and resolve issues in development, test, and production environments. Additional duties include communicating status and risks to the product and management teams, and helping to automate and streamline operations and processes. The role requires participation in shift and on-call rotations as per operational policy when required on a 24/7 basis.
Exécutée au sein de l'équipe en charge de l'intégration, de la mise en production et de l'exploitation des socles de virtualisation pour la 5GC, la Prestation comporte principalement des activités de BUILD : Pilotage de projets sur les outils d'exploitation et de déploiement/configuration pour les nouvelles architectures Caas sur Bare Metal (Clusters Kubernetes adaptés 5GC) selon les besoins des équipes Run. Proposition de réalisation des outils d'exploitation et de déploiement pour gérer au mieux les infrastructures hébergeant des containers (Fault management, Performances management et Configuration management) Réalisation directe ou pilotage des développements dans les services outils, par les fournisseurs de socle ou autres Partenaires retenus, Être partie prenante de la démarche devops avec les développeurs et les testeurs Construire le plan de déploiement de la phase d'études à la mise en production, assurer la communication et veiller à toujours être synchronisé avec le projet global pour tenir les objectifs couts et délais. Veiller au respect des standards de sécurité Réalisation ou pilotage des tests de recette et participation aux suivis de VSR en production Rédaction des modes opératoires d'exploitation et des guides d'utilisation des outils. Sélection et mise en forme des données de monitoring et de configuration des socles pour les exploitants et déployeurs. Présentation/formation techniques sur les projets à destination des équipes de RUN Fourniture du bilan projet, modélisant les étapes de déploiement, les capitalisations et toute la documentation projet. Garantir l'intégrité permanente des services et des produits au fil des itérations et incréments. Compétences : Kubernetes, orchestrateur de containers, RedHat, Ansible , Prométheus,, Kibana, Python, Infra systèmes, 5ans exp +, diplômé(e) d'un BAC+4/5 en Ingénierie Informatique Animation de réunions et rédaction de CR de réunions, aisance écrit et oral en français et anglais, rigueur, autonomie et travail en équipe, capacité à synthétiser et vulgariser à l'écrit et à l'oral des sujets techniques complexes. Savoir lire et comprendre du code est un plus (Python et shell, pratiquer Infrastructure as code : GIT, Terraform, AWS Cloud Formation, YAML K8S, Ansible…)
Dans le cadre du lancement d'un nouveau projet de plateforme Citizen Dev développée en externe, votre objectif principal sera d'assister le Tech Lead dans le déploiement et l'intégration de cet outil. Vous serez garant du suivi de la mise en place de l'architecture informatique, du provisionnement des ressources (comptes, serveurs) et de leur configuration au sein d'un environnement "My Cloud" ou d'un environnement virtualisé (Docker). Missions principales Sous la responsabilité du Tech Lead, l'Ingénieur(e) DevOps aura pour missions de : • Ordonnancer et piloter l'installation de la nouvelle plateforme. • Assurer le déploiement applicatif en veillant au strict respect des exigences et des guidelines d'administration via les outils XL Deploy et XL Release. • Gérer et maintenir l'infrastructure pour garantir la haute disponibilité et la performance des environnements. • Garantir la sécurité de la plateforme en veillant à la mise en conformité avec les exigences de sécurité et les politiques internes de l'entreprise. Assurer l'ensemble des tâches récurrentes liées au rôle de DevOps (automatisation de pipelines CI/CD, scripting, monitoring et résolution des incidents).
Mission au sein d'un centre informatique d'une administration publique, site d'Osny (95). Présence quotidienne sur site, pas de télétravail. Démarrage au plus tard mi-octobre 2026. Durée : 3 mois initiaux, prolongation possible. CONTEXTE Le client construit sa future approche de conteneurisation. Trois agents seront mobilisés à temps plein sur le chantier. L'expert travaille quotidiennement à leurs côtés avec un double objectif : concevoir et mettre en œuvre une première solution opérationnelle, et faire monter ces agents en compétences jusqu'à l'autonomie. Le besoin est en phase de cadrage : des expérimentations existent, mais la cible technologique et l'architecture restent à définir. MISSIONS - Analyser l'existant et les expérimentations déjà réalisées - Faire préciser le besoin, les usages et les exigences d'exploitation - Participer à la définition de l'architecture et de la trajectoire de conteneurisation - Identifier un premier périmètre réalisable sur les 3 mois - Concevoir, configurer et mettre en œuvre la solution retenue - Industrialiser les déploiements, CI/CD et automatisation - Prendre en compte réseau, sécurité, supervision, journalisation, sauvegarde et reprise - Assurer un transfert de compétences permanent par la pratique - Produire la documentation d'exploitation STACK Conteneurisation : Docker, Kubernetes, Rancher IaC : Helm, Terraform, Ansible Réseau et sécurité K8s : CNI, Ingress, Service Mesh, Network et Security Policies Observabilité : Prometheus, Grafana, ELK / Elasticsearch CI/CD : GitLab CI, Jenkins Complémentaire : Linux, Bash, Python, DevSecOps, environnements on-premise
CONTEXTE ET ENVIRONNEMENT Le pôle conçoit et opère des plateformes « as a service » facilitant la mise en place d'architectures modernes, distribuées et hautement résilientes pour l'ensemble des entités du groupe. Le poste s'inscrit au sein de l'équipe GenAI du domaine d'expertise Data & IA, avec pour mission le déploiement, l'industrialisation et l'exploitation de la plateforme GPUaaS et LLMaaS On-Premise. Cette initiative majeure vise à offrir des solutions agentiques souveraines et sécurisées pour l'ensemble des entités du groupe. PÉRIMÈTRE D'INTERVENTION Le périmètre s'étend de la conception du service à son maintien en condition opérationnelle en production. Le candidat évoluera dans un environnement technique complexe, distribué, sécurisé et hautement disponible, au sein d'une équipe dédiée aux produits et services d'intelligence artificielle. MISSIONS PRINCIPALES • Industrialiser et automatiser le déploiement de plateforme dans un environnement on premise sécurisés • Contribuer à l'évolution de l'architectures de la plateforme • Participer à la mise en place de services managés en intégrant les contraintes de sécurité, compliance et gouvernance • Documenter les offres et services et assurer leur mise en production • Réaliser des présentations et démos pour promouvoir les offres et services • Maintenir en conditions opérationnelles et de sécurité les plateformes IA déployées (run) • Collaborer au sein d'une dev team selon les méthodes agiles • Participer aux daily meetings animés par la Product Owner • Contribuer aux réunions de co-construction de la roadmap • Prendre en charge les éléments de la backlog formalisée par la Product Owner • Participer à l'ensemble des rituels de la squad, de la plateforme et du pôle • Participer aux astreintes techniques du pôle
Le contexte Nous recherchons un Tech Lead OpenStack sur Marseille. OpenStack est le socle cible du groupe pour l'ensemble de ses infrastructures. La plateforme porte déjà les deux tiers de ses machines virtuelles, sur plus de vingt clusters répartis en plusieurs générations, avec une trajectoire claire de consolidation sur la génération la plus récente. L'équipe OpenStack est jeune et en croissance. Le client recherche un profil expérimenté, capable de porter la plateforme, de la faire évoluer et d'élever le niveau technique de l'équipe. Vos missions Porter et faire évoluer la plateforme : Être le référent technique de la plateforme OpenStack Faire évoluer l'architecture de la génération cible Préparer et conduire les montées de version Accompagner la migration des applications et le décommissionnement des anciennes générations Garantir le run : Prendre en charge les incidents complexes et l'analyse des causes racines Piloter le capacity planning et l'ajout de nouveaux hyperviseurs Assurer le patch management et le maintien en conditions opérationnelles Faire grandir l'équipe : Accompagner la montée en compétence des membres de l'équipe Définir les standards, les bonnes pratiques et la documentation Travailler avec le Product Owner et les équipes voisines
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations. Profil recherché Vous êtes certifié Kubernetes, justifiez d'une expérience professionnelle minimum de 8 ans dans un poste similaire, et maîtrisez les environnements suivants : Infrastructure : Linux Ubuntu, Kubernetes, Docker, GPU NVIDIA (drivers, CUDA, MIG), Ansible, gestion des environnements distribués. Observabilité : Prometheus, Grafana Stockage : systèmes de fichiers distribués, stockage haute performance et stockage objet Réseau : comprendre l'architecture réseau d'un cluster (VLAN, Load balancing...) Méthodes : ITIL/ITSM, gestion des incidents et des changements, documentation d'exploitation.
Le contexte Nous recherchons un expert OpenStack pour intervenir chez un grand compte du secteur des jeux d'argent, sur son site de Vitrolles. Le client exploite des plateformes OpenStack qui permettent le déploiement des infrastructures virtuelles à destination de l'ensemble de ses projets informatiques. Votre mission Vous apportez votre expertise OpenStack sur deux volets : Build — delivery projets, accompagnement des équipes, support aux utilisateurs de la plateforme. Run — gestion des incidents, problèmes et changements, capacity planning, patch management. Vos livrables Complétion quotidienne des tickets Run et Build PV de réception des actions opérées sur les plateformes, rattachés aux changements Documentation des évolutions techniques à chaque nouvelle release Référencement technique des sources et documentations dans le référentiel d'équipe Environnement technique Expert : OpenStack, Unix/Linux, Ubuntu Confirmé : Terraform, Ansible, Shell, scripting, RedHat, GitLab, ITIL, virtualisation et cloud computing Avancé : Prometheus, Grafana, ServiceNow Notions : Kubernetes
Afin d'intervenir sur des sujets d'évolution et de maintenance des plateformes d'observabilité au sein d'un éco-système technique on-premise, nous cherchons un Ingénieur Devops qui aura pour mission : Automatiser, industrialiser et renforcer les process de construction et de déploiement existants Réaliser des études / POC sur des sujets à venir Maintenir et faire évoluer les plateformes existantes Accompagner les utilisateurs aux différents changements effectués sur les plateformes Participer aux différents rituels de l'équipe (échanges techniques, refinement, daily, ...)
En tant que référent technique DevOps pour l'ensemble du groupe, vous serez le gardien de notre excellence technique et le moteur de notre innovation. Votre mission est d'harmoniser nos pratiques et de guider nos choix technologiques. Sans être manager, votre leadership par l'influence sera la clé pour fédérer notre communauté technique, casser les silos et garantir l'efficacité de nos systèmes à long terme. Vos Responsabilités Concrètes Construire et piloter la vision technique DevOps : Vous définirez et maintiendrez la roadmap de nos outils clés (CI/CD, conteneurisation, observabilité, IaC) et identifierez les innovations qui feront la différence pour nous demain. Fédérer et faire grandir notre communauté technique : Vous animerez notre guilde DevOps à travers des ateliers, des démos et des sessions de partage pour diffuser les bonnes pratiques et renforcer la collaboration entre les équipes. Agir en tant qu'expert et mentor : Vous conseillez les équipes sur les choix d'architecture complexes et les accompagnerez dans la résolution de leurs problèmes techniques les plus ardus. Garantir la qualité et la sécurité de notre delivery : Vous mettrez en place des indicateurs de performance (métriques DORA) et intégrerez les meilleures pratiques de sécurité (DevSecOps) au cœur de nos pipelines, en collaboration étroite avec le RSSI. Piloter la Fiabilité et la Performance de nos Services en Production: Votre mission ultime est de garantir que nos services sont non seulement fonctionnels, mais aussi rapides, résilients et efficients pour nos utilisateurs. Profil recherché Le Profil que nous recherchons Titulaire d'un diplôme Bac+5 en école d'ingénieur, université ou équivalent, avec une spécialisation en informatique, systèmes distribués, cloud computing ou DevOps. Une certification Cloud (Azure, AWS, GCP) ou DevOps est un plus apprécié.
Dans le cadre du renforcement d'une équipe en charge d'environnements Cloud critiques, nous recherchons un Expert AWS Production pour accompagner l'exploitation, la sécurisation et l'évolution des infrastructures hébergées sur AWS. Tu interviens sur des environnements à forts enjeux de disponibilité et de performance, avec une forte dimension RUN, automatisation, observabilité et résilience. Tes missions principales : Assurer le maintien en conditions opérationnelles des environnements AWS Superviser la disponibilité, les performances et la capacité des infrastructures Cloud Analyser et résoudre les incidents de production complexes Réaliser les analyses de causes racines et piloter les actions correctives associées Mettre en place et améliorer les dispositifs de monitoring, alerting et observabilité Sécuriser et fiabiliser les architectures AWS existantes Accompagner les mises en production et les déploiements Automatiser les tâches d'exploitation et d'administration récurrentes Industrialiser les environnements via l'Infrastructure as Code Optimiser les performances et les coûts des ressources Cloud Participer à l'amélioration des procédures et standards d'exploitation Apporter une expertise technique aux équipes Infrastructure, DevOps, Sécurité et Développement Contribuer aux problématiques de PRA/PCA, haute disponibilité et résilience
Dans le cadre du renforcement d'une équipe d'exploitation, nous recherchons un Ingénieur d'exploitation / SRE – SYSOPS chargé d'assurer la fiabilité, la performance et la disponibilité des applications et infrastructures en production. Vous intervenez notamment sur : Le maintien en conditions opérationnelles (MCO) des systèmes, applications et flux. La surveillance et l'observabilité des environnements afin d'anticiper et résoudre les incidents. La gestion des environnements de recette, préproduction et production. L'analyse des incidents, la recherche des causes racines et la mise en œuvre d'actions correctives. L'automatisation des opérations et des déploiements via CI/CD, GitOps et Infrastructure as Code. L'administration et la supervision d'environnements Kubernetes / Rancher. L'optimisation des performances, de la résilience et de la haute disponibilité. La gestion et la supervision d'infrastructures Cloud. La mise en place et le maintien de la documentation et des procédures d'exploitation. La collaboration avec les équipes développement, infrastructure et production dans une démarche SRE / DevOps.
Dans le cadre du développement d'une plateforme IA hautement sécurisée destinée aux environnements critiques, nous recherchons un Ingénieur DevSecOps / MLOps expérimenté pour industrialiser, sécuriser et maintenir les chaînes CI/CD et les environnements de déploiement IA. Vos missions : - Concevoir et industrialiser des patterns CI/CD réutilisables pour des environnements sécurisés. - Accompagner les équipes Data / IA dans le déploiement et l'exploitation de leurs modèles. - Déployer et maintenir les composants DevSecOps : sécurité du code, images, dépendances, secrets et supply chain. - Intégrer les solutions dans des infrastructures On-Prem sécurisées. - Mettre en place l'observabilité, la supervision et la traçabilité de bout en bout. - Participer aux problématiques MLOps, sécurité, conformité et gouvernance. Environnement technique : Docker, Kubernetes, Helm, Kustomize, GitLab CI, GitOps, ArgoCD, Harbor, Nexus, Vault, SAST/DAST/SCA, SBOM, PKI, mTLS, RBAC, Network Policies, Zero Trust, Prometheus, Grafana, ELK, OpenTelemetry. Connaissances appréciées : MLflow, MLOps, GPU NVIDIA, modèles IA/LLM, sécurité Kubernetes et environnements air-gapped / souverains.