Exécutée au sein de l'équipe en charge de l'intégration, de la mise en production et de l'exploitation des socles de virtualisation pour la 5GC, la Prestation comporte principalement des activités de BUILD : Pilotage de projets sur les outils d'exploitation et de déploiement/configuration pour les nouvelles architectures Caas sur Bare Metal (Clusters Kubernetes adaptés 5GC) selon les besoins des équipes Run. Proposition de réalisation des outils d'exploitation et de déploiement pour gérer au mieux les infrastructures hébergeant des containers (Fault management, Performances management et Configuration management) Réalisation directe ou pilotage des développements dans les services outils, par les fournisseurs de socle ou autres Partenaires retenus, Être partie prenante de la démarche devops avec les développeurs et les testeurs Construire le plan de déploiement de la phase d'études à la mise en production, assurer la communication et veiller à toujours être synchronisé avec le projet global pour tenir les objectifs couts et délais. Veiller au respect des standards de sécurité Réalisation ou pilotage des tests de recette et participation aux suivis de VSR en production Rédaction des modes opératoires d'exploitation et des guides d'utilisation des outils. Sélection et mise en forme des données de monitoring et de configuration des socles pour les exploitants et déployeurs. Présentation/formation techniques sur les projets à destination des équipes de RUN Fourniture du bilan projet, modélisant les étapes de déploiement, les capitalisations et toute la documentation projet. Garantir l'intégrité permanente des services et des produits au fil des itérations et incréments. Compétences : Kubernetes, orchestrateur de containers, RedHat, Ansible , Prométheus,, Kibana, Python, Infra systèmes, 5ans exp +, diplômé(e) d'un BAC+4/5 en Ingénierie Informatique Animation de réunions et rédaction de CR de réunions, aisance écrit et oral en français et anglais, rigueur, autonomie et travail en équipe, capacité à synthétiser et vulgariser à l'écrit et à l'oral des sujets techniques complexes. Savoir lire et comprendre du code est un plus (Python et shell, pratiquer Infrastructure as code : GIT, Terraform, AWS Cloud Formation, YAML K8S, Ansible…)
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations. Profil recherché Vous êtes certifié Kubernetes, justifiez d'une expérience professionnelle minimum de 8 ans dans un poste similaire, et maîtrisez les environnements suivants : Infrastructure : Linux Ubuntu, Kubernetes, Docker, GPU NVIDIA (drivers, CUDA, MIG), Ansible, gestion des environnements distribués. Observabilité : Prometheus, Grafana Stockage : systèmes de fichiers distribués, stockage haute performance et stockage objet Réseau : comprendre l'architecture réseau d'un cluster (VLAN, Load balancing...) Méthodes : ITIL/ITSM, gestion des incidents et des changements, documentation d'exploitation.
Le contexte Nous recherchons un Tech Lead OpenStack sur Marseille. OpenStack est le socle cible du groupe pour l'ensemble de ses infrastructures. La plateforme porte déjà les deux tiers de ses machines virtuelles, sur plus de vingt clusters répartis en plusieurs générations, avec une trajectoire claire de consolidation sur la génération la plus récente. L'équipe OpenStack est jeune et en croissance. Le client recherche un profil expérimenté, capable de porter la plateforme, de la faire évoluer et d'élever le niveau technique de l'équipe. Vos missions Porter et faire évoluer la plateforme : Être le référent technique de la plateforme OpenStack Faire évoluer l'architecture de la génération cible Préparer et conduire les montées de version Accompagner la migration des applications et le décommissionnement des anciennes générations Garantir le run : Prendre en charge les incidents complexes et l'analyse des causes racines Piloter le capacity planning et l'ajout de nouveaux hyperviseurs Assurer le patch management et le maintien en conditions opérationnelles Faire grandir l'équipe : Accompagner la montée en compétence des membres de l'équipe Définir les standards, les bonnes pratiques et la documentation Travailler avec le Product Owner et les équipes voisines
Le contexte Nous recherchons un expert OpenStack pour intervenir chez un grand compte du secteur des jeux d'argent, sur son site de Vitrolles. Le client exploite des plateformes OpenStack qui permettent le déploiement des infrastructures virtuelles à destination de l'ensemble de ses projets informatiques. Votre mission Vous apportez votre expertise OpenStack sur deux volets : Build — delivery projets, accompagnement des équipes, support aux utilisateurs de la plateforme. Run — gestion des incidents, problèmes et changements, capacity planning, patch management. Vos livrables Complétion quotidienne des tickets Run et Build PV de réception des actions opérées sur les plateformes, rattachés aux changements Documentation des évolutions techniques à chaque nouvelle release Référencement technique des sources et documentations dans le référentiel d'équipe Environnement technique Expert : OpenStack, Unix/Linux, Ubuntu Confirmé : Terraform, Ansible, Shell, scripting, RedHat, GitLab, ITIL, virtualisation et cloud computing Avancé : Prometheus, Grafana, ServiceNow Notions : Kubernetes
CONTEXTE ET ENVIRONNEMENT Le pôle conçoit et opère des plateformes « as a service » facilitant la mise en place d'architectures modernes, distribuées et hautement résilientes pour l'ensemble des entités du groupe. Le poste s'inscrit au sein de l'équipe GenAI du domaine d'expertise Data & IA, avec pour mission le déploiement, l'industrialisation et l'exploitation de la plateforme GPUaaS et LLMaaS On-Premise. Cette initiative majeure vise à offrir des solutions agentiques souveraines et sécurisées pour l'ensemble des entités du groupe. PÉRIMÈTRE D'INTERVENTION Le périmètre s'étend de la conception du service à son maintien en condition opérationnelle en production. Le candidat évoluera dans un environnement technique complexe, distribué, sécurisé et hautement disponible, au sein d'une équipe dédiée aux produits et services d'intelligence artificielle. MISSIONS PRINCIPALES • Industrialiser et automatiser le déploiement de plateforme dans un environnement on premise sécurisés • Contribuer à l'évolution de l'architectures de la plateforme • Participer à la mise en place de services managés en intégrant les contraintes de sécurité, compliance et gouvernance • Documenter les offres et services et assurer leur mise en production • Réaliser des présentations et démos pour promouvoir les offres et services • Maintenir en conditions opérationnelles et de sécurité les plateformes IA déployées (run) • Collaborer au sein d'une dev team selon les méthodes agiles • Participer aux daily meetings animés par la Product Owner • Contribuer aux réunions de co-construction de la roadmap • Prendre en charge les éléments de la backlog formalisée par la Product Owner • Participer à l'ensemble des rituels de la squad, de la plateforme et du pôle • Participer aux astreintes techniques du pôle
Afin d'intervenir sur des sujets d'évolution et de maintenance des plateformes d'observabilité au sein d'un éco-système technique on-premise, nous cherchons un Ingénieur Devops qui aura pour mission : Automatiser, industrialiser et renforcer les process de construction et de déploiement existants Réaliser des études / POC sur des sujets à venir Maintenir et faire évoluer les plateformes existantes Accompagner les utilisateurs aux différents changements effectués sur les plateformes Participer aux différents rituels de l'équipe (échanges techniques, refinement, daily, ...)
En tant que référent technique DevOps pour l'ensemble du groupe, vous serez le gardien de notre excellence technique et le moteur de notre innovation. Votre mission est d'harmoniser nos pratiques et de guider nos choix technologiques. Sans être manager, votre leadership par l'influence sera la clé pour fédérer notre communauté technique, casser les silos et garantir l'efficacité de nos systèmes à long terme. Vos Responsabilités Concrètes Construire et piloter la vision technique DevOps : Vous définirez et maintiendrez la roadmap de nos outils clés (CI/CD, conteneurisation, observabilité, IaC) et identifierez les innovations qui feront la différence pour nous demain. Fédérer et faire grandir notre communauté technique : Vous animerez notre guilde DevOps à travers des ateliers, des démos et des sessions de partage pour diffuser les bonnes pratiques et renforcer la collaboration entre les équipes. Agir en tant qu'expert et mentor : Vous conseillez les équipes sur les choix d'architecture complexes et les accompagnerez dans la résolution de leurs problèmes techniques les plus ardus. Garantir la qualité et la sécurité de notre delivery : Vous mettrez en place des indicateurs de performance (métriques DORA) et intégrerez les meilleures pratiques de sécurité (DevSecOps) au cœur de nos pipelines, en collaboration étroite avec le RSSI. Piloter la Fiabilité et la Performance de nos Services en Production: Votre mission ultime est de garantir que nos services sont non seulement fonctionnels, mais aussi rapides, résilients et efficients pour nos utilisateurs. Profil recherché Le Profil que nous recherchons Titulaire d'un diplôme Bac+5 en école d'ingénieur, université ou équivalent, avec une spécialisation en informatique, systèmes distribués, cloud computing ou DevOps. Une certification Cloud (Azure, AWS, GCP) ou DevOps est un plus apprécié.
Dans le cadre du renforcement d'une équipe en charge d'environnements Cloud critiques, nous recherchons un Expert AWS Production pour accompagner l'exploitation, la sécurisation et l'évolution des infrastructures hébergées sur AWS. Tu interviens sur des environnements à forts enjeux de disponibilité et de performance, avec une forte dimension RUN, automatisation, observabilité et résilience. Tes missions principales : Assurer le maintien en conditions opérationnelles des environnements AWS Superviser la disponibilité, les performances et la capacité des infrastructures Cloud Analyser et résoudre les incidents de production complexes Réaliser les analyses de causes racines et piloter les actions correctives associées Mettre en place et améliorer les dispositifs de monitoring, alerting et observabilité Sécuriser et fiabiliser les architectures AWS existantes Accompagner les mises en production et les déploiements Automatiser les tâches d'exploitation et d'administration récurrentes Industrialiser les environnements via l'Infrastructure as Code Optimiser les performances et les coûts des ressources Cloud Participer à l'amélioration des procédures et standards d'exploitation Apporter une expertise technique aux équipes Infrastructure, DevOps, Sécurité et Développement Contribuer aux problématiques de PRA/PCA, haute disponibilité et résilience
Vos missions **Exploitation & Administration OpenShift AI** - Administration et maintien en conditions opérationnelles des plateformes OpenShift AI - Traitement des incidents et demandes de support - Supervision de l'environnement Kubernetes/OpenShift - Patching et montées de version - Gestion des workloads, namespaces, quotas et déploiements - Gestion des certificats, accès et configurations de la plateforme **Infrastructure & Plateforme** - Administration des clusters OpenShift sur infrastructures VMware et BareMetal - Gestion des ressources GPU - Administration du stockage et de la persistance des données - Gestion des composants réseau OpenShift (Ingress, Network Policies, exposition des services) **OpenShift AI & MLOps** - Administration des Data Science Projects et Workbenches - Gestion des services de Model Serving (ModelMesh) - Déploiement et exploitation de pipelines ML - Optimisation des ressources GPU pour les usages IA - Accompagnement des équipes Data Science et IA **Automatisation & Industrialisation** - Mise en œuvre des pratiques GitOps et CI/CD - Déploiement d'applications via Helm - Administration d'ArgoCD et des pipelines Tekton - Automatisation des opérations récurrentes - Participation aux projets de transformation de la plateforme **Formation & Accompagnement** - Formation des équipes en charge du RUN - Montée en compétence du Service Owner - Documentation des procédures et bonnes pratiques - Transfert de connaissances vers les équipes d'exploitation
Informations clés Localisation : Montpellier ou Guyancourt (78) — 2 jours de télétravail par semaine TJM max : 550 € Démarrage : ASAP Durée : Mission longue durée (projection jusqu'en 08/2029) Contexte de la mission Au sein du pôle Data & IA, vous intégrez l'équipe Big Data en charge de la conception et de l'exploitation de plateformes « as a service ». L'objectif est de déployer des architectures modernes, distribuées et hautement résilientes. En tant qu'Ingénieur Big Data Senior, vous participerez à la conception, l'implémentation et l'administration d'une infrastructure Cloud Hybride. Une solide expertise sur Google Cloud Platform (GCP) ainsi que sur les infrastructures On-Premise est requise. Le périmètre couvre l'ensemble du cycle de vie des services, de leur conception jusqu'à leur maintien en condition opérationnelle (MCO). Missions principales Infrastructures & Plateformes : Participer à la mise en œuvre, l'administration et l'optimisation continue de la plateforme Big Data et Data Engineering. Infrastructure as Code (IaC) : Développer et maintenir les scripts d'infrastructures avec Terraform et Terragrunt. CI/CD & GitOps : Automatiser et maintenir les pipelines de déploiement continu sous GitLab CI/CD, en appliquant les meilleures pratiques Cloud, DevOps et GitOps. MCO & Observabilité : Assurer le maintien en condition opérationnelle des plateformes, puis déployer et maintenir les outils de monitoring et d'alerting. Collaboration & Documentation : Travailler en synergie avec les équipes applicatives, infra et DevOps, et rédiger la documentation technique et d'exploitation.
CONTEXTE Client final : grand groupe média & audiovisuel français. Au sein de la Direction IT Transverse, l'équipe Services & Automatisation met en place les plateformes de services du groupe. Nous recherchons un Ingénieur Data expérimenté (5 ans et plus) pour construire un MVP de plateforme Data On-Premise reposant sur des briques Open Source : Kafka, NiFi, Spark, Iceberg, Trino. Le MVP s'intègre au socle existant (Kubernetes, GitLab CI, Prometheus/OpenTelemetry) ; projet mené avec l'équipe Data & IA. OBJECTIFS DE LA PLATEFORME - Gérer la transformation de données On-Premise et alimenter un datalake On-Premise - Servir de plateforme d'ingestion pour la plateforme Big Data hébergée sur GCP - Passer les traitements du mode batch au temps réel (streaming) - Démontrer la faisabilité de la migration des flux ETL portés par un outil propriétaire (type OpenText/Genio) : quelques flux dans le MVP, migration complète hors scope MISSIONS 1. Conception et développement du MVP - Architecturer une plateforme On-Premise scalable et robuste, intégrée au socle existant - Choisir, configurer et déployer les briques Open Source : Kafka (streaming), NiFi (ingestion et orchestration de flux), Spark (traitement distribué), Iceberg (tables analytiques), Trino (requêtage SQL distribué) - Intégrer la plateforme avec Kubernetes, GitLab CI (pipelines de déploiement et tests) et Prometheus/OpenTelemetry (monitoring et observabilité) 2. Validation technique et faisabilité - Transformer quelques flux ETL existants pour démontrer la valeur ajoutée - Mettre en place des pipelines streaming (Kafka + Spark Structured Streaming) - Alimenter le datalake On-Premise (Iceberg + Trino) - Valider l'interopérabilité avec la plateforme Big Data GCP 3. Collaboration et transmission - Travailler avec l'équipe Data & IA (besoins métiers/techniques) et les équipes DevOps/Infrastructure (intégration au socle) - Documenter les choix techniques, architectures et bonnes pratiques - Former et accompagner les équipes internes sur les nouveaux outils
- Contexte : Au cœur de l'engagement envers le service de l'eau, le groupe s'efforce de faire de l'eau un bien essentiel de qualité, accessible à tous, grâce à son dévouement en matière d'innovation, de flexibilité technique et organisationnelle. Forte de 12 000 collaborateurs répartis en France, en Arabie Saoudite, en Écosse, en Espagne et en Pologne, le groupe accompagne plus de 7 000 collectivités locales et industriels, apportant ses services à plus de 12 millions de consommateurs dans le monde. Au sein de la Direction des Systèmes d'Information et dans le cadre de sa transformation digitale, le Groupe recherche un Lead Monitoring Performance (H/F) pour renforcer les capacités de monitoring et évoluer vers une supervision réellement proactive et créatrice de valeur pour les métiers. - Expérience requise : De formation Ingénieur ou équivalent, vous justifiez d'au moins 5 ans d'expérience dans le monitoring, l'observabilité, l'Event Management et l'amélioration continue des services IT, idéalement dans des environnements critiques. Vous disposez d'une expérience confirmée dans l'analyse de performance de dispositifs de supervision, la construction d'indicateurs opérationnels, la réduction du bruit d'alerting, l'amélioration des processus Event / Incident / Problem Management et le pilotage d'équipes ou de partenaires offshore. Vous savez transformer des données techniques et opérationnelles en constats factuels, plans d'action priorisés et tableaux de bord permettant de démontrer la valeur créée par le monitoring.
Contexte de la prestation La prestation se déroulera au sein de la Direction des Technologies de France Télévisions / Media Factory / Ingénierie Supply chain et Diffusion, entité en charge des systèmes permettant l'alimentation en médias et la diffusion des chaînes Nationales, des chaînes du réseau Outre-Mer et des chaînes régionales. Ces systèmes sont principalement opérés par le CDE (Centre de Diffusion et d'Échanges) dont les services audiovisuels comprennent la diffusion de F2, F3, F4, F5, franceinfo et de chaînes thématiques, et le CDA actuellement en construction (Centre de Diffusion et d'Acquisition) pour les chaînes du réseau Outre-Mer et le réseau régional de F3. Prestation attendue Dans ce cadre, France Télévisions recherche une prestation d'expertise infra IT de supervision des systèmes broadcast de Supply chain et de diffusion consistant à mettre en place la supervision d'une infra broadcast de Supply chain et de diffusions dont les outils principaux sont Prometheus et Grafana.
Dans un contexte de production informatique, vous interviendrez sur le maintien en condition opérationnelle et la cybersécurité d'un parc de serveurs Linux, ainsi que sur les middlewares associés. Vos principales responsabilités : Assurer le MCO et la cybersécurité des environnements Linux Suivre l'état de l'art et traiter les incidents et demandes Participer à l'intégration de nouveaux outils et aux projets d'évolution du périmètre Intervenir rapidement en cas d'incident afin de réduire au maximum le délai de rétablissement du service Traiter les demandes de mise en service et contribuer à leur industrialisation Assurer le support aux utilisateurs et aux équipes techniques
Dans le cadre du renforcement d'une équipe d'exploitation, nous recherchons un Ingénieur d'exploitation / SRE – SYSOPS chargé d'assurer la fiabilité, la performance et la disponibilité des applications et infrastructures en production. Vous intervenez notamment sur : Le maintien en conditions opérationnelles (MCO) des systèmes, applications et flux. La surveillance et l'observabilité des environnements afin d'anticiper et résoudre les incidents. La gestion des environnements de recette, préproduction et production. L'analyse des incidents, la recherche des causes racines et la mise en œuvre d'actions correctives. L'automatisation des opérations et des déploiements via CI/CD, GitOps et Infrastructure as Code. L'administration et la supervision d'environnements Kubernetes / Rancher. L'optimisation des performances, de la résilience et de la haute disponibilité. La gestion et la supervision d'infrastructures Cloud. La mise en place et le maintien de la documentation et des procédures d'exploitation. La collaboration avec les équipes développement, infrastructure et production dans une démarche SRE / DevOps.
Contexte : Dans le cadre d'un projet à forts enjeux de disponibilité et de sécurité, nous recherchons un Senior DevOps / SRE disposant d'une solide expertise DBA pour intervenir sur une plateforme SaaS critique. Le consultant interviendra en collaboration avec les équipes Ops afin d'assurer le maintien en conditions opérationnelles, la fiabilité, la sécurité et la scalabilité de la plateforme et de ses différents composants. Missions : Administration et maintien en conditions opérationnelles de la plateforme ; Gestion des composants OpenSearch et ClickHouse ; Administration et maintien des différents services et dépendances : Kafka, RabbitMQ, etc. ; Accompagnement des équipes Ops sur les problématiques de disponibilité et de fiabilité ; Mise en place et maintien d'architectures hautement disponibles et sans Single Point of Failure (SPoF) ; Automatisation des déploiements et des opérations ; Gestion et optimisation des environnements Kubernetes ; Monitoring, supervision et amélioration de l'observabilité ; Analyse et résolution d'incidents complexes ; Scripting et automatisation en Bash / Python ; Participation à l'amélioration continue des pratiques DevOps / SRE.