EXPERT KUBERNETES / IA (H/F)Contexte de la missionNous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l'exploitation, la disponibilité, la performance et la stabilité d'un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage. Le profil recherché devra également contribuer à l'automatisation de l'exploitation, au traitement des incidents et à l'amélioration continue de l'infrastructure. Missions principales Maintien en condition opérationnelle – MCO Garantir la disponibilité, la performance et la stabilité du cluster IA. Administrer les nœuds GPU/CPU, les infrastructures de stockage et les composants réseau. Assurer le suivi et l'optimisation des ressources de l'infrastructure. Piloter les opérations de maintenance et les mises à jour techniques. Administration Linux Installer, configurer et administrer les environnements Linux Ubuntu. Réaliser les opérations d'optimisation et de troubleshooting. Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés. Kubernetes Administrer et exploiter les environnements Kubernetes. Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA). Assurer le maintien en conditions opérationnelles des clusters. Piloter les mises à jour des composants Kubernetes. Gérer les problématiques liées aux ressources et à la capacité des clusters. Supervision et observabilité Mettre en place et maintenir la supervision des infrastructures. Exploiter Prometheus et Grafana pour le monitoring et l'analyse des performances. Identifier les anomalies et anticiper les incidents grâce à une approche proactive. Automatisation Automatiser les tâches d'administration et d'exploitation avec Ansible. Développer et maintenir des scripts Bash et Python. Optimiser les processus opérationnels afin de réduire les tâches manuelles. Gestion des jobs IA / GPU Assurer l'ordonnancement des tâches et jobs GPU. Gérer les quotas, priorités et ressources GPU. Optimiser l'allocation des ressources CPU/GPU. Gestion des incidents Prendre en charge les incidents techniques complexes. Réaliser les analyses de causes racines et les post-mortems. Définir et suivre les plans d'actions correctifs. Coordonner les interventions avec les différentes équipes techniques. Documentation Rédiger et maintenir la documentation d'exploitation. Formaliser les procédures techniques et les consignes de maintenance. Garantir la traçabilité et la continuité des opérations.
Notre client, un acteur majeur des infrastructures et services essentiels en France, recherche un Expert Observabilité & Monitoring pour renforcer son équipe d'ingénierie en charge des plateformes de supervision, de monitoring et d'exploitation. Vous intégrerez une équipe experte intervenant sur des environnements critiques où la disponibilité, la performance et la fiabilité des outils d'observabilité sont au cœur des enjeux opérationnels. Cette mission offre l'opportunité de travailler sur des architectures modernes mêlant Prometheus, Grafana, Alertmanager, Centreon, Kubernetes et AWS, au sein d'un contexte technique riche et en constante évolution. Au sein du pôle Outillage de la DSI, vous serez le référent technique sur les solutions de monitoring et d'observabilité. Vos responsabilités principales Assurer le maintien en conditions opérationnelles des plateformes de supervision. Garantir la disponibilité, la performance et l'évolution des solutions d'observabilité. Assurer le support de niveau 3 sur les outils du périmètre. Prendre en charge les demandes d'intégration et de déploiement de bout en bout. Accompagner les équipes métiers et techniques dans l'expression de leurs besoins. Définir et mettre en œuvre les évolutions techniques des plateformes. Participer aux études de cadrage, d'architecture et aux choix de solutions. Réaliser des Proof of Concept (POC) et des études d'opportunité. Gérer les problématiques d'obsolescence et les montées de version. Construire et suivre des indicateurs de performance via des dashboards. Produire, maintenir et enrichir la documentation technique. Assurer le transfert de compétences auprès des équipes internes.
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations. Profil recherché Vous êtes certifié Kubernetes, justifiez d'une expérience professionnelle minimum de 8 ans dans un poste similaire, et maîtrisez les environnements suivants : Infrastructure : Linux Ubuntu, Kubernetes, Docker, GPU NVIDIA (drivers, CUDA, MIG), Ansible, gestion des environnements distribués. Observabilité : Prometheus, Grafana Stockage : systèmes de fichiers distribués, stockage haute performance et stockage objet Réseau : comprendre l'architecture réseau d'un cluster (VLAN, Load balancing...) Méthodes : ITIL/ITSM, gestion des incidents et des changements, documentation d'exploitation.
CONTEXTE Client final : grand groupe média & audiovisuel français. Au sein de la Direction IT Transverse, l'équipe Services & Automatisation met en place les plateformes de services du groupe. Nous recherchons un Ingénieur Data expérimenté (5 ans et plus) pour construire un MVP de plateforme Data On-Premise reposant sur des briques Open Source : Kafka, NiFi, Spark, Iceberg, Trino. Le MVP s'intègre au socle existant (Kubernetes, GitLab CI, Prometheus/OpenTelemetry) ; projet mené avec l'équipe Data & IA. OBJECTIFS DE LA PLATEFORME - Gérer la transformation de données On-Premise et alimenter un datalake On-Premise - Servir de plateforme d'ingestion pour la plateforme Big Data hébergée sur GCP - Passer les traitements du mode batch au temps réel (streaming) - Démontrer la faisabilité de la migration des flux ETL portés par un outil propriétaire (type OpenText/Genio) : quelques flux dans le MVP, migration complète hors scope MISSIONS 1. Conception et développement du MVP - Architecturer une plateforme On-Premise scalable et robuste, intégrée au socle existant - Choisir, configurer et déployer les briques Open Source : Kafka (streaming), NiFi (ingestion et orchestration de flux), Spark (traitement distribué), Iceberg (tables analytiques), Trino (requêtage SQL distribué) - Intégrer la plateforme avec Kubernetes, GitLab CI (pipelines de déploiement et tests) et Prometheus/OpenTelemetry (monitoring et observabilité) 2. Validation technique et faisabilité - Transformer quelques flux ETL existants pour démontrer la valeur ajoutée - Mettre en place des pipelines streaming (Kafka + Spark Structured Streaming) - Alimenter le datalake On-Premise (Iceberg + Trino) - Valider l'interopérabilité avec la plateforme Big Data GCP 3. Collaboration et transmission - Travailler avec l'équipe Data & IA (besoins métiers/techniques) et les équipes DevOps/Infrastructure (intégration au socle) - Documenter les choix techniques, architectures et bonnes pratiques - Former et accompagner les équipes internes sur les nouveaux outils
- Contexte : Au cœur de l'engagement envers le service de l'eau, le groupe s'efforce de faire de l'eau un bien essentiel de qualité, accessible à tous, grâce à son dévouement en matière d'innovation, de flexibilité technique et organisationnelle. Forte de 12 000 collaborateurs répartis en France, en Arabie Saoudite, en Écosse, en Espagne et en Pologne, le groupe accompagne plus de 7 000 collectivités locales et industriels, apportant ses services à plus de 12 millions de consommateurs dans le monde. Au sein de la Direction des Systèmes d'Information et dans le cadre de sa transformation digitale, le Groupe recherche un Lead Monitoring Performance (H/F) pour renforcer les capacités de monitoring et évoluer vers une supervision réellement proactive et créatrice de valeur pour les métiers. - Expérience requise : De formation Ingénieur ou équivalent, vous justifiez d'au moins 5 ans d'expérience dans le monitoring, l'observabilité, l'Event Management et l'amélioration continue des services IT, idéalement dans des environnements critiques. Vous disposez d'une expérience confirmée dans l'analyse de performance de dispositifs de supervision, la construction d'indicateurs opérationnels, la réduction du bruit d'alerting, l'amélioration des processus Event / Incident / Problem Management et le pilotage d'équipes ou de partenaires offshore. Vous savez transformer des données techniques et opérationnelles en constats factuels, plans d'action priorisés et tableaux de bord permettant de démontrer la valeur créée par le monitoring.
Contexte de la prestation La prestation se déroulera au sein de la Direction des Technologies de France Télévisions / Media Factory / Ingénierie Supply chain et Diffusion, entité en charge des systèmes permettant l'alimentation en médias et la diffusion des chaînes Nationales, des chaînes du réseau Outre-Mer et des chaînes régionales. Ces systèmes sont principalement opérés par le CDE (Centre de Diffusion et d'Échanges) dont les services audiovisuels comprennent la diffusion de F2, F3, F4, F5, franceinfo et de chaînes thématiques, et le CDA actuellement en construction (Centre de Diffusion et d'Acquisition) pour les chaînes du réseau Outre-Mer et le réseau régional de F3. Prestation attendue Dans ce cadre, France Télévisions recherche une prestation d'expertise infra IT de supervision des systèmes broadcast de Supply chain et de diffusion consistant à mettre en place la supervision d'une infra broadcast de Supply chain et de diffusions dont les outils principaux sont Prometheus et Grafana.
- Contexte : Au cœur de l'engagement envers le service de l'eau, le groupe s'efforce de faire de l'eau un bien essentiel de qualité, accessible à tous, grâce à son dévouement en matière d'innovation, de flexibilité technique et organisationnelle. Forte de 12 000 collaborateurs répartis en France, en Arabie Saoudite, en Écosse, en Espagne et en Pologne, le groupe accompagne plus de 7 000 collectivités locales et industriels, apportant ses services à plus de 12 millions de consommateurs dans le monde. Au sein de la Direction des Systèmes d'Information et dans le cadre de sa transformation digitale, le Groupe recherche un Lead Monitoring Performance (H/F) pour renforcer les capacités de monitoring et évoluer vers une supervision réellement proactive et créatrice de valeur pour les métiers. - Expérience requise : De formation Ingénieur ou équivalent, vous justifiez d'au moins 5 ans d'expérience dans le monitoring, l'observabilité, l'Event Management et l'amélioration continue des services IT, idéalement dans des environnements critiques. Vous disposez d'une expérience confirmée dans l'analyse de performance de dispositifs de supervision, la construction d'indicateurs opérationnels, la réduction du bruit d'alerting, l'amélioration des processus Event / Incident / Problem Management et le pilotage d'équipes ou de partenaires offshore. Vous savez transformer des données techniques et opérationnelles en constats factuels, plans d'action priorisés et tableaux de bord permettant de démontrer la valeur créée par le monitoring.
Rattaché à l'équipe Data, vous êtes garant du bon fonctionnement, de la fiabilité et de la performance de l'écosystème Big Data de l'entreprise. Vous intervenez sur une plateforme Hadoop hybride, articulée avec des services Cloud GCP et des environnements Kubernetes-as-a-Service. Exploitation et maintien en conditions opérationnelles Vous assurez le MCO de l'écosystème Hadoop et garantissez la disponibilité, la performance et la sécurité des clusters. Vous supervisez l'état de santé des composants (HDFS, Yarn, Hive, Spark, Oozie) et contribuez à la fiabilisation du socle technique en réduisant progressivement les points de fragilité identifiés. Gestion des incidents et support N2/N3 Vous prenez en charge les incidents, menez les analyses techniques, identifiez les causes racines (RCA) et proposez les plans d'actions correctifs. Vous assurez le suivi jusqu'à résolution complète et maintenez la documentation technique associée. Amélioration continue et automatisation Vous contribuez aux chantiers d'amélioration de la plateforme (performance, architecture, déploiements) et développez ou optimisez les scripts d'automatisation en Python, Shell ou Ansible. Vous participez aux évolutions de l'écosystème et aux projets de transformation Big Data. Environnement Cloud GCP Vous participez à l'exploitation et à l'évolution des services GCP liés au Big Data (BigQuery, Dataproc, Cloud Storage), contribuez aux migrations et interconnexions entre Hadoop et GCP, et assurez le monitoring, la gouvernance ainsi que l'optimisation des coûts Cloud. Plateformes KaaS Vous administrez et exploitez les environnements Kubernetes-as-a-Service (GKE, Anthos ou équivalent interne), déployez et maintenez les services Data et applicatifs associés, surveillez les clusters et gérez ressources, namespaces et montée en charge. Vous contribuez à la sécurisation et à la standardisation des déploiements.
🌟 Quel sera ton poste ? 🌟 💼 Poste : OPS Réseau & Automatisation H/F 📍 Lieu : Niort (79) 🏠 Télétravail : 2 jours par semaine 📝 Contrat : Portage ou CDI 💰Rémunération : 48k-50k 👉 Contexte client : Tu rejoins un acteur majeur du secteur de l'assurance, engagé dans la modernisation, l'industrialisation et l'automatisation de ses infrastructures réseau. Dans un contexte de transformation continue du système d'information, les équipes renforcent leur expertise OPS afin d'améliorer la qualité de service, réduire les opérations manuelles et accroître la fiabilité des infrastructures critiques. Cette mission s'inscrit au sein d'une squad réseau en charge de développer et déployer les automatismes permettant d'accélérer, fiabiliser et standardiser les opérations d'exploitation. Tu auras pour missions de : Concevoir, développer et maintenir les automatisations liées à l'exploitation des infrastructures réseau. Participer à la définition des standards d'automatisation et d'exploitation du domaine réseau. Industrialiser les opérations d'administration et de configuration des équipements réseau. Développer des scripts et composants d'automatisation en Python, Ansible et via API REST. Mettre en œuvre des mécanismes de contrôle de conformité des configurations réseau. Participer à l'intégration des équipements réseau dans les chaînes CI/CD. Déployer et maintenir les solutions d'observabilité, de supervision et de métrologie des services réseau. Définir et suivre les indicateurs de qualité de service et de performance. Participer aux analyses d'incidents, aux exercices de Capacity Planning et aux démarches d'amélioration continue. Accompagner les équipes dans l'adoption des pratiques DevOps, SRE et d'automatisation des infrastructures. Maintenir à jour la documentation technique, les procédures d'exploitation et les standards réseau. 🧰 Stack technique : Automatisation & IaC : Python, Ansible, API REST, Terraform, OpenTofu. Réseau : Cisco, Fortinet, F5, automatisation des équipements réseau, Git, GitOps, gestion des configurations. Observabilité : Grafana, Prometheus, Alertmanager, Dynatrace, Kibana. Cloud & Plateformes : Azure, Kubernetes, VMware, oVirt. Méthodologies : CI/CD, DevOps, SRE, Infrastructure as Code, industrialisation des infrastructures
Vos missions En tant que Business Analyst, vous aurez pour principales responsabilités de : Recueillir, analyser et formaliser les besoins métiers. Rédiger les User Stories et les spécifications fonctionnelles. Traduire les besoins métiers en exigences fonctionnelles à destination des équipes de développement. Créer et suivre les tickets dans JIRA. Participer à la priorisation et au suivi du backlog avec les équipes projets. Accompagner les équipes de développement tout au long du cycle de réalisation. Coordonner les phases de recette et organiser les campagnes de tests. Vérifier la conformité des développements avec les besoins exprimés. Produire la documentation fonctionnelle et les supports utilisateurs. Participer aux cérémonies Agile (Sprint Planning, Daily, Review, Rétrospective). Assurer le suivi des demandes métiers et des évolutions applicatives. Construire des tableaux de bord et des reportings afin de suivre l'activité et les indicateurs de performance. Être force de proposition dans l'amélioration continue des processus et des outils.
Habilitation requise : Secret Défense (ou habilitable) Démarrage : dès que possible Contexte : Environnement d'exploitation critique comprenant 4 plateformes Web de production. La mission vise à sécuriser et fiabiliser le socle technique via montées de version, mise à jour des images Docker et renforcement de la supervision. Missions : Qualifier et réaliser les montées de version Debian 13 sur l'ensemble des environnements, dont les 4 plateformes Web de production. Qualifier les nouvelles versions des images Docker et déployer les mises à jour sur toutes les chaînes Web. Mettre à jour les firmwares serveurs (BIOS, BMC, contrôleurs). Compléter la documentation, les plans de tests et les fiches réflexe. Enrichir la supervision (métriques, sondes, alertes) et vérifier la bonne remontée des indicateurs.
DevOps confirmé (Background Dev .Net = très gros plus) 🚀 Démarrage : Septembre ⏳ Durée : pas de fin envisagée pour le moment (stratégie sur plusieurs années du client) 📍 Lieu : Paris 💼 Expérience : 5/7ans 🏠 Télétravail : 3 jours sur site / 2 jours de TT (au choix du candidat) 🏢 Secteur : Finance 🧩 Contexte de la mission Notre client, acteur du secteur financier, recherche un(e) ingénieur(e) DevOps confirmé(e) pour rejoindre une équipe DevOps au sein d'un pôle développement d'une DSI de 60 personnes. L'environnement actuel est on-premise, avec une intégration progressive d'Azure Cloud. L'équipe bénéficie d'une liberté de choix technique et d'une bonne collaboration avec les autres équipes. Le contexte est celui d'une modernisation et standardisation des pratiques de développement. 🛠️ Environnement technique Azure DevOps, C#, PowerShell, YAML, Windows Server (IIS, services Windows, gestion des permissions), SonarQube, Prometheus, Grafana, ELK, outils IA (Claude Code, Copilot, Rogo), Opentelemetry, (Datadog en cours de réflexion) 🎯 Missions principales Participer à la mise en place et à l'évolution des chaînes CI/CD (build, test, déploiement, monitoring) de l'intégration à la production Collaborer avec les équipes de développement pour automatiser les processus de build, test et déploiement Accompagner la mise en place des outils IA (Claude Code, Copilot, Rogo) et des bonnes pratiques associées Participer à la conception, mise en œuvre et maintien en condition opérationnelle d'une solution d'observabilité complète Assurer la maintenance et la fiabilité des systèmes on-premise (Azure DevOps, SonarQube, serveurs Windows, etc.) Participer à l'amélioration continue des systèmes existants via des outils d'audit automatique (linting, qualité, sécurité) Collaborer avec les équipes sécurité pour garantir un delivery sécurisé et conforme Participer à la documentation des systèmes et des pratiques (ARBs, wiki, communications) Assurer une veille technologique et proposer des améliorations pertinentes
Contexte et objectif de la mission La mission porte sur un rôle clé dans la conception, l'intégration et la validation de solutions MCx au sein de réseaux privés 4G/5G. La prolongation de la mission au-delà de 6 mois dépend du succès de l'avant-vente. Missions principales • Mettre en place de manière autonome un environnement complexe incluant un système MCx • Participer à la rédaction des livrables documentaires sur le périmètre concerné : HLD, LLD, documentation technique utilisateurs, supports de formation • Participer aux phases de validation : rédaction de fiches de tests, exécution des tests, support aux tests • Contribuer à l'élaboration des propositions commerciales et des solutions techniques adaptées aux besoins des clients, en intégrant des services MCx • Assurer une veille technologique sur les évolutions du marché des solutions MCx afin d'apporter un support aux équipes avant-vente Livrables attendus • HLD • LLD • Documentation technique utilisateurs • Supports de formation • Fiches de tests
QODEXIA est une société de services informatiques implantée en France et en afrique du nord. Partenaire performant, innovant, agile pour aider les entreprises dans leur transforamtion digitale. QODEXIA s'est spécialisée dans le digital, SAP et les nouvelles technologies, accompagne au quotidien les plus grands acteurs de l'industrie, de l'énergie, du Luxe, de la Banque et de l'Assurance sur leurs projets. L'IT est notre passion, les valeurs humaines sont notre capital, c'est de quoi notre ADN est composé. Pour le compte de l'un de nos clients basés sur Nantes, nous sommes à la recherche d'un profil Devops Senior(H/F)
Je recherche un Ingénieur DevOps (Credit Chain Loan Servicing) ayant plus de 6ans d' experience afin de rejoindre une équipe qui est au cœur de la transformation Front-to-Back de la Credit Chain 📍 Contexte: Dans le cadre de la transformation de la Credit Chain, notre équipe pilote les projets et la maintenance des outils de loan servicing, avec une intervention directe sur toute la chaîne DevOps liée à LoanIQ, Spirit, Utina ainsi que les interfaces de comptabilité, de risque et de paiement associées. Vous rejoindrez une équipe technique dynamique, à l'interface entre les développeurs, les infrastructures cloud et les enjeux métiers du financement. 🎯 Vos missions Déploiement & Scaling : Piloter le déploiement et la montée en charge des applications sur les clusters Kubernetes Automatisation : Concevoir et maintenir des pipelines CI/CD pour fiabiliser et accélérer les livraisons logicielles Release & Support : Accompagner les équipes de développement dans leurs cycles de mise en production et assurer le support technique associé Sécurité : Piloter l'intégration des scanners de sécurité dans les pipelines et garantir la qualité du code et des conteneurs Observabilité : Exploiter les outils de monitoring et de logs pour garantir la stabilité et la performance des microservices 🛠️ Compétences techniques recherchées Conteneurisation: Expertise avancée Docker & Kubernetes (déploiement, scaling, service mesh) CI/CD: Maîtrise Jenkins, GitLab CI ou équivalent Infra as Code: Expérience Terraform, Ansible, Helm Cloud: Environnements cloud et architectures hybrides Architecture: Orchestration de microservices, API Gateways Monitoring: OpenSearch, Dynatrace, Prometheus, Grafana Dev Experience: Bonne compréhension Java / Spring Boot Innovation: Usage d'assistants IA/LLM pour l'automatisation de scripts, documentation, troubleshooting 💡 Pourquoi nous rejoindre ? Une opportunité de contribuer à la modernisation d'un environnement critique du secteur bancaire, en combinant excellence technique DevOps et innovation (IA générative appliquée à l'infrastructure), au sein d'une équipe qui allie expertise Kubernetes/CI-CD et compréhension métier du crédit.
• Définir et maintenir les référentiels d'architecture plateforme (standards, patterns, technologies) et garantir la cohérence technique de bout en bout. • Concevoir les socles techniques transverses : IAM, Data stores, Kafka, CI/CD, /Docker/, observabilité et middlewares. • Définir et appliquer les standards de sécurité (0 Trust, DevSecOps, gestion des certificats et secrets, durcissement SI). • Piloter la gouvernance technique : roadmaps socles, gestion des obsolescences, participation aux comités d'architecture et arbitrages techniques. • Challenger les architectures applicatives des tribes et contribuer aux dossiers d'architecture des projets métiers. • Concevoir les modèles d'Infrastructure as Code (Terraform, Ansible, Helm) et normaliser les pratiques GitOps/CI/CD. • Apporter un support expert de niveau N3 lors d'incidents complexes. • Définir la vision long terme de la plateforme et construire les trajectoires d'évolution (cloud hybride, API management, IAM modernisé, AIOps). • Référentiels d'architecture plateforme (standards, patterns, guidelines techniques) • Roadmaps socles : patching, migrations, gestion des versions en fin de support • Modèles d'Infrastructure as Code (Terraform, Ansible, Helm) • Pipelines CI/CD génériques et patterns ArgoCD/GitOps normalisés • Dossiers d'architecture pour les projets métiers • Rapports de conformité, résultats d'audits et plans de remédiation • Vision stratégique long terme et trajectoires d'évolution de la plateforme