Assurer l'administration et le maintien en conditions opérationnelles des plateformes OpenShift AI. Gérer les incidents, le support, le patching, les montées de version et la supervision Kubernetes/OpenShift. Administrer les clusters OpenShift (VMware, BareMetal), les ressources GPU, le stockage et les composants réseau. Administrer les services OpenShift AI (ModelMesh, Data Science Projects, Workbenches, pipelines ML). Déployer et industrialiser les environnements via GitOps, ArgoCD, Helm et Tekton. Automatiser les opérations récurrentes et contribuer aux projets de transformation de la plateforme. Former, accompagner et assurer le transfert de compétences auprès des équipes RUN et du Service Owner. Documenter les procédures et les bonnes pratiques.
Missions principales (Doit connaitre Kubernetes, Helm, Python, Gestion et tunning de GPU (Nvidia)) Gestion du RUN • Supervision des alertes, incidents et changements ; • Coordination du triage (L1 → L2 → L3) avec l'équipe offshore ; • Rédaction & maintenance des runbooks, playbooks et SOP ; • Suivi du MTTR, escalades et reporting aux parties prenantes. Incident Management & RCA • Conduite d'enquêtes post‑mortem (RCA) ; • Mise en place d'actions correctives et préventives ; • Gestion du carnet d'incidents dans ServiceNow (SNOW). Optimisation des plateformes • Monitoring des métriques (latence, utilisation GPU, capacité des nœuds) ; • Propositions d'optimisation (autoscaling, right‑sizing, tuning des ressources) ; • Gestion des patchs de sécurité et suivi des CVE. Automation & CI/CD • Automatisation des tâches récurrentes (scripts Python, Terraform, Ansible) ; • Intégration des bonnes pratiques GitOps. Collaboration & gouvernance • Interface avec les Product Owners, les équipes DataScience et les fournisseurs d'infrastructure ; • Participation aux cérémonies Scrum/Kanban (stand‑up, grooming, retro) ; • Veille à la conformité ITSM (processes, KPI, SLA). Support aux utilisateurs • Gestion des demandes d'accès, des droits RBAC et de la documentation technique ; • Formation ponctuelle (on‑boarding) des nouveaux membres de l'équipe offshore Profil recherché Expérience • 5 + ans d'expérience en exploitation (Run/Production) d'environnements Kubernetes à grande échelle ; • Expérience confirmée avec des équipes offshore ou distribuées (3 personnes minimum). Compétences techniques • Kubernetes, Helm, Argo CD ; • Scripting Python (débogage, packaging : venv, poetry, uv) ; • Notions Data Science : pandas, numpy ; • CI/CD (GitLab, Jenkins), IaC (Terraform, Ansible) ; • Observabilité (Prometheus, Grafana, Loki) ; • Gestion des GPU (NVIDIA GRID) ; • Sécurité production : gestion CVE, RBAC, Vault.
Notre client, une deeptech parisienne en forte croissance qui combine IA générative et physique computationnelle pour la découverte de médicaments, renforce son équipe CORE Infrastructure (2 ingénieurs, au sein d'une engineering de 17 personnes). Cette équipe fournit le socle de la plateforme : architecture, infra, outillage DevOps des équipes de dev et sécurité. Environnement orienté R&D, avec des enjeux forts de scaling GPU pour l'entraînement de modèles à large échelle. Missions Prendre en charge la roadmap infrastructure de bout en bout, en collaboration directe avec l'ingénieure SRE en place (répartition ~60% build / 40% run) Concevoir et opérer les mécanismes de scaling GPU : provisioning, orchestration de trainings à large échelle sur Kubernetes Garantir la fiabilité et la disponibilité de la plateforme : SLOs, monitoring, alerting, gestion d'incidents et postmortems Maintenir et faire évoluer l'infra-as-code et les pipelines CI/CD Accompagner les équipes de développement sur l'outillage DevOps et les bonnes pratiques SRE Onboarding des nouveaux utilisateurs (matériel) (partie IT largement automatisée, support externalisé pas de charge RUN lourde)
Contexte et environnement Notre client, acteur majeur du secteur bancaire, engage un projet stratégique autour de la conception, du déploiement, de l'industrialisation et de l'exploitation d'une plateforme d'intelligence artificielle générative en environnement on-premise. Ce dispositif s'inscrit dans un contexte bancaire exigeant, marqué par de forts enjeux de sécurité, de conformité, de souveraineté, de gouvernance des données et de résilience des services. L'objectif est de mettre à disposition des solutions GenAI industrialisées, sécurisées et exploitables à grande échelle pour différents métiers et entités internes. L'intervention s'effectuera au sein d'une équipe dédiée aux produits et services Data & IA, dans un environnement technique complexe, distribué, hautement disponible et soumis à des exigences fortes en matière de production IT. Périmètre d'intervention Le périmètre couvre l'ensemble du cycle de vie de la plateforme, depuis la contribution à la conception du service jusqu'à son maintien en conditions opérationnelles et de sécurité en production. Le consultant interviendra sur un dispositif à forts enjeux techniques, au croisement des sujets DevOps, Data, IA générative, conteneurisation, automatisation, sécurité et exploitation de plateformes critiques. Dans un environnement bancaire, la capacité à sécuriser les déploiements, fiabiliser les processus d'industrialisation et garantir la conformité des services sera déterminante. Missions principales Dans ce cadre, le consultant contribuera notamment à : Industrialiser et automatiser le déploiement d'une plateforme d'IA générative en environnement on-premise sécurisé ; Contribuer à la conception et à l'évolution de l'architecture de la plateforme ; Participer à la mise en place de services managés intégrant les contraintes de sécurité, de conformité, de gouvernance et de production bancaire ; Accompagner la mise en production des offres et services associés ; Documenter les services, les modes opératoires et les éléments nécessaires à leur exploitation ; Réaliser des présentations et démonstrations afin de valoriser les offres et services auprès des parties prenantes ; Maintenir les plateformes IA déployées en conditions opérationnelles et de sécurité ; Contribuer au traitement des sujets techniques au sein d'une équipe produit ; Participer aux échanges de cadrage, de priorisation et de co-construction de la roadmap ; Prendre en charge des éléments de backlog formalisés par le Product Owner ; Assurer un rôle de référent technique sur un produit ou un périmètre de la plateforme ; Participer aux rituels d'équipe et aux instances de coordination du dispositif ; Contribuer aux astreintes techniques liées au périmètre. Compétences attendues Le consultant devra présenter une expérience solide sur les environnements DevOps, Data et plateformes distribuées, avec une capacité à intervenir sur des sujets d'industrialisation, d'automatisation et d'exploitation en environnement critique. Les compétences attendues sont notamment les suivantes : Maîtrise du déploiement et de la manipulation de workloads Data ; Bonne compréhension des environnements conteneurisés et des pratiques CI/CD ; Expérience sur des plateformes Kubernetes, OpenShift et Docker ; Capacité à intervenir sur des environnements on-premise sécurisés ; Connaissance des meilleures pratiques en matière de sécurité des données, conformité et gouvernance ; Expérience en automatisation et infrastructure as code ; Capacité à documenter, structurer et sécuriser des services techniques destinés à la production ; Aptitude à porter un rôle de référent technique au sein d'une équipe produit. Une expérience dans le secteur bancaire, financier ou dans un environnement fortement réglementé sera particulièrement appréciée. Une connaissance des plateformes d'IA générative, des environnements LLMOps ou des plateformes agentiques constitue également un plus.
Basée à Lille, Lyon, Nantes, Grenoble, Marseille, Paris et Bruxelles, Insitoo Freelances est une société du groupe Insitoo, spécialisée dans le placement et le sourcing des Freelances IT et Métier. Depuis 2007, Insitoo Freelances a su s'imposer comme une référence en matière de freelancing par son expertise dans l'IT et ses valeurs de transparence et de proximité. Actuellement, afin de répondre aux besoins de nos clients, nous recherchons un Expert Openshift AI (H/F) à Gémenos, France. Contexte : Dans le cadre de l'exploitation, de l'évolution et de l'industrialisation d'une plateforme IA basée sur OpenShift AI, nous recherchons un expert technique capable d'intervenir sur les activités de RUN, d'automatisation et de transformation de la plateforme. Le consultant rejoindra une équipe en place et jouera également un rôle clé dans l'accompagnement des équipes d'exploitation et du Service. Les missions attendues par le Expert Openshift AI (H/F) : Exploitation & Administration OpenShift AI • Administration et maintien en conditions opérationnelles des plateformes OpenShift AI. • Supervision de l'environnement Kubernetes/OpenShift. • Gestion des workloads, namespaces, quotas et déploiements. • Gestion des certificats, accès et configurations de la plateforme. Infrastructure & Plateforme • Administration des clusters OpenShift sur infrastructures VMware et BareMetal. • Gestion des ressources GPU. • Administration du stockage et de la persistance des données. • Gestion des composants réseau OpenShift (Ingress, Network Policies, exposition des services). OpenShift AI & MLOps • Administration des Data Science Projects et Workbenches. • Gestion des services de Model Serving (ModelMesh). • Gestion et optimisation des ressources GPU pour les usages IA. • Accompagnement des équipes Data Science et IA. Automatisation & Industrialisation • Mise en œuvre des pratiques GitOps et CI/CD. • Déploiement d'applications via Helm. • Administration d'ArgoCD et des pipelines Tekton. • Automatisation • Participation aux projets de transformation et d'industrialisation de la plateforme. Formation & Accompagnement • Formation des équipes en charge du RUN. • Accompagnement et montée en compétence du Service. • Documentation Profil recherché • Expert OpenShift / Kubernetes confirmé. • Expérience significative sur OpenShift AI et les environnements MLOps. • Bonne compréhension des architectures IA et des environnements GPU. • Expérience en automatisation, industrialisation et CI/CD. • Capacité à accompagner et former des équipes. • Aisance dans les environnements de transformation et d'amélioration continue. Conditions • Démarrage : ASAP • Mission longue durée • Localisation : Gémenos (13) • Présence sur site : 3 jours/semaine minimum
Nous recherchons avant tout un expert OpenShift AI. Si vous avez une expérience solide sur OpenShift AI (RHODS), l'administration de plateformes IA et les environnements MLOps, cette opportunité est faite pour vous. Vos missions Administration et exploitation d'une plateforme OpenShift AI. Maintien en conditions opérationnelles (RUN), supervision et gestion des incidents. Administration des clusters OpenShift / Kubernetes. Déploiement et industrialisation des environnements IA. Mise en œuvre des pratiques GitOps, Helm, ArgoCD et Tekton. Administration des environnements GPU et accompagnement des équipes Data Science. Automatisation, documentation et transfert de compétences.
Objectif de la missionDévelopper et optimiser les capacités d'hébergement des ressources IA du groupe en assurant la disponibilité, la performance et l'industrialisation des infrastructures cloud et des plateformes de déploiement de modèles IA. Principales responsabilitésConcevoir et développer les composants logiciels et infrastructures nécessaires aux plateformes IA. Automatiser le provisioning et le déploiement des infrastructures via Terraform. Administrer et optimiser les environnements Kubernetes (GKE). Développer et sécuriser des API REST en Python (FastAPI). Industrialiser les pipelines CI/CD avec GitHub Actions. Concevoir et optimiser les infrastructures GPU destinées à l'hébergement et au serving de modèles IA et LLM. Participer à l'évaluation et à l'intégration de solutions d'IA Générative. Assurer la qualité des développements grâce aux tests automatisés, revues de code et contrôles de performance. Participer aux activités Build & Run des produits IA. Produire et maintenir la documentation technique associée aux développements réalisés. LivrablesCode produit des fonctionnalités développées. Documentation technique et fonctionnelle associée. Infrastructures automatisées et industrialisées. Pipelines CI/CD documentés et maintenables. Compétences requisesImpérativesKubernetes / GKE (Expert) Terraform (Expert) Google Cloud Platform (Expert) IA Générative / LLM (Confirmé) Docker GitHub Actions Python FastAPI CI/CD AppréciéesVertex AI Celery Kafka PostgreSQL MongoDB Aiven Gestion d'environnements GPU Automatisation des tests (TDD, BDD, intégration, performance) Profil recherchéMinimum 5 ans d'expérience en ingénierie d'infrastructure, Cloud ou DevOps. Solide expertise Kubernetes et Infrastructure as Code. Expérience significative sur Google Cloud Platform. Première expérience dans l'IA Générative, les LLM ou les environnements MLOps. Capacité à intervenir sur l'ensemble du cycle de vie produit. Autonomie, rigueur et esprit d'initiative. Curiosité technologique et veille active autour de l'IA et des infrastructures cloud. Excellent relationnel et goût du travail en équipe agile.
Vous rejoindrez une équipe de 5 ingénieurs infrastructure répartis sur 2 produits IA/LLM au sein de la Division IA & Data. Vous participerez au support d'une application de gateway d'accès LLM et contribuerez à l'exploitation d'un portefeuille de 3 produits majeurs : une plateforme d'inférence LLM, un pipeline de data-science et un service de mise à disposition de modèles IA. Vos missions principales couvriront plusieurs domaines : Gestion du RUN : Vous assurerez la supervision des alertes, incidents et changements, coordonnerez le triage (L1 → L2 → L3) avec l'équipe offshore, rédigerez et maintiendrez les runbooks, playbooks et SOP, et suivrez le MTTR, les escalades et le reporting aux parties prenantes. Incident Management & RCA : Vous conduirez des enquêtes post-mortem (RCA), mettrez en place des actions correctives et préventives, et gérerez le carnet d'incidents dans ServiceNow (SNOW). Optimisation des plateformes : Vous monitorerez les métriques (latence, utilisation GPU, capacité des nœuds), proposerez des optimisations (autoscaling, right-sizing, tuning des ressources) et gérerez les patchs de sécurité et le suivi des CVE. Automation & CI/CD : Vous automatiserez les tâches récurrentes via des scripts Python, Terraform et Ansible. Collaboration & gouvernance : Vous serez l'interface avec les Product Owners, les équipes DataScience et les fournisseurs d'infrastructure, participerez aux cérémonies Scrum/Kanban (stand-up, grooming, retro) et veillerez à la conformité ITSM (processes, KPI, SLA). Support aux utilisateurs : Vous gérerez les demandes d'accès, les droits RBAC et la documentation technique, et assurerez la formation ponctuelle (on-boarding) des nouveaux membres de l'équipe offshore. L'environnement technique comprend Kubernetes (cluster(s) on-prem & cloud hybride), Helm, Argo CD, CI/CD (GitLab / Jenkins), observabilité (Prometheus / Grafana, Loki), secrets management (Vault) et gestion des GPU (NVIDIA GRID). La méthodologie utilisée est Agile (Scrum/Kanban) avec tableau JIRA et suivi ITSM (ServiceNow).
Almatek recherche pour l'un de ses clients Un Senior Software Engineer sur Grenoble. Profil recherché : - Très bonne maîtrise de Python, avec une vraie expérience de développement (obligatoire) - Compétence solide sur les deux domaines suivants, avec une priorité sur l'IA : - Agentic AI (IA agentique), avec des frameworks comme LangChain, LangGraph, LangSmith - Edge computing (informatique de périphérie) - Bon niveau d'anglais, écrit et parlé (obligatoire) - Profil senior, capable de s'engager sur une mission longue durée En plus c'est un vrai plus : Linux, Docker, CI/CD, IoT, GPU, Scrum/SAFe
En tant qu'ingénieur ML au sein de l'équipe ML Platform, vous mettrez à profit votre solide expérience en industrialisation, votre maîtrise de Python et votre expérience pratique de l'entraînement de modèles pour faciliter le travail quotidien de l'équipe ML Lab sur (leur neocloud de référence), ainsi que l'intégration avec les outils MLOps principalement basés sur AWS, en collaboration étroite avec un DevOps dédié. Responsabilités principales Permettre une expérimentation rapide : développer et maintenir des outils permettant aux chercheurs d'itérer rapidement sur de nouvelles approches ML Gérer des expériences de recherche à grande échelle : concevoir et superviser des entraînements de modèles à grande échelle sur l'infrastructure , en assurant le suivi des expériences et leur reproductibilité Faciliter les collaborations externes : permettre une collaboration sécurisée avec des partenaires académiques et l'accès à des ressources open source de pointe tout en respectant les contraintes de sécurité Optimisation des performances et des ressources : analyser et optimiser les pipelines d'entraînement, gérer efficacement les ressources GPU Développement d'outils de recherche : créer des bibliothèques et utilitaires spécifiques aux domaines de recherche du laboratoire (nouvelles architectures, techniques d'entraînement, frameworks d'évaluation) Transfert de connaissances inter-équipes : partager les enseignements issus de la recherche expérimentale avec l'équipe ML Platform et les chercheurs groupe