CONTEXTE ET ENVIRONNEMENT Le pôle conçoit et opère des plateformes « as a service » facilitant la mise en place d'architectures modernes, distribuées et hautement résilientes pour l'ensemble des entités du groupe. Le poste s'inscrit au sein de l'équipe GenAI du domaine d'expertise Data & IA, avec pour mission le déploiement, l'industrialisation et l'exploitation de la plateforme GPUaaS et LLMaaS On-Premise. Cette initiative majeure vise à offrir des solutions agentiques souveraines et sécurisées pour l'ensemble des entités du groupe. PÉRIMÈTRE D'INTERVENTION Le périmètre s'étend de la conception du service à son maintien en condition opérationnelle en production. Le candidat évoluera dans un environnement technique complexe, distribué, sécurisé et hautement disponible, au sein d'une équipe dédiée aux produits et services d'intelligence artificielle. MISSIONS PRINCIPALES • Industrialiser et automatiser le déploiement de plateforme dans un environnement on premise sécurisés • Contribuer à l'évolution de l'architectures de la plateforme • Participer à la mise en place de services managés en intégrant les contraintes de sécurité, compliance et gouvernance • Documenter les offres et services et assurer leur mise en production • Réaliser des présentations et démos pour promouvoir les offres et services • Maintenir en conditions opérationnelles et de sécurité les plateformes IA déployées (run) • Collaborer au sein d'une dev team selon les méthodes agiles • Participer aux daily meetings animés par la Product Owner • Contribuer aux réunions de co-construction de la roadmap • Prendre en charge les éléments de la backlog formalisée par la Product Owner • Participer à l'ensemble des rituels de la squad, de la plateforme et du pôle • Participer aux astreintes techniques du pôle
En tant qu'Ingénieur ML au sein de l'équipe ML Platform, vous mettrez à profit votre solide expérience en industrialisation, votre maîtrise de Python et votre expertise pratique de l'entraînement de modèles. Votre rôle sera de faciliter le travail quotidien du ML Lab sur (leur "neocloud" de choix) et d'assurer la liaison avec l'outillage MLOps (principalement sur AWS), en étroite collaboration avec un ingénieur DevOps dédié. Responsabilités ClésFavoriser l'expérimentation rapide : Créer et maintenir les outils permettant aux chercheurs d'itérer rapidement sur de nouvelles approches ML. Gérer des expériences de recherche à grande échelle : Concevoir et superviser des cycles d'entraînement massifs sur l'infrastructure , en implémentant le suivi des expériences (experiment tracking) et la reproductibilité. Faciliter la collaboration externe : Permettre une collaboration sécurisée avec des partenaires académiques et l'accès aux ressources open-source tout en respectant les protocoles de sécurité. Optimisation des performances et des ressources : Profiler et optimiser les pipelines d'entraînement ; gérer efficacement les ressources GPU. Développement d'outils de recherche : Développer des bibliothèques et utilitaires spécifiques aux domaines du Lab (nouvelles architectures, techniques d'entraînement, frameworks d'évaluation). Transfert de connaissances : Partager les enseignements issus de la recherche expérimentale avec l'ensemble de l'équipe ML Platform et les chercheurs
Auditer l'architecture d'inférence existante et identifier les axes d'optimisation. Évaluer la scalabilité, les performances et la résilience de l'architecture cible. Optimiser le serving des modèles avec vLLM et Triton : cache KV, prefix caching, parallélisme, streaming, sorties JSON et tool calling. Intégrer et configurer une gateway LLM multi-tenant proposant une API homogène pour les modèles internes et externes. Définir les mécanismes de routage, d'authentification, de gestion des identités, de quotas, de traçabilité et de suivi des coûts. Organiser la ségrégation et la priorisation des charges entre usages batch et interactifs. Concevoir et exécuter des campagnes de tests de charge sur des workloads mixtes. Identifier les goulots d'étranglement et valider le comportement de la plateforme en cas de forte contention ou de bascule de modèles. Définir une stratégie de mutualisation GPU : MIG, time-slicing, scale-to-zero, préchargement des modèles et placement selon l'empreinte VRAM. Produire les livrables suivants : rapport d'audit de l'existant ; dossier d'architecture technique cible ; rapport de tests de charge et de résilience ; plan de capacité matériel et logiciel à 6–12 mois.
Dans le cadre du déploiement d'une solution d'intelligence artificielle, un Administrateur Système confirmé / Ingénieur OpenShift-Kubernetes est recherché pour accompagner l'intégration et l'industrialisation de la solution au sein d'un environnement d'entreprise complexe. Le consultant interviendra à l'interface entre l'éditeur de la solution IA et les équipes internes Infrastructure, Sécurité, Architecture et Exploitation. La mission comporte une forte dimension de cadrage technique, conseil, coordination et transfert de compétences. Responsabilités : Accompagner l'intégration technique de la solution avec l'éditeur ; Analyser les prérequis infrastructure et contribuer au cadrage de la solution ; Déployer et configurer les composants containerisés sur OpenShift / Kubernetes ; Participer à la conception et à la mise en œuvre de l'architecture technique ; Coordonner les travaux avec les équipes Infrastructure, Sécurité et Exploitation ; Mettre en œuvre les exigences de sécurité et de conformité ; Identifier les risques techniques et contribuer à leur traitement ; Participer à l'industrialisation de la solution ; Mettre en place ou contribuer aux pipelines CI/CD ; Packager et automatiser le déploiement de la solution ; Garantir les mécanismes de disponibilité, redondance et exploitabilité ; Participer à la supervision et au maintien en conditions opérationnelles ; Accompagner les phases de tests et de mise en production ; Assurer le transfert de compétences auprès des équipes internes. Livrables attendus : Dossier d'Architecture Technique (DAT) ; Dossier d'Exploitation (DEX) ; Documentation d'installation et de déploiement ; Documentation des procédures d'exploitation ; Documentation CI/CD et industrialisation ; Guides techniques et procédures de troubleshooting ; Supports de transfert de compétences.
Vos missions **Exploitation & Administration OpenShift AI** - Administration et maintien en conditions opérationnelles des plateformes OpenShift AI - Traitement des incidents et demandes de support - Supervision de l'environnement Kubernetes/OpenShift - Patching et montées de version - Gestion des workloads, namespaces, quotas et déploiements - Gestion des certificats, accès et configurations de la plateforme **Infrastructure & Plateforme** - Administration des clusters OpenShift sur infrastructures VMware et BareMetal - Gestion des ressources GPU - Administration du stockage et de la persistance des données - Gestion des composants réseau OpenShift (Ingress, Network Policies, exposition des services) **OpenShift AI & MLOps** - Administration des Data Science Projects et Workbenches - Gestion des services de Model Serving (ModelMesh) - Déploiement et exploitation de pipelines ML - Optimisation des ressources GPU pour les usages IA - Accompagnement des équipes Data Science et IA **Automatisation & Industrialisation** - Mise en œuvre des pratiques GitOps et CI/CD - Déploiement d'applications via Helm - Administration d'ArgoCD et des pipelines Tekton - Automatisation des opérations récurrentes - Participation aux projets de transformation de la plateforme **Formation & Accompagnement** - Formation des équipes en charge du RUN - Montée en compétence du Service Owner - Documentation des procédures et bonnes pratiques - Transfert de connaissances vers les équipes d'exploitation
EXPERT KUBERNETES / IA (H/F)Contexte de la missionNous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l'exploitation, la disponibilité, la performance et la stabilité d'un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage. Le profil recherché devra également contribuer à l'automatisation de l'exploitation, au traitement des incidents et à l'amélioration continue de l'infrastructure. Missions principales Maintien en condition opérationnelle – MCO Garantir la disponibilité, la performance et la stabilité du cluster IA. Administrer les nœuds GPU/CPU, les infrastructures de stockage et les composants réseau. Assurer le suivi et l'optimisation des ressources de l'infrastructure. Piloter les opérations de maintenance et les mises à jour techniques. Administration Linux Installer, configurer et administrer les environnements Linux Ubuntu. Réaliser les opérations d'optimisation et de troubleshooting. Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés. Kubernetes Administrer et exploiter les environnements Kubernetes. Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA). Assurer le maintien en conditions opérationnelles des clusters. Piloter les mises à jour des composants Kubernetes. Gérer les problématiques liées aux ressources et à la capacité des clusters. Supervision et observabilité Mettre en place et maintenir la supervision des infrastructures. Exploiter Prometheus et Grafana pour le monitoring et l'analyse des performances. Identifier les anomalies et anticiper les incidents grâce à une approche proactive. Automatisation Automatiser les tâches d'administration et d'exploitation avec Ansible. Développer et maintenir des scripts Bash et Python. Optimiser les processus opérationnels afin de réduire les tâches manuelles. Gestion des jobs IA / GPU Assurer l'ordonnancement des tâches et jobs GPU. Gérer les quotas, priorités et ressources GPU. Optimiser l'allocation des ressources CPU/GPU. Gestion des incidents Prendre en charge les incidents techniques complexes. Réaliser les analyses de causes racines et les post-mortems. Définir et suivre les plans d'actions correctifs. Coordonner les interventions avec les différentes équipes techniques. Documentation Rédiger et maintenir la documentation d'exploitation. Formaliser les procédures techniques et les consignes de maintenance. Garantir la traçabilité et la continuité des opérations.
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations.
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations. Profil recherché Vous êtes certifié Kubernetes, justifiez d'une expérience professionnelle minimum de 8 ans dans un poste similaire, et maîtrisez les environnements suivants : Infrastructure : Linux Ubuntu, Kubernetes, Docker, GPU NVIDIA (drivers, CUDA, MIG), Ansible, gestion des environnements distribués. Observabilité : Prometheus, Grafana Stockage : systèmes de fichiers distribués, stockage haute performance et stockage objet Réseau : comprendre l'architecture réseau d'un cluster (VLAN, Load balancing...) Méthodes : ITIL/ITSM, gestion des incidents et des changements, documentation d'exploitation.
Exploitation & Administration OpenShift AI • Administration et maintien en conditions opérationnelles des plateformes OpenShift AI. • Traitement des incidents et demandes de support. • Supervision de l'environnement Kubernetes/OpenShift. • Réalisation des opérations de patching et montées de version. • Gestion des workloads, namespaces, quotas et déploiements. • Gestion des certificats, accès et configurations de la plateforme. Infrastructure & Plateforme • Administration des clusters OpenShift sur infrastructures VMware et BareMetal. • Gestion des ressources GPU. • Administration du stockage et de la persistance des données. • Gestion des composants réseau OpenShift (Ingress, Network Policies, exposition des services). OpenShift AI & MLOps • Administration des Data Science Projects et Workbenches. • Gestion des services de Model Serving (ModelMesh). • Déploiement et exploitation de pipelines ML. • Gestion et optimisation des ressources GPU pour les usages IA. • Accompagnement des équipes Data Science et IA. Automatisation & Industrialisation • Mise en œuvre des pratiques GitOps et CI/CD. • Déploiement d'applications via Helm. • Administration d'ArgoCD et des pipelines Tekton. • Automatisation des opérations récurrentes. • Participation aux projets de transformation et d'industrialisation de la plateforme. Formation & Accompagnement • Formation des équipes Sopra Steria en charge du RUN. • Accompagnement et montée en compétence du Service Owner. • Documentation des procédures et bonnes pratiques. • Réalisation des transferts de connaissances vers les équipes d'exploitation.
Contexte de la mission : Dans le cadre du développement de solutions logicielles intégrant des composants d'Intelligence Artificielle, nous recherchons un Ingénieur Logiciel IA / MLOps H/F pour le compte d'un client central du secteur militaire. Vous rejoindrez une équipe en charge de l'industrialisation du cycle de vie de modèles IA, notamment dans des cas d'usage liés au traitement d'images. Vous interviendrez principalement sur l'intégration, le déploiement, la supervision et le maintien en conditions opérationnelles de modèles existants dans des environnements logiciels contraints. Responsabilités : - Intégrer des modèles de Machine Learning et Deep Learning dans les environnements logiciels cibles ; - Packager, versionner et déployer les modèles ainsi que leurs dépendances ; - Mettre en place et améliorer les chaînes d'intégration et de déploiement continus ; - Développer les composants nécessaires à l'exposition des modèles : API, services d'inférence, outils d'administration et scripts d'automatisation ; - Superviser les performances techniques et fonctionnelles des modèles déployés ; - Comparer les résultats obtenus aux jeux de référence et aux performances historiques ; - Identifier et analyser les éventuelles dégradations : dérive des données, évolution des entrées, perte de précision, latence ou contraintes de ressources ; - Optimiser le portage et l'exécution des modèles sur les environnements cibles, notamment sur GPU ; - Participer aux activités de qualification, de tests unitaires, d'intégration et de non régression ; - Rédiger la documentation technique et capitaliser les bonnes pratiques d'industrialisation IA ; - Assurer une veille technologique sur les outils de déploiement, de supervision et de monitoring des modèles IA.
Dans le cadre d'un projet de traitement automatisé de documents, notre client recherche un ingénieur Computer Vision confirmé capable d'intervenir sur des problématiques de vision par ordinateur et de reconnaissance documentaire, en environnement sécurisé avec de fortes exigences de confidentialité, reproductibilité et traçabilité. Le consultant interviendra notamment sur : ▪ Le prétraitement et l'analyse d'images : redressement, binarisation, recalage et alignement de documents ▪ La segmentation, détection et extraction de zones d'intérêt sur des documents ▪ La mise en œuvre de solutions de reconnaissance d'écriture manuscrite et imprimée (OCR / HTR) ▪ L'étude et l'exploitation de modèles Vision-Language (VLM) : prompting, évaluation et, selon les besoins, fine-tuning de modèles open-weight ▪ La conception de métriques d'évaluation adaptées, l'analyse des performances et la mise en place de scores de confiance ▪ L'automatisation des contrôles qualité et la comparaison des résultats avec les données de référence ▪ L'industrialisation des modèles en environnement conteneurisé sur infrastructures GPU
Dans le cadre du déploiement à grande échelle des solutions d'IA générative et agentique d'un grand compte, nous recherchons un AI Platform Engineer pour construire et opérer la plateforme mutualisée qui héberge l'ensemble des cas d'usage IA du groupe. Au sein de l'équipe plateforme, le consultant interviendra notamment sur : ▪ La conception et l'exploitation de la plateforme IA interne mise à disposition des équipes de développement et de data science ▪ Le déploiement et la configuration des services d'infrastructure nécessaires aux cas d'usage IA (environnements d'inférence, GPU, stockage objet) ▪ L'intégration et l'administration des gateways LLM donnant accès aux modèles (internes et fournisseurs externes) ▪ La mise en place des mécanismes de quotas, de gestion des accès et de facturation interne des usages IA ▪ L'industrialisation des services de la plateforme : templates, self-service, documentation ▪ Le maintien en condition opérationnelle : supervision, gestion des incidents, capacity planning ▪ La contribution aux choix d'architecture pour une exploitation industrielle durable
Dans le cadre du développement d'une plateforme d'IA générative souveraine et sécurisée, nous recherchons un DevOps IA Mistral pour intervenir sur le déploiement, l'industrialisation et l'exploitation d'une plateforme Mistral AI On-Premise. Vous participerez à la conception de l'architecture, à l'automatisation des déploiements et à la mise en place de services managés en intégrant les contraintes de sécurité, de conformité et de gouvernance. Vous assurerez également le maintien en conditions opérationnelles et de sécurité des plateformes IA. Intégré à une équipe Agile dédiée aux produits Data & IA, vous prendrez en charge des éléments du backlog, participerez à la construction de la roadmap et assurerez un rôle de lead technique sur le produit. La mission comprend également la documentation, les mises en production, la réalisation de démonstrations ainsi que la participation aux astreintes techniques. Compétences techniquesIA / GenAIMistral AI Plateformes agentiques OpenClaw Hermes LLMOps Workloads IA / Data Dataiku MLflow Infrastructure / ConteneurisationKubernetes OpenShift Docker Infrastructure On-Premise DevOps / AutomatisationTerraform Ansible Jenkins GitLab CI Kestra Artifactory (JFrog) CI/CD Développement / DataPython SQL Bases de données / Vector DBOpenSearch Elasticsearch PGVector MongoDB Atlas RDS Sécurité / RéseauVault Nginx Kong Sécurité des données Compliance / Gouvernance ObservabilitéDynatrace CloudWatch Prometheus Grafana X-Ray GPU – appréciésCUDA MIG Slurm
ContexteLes équipes CIB ITO développent, maintiennent, sécurisent et améliorent les systèmes d'information et applications de CIB. En tant que première banque d'investissement en Europe dans la région EMEA, nous accompagnons nos clients corporates dans leur développement en leur offrant des conseils stratégiques et un accès de premier choix au financement et aux services bancaires transactionnels. Nous considérons notre rôle comme un pont entre nos clients corporates et les investisseurs institutionnels, en nous appuyant sur des équipes situées à travers le monde pour répondre à leurs besoins. Le besoin porte sur un renforcement de l'équipe de Data Scientist de la division AI de la plateforme CIB/Banking. Cette équipe est spécialisée dans l'intégration de solution AI innovantes au sein des diverses applications comme de l'extraction de données à partir de divers documents (états financiers, documents de crédit, etc.) et systèmes internes. MissionsDéfinition et contribution à la mise en œuvre de solutions agentiques pour la simplification et l'accélération de process métiers complexes. Interaction avec les Métiers afin de maximiser l'impact et l'adoption des solutions IA. Extraction des données à partir de divers documents et systèmes internes en utilisant pipelines IA agentiques. Mise en place de systèmes d'évaluations et d'observabilités sur des pipelines agentiques. Déploiement de LLMs, modèles sur des GPUs dans un environnement de dev. Amélioration continue : amélioration constante des performances de l'extraction de données dans le cadre d'une approche itérative et incrémentale. Mise en œuvre de stratégies de test afin de contribuer au maintien du niveau de qualité et à l'amélioration continue des processus de développement. Interaction des standards de développement IT les plus élevés pour industrialiser la data science, en interagissant avec les architectes, les équipes de production. Soutien technique, transfert de compétences et responsabilité technique de use cases métiers et participation à leur mise en production.