Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations. Profil recherché Vous êtes certifié Kubernetes, justifiez d'une expérience professionnelle minimum de 8 ans dans un poste similaire, et maîtrisez les environnements suivants : Infrastructure : Linux Ubuntu, Kubernetes, Docker, GPU NVIDIA (drivers, CUDA, MIG), Ansible, gestion des environnements distribués. Observabilité : Prometheus, Grafana Stockage : systèmes de fichiers distribués, stockage haute performance et stockage objet Réseau : comprendre l'architecture réseau d'un cluster (VLAN, Load balancing...) Méthodes : ITIL/ITSM, gestion des incidents et des changements, documentation d'exploitation.
🎯 MISSIONS : Intégré(e) aux équipes d'un de nos clients grand compte, vos missions seront les suivantes : - Assurer le maintien en conditions opérationnelles (MCO) des applications en production. - Superviser les applications et les traitements batch, analyser les alertes et résoudre les incidents. - Gérer les mises en production et coordonner les déploiements avec les équipes de développement. - Participer à l'automatisation des tâches d'exploitation et à l'amélioration des processus. - Garantir le respect des engagements de service (SLA). - Réaliser les analyses de causes racines (RCA) et mettre en œuvre les actions correctives. - Rédiger et maintenir la documentation d'exploitation et les procédures. - Participer aux astreintes et aux interventions hors horaires ouvrés si nécessaire. - Contribuer aux projets d'évolution de la plateforme et aux initiatives d'amélioration continue. Environnement techniques : - Maîtrise des outils DevOps (Git, Jenkins, Ansible, Kubernetes, Docker) appréciée. - Bonne compréhension des architectures applicatives, des API et des services web. - Bonne connaissance des environnements Linux/Unix. - Maîtrise des scripts Shell et/ou Python. - Connaissance des ordonnanceurs (Control-M, Autosys, Dollar Universe ou équivalent). - Expérience des outils de supervision (Centreon, Zabbix, Prometheus, Grafana, Dynatrace, Splunk…). - Connaissances des bases de données Oracle, PostgreSQL ou SQL Server.