Offre d'emploi Expert kubernetes /ia (h/f) : kubernetes, prometheus
Fontenay-aux-Roses (92)
Gamme solutions
Partager cette offre
Nous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l’exploitation, la disponibilité, la performance et la stabilité d’un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage.
Le profil recherché devra également contribuer à l’automatisation de l’exploitation, au traitement des incidents et à l’amélioration continue de l’infrastructure.
Missions principalesMaintien en condition opérationnelle – MCO
Garantir la disponibilité, la performance et la stabilité du cluster IA.
Administrer les nœuds GPU/CPU, les infrastructures de stockage et les composants réseau.
Assurer le suivi et l’optimisation des ressources de l’infrastructure.
Piloter les opérations de maintenance et les mises à jour techniques.
Administration Linux
Installer, configurer et administrer les environnements Linux Ubuntu.
Réaliser les opérations d’optimisation et de troubleshooting.
Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés.
Kubernetes
Administrer et exploiter les environnements Kubernetes.
Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA).
Assurer le maintien en conditions opérationnelles des clusters.
Piloter les mises à jour des composants Kubernetes.
Gérer les problématiques liées aux ressources et à la capacité des clusters.
Supervision et observabilité
Mettre en place et maintenir la supervision des infrastructures.
Exploiter Prometheus et Grafana pour le monitoring et l’analyse des performances.
Identifier les anomalies et anticiper les incidents grâce à une approche proactive.
Automatisation
Automatiser les tâches d’administration et d’exploitation avec Ansible.
Développer et maintenir des scripts Bash et Python.
Optimiser les processus opérationnels afin de réduire les tâches manuelles.
Gestion des jobs IA / GPU
Assurer l’ordonnancement des tâches et jobs GPU.
Gérer les quotas, priorités et ressources GPU.
Optimiser l’allocation des ressources CPU/GPU.
Gestion des incidents
Prendre en charge les incidents techniques complexes.
Réaliser les analyses de causes racines et les post-mortems.
Définir et suivre les plans d’actions correctifs.
Coordonner les interventions avec les différentes équipes techniques.
Documentation
Rédiger et maintenir la documentation d’exploitation.
Formaliser les procédures techniques et les consignes de maintenance.
Garantir la traçabilité et la continuité des opérations.
Profil recherché
Minimum 8 ans d’expérience professionnelle sur des environnements similaires.
Certification Kubernetes obligatoire.
Expertise en administration Linux Ubuntu.
Très bonne maîtrise de Kubernetes et Docker.
Expérience concrète sur les infrastructures GPU NVIDIA : drivers, CUDA, MIG.
Maîtrise d’Ansible.
Bon niveau en scripting Bash et/ou Python.
Expérience des environnements distribués.
Environnement de travail
Infrastructure
Linux Ubuntu
Kubernetes
Docker
NVIDIA GPU
NVIDIA Drivers
CUDA
MIG
Ansible
Observabilité
Prometheus
Grafana
Stockage
Systèmes de fichiers distribués
Stockage haute performance
Stockage objet
Réseau
Architecture réseau d’un cluster
VLAN
Load Balancing
Méthodes
ITIL / ITSM
Gestion des incidents
Gestion des changements
Documentation d’exploitation
Kubernetes | Linux | Docker | NVIDIA GPU | CUDA | MIG | Ansible | Prometheus | Grafana | Python | Bash | Réseaux | IA
Profil cibleExpert Kubernetes / Infrastructure IA / GPU – Senior 8+ ans – Certification Kubernetes obligatoire
Postulez à cette offre !
Trouvez votre prochaine mission parmi +9 000 offres !
Fixez vos conditions
Rémunération, télétravail... Définissez tous les critères importants pour vous.
Faites-vous chasser
Les recruteurs viennent directement chercher leurs futurs talents dans notre CVthèque.
100% gratuit
Aucune commission prélevée sur votre mission freelance.
Expert kubernetes /ia (h/f) : kubernetes, prometheus
Gamme solutions