Mon Consultant Indépendant
Dans le cadre de l'exploitation, de l'évolution et de l'industrialisation d'une plateforme IA basée sur OpenShift AI, un expert technique est recherché pour intervenir sur les activités de RUN, d'automatisation et de transformation. Intégré à une équipe existante, il jouera un rôle clé dans la mise en œuvre d'une feuille de route de transformation (issue d'un audit/cadrage préalable), l'accompagnement et la formation des équipes d'exploitation, ainsi que la montée en compétence du Service Owner. Objectifs et livrables : • Assurer l'administration, le maintien en conditions opérationnelles (MCO) et la supervision des plateformes OpenShift AI / Kubernetes (workloads, namespaces, quotas, certificats, accès, patching, montées de version). • Traiter et suivre les incidents et les demandes de support. • Gérer l'infrastructure et la plateforme : clusters sur VMware et BareMetal, stockage (ODF), ressources GPU (NVIDIA, MIG Profiles), et réseaux (Ingress, Network Policies, exposition des services). • Administrer la brique OpenShift AI & MLOps : Data Science Projects, Workbenches, Model Serving (ModelMesh), pipelines ML et accompagnement des équipes Data Science. • Mettre en œuvre les actions d'automatisation, d'industrialisation, de GitOps et de CI/CD (Helm, ArgoCD, Tekton). • Accompagner la mise en œuvre de la roadmap de transformation et d'industrialisation de la plateforme. • Rédiger la documentation des procédures et des bonnes pratiques. • Former les équipes du RUN, accompagner le Service Owner et assurer le transfert complet de compétences. Compétences requises : • Expertise confirmée sur OpenShift et Kubernetes. • Expérience significative et indispensable sur OpenShift AI. • Solides compétences MLOps, architectures IA et gestion/optimisation des GPU (NVIDIA GPU Operator, MIG Profiles). • Maîtrise des composants MLOps : ModelMesh, Kubeflow / RHODS Pipelines, vLLM (apprécié). • Maîtrise des pratiques et outils d'automatisation, d'industrialisation et CI/CD : GitOps, ArgoCD, Helm, Tekton. • Compétences en observabilité : Prometheus, Grafana, Alertmanager, Loki / Elastic. • Compétences en sécurité, gouvernance et gestion d'infrastructure : RBAC, OpenShift ACS, ACM (Advanced Cluster Management), Quay Enterprise, VMware, BareMetal, OpenShift Data Foundation (ODF).