Mission freelance Ingénieur Optimisateur vLLM
Bry-sur-Marne (94)
Mindquest
Partager cette offre
Auditer l’architecture d’inférence existante et identifier les axes d’optimisation.
Évaluer la scalabilité, les performances et la résilience de l’architecture cible.
Optimiser le serving des modèles avec vLLM et Triton : cache KV, prefix caching, parallélisme, streaming, sorties JSON et tool calling.
Intégrer et configurer une gateway LLM multi-tenant proposant une API homogène pour les modèles internes et externes.
Définir les mécanismes de routage, d’authentification, de gestion des identités, de quotas, de traçabilité et de suivi des coûts.
Organiser la ségrégation et la priorisation des charges entre usages batch et interactifs.
Concevoir et exécuter des campagnes de tests de charge sur des workloads mixtes.
Identifier les goulots d’étranglement et valider le comportement de la plateforme en cas de forte contention ou de bascule de modèles.
Définir une stratégie de mutualisation GPU : MIG, time-slicing, scale-to-zero, préchargement des modèles et placement selon l’empreinte VRAM.
Produire les livrables suivants :
rapport d’audit de l’existant ;
dossier d’architecture technique cible ;
rapport de tests de charge et de résilience ;
plan de capacité matériel et logiciel à 6–12 mois.
Profil recherché
AI Infrastructure Engineer ou expert en plateformes GPU disposant d’au moins quatre ans d’expérience en environnement de production.
Maîtrise avancée des architectures d’inférence et du serving de modèles IA.
Expertise approfondie de vLLM et Triton.
Expérience dans l’optimisation et le partage de ressources GPU sur Kubernetes on-premise.
Maîtrise des gateways LLM multi-tenant : routage, identités, quotas, rate limiting et traçabilité.
Expertise en benchmarking et en conception de scénarios de stress-test réalistes.
Bonne connaissance des architectures OIDC, OAuth 2.0 et SSO.
Maîtrise de Prometheus et Grafana pour l’observabilité et la métrologie.
Capacité à formaliser des SLA différenciés entre workloads interactifs et batch.
Excellentes capacités d’analyse, de documentation et de rédaction technique en français.
Capacité à produire des dossiers d’architecture, rapports d’audit et rapports de benchmarks.
Environnement de travail
Mission au sein de la tribu dédiée à l’intégration de l’intelligence artificielle d’un grand acteur public français.
Intervention dans une équipe Factory composée de trois profils Ops, trois Data Engineers et un chef de projet.
Plateforme d’inférence IA mutualisée, déployée sur une infrastructure Kubernetes on-premise et un parc de GPU NVIDIA.
Environnement multi-modèles et multi-moteurs couvrant les LLM génératifs, embeddings texte et image, cross-encoders, OCR et vision.
Workloads mixtes combinant traitements batch massifs et usages interactifs soumis à des exigences de disponibilité et de latence.
Enjeux de souveraineté, de mutualisation des ressources GPU, de gouvernance des accès et de montée en charge à horizon 6 à 12 mois.
Découvrir Mindquest
Postulez à cette offre !
Trouvez votre prochaine mission parmi +8 000 offres !
Fixez vos conditions
Rémunération, télétravail... Définissez tous les critères importants pour vous.
Faites-vous chasser
Les recruteurs viennent directement chercher leurs futurs talents dans notre CVthèque.
100% gratuit
Aucune commission prélevée sur votre mission freelance.
Ingénieur Optimisateur vLLM
Mindquest