Share this job
Auditer l’architecture d’inférence existante et identifier les axes d’optimisation.
Évaluer la scalabilité, les performances et la résilience de l’architecture cible.
Optimiser le serving des modèles avec vLLM et Triton : cache KV, prefix caching, parallélisme, streaming, sorties JSON et tool calling.
Intégrer et configurer une gateway LLM multi-tenant proposant une API homogène pour les modèles internes et externes.
Définir les mécanismes de routage, d’authentification, de gestion des identités, de quotas, de traçabilité et de suivi des coûts.
Organiser la ségrégation et la priorisation des charges entre usages batch et interactifs.
Concevoir et exécuter des campagnes de tests de charge sur des workloads mixtes.
Identifier les goulots d’étranglement et valider le comportement de la plateforme en cas de forte contention ou de bascule de modèles.
Définir une stratégie de mutualisation GPU : MIG, time-slicing, scale-to-zero, préchargement des modèles et placement selon l’empreinte VRAM.
Produire les livrables suivants :
rapport d’audit de l’existant ;
dossier d’architecture technique cible ;
rapport de tests de charge et de résilience ;
plan de capacité matériel et logiciel à 6–12 mois.
Candidate profile
AI Infrastructure Engineer ou expert en plateformes GPU disposant d’au moins quatre ans d’expérience en environnement de production.
Maîtrise avancée des architectures d’inférence et du serving de modèles IA.
Expertise approfondie de vLLM et Triton.
Expérience dans l’optimisation et le partage de ressources GPU sur Kubernetes on-premise.
Maîtrise des gateways LLM multi-tenant : routage, identités, quotas, rate limiting et traçabilité.
Expertise en benchmarking et en conception de scénarios de stress-test réalistes.
Bonne connaissance des architectures OIDC, OAuth 2.0 et SSO.
Maîtrise de Prometheus et Grafana pour l’observabilité et la métrologie.
Capacité à formaliser des SLA différenciés entre workloads interactifs et batch.
Excellentes capacités d’analyse, de documentation et de rédaction technique en français.
Capacité à produire des dossiers d’architecture, rapports d’audit et rapports de benchmarks.
Working environment
Mission au sein de la tribu dédiée à l’intégration de l’intelligence artificielle d’un grand acteur public français.
Intervention dans une équipe Factory composée de trois profils Ops, trois Data Engineers et un chef de projet.
Plateforme d’inférence IA mutualisée, déployée sur une infrastructure Kubernetes on-premise et un parc de GPU NVIDIA.
Environnement multi-modèles et multi-moteurs couvrant les LLM génératifs, embeddings texte et image, cross-encoders, OCR et vision.
Workloads mixtes combinant traitements batch massifs et usages interactifs soumis à des exigences de disponibilité et de latence.
Enjeux de souveraineté, de mutualisation des ressources GPU, de gouvernance des accès et de montée en charge à horizon 6 à 12 mois.
Discover Mindquest
Apply to this job!
Find your next career move from +8,000 jobs!
Manage your visibility
Salary, remote work... Define all the criteria that are important to you.
Get discovered
Recruiters come directly to look for their future hires in our CV library.
Join a community
Connect with like-minded tech and IT professionals on a daily basis through our forum.
Ingénieur Optimisateur vLLM
Mindquest