
Mission freelance Data Scientist spécialisé dans l’évaluation des LLMs
Île-de-France
ISUPPLIER
Partager cette offre
Description du poste
Dans le cadre du développement et de l’encadrement des usages de l’intelligence artificielle générative au sein de la banque, le groupe souhaite renforcer ses capacités d’évaluation, de qualification et de sécurisation des LLM.
Les LLM sont amenés à être utilisés dans différents cas d’usage métiers, que ce soit pour l’assistance aux collaborateurs, l’analyse documentaire, la génération de contenus, l’aide à la décision, l’automatisation de processus ou l’exploitation de bases de connaissances internes.
Leur adoption nécessite toutefois un cadre rigoureux afin de garantir leur performance, leur robustesse, leur sécurité, leur conformité et leur adéquation aux exigences du secteur bancaire.
La mission consiste à intervenir en tant que Data Scientist spécialisé dans l’évaluation des LLM, afin de définir et de mettre en œuvre des méthodologies d’évaluation, de benchmark et de red teaming des modèles d’IA générative utilisés, testés ou envisagés par le groupe.
Cette mission s’inscrit dans une démarche de gouvernance des modèles d’IA, de maîtrise des risques liés à l’IA générative et d’industrialisation des pratiques d’évaluation avant mise en production.
Principaux objectifs
Définir et mettre en œuvre un cadre d’évaluation des LLM adapté aux enjeux de la banque.
Évaluer les performances, limites, risques et comportements des modèles d’IA générative.
Réaliser des benchmarks comparatifs entre différents LLM, qu’ils soient internes, open source ou fournis par des éditeurs.
Concevoir et exécuter des campagnes de red teaming pour identifier les vulnérabilités, biais, hallucinations et comportements indésirables.
Contribuer à la sélection, la validation et la qualification des modèles LLM avant usage ou mise en production.
Produire des analyses objectives permettant d’éclairer les décisions métiers, techniques, risques et conformité.
Participer à l’industrialisation des processus d’évaluation des LLM dans le cycle de vie des modèles d’IA.
Contribuer à la constitution de jeux de tests, métriques, référentiels d’évaluation et outils de suivi.
Activités principalesÉvaluation des LLM
Définir les protocoles d’évaluation adaptés aux cas d’usage d’IA générative de la banque.
Identifier les métriques pertinentes pour mesurer la qualité des réponses générées : exactitude, pertinence, cohérence, complétude, factualité, robustesse, sécurité, explicabilité et conformité.
Évaluer les capacités des modèles sur différents types de tâches : résumé, extraction d’information, classification, question-réponse, génération de texte, analyse documentaire, raisonnement, traduction ou reformulation.
Mettre en place des jeux de tests représentatifs des usages métiers bancaires.
Analyser les performances des modèles selon différents contextes, langues, domaines métiers et niveaux de complexité.
Identifier les limites fonctionnelles et techniques des modèles testés.
Documenter les résultats d’évaluation et formuler des recommandations.
Benchmark LLM
Concevoir et conduire des benchmarks comparatifs entre plusieurs modèles LLM.
Comparer les modèles selon des critères de performance, coût, latence, robustesse, sécurité, empreinte technique et conformité.
Tester différents modèles propriétaires, open source ou internes selon les contraintes du groupe.
Mettre en place des grilles d’analyse permettant d’aider au choix des modèles selon les cas d’usage.
Évaluer l’impact de différents paramètres : prompt, température, taille de contexte, modèle d’embedding, architecture RAG, fine-tuning ou quantization.
Produire des rapports de benchmark clairs, exploitables par les équipes métiers, data, IT, sécurité et conformité.
Participer à la définition de standards internes pour la comparaison et la qualification des LLM.
Red teaming et sécurité des LLM
Définir et exécuter des scénarios de red teaming adaptés aux risques liés à l’IA générative.
Tester la résistance des modèles face aux attaques de type prompt injection, jailbreak, data leakage, contournement de garde-fous, génération de contenu inapproprié ou non conforme.
Identifier les risques d’hallucination, de biais, de toxicité, de désinformation ou de réponses dangereuses.
Concevoir des corpus de prompts adversariaux adaptés aux contextes bancaires et réglementaires.
Évaluer la capacité des modèles à respecter les politiques internes, les règles de conformité et les contraintes de sécurité.
Analyser les vulnérabilités détectées et proposer des mesures de mitigation.
Collaborer avec les équipes sécurité, conformité, risques et architecture pour renforcer le cadre d’usage des LLM.
Méthodologie, outillage et industrialisation
Mettre en place des outils, notebooks, scripts ou pipelines d’évaluation automatisée.
Contribuer à l’industrialisation des campagnes d’évaluation dans le cycle de vie des modèles.
Définir des référentiels de métriques et de seuils d’acceptabilité.
Construire et maintenir des datasets d’évaluation internes, anonymisés et représentatifs.
Participer à l’intégration des résultats d’évaluation dans les outils de gouvernance des modèles, notamment ModelHub v2.
Assurer la traçabilité des campagnes d’évaluation, des versions de modèles et des résultats obtenus.
Mettre en place des tableaux de bord ou rapports de suivi de la qualité des LLM.
Contribuer à la veille technologique sur les méthodes d’évaluation, frameworks de benchmark et pratiques de red teaming LLM.
Livrables attendus
Cadre méthodologique d’évaluation des LLM adapté aux usages bancaires.
Protocoles de test et grilles d’évaluation des modèles d’IA générative.
Jeux de tests et datasets d’évaluation documentés.
Corpus de prompts de benchmark et de red teaming.
Rapports d’évaluation des LLM testés.
Rapports de benchmark comparatif entre modèles.
Analyses de risques liées aux comportements des LLM.
Synthèses des vulnérabilités identifiées lors des campagnes de red teaming.
Recommandations de mitigation et plans d’amélioration.
Tableaux de bord ou indicateurs de suivi de performance et de sécurité.
Scripts, notebooks ou pipelines d’évaluation automatisée.
Documentation des métriques, seuils et critères de validation.
Recommandations pour la sélection et la mise en production des modèles.
Contributions à l’intégration des résultats d’évaluation dans ModelHub v2 ou tout autre outil de gouvernance IA.
Supports de présentation à destination des équipes métiers, techniques,
Profil recherché
Expérience dans l’environnement de la prestation : 3 à 5 ans inclus.
Architecte logiciel pouvant démontrer d’une expérience tangible sur des projets d’IA :
Identification des opportunités d’automatisation et d’amélioration des processus par l’IA.
Conception et mise en œuvre de solutions basées sur l’intelligence artificielle.
Analyse et développement de systèmes d’IA adaptés à l’intégration avec les infrastructures existantes.
La séniorité doit s’entendre sur la base du temps passé sur des projets et missions spécifiquement sur l’IA.
Environnement de travail
Le Data Scientist travaillera avec les équipes suivantes :
Data science.
MLOps.
Métiers.
Risques.
Conformité.
Sécurité.
IT.
Architecture.
Il interviendra dans un environnement lié à :
La gouvernance des modèles d’IA.
La maîtrise des risques liés à l’IA générative.
L’évaluation, le benchmark et la qualification des LLM.
La sécurisation des modèles d’IA générative.
L’industrialisation des campagnes d’évaluation dans le cycle de vie des modèles.
La définition de critères de go/no-go avant la mise en production d’un modèle LLM.
La traçabilité des campagnes d’évaluation, des versions de modèles et des résultats obtenus.
La mise en place de tableaux de bord ou de rapports de suivi de la qualité des LLM.
La veille technologique sur les méthodes d’évaluation, les frameworks de benchmark et les pratiques de red teaming LLM.
Le consultant devra également :
Accompagner les équipes projets dans l’évaluation de leurs cas d’usage d’IA générative.
Présenter les résultats d’évaluation aux parties prenantes.
Contribuer aux bonnes pratiques internes d’usage, de test et de validation des LLM.
Participer aux comités de validation ou de gouvernance IA lorsque nécessaire.
Le Data Scientist spécialisé dans l’évaluation des LLM devra permettre d’objectiver les performances des modèles, d’identifier leurs risques et limites, et de fournir aux instances de gouvernance les éléments nécessaires à une prise de décision éclairée, conforme aux exigences de sécurité, de conformité et de maîtrise des risques du secteur bancaire.
Découvrir ISUPPLIER
Postulez à cette offre !
Trouvez votre prochaine mission parmi +9 000 offres !
Fixez vos conditions
Rémunération, télétravail... Définissez tous les critères importants pour vous.
Faites-vous chasser
Les recruteurs viennent directement chercher leurs futurs talents dans notre CVthèque.
100% gratuit
Aucune commission prélevée sur votre mission freelance.
Data Scientist spécialisé dans l’évaluation des LLMs
ISUPPLIER