Trouvez votre prochaine offre d’emploi ou de mission freelance Benchmarking

Votre recherche renvoie 29 résultats.
Freelance
CDI
CDD

Offre d'emploiData scientist - Expert(e) en IA spécialisé(e) - N3

KEONI CONSULTING
Publiée le
Benchmarking
Cybersécurité
Python

18 mois
20k-60k €
160-500 €
Toulouse, Occitanie
Contexte Objectif global : Développer IA au sein du SOC 2 Au sein de notre SOC, nous intégrons des technologies d'Intelligence Artificielle Générative pour automatiser l'analyse de menaces, contextualiser les alertes de sécurité et assister nos analystes. Nous recherchons un(e) Expert(e) en IA spécialisé(e) dans l'entraînement, l'alignement et l'évaluation de Modèles de Langage (LLM/SLM) afin de concevoir des modèles souverains, ultra-spécialisés en cybersécurité. En collaboration directe avec l'équipe R&D Cyber et l'équipe SOC, le/la consultant(e) aura pour missions de : MISSIONS Fine-tuning de modèles : Adapter et spécialiser des LLM open-source (Llama, Mistral, Qwen...) sur des données de cybersécurité (logs, rapports CTI, playbooks). Alignement et limitation des hallucinations : Mettre en œuvre des techniques d'apprentissage par renforcement pour s'assurer que les modèles génèrent des réponses précises, sécurisées et sans biais/hallucinations (crucial pour le SOC). Formatage et structuration des données : Définir et appliquer les meilleurs formats de prompt et de conversation pour l'entraînement. Évaluation et Benchmarking : Mettre en place des pipelines d'évaluation rigoureux pour mesurer la performance des modèles spécialisés "Cyber" par rapport aux standards du marché.
Voir cette offre
Freelance

Mission freelanceSenior data project manager | security master, benchmarks & aladdin migration

Mon Consultant Indépendant
Publiée le
Data quality
ETL (Extract-transform-load)
Python

4 mois
500-550 €
Bruxelles, Bruxelles-Capitale, Belgique
Mission de l'équipe : Dans le cadre de l'intégration d'une activité majeure au sein d'un acteur international de l'Asset Management, l'équipe recherche une expertise senior en gestion de projets Data, disposant d'une forte connaissance des données référentielles Asset Management. La mission s'inscrit dans un program me de migration des données et processus vers la plateforme Aladdin, avec un enjeu central autour des référentiels Security Master, instruments financiers et benchmarks. L'objectif est de sécuriser la migration, l'intégration et la qualité des données de référence tout au long de la transition. 1. Migration et intégration des données référentielles La mission interviendra sur la migration et l'intégration dans Aladdin des données de référence liées notamment : · Au Security Master · Aux instruments financiers · Aux benchmarks Le consultant contribuera à garantir l'intégrité, la cohérence et la disponibilité des données migrées. 2. Définition des besoins et mappings Data En collaboration avec les équipes internes, la mission devra : · Définir et valider les besoins en données · Construire et valider les mappings nécessaires à la migration · Identifier les données requises qui ne sont pas disponibles nativement dans le PMS · Définir les modalités permettant de rendre ces données disponibles dans l'environnement cible 3. Spécifications et coordination des équipes Pour les données non disponibles nativement dans le PMS, le consultant devra rédiger les spécifications techniques nécessaires à leur mise à disposition. Il assurera ensuite la coordination avec les équipes concernées, notamment IT, ESG et autres équipes contributrices, afin d'accompagner leur implémentation. 4. Tests, réconciliations et validation La mission participera aux différentes étapes de sécurisation de la migration : · Tests des données et processus · Réconciliations entre environnements · Contrôle de l'intégrité et de la cohérence des données · Validation des processus migrés
Voir cette offre
Freelance

Mission freelanceSenior Data Project Manager | Security Master, Benchmarks & Aladdin Migration

NOVAMINDS
Publiée le
Data management
Finance
Migration

4 mois
650 €
Bruxelles, Bruxelles-Capitale, Belgique
Mission de l'équipe : Dans le cadre de l'intégration d'une activité majeure au sein d'un acteur international de l'Asset Management, l'équipe recherche une expertise senior en gestion de projets Data, disposant d'une forte connaissance des données référentielles Asset Management. La mission s'inscrit dans un programme de migration des données et processus vers la plateforme Aladdin, avec un enjeu central autour des référentiels Security Master, instruments financiers et benchmarks. L'objectif est de sécuriser la migration, l'intégration et la qualité des données de référence tout au long de la transition. 1. Migration et intégration des données référentielles La mission interviendra sur la migration et l'intégration dans Aladdin des données de référence liées notamment : • au Security Master • aux instruments financiers • aux benchmarks Le consultant contribuera à garantir l'intégrité, la cohérence et la disponibilité des données migrées. 2. Définition des besoins et mappings Data En collaboration avec les équipes internes, la mission devra : • Définir et valider les besoins en données • Construire et valider les mappings nécessaires à la migration • Identifier les données requises qui ne sont pas disponibles nativement dans le PMS • Définir les modalités permettant de rendre ces données disponibles dans l'environnement cible 3. Spécifications et coordination des équipes Pour les données non disponibles nativement dans le PMS, le consultant devra rédiger les spécifications techniques nécessaires à leur mise à disposition. Il assurera ensuite la coordination avec les équipes concernées, notamment IT, ESG et autres équipes contributrices, afin d'accompagner leur implémentation. 4. Tests, réconciliations et validation La mission participera aux différentes étapes de sécurisation de la migration : • Tests des données et processus • Réconciliations entre environnements • Contrôle de l'intégrité et de la cohérence des données • Validation des processus migrés Prestations demandées Les principales responsabilités seront les suivantes : • Piloter les sujets Data associés à la migration vers Aladdin • Accompagner la migration du Security Master et des données de benchmarks • Définir et valider les besoins Data et mappings associés • Analyser les écarts de disponibilité des données dans le PMS • Rédiger les spécifications techniques nécessaires • Coordonner les équipes métier, Data, IT et ESG impliquées dans l'implémentation • Manipuler et analyser des volumes importants de données • Produire les analyses, conversions et KPI nécessaires au suivi de la migration • Participer aux tests, réconciliations et validations des processus • Garantir la qualité, l'intégrité et la cohérence des données migrées Secteur d'activité : Asset Management Calendrier : du 07/09/2026 au 31/12/2026, avec forte possibilité d'extension en 2027
Voir cette offre
Freelance

Mission freelanceSenior data project manager asset management | security master & benchmark data migration (Aladdin)

Mon Consultant Indépendant
Publiée le
Gestion de projet

5 mois
550-590 €
Lille, Hauts-de-France
Mission de l'équipe : Dans le cadre d'un programme stratégique de transformation au sein d'un acteur majeur de l'Asset Management, la mission consiste à accompagner la migration et l'intégration des données de référence vers la plateforme Aladdin. 1. Pilotage de la migration des données de référence La mission est responsable de l'accompagnement des travaux de migration des référentiels Security Master et Benchmark vers la plateforme Aladdin. Les principales activités consistent à : · Piloter les activités de migration des données de référence. · Coordonner les différentes parties prenantes impliquées dans le projet. · Assurer le bon déroulement des différentes phases de transition. 2. Définition et gouvernance des données La mission intervient en collaboration avec les équipes métiers et techniques afin de garantir la qualité des données migrées. Les principales responsabilités consistent à : · Recueillir et valider les besoins métiers relatifs aux données. · Définir et valider les mappings de données. · Veiller au respect des standards de gouvernance des données. · Garantir la cohérence et l'intégrité des données tout au long du processus de migration. 3. Validation et sécurisation de la migration La mission contribue à la sécurisation des livraisons de données avant leur mise en production. Les principales activités consistent à : · Participer aux campagnes de tests. · Réaliser les activités de réconciliation des données. · Valider les processus de migration. · Identifier et analyser les écarts de données. 4. Analyse des données et suivi des indicateurs La mission participe au pilotage de la qualité des données à travers l'analyse de volumes importants de données. Les principales activités consistent à : · Analyser de grands volumes de données. · Produire les analyses nécessaires aux activités de conversion des données. · Suivre les indicateurs de qualité et les KPI liés à la migration. · Contribuer à la résolution des anomalies identifiées. Prestations demandées : La mission interviendra principalement sur les activités suivantes : · Pilotage de projets Data en environnement Asset Management. · Migration des référentiels Security Master et Benchmark vers Aladdin. · Coordination des équipes métiers et IT. · Définition des besoins, mappings et règles de gouvernance des données. · Validation de la qualité, de la cohérence et de l'intégrité des données. · Participation aux tests, réconciliations et validations fonctionnelles. · Analyse de jeux de données volumineux et suivi des KPI. · Contribution au bon déroulement des différentes phases du projet.
Voir cette offre
Freelance

Mission freelanceChef de projet data senior | migration Aladdin, security master & référentiels benchmarks

Mon Consultant Indépendant
Publiée le
Gestion de projet

5 mois
610-660 €
Lille, Hauts-de-France
Mission de l'équipe : Dans le cadre de l'intégration d'une activité de gestion d'actifs au sein d'une nouvelle organisation, un programme de migration des données et des processus est engagé vers la plateforme Aladdin. La mission a pour objectif de sécuriser la transition des données référentielles liées aux instruments financiers et aux benchmarks vers la plateforme cible. 1. Migration des données référentielles · La mission devra accompagner la migration et l'intégration des données Security Master et des données référentielles relatives aux benchmarks vers Aladdin. · L'objectif sera de garantir que les données transférées soient correctement structurées, converties et intégrées dans la plateforme cible. 2. Définition et validation des besoins data La mission travaillera en collaboration avec les équipes internes afin de définir et de valider : · Les besoins en matière de données. · Les règles de mapping entre les systèmes sources et la plateforme cible. · Les standards de gouvernance applicables aux données migrées. · Les règles de conversion et de transformation des données. 3. Sécurisation de la qualité des données · La mission devra garantir l'intégrité, la cohérence et la fiabilité des données migrées. · Une attention particulière sera portée à l'identification des écarts, des anomalies et des incohérences susceptibles d'affecter la qualité des référentiels instruments financiers et benchmarks. 4. Tests, réconciliations et validation des processus La mission participera aux différentes phases de validation de la migration, notamment : · La préparation et l'exécution des tests. · L'analyse des résultats. · La réconciliation des données entre les systèmes sources et Aladdin. · L'identification et le suivi des écarts. · La validation des processus cibles. · La mission devra également contribuer à la production et au suivi d'indicateurs permettant de mesurer la qualité, la complétude et la fiabilité des données migrées. Prestations demandées : La mission interviendra principalement sur les activités suivantes : · Piloter les travaux data liés à la migration vers Aladdin. · Accompagner la migration des référentiels Security Master et Benchmark. · Définir et valider les besoins data avec les équipes concernées. · Formaliser et valider les règles de mapping et de conversion. · Contribuer à la définition et à l'application des standards de gouvernance des données. · Analyser et manipuler des volumes importants de données. · Garantir l'intégrité et la cohérence des données migrées. · Préparer et exécuter les campagnes de tests. · Réaliser les réconciliations entre les données sources et les données intégrées dans Aladdin. · Analyser les écarts et contribuer à leur résolution. · Participer à la validation des processus cibles. · Produire et suivre les KPI liés à la migration et à la qualité des données. · Coordonner les travaux avec les différentes équipes internes. · Intervenir efficacement dans un environnement exigeant et soumis à de fortes contraintes opérationnelles. Expertises : · Gestion de projets Data en environnement Asset Management · Migration et intégration de données · Référentiels instruments financiers · Référentiels benchmarks et indices financiers · Security Master Data · Data Mapping · Conversion et transformation de données · Data Governance · Data Quality · Analyse de volumes importants de données · Tests et validation de migration · Réconciliation de données · Production et suivi de KPI · Coordination de parties prenantes Compétences requises : Secteur : Asset Management Métiers : · Chef de Projet Data · Data Project Manager · Data Migration Project Manager · Data Management Officer · Security Master Data Specialist · Referential Data Specialist · Périmètre fonctionnel · Migration de données référentielles · Intégration de données dans Aladdin · Gestion des référentiels instruments financiers · Gestion des référentiels benchmarks · Définition des besoins data · Mapping et conversion de données · Gouvernance et qualité des données · Tests et réconciliations · Validation des processus · Suivi des KPI de migration · Solution / outil : Aladdin · Security Master
Voir cette offre
Freelance

Mission freelanceSenior Data Project Manager Asset Management | Security Master & Benchmark Data Migration (Aladdin)

NOVAMINDS
Publiée le
Data governance

5 mois
700 €
Lille, Hauts-de-France
Mission de l'équipe :Dans le cadre d'un programme stratégique de transformation au sein d'un acteur majeur de l'Asset Management, la mission consiste à accompagner la migration et l'intégration des données de référence vers la plateforme Aladdin. L'objectif est de garantir une transition fiable, cohérente et sécurisée des référentiels de données, en assurant la qualité, l'intégrité et la gouvernance des données tout au long du projet. La mission s'inscrit dans un environnement international, à forts enjeux métier, où la qualité des données constitue un facteur clé de succès. 1. Pilotage de la migration des données de référenceLa mission est responsable de l'accompagnement des travaux de migration des référentiels Security Master et Benchmark vers la plateforme Aladdin. Les principales activités consistent à : Piloter les activités de migration des données de référence. Coordonner les différentes parties prenantes impliquées dans le projet. Assurer le bon déroulement des différentes phases de transition. 2. Définition et gouvernance des donnéesLa mission intervient en collaboration avec les équipes métiers et techniques afin de garantir la qualité des données migrées. Les principales responsabilités consistent à : Recueillir et valider les besoins métiers relatifs aux données. Définir et valider les mappings de données. Veiller au respect des standards de gouvernance des données. Garantir la cohérence et l'intégrité des données tout au long du processus de migration. 3. Validation et sécurisation de la migrationLa mission contribue à la sécurisation des livraisons de données avant leur mise en production. Les principales activités consistent à : Participer aux campagnes de tests. Réaliser les activités de réconciliation des données. Valider les processus de migration. Identifier et analyser les écarts de données. 4. Analyse des données et suivi des indicateursLa mission participe au pilotage de la qualité des données à travers l'analyse de volumes importants de données. Les principales activités consistent à : Analyser de grands volumes de données. Produire les analyses nécessaires aux activités de conversion des données. Suivre les indicateurs de qualité et les KPI liés à la migration. Contribuer à la résolution des anomalies identifiées. Prestations demandées La mission interviendra principalement sur les activités suivantes : Pilotage de projets Data en environnement Asset Management. Migration des référentiels Security Master et Benchmark vers Aladdin. Coordination des équipes métiers et IT. Définition des besoins, mappings et règles de gouvernance des données. Validation de la qualité, de la cohérence et de l'intégrité des données. Participation aux tests, réconciliations et validations fonctionnelles. Analyse de jeux de données volumineux et suivi des KPI. Contribution au bon déroulement des différentes phases du projet.
Voir cette offre
Freelance

Mission freelance[LFR] Expert en Intelligence Artificielle et Modèles de Langage - 1839

ISUPPLIER
Publiée le

10 mois
300-395 €
Toulouse, Occitanie
Missions : - Adapter et spécialiser des modèles de langage open source sur des jeux de données métier. - Mettre en œuvre des techniques d'alignement visant à améliorer la pertinence, la fiabilité et la qualité des réponses générées. - Définir les formats de données, prompts et structures conversationnelles adaptés à l'entraînement des modèles. - Concevoir et industrialiser des processus rigoureux d'évaluation et de benchmark des performances des modèles. - Participer à l'amélioration continue des méthodes d'apprentissage et d'optimisation des modèles. - Accompagner les équipes techniques sur les sujets liés à l'intelligence artificielle générative. - Compétences techniques requises - Fine-Tuning de modèles - Maîtrise des techniques d'adaptation de modèles de langage telles que LoRA et QLoRA. - Expérience sur des frameworks spécialisés de fine-tuning (Unsloth, Axolotl, TRL ou équivalent). - Structuration et préparation des données - Expérience dans la conception et la structuration de jeux de données d'entraînement. - Maîtrise des formats conversationnels utilisés pour les modèles génératifs (ChatML, Alpaca ou équivalent). - Alignement et optimisation - Mise en œuvre de méthodes d'optimisation des réponses basées sur l'apprentissage par renforcement ou les préférences. - Connaissance des frameworks d'alignement tels que TRL, OpenRLHF, verl ou solutions similaires. - Évaluation et benchmarking - Conception de protocoles de validation et de mesure des performances. - Utilisation de benchmarks standards et d'outils d'évaluation comparative des modèles. - Compétences complémentaires appréciées - Intérêt pour les problématiques liées à la sécurité informatique ou aux systèmes complexes. - Connaissance des plateformes de déploiement et d'inférence de modèles d'IA. - Excellente maîtrise de Python et de PyTorch. - Connaissance des environnements MLOps et des outils d'industrialisation IA. - - Expert en Intelligence Artificielle et Modèles de Langage - Description de mission anonymisée - Dans le cadre d'un programme d'innovation technologique, nous recherchons un(e) Expert(e) en Intelligence Artificielle spécialisé(e) dans les Modèles de Langage (LLM/SLM) afin de concevoir, adapter et évaluer des modèles de traitement du langage naturel dédiés à des cas d'usage métier à forte valeur ajoutée. - En collaboration avec les équipes techniques et les équipes métier, le consultant interviendra sur les activités suivantes :
Voir cette offre
Freelance
CDI

Offre d'emploiConsultant Cybersécurité SAST

VISIAN
Publiée le
API
Static Application Security Testing (SAST)

1 an
Île-de-France, France
ContexteAu sein des équipes Cybersécurité d'une grande institution financière internationale, le prestataire aura pour rôle de cadrer l'évaluation, le benchmarking et la validation d'outils de sécurité applicative SAST de nouvelle génération. L'objectif principal est de définir et de superviser l'exécution de plans de tests comparatifs rigoureux entre les solutions SAST traditionnelles et les outils de détection émergents basés sur l'IA agentique, afin de piloter la modernisation de la stack sécurité. Bien que le cœur de la mission soit le projet de benchmarking, le prestataire contribuera également aux activités courantes (BAU), notamment l'amélioration continue des outils de sécurité agentiques, l'analyse de vulnérabilités et les contrôles de release. MissionsBenchmarking, Tests & Validation SAST Piloter une étude structurée comparant le SAST traditionnel au SAST de nouvelle génération (basé sur harness/agentique) S'assurer que tous les outils évalués répondent aux exigences entreprise strictes en matière d'authentification, d'auditabilité et de gestion des données Soutenir le cycle de vie des tests en assistant à leur exécution et en réalisant des analyses de vulnérabilités avancées Activités BAU & Contribution continue Apporter une expertise AppSec opérationnelle en analysant les vulnérabilités remontées par les outils SAST/SCA et en effectuant un triage manuel pour distinguer les problèmes exploitables des faux positifs Participer à l'industrialisation et au déploiement des contrôles de sécurité dans le processus de release entreprise Fournir aux équipes de développement des recommandations de correction au niveau du code et des patterns de développement sécurisé Environnement techniqueOutils de sécurité : Outils SAST/SCA (Fortify, NexusIQ) DevSecOps : Git (workflows avancés), CI/CD (Jenkins / GitHub Actions, Artifactory), Docker Langages : Java (principal) / Python / TypeScript / .Net IA/ML : LLMs (RAG, fine-tuning, prompt engineering), harness engineering Standards de sécurité : Sécurité LLM (OWASP Top 10 pour les LLMs), OWASP Top 10, NIST, ISO 27001, fondamentaux AppSec Livrables attendusRapport d'analyse comparative des scans – Fortify vs. outil agentique/alternatif Un rapport de benchmarking structuré comparant les résultats de scan entre Fortify et un outil alternatif sélectionné (agentique ou SAST traditionnel), couvrant : Couverture de détection : taux de vrais positifs, taux de faux positifs et vulnérabilités manquées sur un ensemble représentatif de bases de code Cohérence de classification des vulnérabilités : alignement avec l'OWASP Top 10, la taxonomie CWE et le scoring de sévérité Évaluation qualitative : explicabilité des résultats, qualité des recommandations de remédiation, expérience développeur et friction d'intégration Métriques opérationnelles : durée des scans, consommation de ressources et compatibilité CI/CD Une matrice de recommandation finale pour soutenir les décisions outillage, garantissant un niveau équivalent ou des fonctionnalités améliorées dans le nouvel outil Critères d'acceptation de sécurité pour les outils de scan de code Un document de référence formel définissant les exigences de sécurité minimales qu'un outil de scan de code doit satisfaire avant d'être intégré dans l'environnement de l'institution, s'appuyant sur des bases existantes adaptées aux outillages spécifiques, incluant : Authentification & contrôle d'accès : support SSO/SAML, RBAC, gestion des comptes de service et politiques de rotation des clés API Audit & journalisation : exhaustivité des pistes d'audit, standards de format de logs (ex. CEF/JSON) Gestion des données & confidentialité : risque d'exposition du code source, contraintes de résidence des données, chiffrement au repos et en transit Sécurité de la chaîne d'approvisionnement : intégrité des dépendances et transparence du processus de mise à jour
Voir cette offre
Freelance

Mission freelanceConsultant Senior / Expert BI as Code & Analytics IA Freelance

Actual Talent
Publiée le
CI/CD
Claude
CSS

3 jours
650 €
Paris, France
Au sein de nos équipes Data, nous menons actuellement une étude comparative sur le renouvellement de nos usages BI/Dataviz, avec une forte orientation vers les approches BI as Code et l'intégration de l'IA. Plusieurs pistes sont à l'étude : Lightdash, Evidence.dev, Hex, ainsi qu'une approche expérimentale sur-mesure générée par IA (via Claude). Avant d'engager le déploiement opérationnel, nous recherchons un partenaire expert pour finaliser ce benchmark, pousser les outils dans leurs retranchements et sécuriser nos choix d'architecture technique. Vos missions Dans le cadre d'un mini-sprint de 2 à 3 jours, votre intervention s'articulera autour de 4 axes majeurs : Benchmarking final des solutions BI as Code : Pousser Lightdash au maximum de ses capacités fonctionnelles et techniques, et benchmarker de manière comparative Evidence et Hex. Évaluation de l'approche Custom IA : Tester et évaluer la viabilité d'une alternative sur-mesure, générée et packagée via de l'IA pure (Claude). Retour d'Expérience (REX) & Matrice comparative : Structurer un comparatif objectif (coûts, gouvernance, DX, adoption métier, limites techniques) entre ces différentes approches. Sécurisation de l'Architecture : Formuler des préconisations concrètes pour verrouiller les choix d'architecture et la feuille de route de mise en œuvre globale.
Voir cette offre
Freelance

Mission freelanceData Scientist spécialisé dans l’évaluation des LLMs

ISUPPLIER
Publiée le
Data science
IA Générative
MLOps

100 jours
400-550 €
Île-de-France, France
Description du poste Dans le cadre du développement et de l'encadrement des usages de l'intelligence artificielle générative au sein de la banque, le groupe souhaite renforcer ses capacités d'évaluation, de qualification et de sécurisation des LLM. Les LLM sont amenés à être utilisés dans différents cas d'usage métiers, que ce soit pour l'assistance aux collaborateurs, l'analyse documentaire, la génération de contenus, l'aide à la décision, l'automatisation de processus ou l'exploitation de bases de connaissances internes. Leur adoption nécessite toutefois un cadre rigoureux afin de garantir leur performance, leur robustesse, leur sécurité, leur conformité et leur adéquation aux exigences du secteur bancaire. La mission consiste à intervenir en tant que Data Scientist spécialisé dans l'évaluation des LLM, afin de définir et de mettre en œuvre des méthodologies d'évaluation, de benchmark et de red teaming des modèles d'IA générative utilisés, testés ou envisagés par le groupe. Cette mission s'inscrit dans une démarche de gouvernance des modèles d'IA, de maîtrise des risques liés à l'IA générative et d'industrialisation des pratiques d'évaluation avant mise en production. Principaux objectifs Définir et mettre en œuvre un cadre d'évaluation des LLM adapté aux enjeux de la banque. Évaluer les performances, limites, risques et comportements des modèles d'IA générative. Réaliser des benchmarks comparatifs entre différents LLM, qu'ils soient internes, open source ou fournis par des éditeurs. Concevoir et exécuter des campagnes de red teaming pour identifier les vulnérabilités, biais, hallucinations et comportements indésirables. Contribuer à la sélection, la validation et la qualification des modèles LLM avant usage ou mise en production. Produire des analyses objectives permettant d'éclairer les décisions métiers, techniques, risques et conformité. Participer à l'industrialisation des processus d'évaluation des LLM dans le cycle de vie des modèles d'IA. Contribuer à la constitution de jeux de tests, métriques, référentiels d'évaluation et outils de suivi. Activités principalesÉvaluation des LLM Définir les protocoles d'évaluation adaptés aux cas d'usage d'IA générative de la banque. Identifier les métriques pertinentes pour mesurer la qualité des réponses générées : exactitude, pertinence, cohérence, complétude, factualité, robustesse, sécurité, explicabilité et conformité. Évaluer les capacités des modèles sur différents types de tâches : résumé, extraction d'information, classification, question-réponse, génération de texte, analyse documentaire, raisonnement, traduction ou reformulation. Mettre en place des jeux de tests représentatifs des usages métiers bancaires. Analyser les performances des modèles selon différents contextes, langues, domaines métiers et niveaux de complexité. Identifier les limites fonctionnelles et techniques des modèles testés. Documenter les résultats d'évaluation et formuler des recommandations. Benchmark LLM Concevoir et conduire des benchmarks comparatifs entre plusieurs modèles LLM. Comparer les modèles selon des critères de performance, coût, latence, robustesse, sécurité, empreinte technique et conformité. Tester différents modèles propriétaires, open source ou internes selon les contraintes du groupe. Mettre en place des grilles d'analyse permettant d'aider au choix des modèles selon les cas d'usage. Évaluer l'impact de différents paramètres : prompt, température, taille de contexte, modèle d'embedding, architecture RAG, fine-tuning ou quantization. Produire des rapports de benchmark clairs, exploitables par les équipes métiers, data, IT, sécurité et conformité. Participer à la définition de standards internes pour la comparaison et la qualification des LLM. Red teaming et sécurité des LLM Définir et exécuter des scénarios de red teaming adaptés aux risques liés à l'IA générative. Tester la résistance des modèles face aux attaques de type prompt injection, jailbreak, data leakage, contournement de garde-fous, génération de contenu inapproprié ou non conforme. Identifier les risques d'hallucination, de biais, de toxicité, de désinformation ou de réponses dangereuses. Concevoir des corpus de prompts adversariaux adaptés aux contextes bancaires et réglementaires. Évaluer la capacité des modèles à respecter les politiques internes, les règles de conformité et les contraintes de sécurité. Analyser les vulnérabilités détectées et proposer des mesures de mitigation. Collaborer avec les équipes sécurité, conformité, risques et architecture pour renforcer le cadre d'usage des LLM. Méthodologie, outillage et industrialisation Mettre en place des outils, notebooks, scripts ou pipelines d'évaluation automatisée. Contribuer à l'industrialisation des campagnes d'évaluation dans le cycle de vie des modèles. Définir des référentiels de métriques et de seuils d'acceptabilité. Construire et maintenir des datasets d'évaluation internes, anonymisés et représentatifs. Participer à l'intégration des résultats d'évaluation dans les outils de gouvernance des modèles, notamment ModelHub v2. Assurer la traçabilité des campagnes d'évaluation, des versions de modèles et des résultats obtenus. Mettre en place des tableaux de bord ou rapports de suivi de la qualité des LLM. Contribuer à la veille technologique sur les méthodes d'évaluation, frameworks de benchmark et pratiques de red teaming LLM. Livrables attendus Cadre méthodologique d'évaluation des LLM adapté aux usages bancaires. Protocoles de test et grilles d'évaluation des modèles d'IA générative. Jeux de tests et datasets d'évaluation documentés. Corpus de prompts de benchmark et de red teaming. Rapports d'évaluation des LLM testés. Rapports de benchmark comparatif entre modèles. Analyses de risques liées aux comportements des LLM. Synthèses des vulnérabilités identifiées lors des campagnes de red teaming. Recommandations de mitigation et plans d'amélioration. Tableaux de bord ou indicateurs de suivi de performance et de sécurité. Scripts, notebooks ou pipelines d'évaluation automatisée. Documentation des métriques, seuils et critères de validation. Recommandations pour la sélection et la mise en production des modèles. Contributions à l'intégration des résultats d'évaluation dans ModelHub v2 ou tout autre outil de gouvernance IA. Supports de présentation à destination des équipes métiers, techniques,
Voir cette offre

Au service des talents IT

Free-Work est une plateforme qui s'adresse à tous les professionnels des métiers de l'informatique.

Ses contenus et son jobboard IT sont mis à disposition 100% gratuitement pour les indépendants et les salariés du secteur.

Free-workers
Ressources
A propos
Espace recruteurs
2026 © Free-Work / AGSI SAS
Suivez-nous