Data Scientist spécialisé dans l’évaluation des LLMs
ISUPPLIERFintechPubliée il y a 3 semaines
~ 400 €/jFourchette estimée par FreelanceScope à partir du niveau d'expérience demandé : la source ne publie pas de TJM pour cette mission.
- Lieu
- Île-de-France · Sur site
- Durée
- 6 mois
- Démarrage
- 7 septembre 2026
- Expérience
- Confirmé (3-6 ans)
- Langues
- Français
- Contrat
- Freelance
Situer cette mission
Repères calculés par FreelanceScope sur les missions ouvertes de son catalogue — ils ne proviennent pas de l'annonce et n'engagent pas l'entreprise.
- Le TJM de cette mission se situe au-dessus de la médiane des 22 missions de votre métier et de votre séniorité de notre catalogue, dont la médiane est de 315 €/jour (moitié centrale : 210 à 430 €/jour).
- 4 missions data scientist sont ouvertes à Île-de-France en ce moment, sur 29 pour ce métier en France.
- 0 % des missions data scientist de notre catalogue sont ouvertes en télétravail total.
- Compétences peu demandées ailleurs dans le catalogue : LLM (68 missions). À séniorité égale, une compétence rare se négocie mieux.
Profil confirmé (3-6 ans) · Comment ces repères sont calculés
La mission
Description du poste
Dans le cadre du développement et de l’encadrement des usages de l’intelligence artificielle générative au sein de la banque, le groupe souhaite renforcer ses capacités d’évaluation, de qualification et de sécurisation des LLM.
Les LLM sont amenés à être utilisés dans différents cas d’usage métiers, que ce soit pour l’assistance aux collaborateurs, l’analyse documentaire, la génération de contenus, l’aide à la décision, l’automatisation de processus ou l’exploitation de bases de connaissances internes.
Leur adoption nécessite toutefois un cadre rigoureux afin de garantir leur performance, leur robustesse, leur sécurité, leur conformité et leur adéquation aux exigences du secteur bancaire.
La mission consiste à intervenir en tant que Data Scientist spécialisé dans l’évaluation des LLM, afin de définir et de mettre en œuvre des méthodologies d’évaluation, de benchmark et de red teaming des modèles d’IA générative utilisés, testés ou envisagés par le groupe.
Cette mission s’inscrit dans une démarche de gouvernance des modèles d’IA, de maîtrise des risques liés à l’IA générative et d’industrialisation des pratiques d’évaluation avant mise en production.
Principaux objectifs
Définir et mettre en œuvre un cadre d’évaluation des LLM adapté aux enjeux de la banque.
Évaluer les performances, limites, risques et comportements des modèles d’IA générative.
Réaliser des benchmarks comparatifs entre différents LLM, qu’ils soient internes, open source ou fournis par des éditeurs.
Concevoir et exécuter des campagnes de red teaming pour identifier les vulnérabilités, biais, hallucinations et comportements indésirables.
Contribuer à la sélection, la validation et la qualification des modèles LLM avant usage ou mise en production.
Produire des analyses objectives permettant d’éclairer les décisions métiers, techniques, risques et conformité.
Participer à l’industrialisation des processus d’évaluation des LLM dans le cycle de vie des modèles d’IA.
Contribuer à la constitution de jeux de tests, métriques, référentiels d’évaluation et outils de suivi.
Activités principalesÉvaluation des LLM
Définir les protocoles d’évaluation adaptés aux cas d’usage d’IA générative de la banque.
Identifier les métriques pertinentes pour mesurer la qualité des réponses générées : exactitude, pertinence, cohérence, complétude, factualité, robustesse, sécurité, explicabilité et conformité.
Évaluer les capacités des modèles sur différents types de tâches : résumé, extraction d’information, classification, question-réponse, génération de texte, analyse documentaire, raisonnement, traduction ou reformulation.
Mettre en place des jeux de tests représentatifs des usages métiers bancaires.
Compétences attendues
Indispensables
- LLM
- Documentation


