Expert en évaluation d’agents IA
MindriftÉducationPubliée il y a 3 semaines
~ 750 – 950 €/jFourchette estimée par FreelanceScope à partir du niveau d'expérience demandé : la source ne publie pas de TJM pour cette mission.
- Lieu
- Paris · Sur site
- Durée
- 3 ans
- Démarrage
- 3 septembre 2026
- Expérience
- Expert (10 ans et +)
- Langues
- Français, Anglais
- Contrat
- Freelance
Situer cette mission
Repères calculés par FreelanceScope sur les missions ouvertes de son catalogue — ils ne proviennent pas de l'annonce et n'engagent pas l'entreprise.
- Le TJM de cette mission se situe au-dessus de la médiane des 80 missions de votre métier et de votre séniorité de notre catalogue, dont la médiane est de 595 €/jour (moitié centrale : 315 à 850 €/jour).
- 38 missions consultant cybersécurité sont ouvertes à Paris en ce moment, sur 213 pour ce métier en France.
- 0 % des missions consultant cybersécurité de notre catalogue sont ouvertes en télétravail total.
- Compétences peu demandées ailleurs dans le catalogue : Redis (6 missions), TypeScript (25 missions), React (25 missions). À séniorité égale, une compétence rare se négocie mieux.
Profil expert (10 ans et +) · Comment ces repères sont calculés
La mission
Contribuer à la création d’un jeu de données destiné à évaluer les agents IA de programmation sur leur capacité à traiter des tâches de développement réalistes.
Concevoir des environnements, tâches et critères d’évaluation permettant de mesurer de manière fiable les performances des agents IA.
Missions principales
Construire des environnements de développement réalistes comprenant une base de code, une infrastructure et un contexte de développement.
Concevoir des tâches à partir d’états intermédiaires de ces environnements, définir les critères de résolution et vérifier leur faisabilité par un agent IA.
Écrire des tests permettant de valider les solutions proposées par les agents, en acceptant les approches correctes et en rejetant les solutions incorrectes.
Analyser les solutions produites par les agents et les résultats des tests.
Itérer sur les tâches et les tests à partir des retours QA afin d’améliorer la robustesse et l’équité des évaluations.
Compétences attendues
Minimum 5 ans d’expérience en développement logiciel.
Maîtrise de Python et FastAPI.
Maîtrise de JavaScript / TypeScript et React.
Connaissance de Docker, PostgreSQL, Kafka et Redis.
Expérience dans la rédaction de tests fonctionnels et d’intégration.
Anglais niveau B2 minimum.
Capacité à analyser les limites et erreurs des modèles d’IA sur des tâches de développement.
Profil recherché
Formation Bac +5 en informatique, génie logiciel, Data Science / Data Analytics, intelligence artificielle / Machine Learning, linguistique computationnelle / NLP, systèmes d’information ou domaine connexe.
Un diplôme Bac +3 peut être accepté avec au moins 5 ans d’expérience dans le domaine.
Expérience professionnelle en développement logiciel.
Compétences attendues
Indispensables
- Python
- JavaScript
- TypeScript
- React
- Docker
- PostgreSQL
- Kafka
- Redis
Appréciées
- Machine Learning
- NLP

