Tech lead Data Engineer - RAG - Information Retrieval avec pré-embauche - Freelance (H/F)
Collective.workMédiasPubliée aujourd'hui
700 €/j
- Lieu
- Paris · Hybride
- Durée
- 6 mois
- Démarrage
- 17 octobre 2026
- Expérience
- Expert (10 ans et +)
- Langues
- Français, Anglais
- Contrat
- Freelance
Situer cette mission
Repères calculés par FreelanceScope sur les missions ouvertes de son catalogue — ils ne proviennent pas de l'annonce et n'engagent pas l'entreprise.
- Le TJM de cette mission se situe au-dessus de la médiane des 45 missions de votre métier et de votre séniorité de notre catalogue dont l'annonce publie un budget, dont la médiane est de 490 €/jour (moitié centrale : 400 à 525 €/jour).
- 221 missions data engineer sont ouvertes à Paris en ce moment, sur 609 pour ce métier en France.
- 2 % des missions data engineer de notre catalogue sont ouvertes en télétravail total.
- Compétences peu demandées ailleurs dans le catalogue : pgvector (3 missions), Weaviate (4 missions), RAG (114 missions). À séniorité égale, une compétence rare se négocie mieux.
Profil expert (10 ans et +) · Comment ces repères sont calculés
La mission
Taux journalier (TJM): 700
CONTEXTE
PRE EMBAUCHE - 6 mois de mission maximum. Aux côtés d'une équipe d'experts au sein d'un pôle AI, vous serez responsable de la collecte, de l'ingestion, de l'indexation et de la recherche de pertinence sur des volumes juridiques massifs pour alimenter des modèles de langage et des produits. Enjeu : garantir la fraîcheur des index, la qualité du retrieval et la scalabilité face à une volumétrie et une hétérogénéité de sources importantes. Localisation : Europe.
MISSIONS
*
Concevoir des pipelines d'ingestion pour sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.
*
Indexation & embeddings : choisir et industrialiser les modèles d'embeddings, maintenir les bases vectorielles, gérer la fraîcheur et la reconstruction des index.
*
Assurer scalabilité, traçabilité des données (lignage, versioning des index).
*
Définir stratégie de retrieval : combiner recherche lexicale et sémantique (BM25 + embeddings) avec reranking et filtrage par métadonnées.
*
Mettre en place évaluation continue : jeux de tests et métriques (recall, precision, nDCG, MRR).
*
Structurer la phase de récupération pour alimenter les LLM (contexte, citations, dé-duplication, gestion des fenêtres de contexte).
*
Instrumenter les pipelines (logs, métriques, traces de qualité) et garantir sécurité et conformité des données (RGPD, cloisonnement par pays).
*
Promouvoir pratiques de Clean Code, SOLID, tests automatisés.
*
Contribuer au rayonnement technique (articles, meetups, open-source) et assurer transfert de compétences.
OUTILS & ENVIRONNEMENT
*
Langages : Python 3.11+ (maîtrise requise), Go.
*
Indexation : bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25.
*
Embeddings & NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing de documents.
*
RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock.
*
Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S.
*
Tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR).
CONDITIONS DE TRAVAIL
*
Mission pré-embauche de 6 mois maximum.
*
Localisation : Europe.
*
Contexte européen avec anglais fluide requis.
Abonnez-vous à la page NaxoTech sur LinkedIn pour découvrir nos offres régulières : https://www.linkedin.com/company/naxotech (https://www.linkedin.com/company/naxotech)
1. Master, PhD ou équivalent 2. Maîtrise de Python 3.11+ et connaissance de Go 3. Expérience avec des bases vectorielles telles que pgvector, Weaviate, Qdrant, OpenSearch et recherche hybride / BM25 4. Compétences en embeddings et NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing de documents 5. Connaissance des outils RAG et LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock 6. Maîtrise des technologies Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S 7. Expérience avec les tests : Pytest et évaluation de la pertinence (recall, nDCG, MRR) 8. Expérience avérée en data engineering / information retrieval en production 9. Anglais fluide (contexte européen quotidien) 10. Qualités personnelles : vision produit, leadership technique, rigueur sur sécurité des données, communication pédagogique
Entreprise : Collective.work
Lieu de travail : 75 - Paris
Type de contrat : Profession libérale — Emploi non salarié
Expérience : Débutant accepté
Rémunération : 700 € par jour
Code ROME : L1403 Cavalier / Cavalière d'entraînement
Dernière mise à jour chez France Travail : 26/09/2026
Source : France Travail — offre reprise sous la Licence de réutilisation de la base de données des offres d'emploi (francetravail.io).
Compétences attendues
Indispensables
- RAG
- LLM
- RGPD
- Tests automatisés
- Python
- Go
- pgvector
- Weaviate
Appréciées
- Qdrant
- NLP
- LangChain
- PostgreSQL
- Airflow
- Spark

