Expert Airflow
Cherry PickSaaS B2BPubliée il y a 2 jours
~ 750 – 950 €/jFourchette estimée par FreelanceScope à partir du niveau d'expérience demandé : la source ne publie pas de TJM pour cette mission.
- Lieu
- Paris · Sur site
- Durée
- 6 mois
- Démarrage
- 28 septembre 2026
- Expérience
- Expert (10 ans et +)
- Langues
- Français
- Contrat
- Freelance
Situer cette mission
Repères calculés par FreelanceScope sur les missions ouvertes de son catalogue — ils ne proviennent pas de l'annonce et n'engagent pas l'entreprise.
- Le TJM de cette mission se situe au-dessus de la médiane des 75 missions de votre métier et de votre séniorité de notre catalogue, dont la médiane est de 450 €/jour (moitié centrale : 230 à 850 €/jour).
- 75 missions data engineer sont ouvertes à Paris en ce moment, sur 265 pour ce métier en France.
- 2 % des missions data engineer de notre catalogue sont ouvertes en télétravail total.
- Compétences peu demandées ailleurs dans le catalogue : Airflow (23 missions), Docker (130 missions). À séniorité égale, une compétence rare se négocie mieux.
Profil expert (10 ans et +) · Comment ces repères sont calculés
La mission
Contexte & Enjeux
Dans le cadre du passage à l'échelle de sa plateforme Data (croissance rapide de 100 à plus de 500 DAGs en production), l'environnement AWS MWAA du client subit des ralentissements majeurs et une instabilité récurrente.
L'équipe technique dispose déjà d'un premier historique de recommandations, mais fait face à un effet de « balancier » : la résolution d'une anomalie en entraîne de nouvelles. L'objectif actuel est de sortir d'un mode uniquement réactif (pompier) pour reprendre la main de manière proactive sur la plateforme, comprendre les fondements infra/système, et offrir une sérénité totale sur le delivery et les déploiements.
Missions & Responsabilités
Le consultant aura les mains libres et la responsabilité directe de la stabilité de la plateforme Airflow, en lien étroit avec les équipes Ops et Tech Lead :
Urgence & Stabilisation Immédiate (Court Terme) :
Réaliser un diagnostic flash des métriques de production et traiter la cause racine des pannes récurrentes (No space left on device, Deadlocks BDD, blocages Virtual Hand, dérives de parsing DagBag).
Isoler et corriger les comportements asynchrones non reproductibles (erreurs survenant uniquement en production liées aux dépendances de plugins).
Apporter des correctifs opérationnels immédiats pour restaurer la fiabilité des exécutions.
Audit Infra, Tuning & Proactivité (Moyen Terme) :
Évaluer le dimensionnement global de MWAA (arbitrage et réglages des instances, scaling horizontal vs vertical des workers, allocation de mémoire/CPU, gestion des slots et de la concurrence).
Mettre en place et affiner l'observabilité de l'infrastructure via AWS CloudWatch (suivi du heartbeat du Scheduler, des connexions MetaDB, de la charge des workers) pour détecter les anomalies avant la panne.
Analyser l'impact du code des DAGs sur la plateforme (distinction entre temps de parsing et temps d'exécution, suppression du code top-level bloquant, accompagnement sur l'usage des DAG Factory).
Pérennisation & Trajectoire Future (Long Terme) :
Définir la trajectoire d'évolution infra, notamment la sortie des workers vers des conteneurs Docker pour isoler les traitements.
Garantir la sécurité et la fiabilité des déploiements dans la CI/CD pour que les équipes projets puissent délivrer leurs pipelines sans risquer de déstabiliser la plateforme.
Transmettre les bonnes pratiques de configuration aux équipes en place.
Compétences attendues
Indispensables
- Airflow
- AWS
- Docker
- CI/CD

