Share this job
Contexte & Enjeux
Dans le cadre du passage à l'échelle de sa plateforme Data (croissance rapide de 100 à plus de 500 DAGs en production), l'environnement AWS MWAA du client subit des ralentissements majeurs et une instabilité récurrente.
L'équipe technique dispose déjà d'un premier historique de recommandations, mais fait face à un effet de « balancier » : la résolution d'une anomalie en entraîne de nouvelles. L'objectif actuel est de sortir d'un mode uniquement réactif (pompier) pour reprendre la main de manière proactive sur la plateforme, comprendre les fondements infra/système, et offrir une sérénité totale sur le delivery et les déploiements.
Missions & Responsabilités
Le consultant aura les mains libres et la responsabilité directe de la stabilité de la plateforme Airflow, en lien étroit avec les équipes Ops et Tech Lead :
Urgence & Stabilisation Immédiate (Court Terme) :
Réaliser un diagnostic flash des métriques de production et traiter la cause racine des pannes récurrentes (No space left on device, Deadlocks BDD, blocages Virtual Hand, dérives de parsing DagBag).
Isoler et corriger les comportements asynchrones non reproductibles (erreurs survenant uniquement en production liées aux dépendances de plugins).
Apporter des correctifs opérationnels immédiats pour restaurer la fiabilité des exécutions.
Audit Infra, Tuning & Proactivité (Moyen Terme) :
Évaluer le dimensionnement global de MWAA (arbitrage et réglages des instances, scaling horizontal vs vertical des workers, allocation de mémoire/CPU, gestion des slots et de la concurrence).
Mettre en place et affiner l'observabilité de l'infrastructure via AWS CloudWatch (suivi du heartbeat du Scheduler, des connexions MetaDB, de la charge des workers) pour détecter les anomalies avant la panne.
Analyser l'impact du code des DAGs sur la plateforme (distinction entre temps de parsing et temps d'exécution, suppression du code top-level bloquant, accompagnement sur l'usage des DAG Factory).
Pérennisation & Trajectoire Future (Long Terme) :
Définir la trajectoire d'évolution infra, notamment la sortie des workers vers des conteneurs Docker pour isoler les traitements.
Garantir la sécurité et la fiabilité des déploiements dans la CI/CD pour que les équipes projets puissent délivrer leurs pipelines sans risquer de déstabiliser la plateforme.
Transmettre les bonnes pratiques de configuration aux équipes en place.
Candidate profile
Profil Recherché :
Positionnement : Expert Infra / Admin Airflow & Data Platform Engineer (et non un Data Engineer applicatif qui développe des pipelines).
Expérience : 6 à 10+ ans en ingénierie Data / Cloud Infra, avec une spécialisation poussée sur l'administration et le tuning d'Airflow sous forte charge (+300 DAGs).
Posture : Autonomie totale, capacité de diagnostic rapide, pragmatisme et culture du résultat. Capable de piloter un plan d'action d'urgence tout en vulgarisant ses arbitrages auprès de la direction technique.
Compétences Techniques Requises
Airflow Internals & Configuration (Incontournable) : Maîtrise approfondie des rouages d'Airflow (Schedulers, Celery Executors, tuning de la BDD de métadonnées PostgreSQL/MySQL, gestion des verrous, gestion du parallélisme et du garbage collector/disk).
Environnement AWS / MWAA : Pratique avérée du service managé AWS MWAA et de ses limitations, intégration avec CloudWatch, S3, VPC, Security Groups, IAM.
Écosystème Data : Compréhension des interactions avec Snowflake, dbt Core, AWS Glue et PySpark.
Conteneurisation & CI/CD : Docker, principes d'isolation des dépendances, pipelines de déploiement automatisés.
Working environment
Profil Recherché :
Positionnement : Expert Infra / Admin Airflow & Data Platform Engineer (et non un Data Engineer applicatif qui développe des pipelines).
Expérience : 6 à 10+ ans en ingénierie Data / Cloud Infra, avec une spécialisation poussée sur l'administration et le tuning d'Airflow sous forte charge (+300 DAGs).
Posture : Autonomie totale, capacité de diagnostic rapide, pragmatisme et culture du résultat. Capable de piloter un plan d'action d'urgence tout en vulgarisant ses arbitrages auprès de la direction technique.
Compétences Techniques Requises
Airflow Internals & Configuration (Incontournable) : Maîtrise approfondie des rouages d'Airflow (Schedulers, Celery Executors, tuning de la BDD de métadonnées PostgreSQL/MySQL, gestion des verrous, gestion du parallélisme et du garbage collector/disk).
Environnement AWS / MWAA : Pratique avérée du service managé AWS MWAA et de ses limitations, intégration avec CloudWatch, S3, VPC, Security Groups, IAM.
Écosystème Data : Compréhension des interactions avec Snowflake, dbt Core, AWS Glue et PySpark.
Conteneurisation & CI/CD : Docker, principes d'isolation des dépendances, pipelines de déploiement automatisés.
Apply to this job!
Find your next career move from +8,000 jobs!
Manage your visibility
Salary, remote work... Define all the criteria that are important to you.
Get discovered
Recruiters come directly to look for their future hires in our CV library.
Join a community
Connect with like-minded tech and IT professionals on a daily basis through our forum.
Expert Airflow
Cherry Pick
