Notre client dans le secteur Banque et finance recherche un/une Data Engineer Senior — Industrialisation & Migration Airflow/Astronomer H/F Description de la mission : Contexte de la mission L'équipe data de l'organisation fonctionne actuellement sans outil d'orchestration ETL : l'ensemble des pipelines de données a été développé manuellement en Python, sans framework d'industrialisation. Dans une logique de scalabilité, de fiabilisation et de maintenabilité, la mission vise à migrer l'intégralité de l'existant vers Apache Airflow (Astronomer). Le Data Engineer recruté sera responsable de concevoir et d'industrialiser from scratch la nouvelle architecture d'orchestration, en reprenant les pipelines Python existants pour les transformer en DAGs robustes, monitorés et déployables en continu. Missions principales • Auditer l'existant : cartographier les scripts Python actuels, identifier les dépendances, les points de fragilité et les priorités de migration • Concevoir l'architecture cible Airflow / Astronomer : structure des DAGs, gestion des connexions, secrets et environnements • Migrer progressivement les pipelines existants vers des DAGs industrialisés, testés et documentés • Développer et maintenir des pipelines de données streaming avec Kafka ainsi que des pipelines batch / asynchrones classiques • Mettre en place les bonnes pratiques DataOps : CI/CD des DAGs, tests, monitoring, alerting et gestion des environnements dev / staging / prod • Travailler dans des environnements big data distribués et volumineux • Participer à terme à l'intégration de Starburst dans l'architecture data, dans une logique de fédération de requêtes / lakehouse • Être force de proposition sur les choix techniques et les standards de l'équipe Compétences / Qualités indispensables : Python avancé, Apache Airflow / Astronomer, Kafka, Kubernetes, DataOps (CI/CD, monitoring), Architecture data et industrialisation Compétences / Qualités qui seraient un + : Notions de bases de données graphe (type Neo4j)
Le contexte Nous accompagnons une grande organisation financière dans la structuration et la montée en compétence de sa filière Data autour d'une modern data stack. Dans ce cadre, nous recherchons un Analytics Engineer pour rejoindre une équipe de 3 personnes, avec une mission à double dimension : technique et pédagogique. La mission Au sein d'une équipe data structurée, vous jouez un rôle clé dans l'industrialisation des pratiques et la montée en compétence collective : Développer et maintenir des modèles dbt en suivant les standards de l'équipe Contribuer à la création de templates, conventions de nommage et bonnes pratiques de développement Participer à l'élaboration et à l'animation de parcours de formation à destination d'une centaine de collaborateurs internes (data analysts, métiers, équipes tech) Produire des supports pédagogiques clairs et accessibles (tutoriels, wiki, best practices) Travailler en lien avec les pipelines Airflow et les workflows GitLab CI Profil recherché Le profil recherché Maîtrise de dbt, idéalement en environnement professionnel ou sur projet personnel significatif Connaissance d'Airflow et d'un environnement data warehouse cloud (Snowflake, BigQuery, Redshift ou autre) Notions de GitLab et de bonnes pratiques de versioning Réelle appétence pour la transmission et la pédagogie : vous aimez expliquer, documenter et former À l'aise à l'oral, capable d'adapter votre discours selon le niveau technique de votre audience Les conditions Localisation : Roubaix — 3 jours sur site, 2 jours de télétravail par semaine Profil junior à confirmé accepté selon l'expérience sur dbt Début de mission en septembre 2026 Durée : 1 an
Contexte de la mission Dans le cadre du renforcement d'une équipe Data intervenant sur un projet Agile, nous recherchons un Data Ingénieur confirmé (+8 ans d'expérience) pour intégrer une équipe composée de 2 Data Ingénieurs et d'un Chef de section en charge de l'orchestration (GitLab CI/CD, Docker, Airflow). La mission est prévue pour une durée initiale de 6 mois, renouvelable 6 mois, avec un démarrage idéal la dernière semaine d'août. Missions : Développer, maintenir et optimiser des pipelines ETL en Python / Pandas / SQL Participer aux cérémonies Agile (daily, sprint planning, review, rétrospective) Collaborer avec le chef de section sur les aspects d'orchestration et d'industrialisation Contribuer à la qualité du code, aux bonnes pratiques et à la documentation Assurer la fiabilité, la performance et la robustesse des traitements data Participer à l'amélioration continue de l'architecture data Travailler en coordination avec les équipes internes et les autres Data Ingénieurs Profil : 5 ans d'expérience minimum en tant que Data Ingénieur Maîtrise confirmée de Python / Pandas / SQL / ETL Capacité à intervenir dans un environnement Agile Autonomie, rigueur, sens du delivery Capacité à collaborer dans une équipe technique exigeante Intérêt pour l'orchestration (Airflow, Docker, CI/CD) Bon niveau de communication et de documentation Compétences obligatoiresPython + Pandas (confirmé) SQL (confirmé) ETL (confirmé) Pipelines de données : conception, optimisation, industrialisation Compétences appréciéesDocker Airflow CI/CD GitLab Connaissance des environnements d'orchestration
Dans le cadre du développement de ses systèmes d'information Épargne Salariale et Retraite, les Bénéficiaires doivent recourir à une prestation externe pour fournir assistance à la modernisation de la plateforme BI. 1. OBJET DE LA PRESTATION Dans le cadre du projet de modernisation de la plateforme BI, la prestation consistera à mettre en place des solutions répondant aux besoins couverts par l'existant et permettant de proposer de nouveaux services. Cette solution devra utiliser les outils validés et mis à disposition par le groupe. La mission sera pilotée par l'équipe Coeur-Data au sein de la R&D Epargne salariale et retraite. Le data engineer devra intervenir en collaboration avec l'équipe de 5 personnes ainsi qu'avec les clients et les équipes transverses du client. Exemple d'applications du domaine d'intervention : Architecture : Définition de l'organisation du Lakehouse dans le S3 Chargement : Utilisation de pipelines spark, pyspark et python Ordonnancement : Dagster Restitution : Mise à disposition de la donnée brut + création de rapports sur un outil de dataviz à définir sur la base du LakeHouse L'objectif principal de la prestation sera la mise à disposition de data structurées à destination de l'équipe marketing . Dans ce cadre, il conviendra de réaliser : - Le développement d'une solution de collecte de données - Le développement d'un système de stockage de la donnée - La documentation des développements - La réalisation de tests unitaires - La mise en place d'un suivi des traitements - L'assistance à la recette par la MOA / les utilisateurs - Des comptes rendus aux pilotes sur l'avancement du projet et les blocages rencontrés - Des études avec les équipes transverses du client 2. ENVIRONNEMENT FONCTIONNEL DE LA PRESTATION La prestation se déroulera au sein du service IT en charge de la Maintenance applicative 3. ENVIRONNEMENT TECHNIQUE DE LA PRESTATION - Langages de programmation : Python, Spark, Pyspark, SQL - Outil de gestion de version : Git - Intégration continue : JENKINS - Ticketing : JIRA - Documentation : Confluence - Poste de travail Windows 10 avec WSL (Windows Subsystem for Linux) - Outils de la plateforme actuelle : Informatica, DAC, OBIEE, Eclipse BIRT, Oracle 19 - Outils de la plateforme cible : Dagster, Trino, S3 4. RESULTATS ATTENDUS / LIVRABLES - Respect du planning détaillé validé - Estimation des charges MOE - Mise en œuvre des solutions développées - Programme testé et prêt à la recette par les utilisateurs / MOA - Tests unitaires des développements effectués - Suivi d'avancement des tâches du projet en cours - Documentation technique - Amélioration continue des processus de développements 5. PRE-REQUIS ET/OU ELEMENTS INDISPENSABLES - Python, Spark appliqué à la data - Machine learning appliqué à la donnée (scikit-learn, feature engineering) - Relationnel pour les échanges avec le métier - Outils Informatica - Outils LLM/GenAI pour l'accès et l'exploration de la donnée
"Nous recherchons un consultant Data Scientist orienté ML Engineering, alliant une solide expertise en science des données et de fortes compétences en ingénierie logicielle et infrastructure. Le consultant interviendra sur des sujets variés au sein de la direction DATA, couvrant aussi bien le développement de modèles de machine learning que leur industrialisation et leur mise en production à grande échelle. Le profil recherché est capable de naviguer entre la conception de modèles IA/ML, la construction de pipelines de données robustes, et le déploiement de solutions scalables dans un environnement cloud moderne."
Contexte de la missionDans le cadre du développement et de l'évolution d'une plateforme Data Cloud basée sur AWS, nous recherchons un Senior Cloud Data Platform Engineer capable de concevoir, industrialiser et maintenir une infrastructure Data moderne, sécurisée et évolutive. Le consultant interviendra au sein d'équipes pluridisciplinaires composées d'Architectes Cloud, Data Engineers, DevOps Engineers et équipes Support afin de fournir une plateforme robuste permettant l'ingestion, le traitement, le stockage et l'exploitation de données à grande échelle. Missions principales1. Conception et industrialisation de l'infrastructure CloudConcevoir et développer des composants Infrastructure as Code (IaC) réutilisables. Créer et maintenir des templates avancés permettant le provisionnement automatisé des ressources AWS. Définir les standards techniques et les bonnes pratiques d'architecture Cloud. Garantir la conformité, la sécurité et la gouvernance des infrastructures déployées. Participer aux choix d'architecture et aux revues techniques. Livrables attendusTemplates AWS CDK et CloudFormation. Modules d'infrastructure réutilisables. Documentation d'architecture. Standards de développement et de déploiement. 2. Architecture et développement de la Data PlatformConcevoir des blueprints techniques destinés aux équipes Data Engineering. Mettre en œuvre des architectures Data Lake et Lakehouse sur AWS. Définir les modèles de stockage optimisés pour la performance et la scalabilité. Concevoir des pipelines de données performants et résilients. Accompagner les projets métier dans leur intégration à la plateforme. Livrables attendusArchitectures de référence. Blueprints applicatifs. Pipelines Data industrialisés. Guides d'intégration et d'exploitation. 3. Data Engineering & LakehouseParticiper à la conception et au déploiement des traitements de données. Optimiser les performances des pipelines de transformation. Mettre en œuvre des formats de stockage analytiques performants. Développer des solutions de gouvernance et de catalogage des données. Garantir la qualité et la disponibilité des données. Technologies associéesApache Iceberg Parquet AWS Glue AWS Athena AWS Lake Formation PySpark AWS EMR 4. Exploitation et amélioration continueAssurer le maintien en conditions opérationnelles des plateformes existantes. Superviser les composants de la plateforme Data. Participer à la résolution des incidents et problèmes. Optimiser les coûts et les performances des ressources AWS. Améliorer continuellement les processus d'industrialisation. Outils associésAWS CloudWatch Jenkins SonarQube Ruff 5. Support et accompagnement des équipesAccompagner les Data Engineers dans l'utilisation de la plateforme. Apporter une expertise technique sur les sujets Cloud et Data. Participer aux ateliers d'architecture. Réaliser des formations et transferts de compétences. Contribuer à la diffusion des bonnes pratiques au sein des équipes.
Rôle et responsabilités des Développeurs • Développement et expertise Réaliser des développements de complexité moyenne. Assurer la maintenance applicative (Gestion des obsolescence et vulnérabilités) • Contribution agile Participer aux rituels techniques (estimation de charge, engagement sur le sprint). • Architecture et standards Concevoir et mettre en oeuvre l'architecture applicative et technique. Veiller au respect des normes, bonnes pratiques et standards Groupe. • Qualité et documentation Garantir la qualité des livrables (revues de code, bonnes pratiques). Assurer la production et la maintenance de la documentation projet. • RUN Assurer le suivi d'exploitation des traitements PySpark en production : supervision, résolution des incidents, analyse des performances et amélioration continue des traitements - Maîtrise avancée des environnements de conteneurisation et d'orchestration, notamment Kubernetes et Docker, ainsi que de la gestion sécurisée des secrets avec HashiCorp Vault - Maîtrise avancée des traitements Big Data, incluant PySpark 3 ainsi que la manipulation de formats de données distribués (Parquet, gestion des buckets). - Maîtrise opérationnelle de l'orchestration de workflows de données à l'aide de l'outil Apache Airflow. - Maîtrise confirmée des bases de données relationnelles, particulièrement PostgreSQL. - Maîtrise des outils de gestion de code et de qualité logicielle, incluant GitLab, Fortify et SonarQube. - Maîtrise des outils de stockage objet, notamment via l'utilisation des commandes MinIO. - Maîtrise des outils de transfert de fichiers, en particulier CFT (Cross File Transfer). Pour l'ensemble du projet de titrisation Bail : • Dossiers d'architecture (schémas, principes techniques, choix structurants). • Backlog enrichi et priorisé en lien avec les parties prenantes. • Composants applicatifs développés, testés et documentés. • Comptes rendus des revues de code et plan d'amélioration continue. • Documentation projet à jour (Spécifications techniques, JIRA, Page Confluence, Runbook). • Reporting d'avancement sur le périmètre confié. • RUN : Reporting de type Morning check
Bonjour, Pour le compte d'un de mes clients, je recherche un profil disposant des compétences suivantes : Data Quality (frameworks, dimensions DAMA, data contracts, scoring) DBT (tests, macros, Elementary, dbt-expectations) Snowflake (SQL avancé, monitoring, DMF) Airflow (DAGs, sensors, SLA, alerting) Python / Git / CI/CD Compétences souhaitées Open Data Contract Standard (ODCS) ou expérience en data contracts Snowflake Cortex Data Quality / DMF Exigences réglementaires bancaires (BCBS 239, DORA...) Collibra (module data quality) Great Expectations ou Soda Expérience multi-pays / cross-JV Secteur banque ou assurance Qualités attendues Vision architecturale et structuration de bout en bout Pédagogie et capacité à embarquer les équipes Rigueur (contexte réglementaire, auditabilité) Autonomie et force de proposition
Votre missionDans le cadre du développement de notre plateforme Data, nous recherchons un(e) Senior Data Engineer / Tech Lead Databricks pour piloter les développements, garantir la qualité des solutions mises en œuvre et accompagner les équipes sur les sujets techniques. Vous serez notamment amené(e) à : Concevoir et faire évoluer l'architecture des pipelines de données sur Databricks. Développer et optimiser les traitements d'ingestion et de transformation en Python, Spark et SQL. Piloter l'orchestration et la supervision des traitements sur AWS. Garantir la performance, la fiabilité et la qualité des pipelines de données. Définir les bonnes pratiques de développement, participer aux revues de code et accompagner les membres de l'équipe. Assurer le support technique, la résolution des incidents complexes et l'amélioration continue de la plateforme. Participer aux ateliers d'architecture, aux échanges avec les équipes métiers et contribuer aux choix techniques.
Dans le cadre du renforcement de sa plateforme Data Cloud, un acteur majeur du secteur financier recherche un Senior Cloud Data Platform Engineer afin d'accompagner l'évolution de son écosystème Data. Vous intégrerez une équipe en charge de concevoir, industrialiser et maintenir une plateforme permettant aux équipes Data Engineering de développer et d'exploiter leurs traitements de données dans un environnement Cloud moderne. Vos principales missions seront de concevoir des infrastructures Cloud via des approches Infrastructure as Code (IaC), développer des architectures Data évolutives et sécurisées, maintenir les services AWS existants et participer à l'amélioration continue de la plateforme. Vous serez également un référent technique auprès des équipes Data Engineering afin de faciliter l'intégration de nouveaux projets et d'optimiser les performances de la plateforme. Cette mission s'inscrit dans un contexte technique exigeant où l'automatisation, la qualité de code, la performance et la scalabilité sont des enjeux majeurs.
Votre missionDans le cadre du développement de notre plateforme Data, nous recherchons un Data Engineer pour concevoir, développer et maintenir des pipelines de données performants dans un environnement Cloud AWS. Vous participerez notamment à : Développer et optimiser les traitements d'ingestion et de transformation de données avec Python, Spark et Databricks. Mettre en place les flux de données entre différentes sources et le Data Lake. Orchestrer et superviser les traitements avec Airflow. Garantir la qualité, la disponibilité et les performances des pipelines. Assurer le support, la correction des anomalies et l'amélioration continue de la plateforme. Participer aux choix techniques, aux ateliers projet et à la documentation.
• Analyse et cadrage Recueillir et analyser les besoins métiers. Formaliser les US en spécifications techniques exploitables. • Pilotage technique Assurer un pilotage intermédiaire sur un périmètre projet (coordination technique, suivi d'avancement). Contribuer aux choix techniques structurants. • Développement et expertise Réaliser des développements complexes. Assurer la maintenance applicative (Gestion des obsolescence et vulnérabilités) Apporter un support technique aux équipes sur les composants critiques. • Contribution agile Participer à l'élaboration et à la priorisation du backlog avec les PO et BA. Animer et contribuer aux rituels techniques (code reviews, challenger les estimations de charge etc.) • Architecture et standards Concevoir et mettre en oeuvre l'architecture applicative et technique. Veiller au respect des normes, bonnes pratiques et standards Groupe. • Qualité et documentation Garantir la qualité des livrables (revues de code, bonnes pratiques). Assurer la production et la maintenance de la documentation projet. • RUN Planification des activités, gestion du calendrier de l'équipe et priorisation des actions Assurer le suivi d'exploitation des traitements PySpark en production : supervision, résolution des incidents, analyse des performances et amélioration continue des traitements Maîtrise avancée des environnements de conteneurisation et d'orchestration, notamment Kubernetes et Docker, ainsi que de la gestion sécurisée des secrets avec HashiCorp Vault Maîtrise avancée des traitements Big Data, incluant PySpark 3 ainsi que la manipulation de formats de données distribués (Parquet, gestion des buckets). Maîtrise opérationnelle de l'orchestration de workflows de données à l'aide de l'outil Apache Airflow. Maîtrise confirmée des bases de données relationnelles, particulièrement PostgreSQL. Maîtrise des outils de gestion de code et de qualité logicielle, incluant GitLab, Fortify et SonarQube. Maîtrise des outils de stockage objet, notamment via l'utilisation des commandes MinIO. Maîtrise des outils de transfert de fichiers, en particulier CFT (Cross File Transfer). Pour l'ensemble du projet de titrisation Bail : • Dossiers d'architecture (schémas, principes techniques, choix structurants). • Backlog enrichi et priorisé en lien avec les parties prenantes. • Composants applicatifs développés, testés et documentés. • Comptes rendus des revues de code et plan d'amélioration continue. • Documentation projet à jour (Spécifications techniques, JIRA, Page Confluence, Runbook). • Reporting d'avancement sur le périmètre confié. • RUN : Reporting de type Morning check
Dans le cadre de l'optimisation et de l'unification de ses capacités analytiques transversales, notre client recherche un consultant Data Analytics Engineer autonome pour une mission d'intégration, de modélisation et de restitution des données Corporate stratégiques du groupe. Cette initiative vise à fournir une vision consolidée et exploitable des indicateurs clés provenant de diverses sources internes, essentielles à la prise de décision stratégique et opérationnelle. Objectifs de la mission Établir et sécuriser des connexions techniques robustes et évolutives avec les systèmes sources Corporate identifiés (ERP, Plateformes Financières, RH, ITSM etc.). Extraire et charger les données des domaines fonctionnels Corporate clés : finance, ressources humaines, référentiels, achats, etc. Concevoir et implémenter des pipelines d'ingestion automatisés fiables et performants, garantissant l'intégrité et la fraîcheur des données. Structurer et modéliser les données dans un entrepôt de données (Data Warehouse Snowflake) de manière logique, modulaire, réutilisable et optimisée pour l'analyse et la restitution. Mettre en place des mécanismes de gouvernance des données : gestion des métadonnées, logiques de rafraîchissement, suivi de la qualité des données et gestion des erreurs. Développer des vues et agrégats de données spécifiques aux besoins de restitution et d'analyse des différents départements Corporate. Documenter de manière exhaustive les pipelines d'ingestion, les modèles de données (logique et physique), les règles de transformation et les points de reprise pour assurer la maintenabilité et la transférabilité.
Pour un client dans le Retail, nous recherchons un profil Ingénieur Data. L'idée sera d'intégrer une équipe pluridisciplinaire pour un cas d'usage data avec un focus sur la maîtrise des coûts. Missions : concevoir des solutions conformes, développer et modéliser les données, maintenir les systèmes opérationnels, gérer les incidents, déployer via Git et renforcer l'expertise SI. Compétences recherchées : Python, Apache Airflow, Google Data Studio, BigQuery, GCP, Scripts Shell, Terraform, GitLab Mission dans la métropole lilloise.