🚀 Data Engineer Senior – Big Data / Lakehouse / AWS Niveau : Senior Expérience : 8 ans minimum en Data Engineering Démarrage souhaité : ASAP Durée : 12 mois, renouvelable Rythme : 5 jours/semaine Télétravail : 3 jours/semaine 🎯 Contexte de la mission : Dans le cadre du renforcement de son pôle Data Services, notre client recherche un Data Engineer Senior pour accompagner la conception, l'industrialisation et l'évolution de ses solutions Data. Le consultant interviendra sur des sujets à forte dimension Data Engineering, Big Data et Lakehouse, avec notamment des problématiques d'architecture, de modélisation, d'optimisation des pipelines et d'industrialisation des traitements. Il contribuera également à l'évolution de la stratégie Lakehouse du client et devra être capable d'accompagner techniquement des profils plus juniors. 🔎 Missions Concevoir, développer et optimiser des pipelines de données à grande échelle Mettre en œuvre des flux batch, streaming et ingestion via API Structurer les données selon une architecture Médaillon (Bronze / Silver / Gold) Développer et industrialiser les transformations avec DBT, Spark et Iceberg Contribuer à l'évolution et à l'optimisation de l'architecture Lakehouse Déployer et maintenir les pipelines dans un environnement AWS Orchestrer les workflows ETL / ELT via Airflow Mettre en œuvre l'Infrastructure as Code avec Terraform Participer à la mise en place et au maintien de l'observabilité et de la supervision des traitements Définir et mettre en œuvre les règles de Data Quality : tests, contrôles et validations automatisées Participer à la gestion des incidents et à l'amélioration continue Documenter les architectures, pi
La mission, au sein du domaine « Pertes, Garanties et Entrepôt Risques », consiste à participer à la réalisation du projet basée sur Google Cloud Platform, à forts enjeux au sein d'une équipe engagée et experte sur le sujet. Une expérience dans le domaine du Risques de crédit est appréciée. Développement et Intégration de solutions Python Spark avec les services data et compute de Google Cloud Platform - Excellente maitrise : BigQuery, Dataproc, Composer, Cloud Functions, Cloud Run Jobs, et GCS. - Bonne maitrise de la partie DevOps : XLD, Terraforme, jenkins - Bonne communication, autonomie et fluidité du travail en équipe.
Rejoignez-nous ! Nous recherchons un(e) Data Engineer Hadoop / PySpark pour intervenir sur une plateforme Data stratégique et contribuer aux évolutions d'un datalake. Vous serez en charge de la mise en œuvre technique de nouvelles ingestions de données, des traitements de préparation et de transformation, ainsi que de la maintenance et de l'évolution des pipelines de données. Vous travaillerez en étroite collaboration avec les équipes de production applicative et DevOps, dans un environnement Agile, dynamique et international. Ce que vous ferez : Mettre en œuvre de nouvelles ingestions de données au sein du datalake. Développer les traitements de préparation et de transformation des données. Maintenir et faire évoluer les pipelines de données en PySpark et shell scripting. Développer et optimiser les traitements de données sur la plateforme Hadoop. Exploiter Hive et SQL pour la manipulation, la transformation et l'analyse des données. Collaborer avec l'équipe DevOps et lui adresser les demandes relatives aux évolutions de la plateforme. Participer à l'intégration et au déploiement des évolutions via les outils de gestion de code source et d'intégration continue. Rédiger des spécifications techniques claires et précises. Analyser et résoudre des problématiques techniques complexes liées aux traitements et pipelines de données. Contribuer à l'amélioration continue de la plateforme et être force de proposition sur les solutions et technologies à mettre en œuvre. Votre positionnement vous permettra d'intervenir au cœur d'une plateforme Data stratégique, en interaction avec des équipes techniques multidisciplinaires et internationales.
Vous aimez les plateformes de données qui tournent vraiment en production ? Rejoignez l'équipe qui fait vivre le datalake des fonctions Technologies & Opérations d'un grand groupe bancaire. La DSI fournit aux directions technologiques, aux opérations et à la banque de proximité les applications et les données dont elles ont besoin au quotidien. Le datalake Hadoop en est une pièce centrale : il alimente le pilotage et les usages analytiques de plusieurs directions. Vous intervenez en lien direct avec la production applicative et l'équipe DevOps, au sein d'une équipe IT internationale. Vos principales missions : Concevoir et mettre en production de nouvelles ingestions de données : collecte, préparation, transformation. Maintenir et faire évoluer les outils de gestion des pipelines de données (PySpark, shell scripting). Porter auprès de l'équipe DevOps les évolutions nécessaires de la plateforme. Rédiger des spécifications techniques claires et exploitables par l'équipe. Ce que la mission vous apporte : Un datalake en production, avec de vrais volumes et de vrais utilisateurs métier. Une équipe internationale : l'anglais est utilisé au quotidien. Une ouverture vers le cloud (GCP / BigQuery) pour qui veut élargir sa stack. Environnement technique : Hadoop, PySpark, Spark, Hive, Python, SQL, Git, Jenkins, Jira, Unix / Linux — Scrum.
Data Engineers Databricks, PySpark, Python, SQL, Gitlab, Nexus, Terraform Nantes ( 3 à 4 jours de télétravail) 05/10/2026 Databricks, PySpark, Python, SQL, Gitlab, Nexus, Terraform Nous recherchons 2 data Engineers confirmés qui travailleront sur des cas d'usage. Les principales tâches seront: - Participer à la conception des usages suivant l'architecture définie. - Réaliser les développements en langage python/spark, - Être vigilant sur les bonnes pratiques du point de vue FINOPS - Réaliser les travaux jusqu'en environnement de production - Participer au support N3 de la production - Être force de proposition, - Documenter les réalisations. Il est nécessaire de maitriser Databricks, Python, PySpark
Data Engineer Senior — Databricks — Descriptif du poste Dans le cadre du développement de nos activités data, nous recrutons un Data Engineer Senior spécialisé sur la plateforme Databricks. Vous intervenez sur la conception et l'industrialisation de plateformes de données lakehouse : vous cadrez les besoins avec les équipes métiers, vous définissez les architectures cibles, vous construisez les pipelines d'ingestion et de transformation, et vous assurez leur mise en production ainsi que leur optimisation en coût et en performance. Vous êtes l'interlocuteur technique direct des équipes métiers sur votre périmètre et vous accompagnez la montée en compétences des profils plus juniors. — Parmi vos missions 🛠 Concevoir et industrialiser les plateformes de données sur Databricks Concevoir des architectures lakehouse en couches (bronze / silver / gold) sur Delta Lake Développer et optimiser les pipelines d'ingestion et de transformation en PySpark et en SQL Industrialiser les traitements avec Databricks Workflows, Delta Live Tables et une chaîne CI/CD Optimiser les coûts et les performances : dimensionnement des clusters, partitionnement, Photon, gestion du cache Mettre en place la gouvernance et la qualité des données Structurer Unity Catalog : catalogues, schémas, gestion des droits, lignage Définir les règles de qualité, les tests et le monitoring des pipelines en production Documenter les modèles de données et les contrats d'interface avec les systèmes amont et aval Cadrer les besoins avec les équipes métiers Animer les ateliers de recueil de besoins et traduire les exigences en solutions data Préconiser les architectures cibles et arbitrer les choix techniques (batch ou streaming, build ou buy) Présenter et défendre vos recommandations auprès des interlocuteurs techniques comme métiers Piloter la livraison et faire monter l'équipe en compétences Piloter un lot de bout en bout : conception, chiffrage, livraison, respect des délais Encadrer les profils juniors en revue de code et en pair programming Diffuser les bonnes pratiques d'engineering : versioning, tests, revue, documentation — Modalités pratiques Lieu : Ile de France Type de contrat : CDI Date de démarrage : A définir Télétravail : Fonction des contraintes opérationnelles (en moyenne : 2 jours)
Contexte de la missionNous cherchons un candidat capable de s'adapter à l'environnement technique du département Service & Données et aux pratiques de l'équipe qu'il va rejoindre : • Qui saura travailler de manière autonome • Disposant d'un bon sens de l'organisation et de la rigueur • Qui saura synthétiser ses travaux pour communiquer efficacement à ses commanditaires Objectifs et livrablesActivité principale A ce titre, le profil sera amené à assurer les activités suivantes : • Participation à des ateliers avec des experts métiers pour collecter le besoin et comprendre les données • Conception et développement de traitements de données • Réalisation d'études statistiques • Présentation de résultats sous la forme de rapports d'étude ou de tableaux de bord • Diffusion et vulgarisation des résultats d'études Le consultant sera également attendu sur les compétences suivantes : • Lien entre la partie métier et la partie data science • Conception fonctionnelle du besoin métier au sein d'un SI • Préparer et participer aux ateliers avec le métier et ses représentants utilisateurs Activité secondaire o Veille technologique sur les outils utilisés au sein du projet o Partage et formation sur les guides de bonnes conduites
ContexteDans le cadre d'un projet stratégique autour de la gestion des risques climatiques et physiques, notre client recherche un Data Engineer Python / Spark pour contribuer à la mise en place d'une solution permettant d'ingérer, agréger et exposer des données issues de sources multiples afin de produire des reportings métier liés à la surveillance du risque de crédit. La mission s'inscrit au sein d'une équipe experte et engagée, sur un projet à forte visibilité basé sur Google Cloud Platform (GCP). Une expérience dans le domaine du risque de crédit est appréciée. MissionsConcevoir et développer des solutions Data en Python / Spark. Participer à l'intégration de données provenant de sources multiples. Exploiter les services Data & Compute de Google Cloud Platform. Contribuer à l'ingestion, l'agrégation et l'exposition des données. Participer à la mise en œuvre et à l'évolution des pipelines Data. Collaborer avec les équipes techniques et métier du projet. Contribuer aux pratiques DevOps et à l'industrialisation des solutions. Profil recherchéExpertise technique indispensable : Python / Spark BigQuery Dataproc Cloud Composer Cloud Functions Cloud Run Jobs Google Cloud Storage (GCS) DevOpsXL Deploy (XLD) Terraform Jenkins
Nous recherchons un(e) Développeur(se) Python / Data Engineer passionné(e) pour rejoindre notre équipe et contribuer à la conception et au développement de plateformes et de pipelines permettant l'industrialisation de modèles de Machine Learning. Ces solutions couvrent l'ensemble du cycle de vie des modèles : préparation des données et des features, entraînement, tuning, inférence, exposition via APIs et orchestration des traitements dans un environnement cloud. Elles permettent aux Quants et Data Scientists d'industrialiser l'utilisation de modèles avancés dans les processus de prévision de la consommation et de la production d'énergie.
En quelques motsCherry Pick est à la recherche d'un "Data Engineer Databricks (H/F) " pour un client dans le secteur du Retail Description🏢 Le Contexte : Passer à l'Échelle la Data Factory Supply ChainAu sein de la filiale informatique d'un groupe majeur de la grande distribution, la Data Factory réunit les équipes IT et les directions métiers pour concevoir, développer et déployer des produits analytiques et Data Science à forte valeur ajoutée. Afin de répondre à une demande croissante, l'organisation s'industrialise et adopte un modèle Agile à l'échelle (Domaines, Tribus, Squads). Vous intégrerez la squad Supply / Logistique, responsable de la création de cas d'usage stratégiques dédiés à l'optimisation des flux, à la gestion des entrepôts et à la performance logistique. Nous recherchons un(e) Data Engineer Confirmé / Senior évoluant sur une plateforme Cloud Azure / Databricks. Ce poste exige une réelle polyvalence : au-delà de la construction des pipelines de données, vous serez le garant de la qualité (QA/Testing) et participerez activement à la restitution décisionnelle. 🎯 Vos Missions : Pipelines, Data Warehouse, QA & RestitutionRattaché(e) à la squad Supply Chain, vos activités couvrent tout le cycle de vie de la donnée : 1. Data Engineering & Cloud Architecture (Majeure) : Concevoir et construire de manière industrielle les pipelines de données (ETL/ELT) pour transformer, enrichir et ingérer les données dans le Data Lake. Développer des notebooks Databricks (Spark / Python) pour assurer des traitements massifs complexes. Mettre en œuvre et optimiser les solutions de Cloud Data Warehousing (tuning de requêtes SQL, modélisation de tables). Assurer la livraison continue des développements dans un environnement DevOps intégrant les processus CI/CD (Azure DevOps). 2. QA, Testing & Qualité de Code : Assurer la QA et le testing des pipelines développés par le second Data Engineer de la squad. Concevoir et exécuter les tests unitaires, d'intégration et de non-régression. Réaliser des revues de code rigoureuses pour garantir le respect des bonnes pratiques et des standards d'ingénierie. 3. Data Analyse & Restitution Decisionnelle : Participer au recueil des besoins métiers et mener les analyses de données en amont. Concevoir et développer les tableaux de bord sous Power BI pour restituer les indicateurs Supply Chain aux opérationnels. Rédiger la documentation technique (Dossiers d'Analyse Technique, release notes).
Dans le cadre du développement des projets Data, nous recherchons un Data Engineer / DataOps pou accompagner les différentes entités dans l'utilisation et l'industrialisation de la plateforme. Missions :Administrer, superviser et maintenir les workspaces Définir, documenter et faire évoluer les standards et bonnes pratiques Garantir la qualité, la sécurité et la conformité des services proposés aux différentes entités Industrialiser les environnements et déploiements avec des pratiques DevOps / IaC Tester et évaluer les nouvelles fonctionnalités Databricks puis formuler des recommandations Veiller au respect des politiques et accompagner leur mise en œuvre Contribuer à la conception et réalisation de use cases Data stratégiques portés par les différentes entités Participer à l'amélioration continue de l'écosystème Data et des processus d'exploitation Compétences techniques :Databricks : administration, configuration et exploitation de workspaces. Python / PySpark / Spark. Git et pratiques de gestion de code. AWS et/ou Azure. Infrastructure as Code (IaC) : Terraform, CloudFormation ou équivalent. DevOps / DataOps : CI/CD, automatisation, industrialisation et déploiement. Environnements Agile : Scrum et/ou Kanban.
Contexte Dans le cadre d'un programme stratégique associant Data et intelligence artificielle générative, nous recherchons un Data Engineer AWS pour participer au développement et à l'évolution d'une Data Platform destinée à alimenter des solutions métiers et des cas d'usage IA. La plateforme est déjà en production sur AWS. La mission consiste à renforcer son architecture, développer de nouveaux pipelines et industrialiser la gestion des données selon une approche moderne de type Data Lakehouse. Missions Participer à la définition et à l'évolution de l'architecture de la Data Platform et du Lakehouse. Concevoir, développer et optimiser des pipelines d'ingestion et de transformation de données. Développer des jobs Data avec AWS Glue, Spark et PySpark. Intégrer les services AWS dédiés au Data Management. Développer et maintenir des API en Java 17/21 avec Spring Boot. Traiter des données internes et provenant de fournisseurs externes. Traduire les besoins fonctionnels en solutions techniques fiables et évolutives. Participer à la mise en place d'un environnement Data Lab. Industrialiser les développements et les déploiements avec des pipelines CI/CD. Mettre en place les tests automatisés et les contrôles de qualité du code. Garantir la sécurité, la performance et la maintenabilité des solutions. Participer aux mises en production. Assurer le support de production en cas d'incident majeur. Produire et maintenir la documentation technique. Compétences techniquesAWS : S3, Glue et services Data associés Data Engineering : Spark, PySpark et Hadoop Lakehouse : Apache Iceberg et Trino Développement : Java 17/21 et Spring Boot Bases de données : PostgreSQL et Oracle Tests : JUnit 5 et Mockito CI/CD : GitLab CI Qualité et gestion des dépendances : SonarQube, Maven et Artifactory Conteneurisation : Docker et Kubernetes GitOps et déploiement : Argo CD Formats : JSON, YAML et XML Outils : GitHub, GitHub Copilot, IntelliJ IDEA, Jira et SharePoint
Nous recherchons un profil Hadoop / PySpark qui sera en charge, en lien avec l'équipe de production applicative / devops, de mettre en œuvre techniquement les évolutions du datalake. Passionné par le développement et le traitement des données, capable de s'adapter à un environnement dynamique et en constante évolution, le candidat doit faire preuve d'autonomie, d'initiative et d'une forte capacité d'analyse pour résoudre des problèmes complexes. Les tâches suivantes seront confiées au consultant : Mettre en œuvre de nouvelles ingestions de données, data prep/transformation Maintenir et faire évoluer nos outils de gestion des pipelines de données (Pyspark + shell scripting) Adresser à l'équipe devops les demandes relatives aux évolutions de la plateforme
Projet "Pricing Excellence" : mettre en place une gestion globale de la croissance des revenus (RGM) pour fixer le juste prix au client. Prix basé sur la data, en équilibrant le coût total, la perception du prix par le client et la rentabilité. Forte ambition sur les outils digitaux, la data et l'IA. Équipe composée d'un centre d'excellence Pricing et d'une équipe transverse Data / IA. Objectif : optimiser les prix de façon proactive, suivre le marché et améliorer l'expérience client. Objectifs et livrables Travailler avec les Product Managers, Data Scientists et Data Analysts pour améliorer les produits de dataviz. Créer des frameworks d'analyse scalables sur l'écosystème pricing. Analyser et améliorer les processus de changement de prix. Trouver et chiffrer de nouvelles opportunités business ou produit. Transformer des problèmes business en insights actionnables. Accompagner les analystes juniors.
Bonjour à tous, Mission Data Engineer Senior / Expert – Lakehouse AWS Nous recherchons 2 Data Engineers Senior / Experts pour accompagner une équipe Data dans la conception, l'industrialisation et l'évolution de solutions data à grande échelle. La mission · Concevoir et optimiser des pipelines de données · Développer des flux batch, streaming et API · Structurer les transformations selon le modèle Médaillon (Bronze / Silver / Gold) · Contribuer à l'évolution d'une architecture Lakehouse · Garantir la qualité, la supervision et l'observabilité des traitements Stack technique Spark / PySpark • Python • AWS • DBT • Iceberg Airflow • Terraform • Docker • KubernetesAWS S3, Glue, EMR Trino / Starburst • Datadog ➕ Data Catalog 📍 Localisation : Île-de-France 🏠 Télétravail : 3 jours/semaine 📅 Démarrage : dès que possible ⏳ Durée : jusqu'à août 2027 🎓 Expérience : 8 ans minimum en Data Engineering Vous avez une solide expérience en Data Engineering, Big Data et architectures Lakehouse et vous maîtrisez Spark, AWS, Python et DBT ? 📩 N'hésitez pas à me contacter en MP ou à partager votre CV.
Contexte: Dans le cadre du renforcement d'une équipe Data, nous recherchons un(e) Data Engineer confirmé(e) pour intervenir sur une plateforme Big Data dédiée à la collecte, au traitement et à l'exploitation de données à grande échelle. Vous intégrerez une équipe en charge de la mise à disposition de données fiables et exploitables pour les équipes Data et participerez activement à l'évolution d'une plateforme moderne reposant sur des architectures distribuées et des technologies Cloud Native. Vos missions: Concevoir, développer et maintenir des pipelines de traitement de données avec PySpark / Spark. Préparer, nettoyer et mettre à disposition des jeux de données destinés aux équipes Data. Développer des indicateurs de performance (KPI) et des tableaux de bord sous Tableau. Superviser et maintenir une plateforme Big Data fonctionnant sur Kubernetes / OpenShift. Diagnostiquer et résoudre les incidents techniques liés aux traitements de données et aux applications. Participer à l'évolution des traitements Spark et des datasets. Déployer et maintenir les applications via Helm. Administrer les composants de la plateforme (Airflow, MinIO, MySQL, JupyterHub, etc.). Gérer les environnements de déploiement continu avec GitLab. Participer à l'administration du Data Lake (stockage, utilisateurs, règles de gestion). Contribuer à l'amélioration continue des performances, de la sécurité et de la disponibilité de la plateforme. Environnement technique : Python PySpark Apache Spark Scala Pandas Hadoop / HDFS Tableau Software Kubernetes OpenShift Helm GitLab Docker Airflow MinIO MySQL Data Lake Parquet