Date de démarrage : ASAP Date de fin : 31/10/2026 Localisation : Paris Tarif Journalier Moyen (TJM) Max : 660 € Descriptif de la MissionAu sein des équipes Data, vous interviendrez sur la conception, le développement, la gouvernance et l'optimisation de nos plateformes de données. Vos activités principales s'articuleront autour de quatre grands piliers : 1. Développement & Architecture DataConcevoir et développer des pipelines de données robustes et scalables sur Databricks (PySpark, Spark SQL, Delta Live Tables). Mettre en place des architectures Lakehouse basées sur Delta Lake. Industrialiser et orchestrer les workflows ETL/ELT à l'aide de Databricks Workflows. 2. Gestion et Administration de la Plateforme DatabricksAdministrer l'espace de travail (gestion des workspaces, configuration des clusters, gestion des permissions). Assurer l'optimisation des coûts (finops) via la configuration fine, l'autoscaling et le monitoring des clusters. Implémenter et faire respecter les bonnes pratiques de sécurité (Unity Catalog, gestion des accès, lineage de la donnée). 3. Gouvernance & Qualité des DonnéesMettre en place des mécanismes stricts de qualité et de validation des données (expectations, tests automatisés). Documenter rigoureusement les modèles et les flux sur la plateforme. Garantir la fiabilité, la cohérence et la fraîcheur des données mises à disposition. 4. Collaboration & SupportCollaborer étroitement avec les Data Analysts, Data Scientists et les équipes métiers. Accompagner et former les utilisateurs clés dans l'adoption et la prise en main de l'écosystème Databricks. Participer activement aux revues de code, à la standardisation et au partage des bonnes pratiques d'ingénierie. Compétences RequisesTechniques (Incontournables) :Développement : Excellente maîtrise de PySpark ou Spark SQL. Écosystème : Forte expérience pratique avec Databricks (pipelines, clusters, notebooks, Unity Catalog). Architecture : Solides connaissances des architectures Lakehouse, du data modeling, des concepts ETL/ELT et des stratégies d'ingestion (batch & streaming). Cloud : Connaissance approfondie d'au moins un des principaux fournisseurs cloud (Azure, AWS ou GCP). DevOps : Maîtrise de Git et des pratiques de CI/CD (Azure DevOps, GitHub Actions, etc.). Souhaitées (Un plus) :Connaissances en MLflow, orchestration de modèles et pratiques MLOps. Notions avancées en DataOps, cost optimization (FinOps) et outils de monitoring. Expérience dans l'exploitation d'APIs et l'ingestion de données en temps réel (ex: Kafka).
Contexte de la mission Cette équipe en cours de construction est aujourd'hui constituée d'un chef de projet. Elle est accompagnée par diverses ressources du pôle, du département ou des équipes applicatives ( managers, coodinateurs, référent techniques, pilote de système applicatifs...). La mission du projet : Accompagner la migration et l'industrialisation d'une plateforme data cible autour de Databricks / Spark / Power BI Description du profil: Nous recherchons un Lead Data Engineer / Expert Databricks pour accompagner la migration et l'industrialisation d'une nouvelle plateforme data. Le profil interviendra sur la conception de pipelines Databricks / Spark, la structuration du modèle de données cible et la mise en place de standards de développement robustes, maintenables et industrialisés. Le profil devra accompagner les équipes de développement pour assurer le respect des bonnes pratiques établies pendant la migration. Une capacité à prendre du recul, à proposer des choix techniques structurants et à travailler avec des équipes Data, BI et métier est attendue. Une connaissance de Power BI est appréciée pour faciliter l'exposition des données vers les usages analytiques. Objectifs et livrables Activité principale : Concevoir, développer et maintenir des pipelines data sous Databricks / Spark Développer les traitements en Python, PySpark et SQL Contribuer à la définition et à la mise en œuvre du modèle de données cible Industrialiser les pipelines : standards de développement, tests, CI/CD, déploiement Mettre en place des traitements robustes, maintenables et scalables Orchestrer les traitements via Databricks Workflows / Lakeflow Jobs Contribuer à la qualité, à l'observabilité et à la fiabilité des traitements Participer au run : suivi de production, analyse d'incidents, amélioration continue Prendre en compte les enjeux de performance et de maîtrise des coûts Activité secondaire : Participer au cadrage des besoins avec le Product Owner et les équipes utilisatrices Contribuer aux choix techniques liés à la nouvelle plateforme data Participer à la mise en place des pratiques de développement Databricks Contribuer à l'interfaçage avec Power BI ou à des processus intégrés Databricks / Power BI Participer à l'intégration de sources d'alimentation du datalake, Kafka apprécié Contribuer à la documentation technique et aux standards d'équipe Participer aux rituels agiles et à l'amélioration continue de la feature team Stack technique de l'équipe: Obligatoires : Databricks, Spark, PySpark, Python, SQL Obligatoires : Modélisation data, Delta Lake, Unity Catalog Obligatoires : CI/CD, tests, industrialisation des pipelines Demandées : Certification Databricks, cloud public, Terraform Demandées : Databricks Workflows, observabilité Appréciées : Kafka, Lakeflow / DLT, Power BI Appréciées : Certification cloud