RésuméLe projet a pour objectif la création et l'évolution d'un produit de données à destination des actuaires, qui utiliseront ces données pour l'entraînement de leurs modèles (tarifaires par exemple). Le candidat rejoindra une équipe de 4 data engineers (dont un lead) pour participer à la mise en place de ce produit de données. Responsabilités :Proposer et valider des solutions techniques Mettre en œuvre des solutions performantes dans un cadre Agile Participer aux activités opérationnelles courantes Must Haves :Expérience avec Cloud Azure (Data Factory, ADLS, Databricks) Compétences obligatoires en PySpark et Python Bonnes connaissances des architectures de données Compétences en SQL Nice to Haves :Connaissance de Scala Expérience sur les processus DevOps et CI/CD Autres Détails :Localisation : Hauts-de-Seine (92) Télétravail : 3 jours
Dans le cadre du renforcement d'une équipe Data, nous recherchons un(e) Data Engineer pour intervenir sur une plateforme Data à fort volume, au sein d'un environnement international et orienté produit. Vous rejoindrez une équipe technique en charge de construire, industrialiser et faire évoluer des solutions permettant de collecter, transformer, fiabiliser et exposer la donnée à destination des équipes Data et métiers. L'environnement repose sur une Modern Data Stack, avec une architecture de type Lakehouse, et de forts enjeux autour de la scalabilité, de l'automatisation et de la qualité des données. Vos missionsConcevoir, développer et maintenir des pipelines de données robustes et scalables. Collecter, transformer et mettre à disposition des données provenant de différentes sources. Développer des traitements en Python / PySpark / SQL. Orchestrer les pipelines de données et les workflows avec Airflow. Participer à la modélisation et à la structuration des données. Développer et maintenir les transformations avec dbt. Mettre en place des contrôles permettant de garantir la qualité et la fiabilité des données. Optimiser les performances et les coûts des traitements. Participer à l'amélioration continue de la plateforme Data. Contribuer aux sujets de Data Governance, Data Lineage et Data Contracts. Appliquer les bonnes pratiques de Software Engineering : Git, GitHub, CI/CD, tests et documentation. Travailler en étroite collaboration avec les Data Engineers, Analytics Engineers, Data Analysts et Data Scientists. Environnement techniqueCloud : AWS / GCP Data Platform : Databricks, S3 Processing : Spark / PySpark Langages : Python, SQL, idéalement Scala Orchestration : Airflow Transformation : dbt Data Quality : Great Expectations Versioning / Delivery : Git, GitHub, CI/CD Data : Lakehouse, Data Lineage, Data Governance, Data Contracts Méthodologies : Agile / Scrum / Kanban