OCTOGONE
Il s'agit d'assister le client en tant qu'ingénieur DATA sur le service de cloud datawarehouse sous Azure. Nous recherchons un Data Engineer ayant déjà fait du DevOps, capable de travailler à la fois sur les traitements de données (Databricks, architecture médaillon bronze / silver / gold) et sur l'infrastructure cloud associée (Azure, Terraform, Jenkins), dans un contexte d'entreprise avec des standards Git et CI/CD.Du conseil, des études d'opportunité et dossiers d'innovation seront demandés. Missions principales (Data & supervision) • Concevoir, développer et enchaîner des notebooks Databricks en PySpark pour alimenter les zones bronze, silver et gold. • Maîtriser et exploiter les formats parquet, delta et csv, en comprenant leurs impacts sur la performance, la robustesse et les coûts. • Optimiser les notebooks et jobs existants (performance, qualité de données, coûts d'exécution). • Mettre en place et faire vivre la supervision des flux : monitoring des pipelines Azure Data Factory, suivi de la qualité des données, création d'alertes et de tableaux de bord de suivi. • Contribuer à la fiabilisation globale de la plateforme data (détection d'anomalies, reprise sur incident, bonnes pratiques de développement). • Collaborer avec les équipes métier et techniques pour comprendre les besoins, prioriser les évolutions et industrialiser les traitements. Missions annexes (DevOps & infra) • Mettre à jour et faire évoluer les repos d'infrastructure (Terraform, Jenkins) en suivant les templates et bonnes pratiques du git d'entreprise. • Maintenir, paramétrer et exécuter les pipelines Jenkins liés aux déploiements et aux traitements data, en garantissant leur fiabilité et leur traçabilité. • Participer activement à la vie des repos GitHub : revue de code (PR/MR), gestion des branches, compréhension des workflows Git avancés, automatisation et diffusion des bonnes pratiques. Technologies & environnement technique • Cloud & data platform : Azure, Databricks, Azure Data Factory, Azure Storage Account, Azure Key Vault, Power BI. • Infra & CI/CD : Terraform, Jenkins, GitHub (PR/MR, workflows), intégration runtime via VM. • Langages & frameworks : Python, PySpark (DataFrame API, Spark SQL), SQL. • Formats & data : parquet, delta, csv… • Librairies Python courantes : o pyspark (transformations, jointures, agrégations, optimisations). o delta-spark et librairies Delta Lake pour la gestion des tables (ACID, time travel, optimisation). o Packages Azure (azure-identity, azure-keyvault-secrets, azure-storage-blob, etc.) pour l'intégration avec les services cloud.