Contexte: Dans le cadre du renforcement d'une équipe Data, nous recherchons un(e) Data Engineer confirmé(e) pour intervenir sur une plateforme Big Data dédiée à la collecte, au traitement et à l'exploitation de données à grande échelle. Vous intégrerez une équipe en charge de la mise à disposition de données fiables et exploitables pour les équipes Data et participerez activement à l'évolution d'une plateforme moderne reposant sur des architectures distribuées et des technologies Cloud Native. Vos missions: Concevoir, développer et maintenir des pipelines de traitement de données avec PySpark / Spark. Préparer, nettoyer et mettre à disposition des jeux de données destinés aux équipes Data. Développer des indicateurs de performance (KPI) et des tableaux de bord sous Tableau. Superviser et maintenir une plateforme Big Data fonctionnant sur Kubernetes / OpenShift. Diagnostiquer et résoudre les incidents techniques liés aux traitements de données et aux applications. Participer à l'évolution des traitements Spark et des datasets. Déployer et maintenir les applications via Helm. Administrer les composants de la plateforme (Airflow, MinIO, MySQL, JupyterHub, etc.). Gérer les environnements de déploiement continu avec GitLab. Participer à l'administration du Data Lake (stockage, utilisateurs, règles de gestion). Contribuer à l'amélioration continue des performances, de la sécurité et de la disponibilité de la plateforme. Environnement technique : Python PySpark Apache Spark Scala Pandas Hadoop / HDFS Tableau Software Kubernetes OpenShift Helm GitLab Docker Airflow MinIO MySQL Data Lake Parquet
Au sein d'une équipe Data & Digital, vous intervenez sur le développement et l'industrialisation de solutions Big Data à forte volumétrie dans un environnement exigeant et innovant. Vous contribuerez à la conception, au développement et à l'exploitation de plateformes Data reposant sur des technologies Cloud et Big Data. Vos missionsDévelopper des applications Data et des API REST en Java/Spring. Participer aux études de faisabilité et aux choix techniques. Concevoir et implémenter des traitements Big Data. Mettre en œuvre les bonnes pratiques de qualité logicielle (TDD/BDD). Automatiser les déploiements et contribuer à l'industrialisation des environnements. Optimiser les performances applicatives et la stabilité des plateformes. Accompagner les équipes métiers et participer au support des phases de tests. Assurer le maintien en conditions opérationnelles des solutions. Profil recherchéBac+5 École d'Ingénieur ou équivalent. Expérience significative en Data Engineering et environnements Big Data. Excellente maîtrise de Java. Solides compétences sur Spark et Hadoop. Expérience des environnements Cloud AWS et/ou Azure. Bonne maîtrise de Python et/ou Scala. Expérience des API REST et du framework Spring. Environnement techniqueJava Spring Boot Spark Hadoop HDFS Oozie Scala Python AWS Azure Shell Unix Git / GitHub Containers TDD / BDD
Merci de contacter Sumi Delplanque. Nous recherchons un expert Big Data confirmé pour prendre en charge l'exploitation complète et la sécurisation d'un écosystème Cloudera Data Platform (CDP) en environnement de production, avec une architecture Lakehouse déjà en place. Le cœur du besoin : administration et MCO/MCS de Cloudera Nous avons besoin de quelqu'un qui assure : L'installation et l'administration du cluster avec TLS et Kerberos (donc un environnement sécurisé, pas un POC). MCO/MCS (Maintien en Conditions Opérationnelles/de Sécurité) des services cœur : HDFS, Yarn, Zookeeper, Cloudera Manager. Des morning checks quotidiens avec rédaction de rapports synthétisés : visibilité et traçabilité sur l'état de la plateforme, pas juste un "ça marche". Le périmètre technique : une architecture Lakehouse complète Nous requérons un profil capable de couvrir toute la chaîne de valeur de la donnée : Il assure le déploiement et le MCO/MCS de l'écosystème Cloudera (Cloudera manager, services Cloudera data platform : HDFS, Yarn, Zookeeper …). C'est un poste de généraliste expert plutôt que de spécialiste pointu sur un seul outil : nous voulons une personne qui parle à toute la stack, pas plusieurs experts séparés. Les compétences transverses attendues Automatisation : Ansible pour les configs, certificats, keystores. Réduction des interventions manuelles répétitives. Process de production : incidents, ticketing, ITIL (gestion des incidents, problèmes, changements). Opération dans un cadre structuré, probablement avec des SLA contractuels. Anglais technique : pour échanger directement avec l'éditeur Cloudera (support niveau 3, escalades). DevOps : Github, Jenkins pour le versionning et les packages. Linux avancé : analyse de logs pour le traitement d'incidents. Contribution active : force de proposition sur l'exploitabilité, participation aux comités et réunions d'équipe. Ce que ça signifie en synthèse : Nous avons besoin d'un administrateur systèmes expert Big Data qui combine trois casquettes : opérationnelle (exploitation quotidienne, incidents, SLA), technique transverse (toute la stack Lakehouse Cloudera) et amélioration continue (automatisation, proposition, reporting). C'est un poste clé pour la stabilité et la sécurité d'une plateforme de données critique en production. Lieu de travail : La Défense 2 jours de télétravail par semaine (full présentiel le 1er mois)
Pour un client dans le domaine de la finance - Connaissance Métier Finance de Marché / CIB : compréhension immédiate des notions de VaR, Grecs, P&L Explain, produits financiers (FICC, Equities). Il doit pouvoir challenger les équipes sans formation préalable sur le métier. - Compétences en modélisation de données et en intégration de donné - Expertise avancée en Power BI (visualisation, DAX, Power Query, RLS). - Maîtrise des requêtes SQL (SQL Server, Hadoop, ..). es provenant de sources multiples. - Capacité à travailler en équipe et à communiquer efficacement avec des parties prenantes techniques et non techniques. - Une maitrise de l'ensemble de la Power Platform (App, Automate…) serait appréciée. - Bon niveau d'anglais exigé.
Contexte de la mission Poste de data engineer, experimenté à senior, avec un savoir faire significatif de realisation de traitements Spark en Scala (pas Python/Pyspark, ou alors en compétence secondaire) Une experience de flux réalisés sur Databricks/Azure serait un plus important. Pour intégrer une équipe de data engineering dans la filiale d'une grande banque française ATTENTION : pas de portage d'independant, ne nous proposez que des collaborateurs que vous avez en CDI Objectifs et livrables Objectifs et livrables Activités principales Développement et intégration Développer et maintenir des pipelines de données sur l'infrastructure existante (batch, streaming, API) Concevoir, optimiser et industrialiser les traitements de données en Spark (Scala) Assurer l'intégration et la gestion de flux de données via Kafka et HDFS Exploiter et administrer des bases de données NoSQL (Cassandra) Gestion du run (rôle tournant) Surveiller la performance et la scalabilité des processus Prendre en charge la résolution des incidents et l'amélioration continue en production Escalader auprès des sachants les anomalies critiques Communiquer les incidents aux parties prenantes le cas échéant. Relation métier et vulgarisation Participer aux ateliers métier pour comprendre les besoins et proposer des solutions adaptées Vulgariser et documenter les travaux réalisés pour faciliter leur appropriation par l'équipe et les parties prenantes Profil recherché Formation : Bac+5 en informatique, data engineering ou équivalent Expérience : Minimum 3 ans sur un poste similaire Compétences techniques requises Maîtrise du développement Spark (Scala) Bonne connaissance de l'écosystème Big Data : HDFS, Kafka, Cassandra Expérience sur des architectures batch, streaming et API Pratique du versioning (git) et des outils d'intégration continue Bonus : experience en env Databricks/Azure Compétences complémentaires (atouts) Databricks Expérience sur Airflow Expérience sur des environnements cloud (Azure) Développement Node.js Pratique de la CI/CD et des outils de monitoring Savoir-être Esprit d'équipe, sens du service et de la communication Capacité à vulgariser et à transmettre ses connaissances Capacité d'analyse Autonomie, rigueur et sens de l'organisation
ContexteDans le cadre du renforcement de son équipe Data & IA, notre client recherche un Data Engineer / Administrateur Plateforme Data pour assurer l'administration, l'exploitation et l'évolution des infrastructures Data basées sur Cloudera CDP et les technologies Open Source. Vous interviendrez sur des plateformes critiques en collaboration avec les équipes applicatives, infrastructures, métiers et internationales afin de garantir la disponibilité, les performances et l'évolution des environnements Data. MissionsAdministration & ExploitationAdministrer et maintenir les plateformes Data Cloudera CDP. Garantir le maintien en condition opérationnelle des infrastructures. Superviser les plateformes et assurer le traitement des incidents. Participer aux astreintes et aux interventions hors horaires ouvrés. Optimiser les performances et la capacité des plateformes. Data EngineeringConcevoir les solutions d'ingestion de données (API). Mettre en œuvre des architectures de stockage (Hadoop, Ozone, Druid, ClickHouse...). Développer et automatiser les traitements de données. Mettre en place les tests unitaires et d'intégration. Industrialiser les traitements de nettoyage et de transformation des données. Évolution des plateformesParticiper aux migrations des clusters Hadoop Cloudera. Contribuer au déploiement des nouvelles plateformes Cloudera Data Services sous OpenShift/Kubernetes. Être force de proposition sur les évolutions techniques. Participer au design des infrastructures Data. Support & ExpertiseRésoudre les incidents complexes (Hive, Spark, Yarn...). Accompagner les équipes applicatives et métiers. Assurer un support technique de haut niveau. Participer à la documentation et au partage de connaissances. Environnement techniqueImpératifCloudera CDP 7.1.x RedHat Enterprise Linux 8 & 9 Python Java Ansible DevOps Très bonnes connaissancesHadoop Hive HBase Kafka Spark Solr Knox Ranger ZooKeeper Kerberos LDAP AppréciéesOpenShift Kubernetes Trino / Starburst Airflow Flink Maven Gradle ClickHouse Ozone Druid Profil recherchéFormation Bac+5 en informatique ou équivalent. Expérience significative sur des plateformes Big Data Cloudera. Expertise Linux RedHat. Bonne maîtrise des environnements Open Source Data. Solides compétences en automatisation (Ansible). Connaissances DevOps. Capacité à analyser et résoudre des incidents complexes. Esprit d'équipe, autonomie et bonnes capacités de communication. ConditionsCouverture de l'équipe : 8h00 – 19h00 Astreintes et interventions hors horaires ouvrés selon un planning de rotation. Niveau attendu : Confirmé / Senior (N4). Compétences clés : Cloudera CDP 7.1.x, RedHat 8/9, Hadoop, Spark, Hive, Kafka, Python, Java, Ansible, DevOps, OpenShift, Kubernetes.
Tech Lead Power BI - Migration BI & Industrialisation, SSIS, SSAS, SSRS & SQL Server, Microsoft Business Intelligence (msbi), Power BI Cloud & Report ServerProject contextAu sein du département entreprise France, dans les deux équipes epilot et Data factory. Goals and deliverablesIntervention sur plusieurs périmètres de la vente et de l'après-vente. Gestion partie intégration de la donnée depuis plusieurs sources: EDH (base de données sous Hadoop), API, fichiers,. vers nos serveurs SQL. Analyse de données, le développement de cubes tabulaires et création de rapports Power BI. Expected skillsSkillsSkill level Migration BI & Industrialisation SSIS, SSAS, SSRS & SQL Server Microsoft Business Intelligence (msbi) Power BI Cloud & Report Server
Au sein d'une équipe Architecture d'une Direction des Infrastructures et de la Production de l'un de nos clients, nous recherchons un(e) architecte technique généraliste qui contribuera aux activités suivantes : - Etudes techniques & Design - Cadrage budgétaire - Définition des best practices d'architecture - Documentation (DAT) - Accompagnement de la stratégie Move2Cloud - Accompagnement des équipes d'exploitation et de développement Environnement général : - Plateformes E-commerce - Plateformes BackOffice & Logistique - Cloud Public Azure & GCP - Cloud Privé (Infrastructure VMWARE Infogérée) - CDN Akamai, LoadBalancing BigIP F5, Firewalling (Checkpoint & Fortinet) - Bases de données MS SQL Server, PostgreSQL, MySQL, IBM DB2, Oracle - Big Data Hadoop, Terradata, MapR, BigQuery, DataBricks - Conteneurisation Docker & Orchestration AKS - Progiciels SAP, Siebel, HRAccess