Nous recherchons un profil Hadoop / PySpark qui sera en charge, en lien avec l'équipe de production applicative / devops, de mettre en œuvre techniquement les évolutions du datalake. Passionné par le développement et le traitement des données, capable de s'adapter à un environnement dynamique et en constante évolution, le candidat doit faire preuve d'autonomie, d'initiative et d'une forte capacité d'analyse pour résoudre des problèmes complexes. Les tâches suivantes seront confiées au consultant : Mettre en œuvre de nouvelles ingestions de données, data prep/transformation Maintenir et faire évoluer nos outils de gestion des pipelines de données (Pyspark + shell scripting) Adresser à l'équipe devops les demandes relatives aux évolutions de la plateforme
Profil recherché : Ingénieur data confirmé/senior, avec une solide expérience sur Google Cloud Platform, pour rejoindre une nouvelle équipe projet. Anglais minimum 3/5 mandatory. Contexte : Les Data Engineers travaillent sur les systèmes sources (GTM, Shopping Data Hub), sur une plateforme de données centralisant l'ensemble des données nécessaires ainsi que sur le composant Personnalisation Context Service. La personne rejoindra une nouvelle équipe de Data Engineers chargée de développer le Personnalisation Context Service et sa plateforme de données, afin d'alimenter les modèles de machine learning avec des données de personnalisation plus pertinentes. Dans un premier temps, elle viendra renforcer une équipe travaillant sur les données Google Tag Manager (GTM) afin d'améliorer cette source essentielle pour le Personnalisation Context Service. Elle contribuera ensuite à la mise en œuvre de la plateforme de données, élément central du projet. Compétences techniques : GCP (DataProc, DataFlow, BigQuery, BigTable) Terraform Kafka set-up Github actions Scala/Java Montreal Associates is acting as an Employment Business in relation to this vacancy.
🏭 Secteurs stratégiques : Banque d'investissement PAS DE FULL REMOTE NI SOUS TRAITANCE MERCI 🗓 Démarrage : ASAP 💡 Contexte /Objectifs : Le département a lancé un programme stratégique, qui comporte plusieurs projets d'harmonisation des processus et outils. L'un de ces streams a pour vocation de constituer un datalake sur une stack Hadoop, afin de servir les besoins en data et reporting. Ce datalake a également pour vocation de devenir la brique centrale de l'architecture du SI . Nous recherchons un profil Hadoop / PySpark qui sera en charge, en lien avec l'équipe de production applicative / devops, de mettre en œuvre techniquement les évolutions du datalake. Passionné par les données, capable de s'adapter à un environnement dynamique et en constante évolution, le prestataire doit faire preuve d'autonomie, d'initiative et d'une forte capacité d'analyse pour résoudre des problèmes complexes. 🤝Principales missions : Les tâches suivantes seront confiés au consultant : • Mettre en œuvre de nouvelles ingestions de données, data prep/transformation • Maintenir et faire évoluer nos outils de gestion des pipeline de données (Pyspark + shell scripting) • Adresser à l'équipe devops les demandes relatives aux évolutions de la plateforme • Eventuellement mettre en œuvre une couche d'APIs afin d'exposer nos données
Contexte de la mission : Nous sommes à la recherche d'un profil pour une mission de prestation au sein du service Data d'un de nos clients : · Les missions du service consistent à Collecter, structurer et distribuer les données client dans une logique temps réel puis les rendre exploitables par les outils de la relation client et le pilotage Gérer les projets du périmètre Customer Data Platform (Environnement de données, moteur de scores/segmentation, API IA…) Administrer et faire évoluer les outils relationnels (Marketing automation, outils de personnalisation (moteur de recommandation, …)) Tâches à réaliser : Suivi de production quotidien - contrôles fonctionnels (analyse de cohérence d'écarts de volume entre J et J-1) sur tout le périmètre DataPrep, Manipulation de données complexes (SQL ou R) Projet et Maintenance évolutive · Participation aux ateliers de définition des indicateurs et des données brutes nécessaires aux besoins des métiers · Participation à la modélisation des bases de données / architectures · Spécification fonctionnelle des indicateurs · Elaboration de la stratégie et du plan de recette · Recette des indicateurs, via développement AMOA des indicateurs en R ou SQL, en comparaison des livrables MOE et analyse de cohérence fonctionnelle de données · Création de reportings (outils Tableau/OAC) simples · Documentation Compétences recherchées : Obligatoires : Connaissance SQL, et idéalement R ou Python Connaissance ou première approche de l'environnement Hadoop, Cloud et des opportunités autour du Big data Connaissance d'outils de Dataviz, idéalement Tableau et/ou OAC Appétence pour le fonctionnel bancaire Bonne capacité rédactionnelle Expérience nécessaire : minimum 2 années d'expérience sur le poste Langues : Français Date de démarrage : ASAP Localisation : Locaux du client situés à Brest Possibilité d'interventions hors site Client : OUI, 40% (limitée à un maximum de 40% du temps de prestation contractualisé – réalisable en France Métropolitaine uniquement). Pas d'interventions hors site prévues les 2 premiers mois. Astreintes / interventions HNO : NON Déplacements sur d'autres site client en France : NON Autre matériel requis : NON
Présentation de mission – Data Engineer GCP / BigQuery / Java / HadoopDans le cadre du lancement d'un nouveau programme Data, un acteur majeur de l'aéronautique et du transport aérien recherche un Data Engineer confirmé à senior pour rejoindre une équipe projet basée à Valbonne. Cette mission stratégique s'inscrit dans le développement d'une plateforme de données de nouvelle génération destinée à améliorer les capacités de personnalisation et d'alimentation des modèles de machine learning du groupe. Le consultant intégrera une équipe en charge de la conception et de l'évolution du Personalization Context Service, un composant clé permettant de centraliser, enrichir et exploiter les données issues de multiples sources, notamment Google Tag Manager (GTM) et le Shopping Data Hub. Dans un premier temps, il contribuera à l'amélioration des flux de données GTM afin d'optimiser la qualité et la pertinence des informations utilisées par les modèles analytiques. Il participera ensuite à la mise en œuvre et à l'évolution de la plateforme de données qui constituera le socle technique du projet. Le profil recherché dispose d'une solide expérience sur Google Cloud Platform, avec une maîtrise des services Dataproc, Dataflow, BigQuery et BigTable, ainsi que des outils d'automatisation et d'industrialisation tels que Terraform, GitHub Actions et Kafka. Une expertise en développement Scala et/ou Java est également indispensable. Un niveau d'anglais professionnel (minimum 3/5) est requis pour évoluer dans un environnement international. Démarrage : 01/09/2026 Fin de mission : 31/12/2026 renouvelable TJM maximum : 400 € Localisation : Côte d'Azur.
Nous recherchons un Data Engineer Hadoop pour intégrer une équipe dynamique dans le secteur bancaire. Ce rôle exige une expertise solide en gestion et analyse de données, avec un accent particulier sur l'utilisation de systèmes Hadoop, ainsi que des compétences en développement Python et SQL. RésuméLe poste de Data Engineer Hadoop consiste à travailler au sein d'une équipe pour gérer et analyser des données dans un environnement bancaire. L'objectif principal est d'assurer le bon fonctionnement des systèmes Hadoop tout en apportant des solutions basées sur Python et SQL. Responsabilités :Gérer et optimiser des pipelines de données en utilisant Hadoop et BigQuery. Développer des scripts en Python pour le traitement des données. Participer à la méthodologie agile en contribuant aux sprints Scrum. Collaborer avec l'équipe pour assurer des sauvegardes en cas de besoin. Assurer la qualité des données à travers l'écriture de requêtes SQL. Exigences clés :5-6 ans d'expérience en tant que Data Engineer. Expérience avec Hadoop. Compétences solides en Python. Connaissance de SQL. Anglais requis. Atouts :Expérience avec BigQuery. Connaissance des méthodologies Agile. Expérience dans le domaine bancaire. Connaissance de Google Cloud Platform (GCP). Autres Détails :Lieu : 94. Démarrage : ASAP. Durée : >12 mois. Télétravail : 2 jours / semaine.
Dans le cadre de l'évolution et du maintien en conditions opérationnelles d'une plateforme Big Data stratégique, nous recherchons un Expert Hadoop / Cloudera CDP Senior pour intégrer une équipe en charge de l'administration et de l'optimisation d'un environnement de données critique. Vos missionsAdministrer et maintenir les clusters Hadoop sous Cloudera CDP. Garantir la disponibilité, la performance et la sécurité de la plateforme. Automatiser les déploiements, patchs et opérations d'exploitation via Ansible et Terraform. Participer à la résolution d'incidents complexes et aux task forces techniques. Accompagner les montées de version des composants Hadoop. Déployer de nouvelles fonctionnalités à forte valeur ajoutée. Assurer la gestion des changements (préparation, tests, rollback, suivi). Produire et maintenir la documentation technique. Environnement techniqueHadoop Cloudera CDP 7.1.9 Kafka Apache NiFi Spark Ansible Terraform Terragrunt AWX Shell Scripting Linux Profil recherché Formation Bac+5 école d'ingénieurs ou université. Expérience significative en administration Hadoop en environnement de production. Expertise Cloudera CDP indispensable. Maîtrise d'Ansible et des pratiques d'automatisation. Bonne connaissance de Kafka, NiFi et Spark. Anglais professionnel courant. Autonomie, esprit d'analyse et capacité à intervenir sur des environnements critiques. Les plusMission au sein d'un environnement Big Data de grande envergure. Fort enjeu d'automatisation et de modernisation des infrastructures. Interventions sur des problématiques techniques à forte complexité. Exposition à un écosystème Cloudera/CDP mature et stratégique.
Client final : Secteur Industrie Type de contrat : Freelance / Indépendant uniquement Démarrage : Dès que possible – cette semaine Durée : Mission courte, haute intensité ("coup de poing") Budget : No limit / à négocier selon expertise (TJM ouvert) Contexte de la missionNotre client, acteur majeur du secteur industriel, doit impérativement migrer son cluster Azure HDInsight de la version 4.0 vers la version 5.1 d'ici le 31/08. Le cluster rencontre actuellement des problèmes de performance dégradée sur HBase, et le client recherche un expert capable d'intervenir en urgence pour : Identifier les causes racines de la dégradation de performance Auditer et optimiser la configuration du cluster HBase Sécuriser et accompagner la migration HDInsight 4.0 → 5.1 Résoudre les incidents bloquants
Vous intégrez une équipe en charge de l'infrastructure de gestion de la donnée d'un acteur bancaire en ligne à très forte volumétrie, sur un système d'information majoritairement construit en briques open source. L'équipe couvre l'intégralité du cycle de vie des plateformes data — conception, déploiement, administration, supervision — sans séparation build/run ni logique de procédures cloisonnées. Vous n'êtes pas administrateur de bases de données au sens classique : vous concevez, scalez, sécurisez et industrialisez les moteurs de données. L'optimisation de requêtes reste marginale. Volumétrie de référence : 180 instances MySQL avec sharding, cluster Hadoop d'environ 3 Po, stockage objet S3 de plusieurs pétaoctets. Vos missions : Traitement N3 des incidents de production sur l'ensemble des briques de gestion de la donnée Industrialisation des moteurs de données via déploiement automatisé (Terraform, sur VM pré-outillées EDR/hardening) Conception et exploitation des mécanismes de haute disponibilité, scalabilité, réplication et sharding à l'échelle Définition et exécution des stratégies de backup/restauration sur gros volumes Traitement de l'obsolescence : montée de version MySQL vers 8.x sur l'ensemble du parc Qualification et industrialisation de nouvelles briques techniques Pilotage de la couche système sous-jacente et des couches d'exposition (ex. Consul) Suivi des KPIs de production et mise en œuvre d'actions correctives Traitement des sujets de sécurité sur les plateformes data Interface quotidienne avec les équipes de développement et l'infrastructure Environnement technique : Socle commun : Linux (Debian/RHEL) niveau confirmé à avancé, Terraform/Ansible/Puppet, CI/CD, Git, Docker, Kubernetes (RKE2) en trajectoire GitOps (ArgoCD) Bigdata/Hadoop (cœur du poste) : Hadoop, Hive, Hue, Yarn, Zeppelin, Spark Streaming — niveau confirmé Autres : Cassandra, Kafka, Airflow niveau confirmé ; MySQL niveau avancé ; suite ELK Supervision : Zabbix, Prometheus, Grafana, Loki
Rattaché à l'équipe Data, vous êtes garant du bon fonctionnement, de la fiabilité et de la performance de l'écosystème Big Data de l'entreprise. Vous intervenez sur une plateforme Hadoop hybride, articulée avec des services Cloud GCP et des environnements Kubernetes-as-a-Service. Exploitation et maintien en conditions opérationnelles Vous assurez le MCO de l'écosystème Hadoop et garantissez la disponibilité, la performance et la sécurité des clusters. Vous supervisez l'état de santé des composants (HDFS, Yarn, Hive, Spark, Oozie) et contribuez à la fiabilisation du socle technique en réduisant progressivement les points de fragilité identifiés. Gestion des incidents et support N2/N3 Vous prenez en charge les incidents, menez les analyses techniques, identifiez les causes racines (RCA) et proposez les plans d'actions correctifs. Vous assurez le suivi jusqu'à résolution complète et maintenez la documentation technique associée. Amélioration continue et automatisation Vous contribuez aux chantiers d'amélioration de la plateforme (performance, architecture, déploiements) et développez ou optimisez les scripts d'automatisation en Python, Shell ou Ansible. Vous participez aux évolutions de l'écosystème et aux projets de transformation Big Data. Environnement Cloud GCP Vous participez à l'exploitation et à l'évolution des services GCP liés au Big Data (BigQuery, Dataproc, Cloud Storage), contribuez aux migrations et interconnexions entre Hadoop et GCP, et assurez le monitoring, la gouvernance ainsi que l'optimisation des coûts Cloud. Plateformes KaaS Vous administrez et exploitez les environnements Kubernetes-as-a-Service (GKE, Anthos ou équivalent interne), déployez et maintenez les services Data et applicatifs associés, surveillez les clusters et gérez ressources, namespaces et montée en charge. Vous contribuez à la sécurisation et à la standardisation des déploiements.
Au sein de la DSI de notre client, dont la mission est de concevoir et maintenir les applications stratégiques des métiers du Groupe. Dans le cadre de l'évolution du Data Lake CIO Office, nous recherchons un Data Engineer expérimenté afin de participer au développement, à l'évolution et à l'industrialisation des pipelines de données, en collaboration avec les équipes de production applicative et DevOps. Vous évoluerez dans un environnement Big Data moderne, orienté Cloud et Agile, avec des échanges réguliers avec les équipes internationales basées à Porto.
🚀 Qui sommes-nous ? Finaxys est un cabinet de conseil spécialisé dans les secteurs Banque, Finance et Assurance. Depuis plus de 15 ans, nous intervenons auprès des plus grandes institutions telles que BNP Paribas, Crédit Agricole, Société Générale, AXA, Malakoff Humanis, etc. en proposant des solutions technologiques innovantes (IA, Machine Learning, Data, Cloud, DevSecOps, etc.). Notre mission ? Accompagner nos clients dans leur transformation digitale et répondre aux défis IT les plus complexes grâce à l'expertise de nos équipes. 🎯 Votre mission : En tant que DataOps, vous rejoindrez les équipes techniques de nos clients grands comptes pour : Industrialiser et automatiser les déploiements avec Ansible Mettre en production de nouveaux clusters et mettre à l'échelle les clusters existants (scale horizontal et vertical) Documenter les offres Apporter une expertise technique aux utilisateurs de la plateforme Participer à la définition des architectures des futures briques de la plateforme Streaming Construire un MVP de ces services puis enrichir l'offre Prendre des éléments de la backlog qui ont été formalisés par le Squad Lead et mettre en œuvre les éléments de la backlog Réaliser l'intégration dans le SI (observabilité, alerting, gestion des droits, backup, etc) Rendre compte des difficultés auxquelles il est confronté et proposer des solutions pour les résoudre Participer à l'ensemble des rituels agiles de la Squad (Rétro, Démos, Pi Planning) Environnement technique / fonctionnel : Python, Java, Hadoop, Spark, Kafka, Flink, Kubernetes, Gitlab, Ansible, Vault, Artifactory, CI/CD, Jira
ContexteLe bénéficiaire souhaite une prestation d'accompagnement dans le cadre de la maintenance et la construction des plateformes Hadoop Cloudera (CDP). Il s'agit également d'un accompagnement au développement d'un ensemble des DATA Services, avec un challenge sur les fonctionnalités à développer et les standards de travail. MissionsInstallation de cluster Monitoring et administration des outils Big Data Administration de cluster Upgrade des distributions et des composants Hadoop Installation des différents composants sur Hadoop Support et résolution des problèmes N2 et N3 Mise en place d'environnements de développement et de test Sécurisation des clusters
📍 Contexte Société Générale recherche un Data Engineer / Expert Hadoop pour assurer l'administration, la maintenance et l'évolution de sa plateforme Big Data Cloudera CDP. La mission porte sur la fiabilité, la performance, les montées de version et l'automatisation de l'infrastructure Big Data. 🎯 Missions principales Administrer et maintenir les clusters Hadoop Cloudera CDP. Participer aux montées de version des composants Hadoop. Résoudre les incidents techniques complexes et intervenir en task force. Automatiser les déploiements, le patching et l'exploitation avec Ansible et Terraform/Terragrunt. Garantir la disponibilité, la performance et la sécurité de la plateforme. Gérer les changements (tests, rollback, mise en production). Collaborer avec Cloudera et les équipes internes. Rédiger la documentation technique. 🛠 Stack technique Big Data : Hadoop, Cloudera CDP 7.1.9, Spark Ingestion : Kafka, Apache NiFi Automatisation : Ansible, Terraform, Terragrunt, AWX Versioning / Scripting : Shell, Git, GitHub
Résumé Le Data Engineer GCP sera responsable de la conception, de la mise en œuvre et de l'optimisation des solutions de traitement de données sur GCP au sein de l'équipe Data. L'objectif principal de ce rôle est d'assurer une gestion efficace des données, d'améliorer l'accès aux données et de soutenir les processus analytiques au sein du secteur bancaire. Responsabilités : Concevoir et développer des solutions de données sur la plateforme GCP. Optimiser les requêtes et les performances des bases de données BigQuery. Collaborer avec les équipes fonctionnelles pour collecter et comprendre les exigences en matière de données. Suivre les meilleures pratiques d'ingénierie des données et assurer la qualité des données. Participer aux revues de code et aux pratiques de développement agile en utilisant Scrum. Must Haves : Expérience de 5-6 ans en ingénierie des données. Compétences solides en Python et SQL. Expérience avec BigQuery sur GCP. Connaissance des systèmes de contrôle de version, tels que Git. Expérience avec la méthodologie agile, notamment Scrum.
🚀 Opportunité – Expert Hadoop / Cloudera CDP / Ansible (H/F)Dans le cadre du renforcement d'une plateforme Big Data stratégique d'un grand groupe bancaire, nous recherchons un Expert Hadoop / Cloudera CDP pour intervenir sur des projets d'évolution, d'industrialisation et de maintien en conditions opérationnelles d'une infrastructure critique. Vos missionsAdministrer, maintenir et optimiser des clusters Hadoop (Cloudera CDP). Assurer la disponibilité, la performance et la sécurité de la plateforme Big Data. Automatiser les déploiements, patchs et configurations avec Ansible et Terraform. Participer aux montées de version des composants Hadoop. Intervenir sur des incidents complexes et contribuer aux task forces techniques. Déployer de nouvelles fonctionnalités d'infrastructure. Collaborer avec l'éditeur et les équipes techniques internes. Produire et maintenir la documentation technique. Environnement techniqueHadoop / Cloudera CDP 7.1.x Apache Kafka Apache NiFi Spark Ansible Terraform / Terragrunt Shell scripting GitHub / AWX Profil recherchéSolide expérience d'administration de plateformes Hadoop / Cloudera. Très bonne maîtrise d'Ansible et de l'automatisation d'infrastructure. Expérience sur Kafka, NiFi et Spark. Bonne connaissance des environnements Linux et des pratiques DevOps. Capacité à intervenir sur des problématiques techniques complexes et à accompagner les évolutions d'une plateforme Big Data. Informations complémentaires📍 Localisation : Île-de-France 🏢 Mission en présentiel 📅 Démarrage : ASAP ⏳ Mission longue durée (12 mois renouvelables) 📩 Si cette opportunité vous intéresse, n'hésitez pas à me contacter en message privé ou à envoyer votre CV.