Find your next tech and IT Job or contract PySpark

Your search returns 32 results.
Contractor
Permanent

Job VacancyDéveloppeur Big Data Hadoop/PySpark/Python

Digistrat consulting
Published on
Apache Hive
Apache Spark
Hadoop

3 years
38k-43k €
300-400 €
Paris, France
🏭 Secteurs stratégiques : Banque d'investissement PAS DE FULL REMOTE NI SOUS TRAITANCE MERCI 🗓 Démarrage : ASAP 💡 Contexte /Objectifs : Le département a lancé un programme stratégique, qui comporte plusieurs projets d'harmonisation des processus et outils. L'un de ces streams a pour vocation de constituer un datalake sur une stack Hadoop, afin de servir les besoins en data et reporting. Ce datalake a également pour vocation de devenir la brique centrale de l'architecture du SI . Nous recherchons un profil Hadoop / PySpark qui sera en charge, en lien avec l'équipe de production applicative / devops, de mettre en œuvre techniquement les évolutions du datalake. Passionné par les données, capable de s'adapter à un environnement dynamique et en constante évolution, le prestataire doit faire preuve d'autonomie, d'initiative et d'une forte capacité d'analyse pour résoudre des problèmes complexes. 🤝Principales missions : Les tâches suivantes seront confiés au consultant : • Mettre en œuvre de nouvelles ingestions de données, data prep/transformation • Maintenir et faire évoluer nos outils de gestion des pipeline de données (Pyspark + shell scripting) • Adresser à l'équipe devops les demandes relatives aux évolutions de la plateforme • Eventuellement mettre en œuvre une couche d'APIs afin d'exposer nos données
View this job
Contractor

Contractor jobData Engineer Big Data / PySpark

DATAMED RESEARCH
Published on
Kubernetes

1 year
400-490 €
Ile-de-France, France
Contexte: Dans le cadre du renforcement d'une équipe Data, nous recherchons un(e) Data Engineer confirmé(e) pour intervenir sur une plateforme Big Data dédiée à la collecte, au traitement et à l'exploitation de données à grande échelle. Vous intégrerez une équipe en charge de la mise à disposition de données fiables et exploitables pour les équipes Data et participerez activement à l'évolution d'une plateforme moderne reposant sur des architectures distribuées et des technologies Cloud Native. Vos missions: Concevoir, développer et maintenir des pipelines de traitement de données avec PySpark / Spark. Préparer, nettoyer et mettre à disposition des jeux de données destinés aux équipes Data. Développer des indicateurs de performance (KPI) et des tableaux de bord sous Tableau. Superviser et maintenir une plateforme Big Data fonctionnant sur Kubernetes / OpenShift. Diagnostiquer et résoudre les incidents techniques liés aux traitements de données et aux applications. Participer à l'évolution des traitements Spark et des datasets. Déployer et maintenir les applications via Helm. Administrer les composants de la plateforme (Airflow, MinIO, MySQL, JupyterHub, etc.). Gérer les environnements de déploiement continu avec GitLab. Participer à l'administration du Data Lake (stockage, utilisateurs, règles de gestion). Contribuer à l'amélioration continue des performances, de la sécurité et de la disponibilité de la plateforme. Environnement technique : Python PySpark Apache Spark Scala Pandas Hadoop / HDFS Tableau Software Kubernetes OpenShift Helm GitLab Docker Airflow MinIO MySQL Data Lake Parquet
View this job
Contractor
Permanent

Job VacancyExpert BMC Helix Discovery - Data Product

VISIAN
Published on
API
BMC Discovery
ITSM

1 year
Paris, France
ContexteDans le cadre du programme ITAM et la mise en place du Group Global Inventory ainsi que l'alimentation industrielle de la CMDB Group, le bénéficiaire renforce ses activités autour du produit BMC Helix Discovery. MissionsResponsable Discovery Data product : Développement des query API Discovery en regard des besoins production Construction des data sets dans l'outil de query engine Exposition du data product à la consommation opérationnelle Interfaçage au MCP pour alimenter l'IA Production MCO et optimisation des query et data sets DevOps Discovery : Configuration et paramétrage de BMC Discovery : configurer et paramétrer BMC Discovery pour collecter les données d'actifs informatiques, telles que les périphériques réseau, les logiciels, les matériels, etc. Intégration des données de BMC Discovery : intégrer les données de BMC Discovery dans le système de nettoyage des données pour enrichir les données existantes. Définition des règles de correspondance : définir des règles de correspondance pour associer les données de BMC Discovery avec les données existantes dans le système. Mise en place de la synchronisation des données : mettre en place la synchronisation des données entre BMC Discovery et le système de nettoyage des données. Gestion des erreurs et des exceptions : gérer les erreurs et les exceptions qui peuvent survenir lors de la collecte, de l'intégration et de la synchronisation des données. Outils & EnvironnementBMC Helix Discovery (mandatory) Starburst (Data product, MCP, AI) Spark / Pyspark ServiceNow ITSM (change, incident, problem, request) Jira / Confluence Nice to have : Tableau Server / Tableau Desktop / PowerBI / Dataikku Talend Real Time Big Data / ESB, ETL, EAI Talend Data Catalogue PostGreSQL / Apache Kafka / S3 storage Environnement techniqueL'expert utilisera BMC Discovery et d'autres outils pour collecter et intégrer les données, pour ensuite les exposer en data products afin d'alimenter des IA. DonnéesTravail avec des données d'actifs informatiques, notamment des informations sur les périphériques réseau, les logiciels, les matériels, etc. Système de nettoyage des donnéesL'expert doit comprendre le fonctionnement du système de nettoyage des données et comment les données de BMC Discovery peuvent être intégrées pour améliorer la qualité des données.
View this job
Permanent

Job VacancyTech Lead Databricks

KOMEET TECHNOLOGIES
Published on
Databricks
PySpark

55k-70k €
Paris, France
En tant que Tech Lead, vous êtes l'expert Data Engineering et le référent technique dans vos missions. Vous intervenez principalement sur les problématiques d'ingestion, de traitement et d'industrialisation des données sur la data plateforme. Sans être responsable de l'architecture Data globale, vous avez un rôle clé dans la qualité des livrables, la standardisation des pratiques et la montée en compétence des Data Engineers. Expérience attendue : 7 à 12+ ans en Data Engineering avec une expérience dans un rôle de référent technique Vous correspondez au/à la Tech Lead que nous recherchons si : Vous disposez d'un leadership technique, reconnu et légitime auprès des équipes Vous savez animer, encadrer et fédérer une équipe autour de bonnes pratiques techniques et d'objectifs communs Vous faites preuve d'une excellente communication, associée à une forte capacité pédagogique Vous adoptez un esprit critique constructif et savez challenger les choix techniques dans une logique d'amélioration continue Vous êtes capable de prendre du recul sur des problématiques techniques afin de proposer des solutions pertinentes et durables Vous êtes autonome, proactif et doté d'un fort sens des responsabilités Vous favorisez le partage de connaissances et la montée en compétence collective Vous savez collaborer efficacement avec des rôles transverses (Architectes, Product Owners, DevOps, ML Engineers) Vous maîtrisez Python et SQL à un niveau avancé, avec une forte sensibilité aux bonnes pratiques de software engineering (qualité, maintenabilité, testabilité) Vous êtes capable de définir, documenter et faire appliquer des standards de développement, incluant la structuration des projets, les conventions de code et les stratégies de tests Vous avez une expérience significative dans la mise en place et la maintenance de chaînes CI/CD appliquées aux pipelines Data Vous portez une attention particulière à la qualité des données, à la testabilité et à l'observabilité des pipelines en production Vous pratiquez régulièrement les revues de code, le mentoring et l'accompagnement technique des Data Engineers Vous êtes en mesure de concevoir des frameworks internes et des briques techniques réutilisables afin d'industrialiser et standardiser les développements Vous comprenez les enjeux de performance, de scalabilité et de maîtrise des coûts, et savez les intégrer dans vos choix techniques
View this job
Permanent

Job VacancyTech Lead Databricks - Lyon

KOMEET TECHNOLOGIES
Published on
Databricks
PySpark

50k-60k €
Lyon, Auvergne-Rhône-Alpes
En tant que Tech Lead, vous êtes l'expert Data Engineering et le référent technique dans vos missions. Vous intervenez principalement sur les problématiques d'ingestion, de traitement et d'industrialisation des données sur la data plateforme. Sans être responsable de l'architecture Data globale, vous avez un rôle clé dans la qualité des livrables, la standardisation des pratiques et la montée en compétence des Data Engineers. Expérience attendue : 7 à 12+ ans en Data Engineering avec une expérience dans un rôle de référent technique Vous correspondez au/à la Tech Lead que nous recherchons si : Vous disposez d'un leadership technique, reconnu et légitime auprès des équipes Vous savez animer, encadrer et fédérer une équipe autour de bonnes pratiques techniques et d'objectifs communs Vous faites preuve d'une excellente communication, associée à une forte capacité pédagogique Vous adoptez un esprit critique constructif et savez challenger les choix techniques dans une logique d'amélioration continue Vous êtes capable de prendre du recul sur des problématiques techniques afin de proposer des solutions pertinentes et durables Vous êtes autonome, proactif et doté d'un fort sens des responsabilités Vous favorisez le partage de connaissances et la montée en compétence collective Vous savez collaborer efficacement avec des rôles transverses (Architectes, Product Owners, DevOps, ML Engineers) Vous maîtrisez Python et SQL à un niveau avancé, avec une forte sensibilité aux bonnes pratiques de software engineering (qualité, maintenabilité, testabilité) Vous êtes capable de définir, documenter et faire appliquer des standards de développement, incluant la structuration des projets, les conventions de code et les stratégies de tests Vous avez une expérience significative dans la mise en place et la maintenance de chaînes CI/CD appliquées aux pipelines Data Vous portez une attention particulière à la qualité des données, à la testabilité et à l'observabilité des pipelines en production Vous pratiquez régulièrement les revues de code, le mentoring et l'accompagnement technique des Data Engineers Vous êtes en mesure de concevoir des frameworks internes et des briques techniques réutilisables afin d'industrialiser et standardiser les développements Vous comprenez les enjeux de performance, de scalabilité et de maîtrise des coûts, et savez les intégrer dans vos choix techniques
View this job
Contractor
Permanent

Job VacancyData Engineer Microsoft Fabric

5COM Consulting
Published on
Microsoft Fabric
Microsoft Power BI
PySpark

2 years
40k-45k €
400-450 €
Paris, France
Nous recherchons pour un de nos clients un Data Engineer Microsoft FabricCompétences obligatoiresMicrosoft Fabric (2 ans d'expérience minimum) PySpark Lakehouse / OneLake Notebooks Fabric Spark dans Fabric Fabric Endpoints Data Engineering sous Fabric Power BI (intégration avec Fabric) Modélisation de données Compétences fonctionnellesGouvernance des données Data Products Data Mesh Architecture Médaillon (Bronze / Silver / Gold) Expérience recherchéeMise en œuvre complète de la chaîne Microsoft Fabric : Ingestion des données Transformation Modélisation Industrialisation Exposition vers Power BI Construction de pipelines de transformation avant restitution dans Power BI. Expérience sur des plateformes Data modernes. Compétences appréciées (plus)Expérience avec dbt (Data Build Tool) pour la transformation et la modélisation des données. Connaissance des bonnes pratiques d'industrialisation et de versionning des modèles de données. Expérience sur Azure Data Platform (Synapse, Data Factory, Databricks) dans un contexte Microsoft Fabric. Le candidat devra maîtriserOneLake Lakehouse Notebooks PySpark Data Engineering Fabric Data Factory / Pipelines Fabric Endpoints Semantic Models Power BI Ce qui est attenduLe consultant devra être capable d'intervenir immédiatement sur une plateforme Microsoft Fabric en production et maîtriser l'ensemble de la chaîne Data, de l'ingestion à la transformation des données, jusqu'à leur exposition dans Power BI. Le besoin porte sur un profil très opérationnel, autonome et rapidement productif. Une expérience avec dbt (Data Build Tool) constituera un atout supplémentaire.
View this job
Contractor

Contractor jobData Engineer Senior

Keypeople Consulting
Published on
Amazon S3
AWS Cloud
AWS Glue

12 months
400-480 €
Paris, France
Nous recherchons actuellement un(e) Data Engineer Senior pour accompagner une équipe Data sur des sujets à forts enjeux autour de la Data Engineering, du Big Data et des architectures Lakehouse. 🔎 1 Data Engineer Senior 🎯 Missions principales : · Concevoir, développer et optimiser des pipelines de données à grande échelle · Mettre en œuvre des flux batch, streaming et ingestion via API · Structurer les transformations selon le modèle Médaillon (Bronze / Silver / Gold) · Développer et industrialiser les pipelines avec DBT, Spark et Iceberg · Contribuer à l'évolution et à l'optimisation de l'architecture Lakehouse · Déployer et maintenir les pipelines dans un environnement Cloud AWS · Orchestrer les workflows ETL / ELT avec Airflow · Mettre en œuvre l'Infrastructure as Code avec Terraform · Travailler sur des environnements conteneurisés avec Docker / Kubernetes · Garantir la disponibilité, la supervision et l'observabilité des traitements · Participer à la gestion des incidents et à l'amélioration continue · Définir et mettre en œuvre les règles de qualité des données : tests, validations et contrôles automatisés · Documenter les architectures, pipelines et règles métier · Garantir la conformité des flux, notamment dans le respect des exigences RGPD ⚙️ Environnement technique : · DBT / Data Catalog · Apache Spark · Apache Iceberg · AWS : Glue, EMR, S3… · Terraform · Airflow · Python · Trino / Starburst · Datadog · Docker / Kubernetes · Architectures Big Data / Lakehouse · Modélisation et collecte de données 🧑‍💻 Profil recherché : · Minimum 8 ans d'expérience en Data Engineering · Expertise confirmée des architectures Big Data et Lakehouse · Très bonne maîtrise de DBT, Spark, Iceberg, AWS et Terraform · Solide expérience sur les services AWS, notamment Glue, EMR et S3 · Connaissance de Trino / Starburst et Datadog · Bon niveau en Python · Forte capacité d'analyse et de compréhension des enjeux métiers · Expérience dans l'accompagnement et l'encadrement de profils juniors · Autonomie, rigueur et forte culture de l'amélioration continue 🌍 Contexte : · Environnement Data à grande échelle · Projets autour de la modernisation et de l'industrialisation des plateformes Data · Forts enjeux Lakehouse, Data Quality, Observabilité et Cloud · Collaboration avec des équipes Data, IT et métiers 📍 Localisation : Île-de-France – Hybride 🏠 Télétravail : 3 jours par semaine 📅 Démarrage : fin août 2026 💼 Mission longue durée Si vous êtes intéressé(e) ou connaissez un(e) Data Engineer Senior correspondant à ce profil, n'hésitez pas à me contacter en MP ou directement par téléphone. Cordialement,
View this job
Contractor
Permanent
Fixed term

Job VacancyBusiness analyst DATA

R&S TELECOM
Published on
Agile Method
Alteryx
Big Data

3 years
Bordeaux, Nouvelle-Aquitaine
ENTITE CONCERNEE Le portefeuille des "Fonctions mutualisées (DSI360)" a pour objectif de piloter et maintenir un écosystème applicatif central, garantissant la cohérence, la fiabilité et l'interopérabilité des données et des socles techniques pour l'ensemble des applications du domaine. Le portefeuille de solutions « Fonctions Mutualisées » est organisé autour de 2 activités principales : 1. La "Gestion de la donnée" qui a pour objectif répondre aux enjeux stratégiques du domaine (DPS) en termes de data (décisionnel, big data, intelligence artificielle, open data) en fournissant les données et outils nécessaires aux cas d'usage pour les différents métiers de la DPS, en particulier de la Formation Professionnelle et compétences 2. Les "Référentiels et Fonctions transverses" qui ont pour missions principales de : • Gérer les bases de données centrales (clients, paramètres, accédant) la cohérence et la traçabilité des données référentielles. • Assurer la Gestion documentaire et des courriers. Centralisation des paramètres et configurations • Documenter et industrialiser les configurations pour faciliter les déploiements et les évolutions. CONTEXTE DE LA MISSION La présente mission s'inscrit dans les activités Data de la Retraite et du Handicap de la DSI à Bordeaux et plus particulièrement dans l'équipe produit Data DL7 • Un lac de données DPS qui héberge des données sources venant du SI Opérationnel de la Direction • Des datamarts DL7 répondant à l'ensemble des usages Data de reporting et de pilotage de la retraite et du handicap • Des usages de Data hébergés sous technologie Hadoop / PySpark… • Des applications de DataViz (internes et externes) développées avec l'outil Tableau • Des usages d'exploration de la données et d'analyse Adhoc : SQL et Alteryx CONTENU DE LA MISSION Il est attendu de l'intervenant les travaux suivants : • Conception, recette, mise en production et suivi d'évolutions et correctifs. • Rédaction des user stories ou SFD des évolutions (amélioration de l'outil, évolution réglementaire, extension de périmètre) • Réalisation des plans recette et des TNR • Suivi de production et RUN : Analyse, qualification, recette des correctifs des anomalies de production • Participation aux réunions d'équipe • Accompagnement des métiers dans l'utilisation des outils Data • Réalisation/automatisation de rapports et d'indicateurs LIVRABLES ATTENDUS • Tableaux de suivi (actions, liste des Jira traités, planning…) • Stratégie de recette, cahiers et plans de tests, jeux de données • Comptes rendus d'ateliers et comités COMPETENCES RECHERCHEES • Maîtrise de la modélisation décisionnelle • Maîtrise de l'outil de datavisualisation Tableau et du SQL • Expérience significative dans la mise en œuvre de cas d'usages data • Connaissance des architectures Big Data • Expérience dans la fonction maîtrise d'ouvrage et des projets SI • Esprit d'analyse • Être automne et force de proposition • Maîtrise dans l'animation d'ateliers métiers et la compréhension des besoins utilisateurs • Expérience avérée dans une méthode Agile • Maîtrise des outils Bureautique MODALITES Intervention sur Bordeaux Télétravail accepté mais dans la limite d'une présence minimale de trois jours sur site par semaine (Jour à définir avec l'équipe).
View this job
Contractor

Contractor jobLead Architecte IA, Data & Python

CAT-AMANIA
Published on
AI
API REST
Docker

3 months
Paris, France
Dans le cadre du développement de ses initiatives autour de l'Intelligence Artificielle, du Data Engineering et du développement Python, notre client, grand groupe bancaire, recherche un(e) Lead Architecte IA, Data & Python. Référent(e) technique sur ces sujets, vous accompagnerez les équipes projets dès les phases de cadrage et de conception, concevrez les architectures IA et Data, et définirez les standards et patterns de référence (Machine Learning, RAG, Agents IA, IA Générative, MLOps/LLMOps, APIs IA). Vous réaliserez les études d'architecture et les choix technologiques, garantirez l'intégration des solutions IA dans le système d'information, et veillerez à la gouvernance et à la conformité des projets (RGPD, AI Act, sécurité). Sur le volet Python, vous définirez les standards de développement, accompagnerez les équipes sur Python avancé, FastAPI, Flask, Django, PySpark et Pandas, réaliserez des POC et prototypes, et mettrez en place les bonnes pratiques de qualité de code, tests, sécurité, performance et CI/CD. Sur le volet Data Engineering, vous concevrez les pipelines de traitement des données, définirez les architectures d'échange et d'intégration, garantirez la qualité des données et superviserez la mise en œuvre des plateformes Data, en vous appuyant notamment sur Spark, Kafka, Airflow, DuckDB et Trino. Enfin, vous contribuerez à la gouvernance et à l'innovation en construisant le catalogue de patterns IA et Data, en assurant une veille technologique permanente et en animant les communautés Data et IA.
View this job
Contractor
Permanent

Job VacancyData Engineer

CAT-AMANIA
Published on
Apache Airflow
PySpark

6 months
40k-70k €
400-520 €
Levallois-Perret, Ile-de-France
Rôle et responsabilités des Développeurs • Développement et expertise Réaliser des développements de complexité moyenne. Assurer la maintenance applicative (Gestion des obsolescence et vulnérabilités) • Contribution agile Participer aux rituels techniques (estimation de charge, engagement sur le sprint). • Architecture et standards Concevoir et mettre en oeuvre l'architecture applicative et technique. Veiller au respect des normes, bonnes pratiques et standards Groupe. • Qualité et documentation Garantir la qualité des livrables (revues de code, bonnes pratiques). Assurer la production et la maintenance de la documentation projet. • RUN Assurer le suivi d'exploitation des traitements PySpark en production : supervision, résolution des incidents, analyse des performances et amélioration continue des traitements - Maîtrise avancée des environnements de conteneurisation et d'orchestration, notamment Kubernetes et Docker, ainsi que de la gestion sécurisée des secrets avec HashiCorp Vault - Maîtrise avancée des traitements Big Data, incluant PySpark 3 ainsi que la manipulation de formats de données distribués (Parquet, gestion des buckets). - Maîtrise opérationnelle de l'orchestration de workflows de données à l'aide de l'outil Apache Airflow. - Maîtrise confirmée des bases de données relationnelles, particulièrement PostgreSQL. - Maîtrise des outils de gestion de code et de qualité logicielle, incluant GitLab, Fortify et SonarQube. - Maîtrise des outils de stockage objet, notamment via l'utilisation des commandes MinIO. - Maîtrise des outils de transfert de fichiers, en particulier CFT (Cross File Transfer). Pour l'ensemble du projet de titrisation Bail : • Dossiers d'architecture (schémas, principes techniques, choix structurants). • Backlog enrichi et priorisé en lien avec les parties prenantes. • Composants applicatifs développés, testés et documentés. • Comptes rendus des revues de code et plan d'amélioration continue. • Documentation projet à jour (Spécifications techniques, JIRA, Page Confluence, Runbook). • Reporting d'avancement sur le périmètre confié. • RUN : Reporting de type Morning check
View this job

Connecting Tech-Talent

Free-Work, THE platform for all IT professionals.

Free-workers
Resources
About
Recruiters area
2026 © Free-Work / AGSI SAS
Follow us