Contractor job Senior Kafka Reliability & Performance Engineer
Paris
Trait d'Union
Share this job
Nous recherchons un(e) expert(e) Kafka pour un mandat exclusivement centré sur le diagnostic d'une plateforme Apache Kafka en production (distribution open-source, non-Confluent) au sein d'un environnement hautement réglementé.
L'écosystème repose sur des clients Python et C++ utilisant la bibliothèque (les clients Java et Kafka Streams ne sont pas du tout utilisés sur ce projet).
Ta Mission:La plateforme rencontre actuellement plusieurs difficultés que vous devrez analyser :
Des pertes d'événements intermittentes.
Des pics de latence de queue (tail-latency) inexpliqués.
De fortes faiblesses dans la détection des incidents.
Votre rôle consistera à instrumenter la plateforme, mener l'enquête technique et concevoir des solutions pérennes.
Livrables attendus:Un plan de remédiation priorisé.
Un cadre d'observabilité complet.
Candidate profile
Expérience : Plus de 10 ans sur des systèmes distribués, dont plus de 5 ans d'expertise approfondie sur Kafka en production, avec de fortes contraintes de fiabilité et de latence.
Méthodologie : Vous êtes un(e) investigateur/trice pragmatique basé(e) sur la preuve (vous instrumentez d'abord, vous émettez des hypothèses, et vous éliminez les pistes grâce aux données).
Profondeur technique : Vous êtes capable d'analyser les problèmes depuis la couche haute (Broker, JVM, Garbage Collector) jusqu'aux couches très basses (TCP, carte réseau, horloge).
Maîtrise experte du troubleshooting Kafka en production.
Excellente maîtrise pratique de en Python et/ou C++ (une connaissance très fine des paramètres de configuration et du débogage est requise).
Optimisation (tuning) des brokers Kafka : JVM, GC (G1/ZGC), gestion de la mémoire Heap vs Page-cache, comportement de l'ISR sous stress.
Capacité à mener des investigations de pertes de données de bout en bout (ex: réconciliation d'offsets).
Création depuis zéro d'outils d'observabilité avec Prometheus et Grafana (développement d'exportateurs, dashboards, alertes).
Expérience préalable dans des environnements à faible latence ou réglementés (finance, trading, télécoms, etc.).
Protocoles de synchronisation : déploiement PTP et compréhension experte de la dérive d'horloge (clock skew).
Diagnostic réseau bas niveau : TCP, optimisation de la carte réseau (NIC) via / et analyse du page-cache du noyau.
Maîtrise des protocoles de sérialisation (Avro, Protobuf ou binaire sur mesure), gestion de l'évolution des schémas et détection des pertes silencieuses lors des échecs de décodage.
Expérience réussie dans des missions d'audit générant des plans d'action clairs, pouvant être directement exécutés par une équipe interne.
Working environment
Apply to this job!
Find your next career move from +10,000 jobs!
Manage your visibility
Salary, remote work... Define all the criteria that are important to you.
Get discovered
Recruiters come directly to look for their future hires in our CV library.
Join a community
Connect with like-minded tech and IT professionals on a daily basis through our forum.
Senior Kafka Reliability & Performance Engineer
Trait d'Union