Trait d'Union

Contractor job Senior Kafka Reliability & Performance Engineer

Paris

Trait d'Union

Published on 07/24/2026

Share this job

Nous recherchons un(e) expert(e) Kafka pour un mandat exclusivement centré sur le diagnostic d'une plateforme Apache Kafka en production (distribution open-source, non-Confluent) au sein d'un environnement hautement réglementé.

L'écosystème repose sur des clients Python et C++ utilisant la bibliothèque (les clients Java et Kafka Streams ne sont pas du tout utilisés sur ce projet).

Ta Mission:

La plateforme rencontre actuellement plusieurs difficultés que vous devrez analyser :

  • Des pertes d'événements intermittentes.

  • Des pics de latence de queue (tail-latency) inexpliqués.

  • De fortes faiblesses dans la détection des incidents.

Votre rôle consistera à instrumenter la plateforme, mener l'enquête technique et concevoir des solutions pérennes.

Livrables attendus:

  • Un plan de remédiation priorisé.

  • Un cadre d'observabilité complet.

Candidate profile

  • Expérience : Plus de 10 ans sur des systèmes distribués, dont plus de 5 ans d'expertise approfondie sur Kafka en production, avec de fortes contraintes de fiabilité et de latence.

  • Méthodologie : Vous êtes un(e) investigateur/trice pragmatique basé(e) sur la preuve (vous instrumentez d'abord, vous émettez des hypothèses, et vous éliminez les pistes grâce aux données).

  • Profondeur technique : Vous êtes capable d'analyser les problèmes depuis la couche haute (Broker, JVM, Garbage Collector) jusqu'aux couches très basses (TCP, carte réseau, horloge).

Compétences Techniques Indispensables:
  • Maîtrise experte du troubleshooting Kafka en production.

  • Excellente maîtrise pratique de en Python et/ou C++ (une connaissance très fine des paramètres de configuration et du débogage est requise).

  • Optimisation (tuning) des brokers Kafka : JVM, GC (G1/ZGC), gestion de la mémoire Heap vs Page-cache, comportement de l'ISR sous stress.

  • Capacité à mener des investigations de pertes de données de bout en bout (ex: réconciliation d'offsets).

  • Création depuis zéro d'outils d'observabilité avec Prometheus et Grafana (développement d'exportateurs, dashboards, alertes).

  • Expérience préalable dans des environnements à faible latence ou réglementés (finance, trading, télécoms, etc.).

  • Protocoles de synchronisation : déploiement PTP et compréhension experte de la dérive d'horloge (clock skew).

  • Diagnostic réseau bas niveau : TCP, optimisation de la carte réseau (NIC) via / et analyse du page-cache du noyau.

  • Maîtrise des protocoles de sérialisation (Avro, Protobuf ou binaire sur mesure), gestion de l'évolution des schémas et détection des pertes silencieuses lors des échecs de décodage.

  • Expérience réussie dans des missions d'audit générant des plans d'action clairs, pouvant être directement exécutés par une équipe interne.

Working environment

Apply to this job!

Find your next career move from +10,000 jobs!

  • Manage your visibility

    Salary, remote work... Define all the criteria that are important to you.

  • Get discovered

    Recruiters come directly to look for their future hires in our CV library.

  • Join a community

    Connect with like-minded tech and IT professionals on a daily basis through our forum.

Senior Kafka Reliability & Performance Engineer

Trait d'Union

Connecting Tech-Talent

Free-Work, THE platform for all IT professionals.

Free-workers
Resources
About
Recruiters area
2026 © Free-Work / AGSI SAS
Follow us