Notre client, éditeur de solutions logicielles pour les professionnels de la finance et de la gestion de patrimoine, renforce son équipe Observabilité. Le groupe s'est construit par croissance externe et mène un chantier de rationalisation autour d'une plateforme Grafana Cloud déjà déployée et validée sur deux équipes pilotes. L'enjeu est désormais de l'étendre à une dizaine d'équipes supplémentaires, sur un périmètre de 20 à 25 équipes et environ 300 ingénieurs. MissionsDéployer et fine-tuner la plateforme Grafana Cloud sur de nouvelles équipes applicatives : configuration des connecteurs, dashboards, règles d'alerting et healthchecks. Concevoir des setups standardisés et réutilisables pour industrialiser l'onboarding de chaque nouvelle équipe. Instrumenter les applications avec les équipes de développement : métriques applicatives, logs structurés, traces distribuées et suivi de l'expérience utilisateur. Définir et mettre en œuvre les processus de gestion d'incidents : règles d'alerte, routage, escalade, runbooks, et passage d'une détection passive à une détection proactive avant impact client. Définir les SLI/SLO des applications du périmètre avec les équipes, et exploiter les error budgets comme outil d'arbitrage. Réduire le bruit d'alerting et maîtriser les volumes d'ingestion (cardinalité, labellisation, rétention). Accompagner chaque équipe de bout en bout : état des lieux, configuration, tests, suivi de la montée en maturité. Faire converger les pratiques de monitoring entre les équipes et s'aligner avec la DSI sur la trajectoire globale.
1. Architecture & Intégration LLM -Conception des services : Définir l'architecture des APIs et des workers, la stratégie de cache et les mécanismes de résilience (retries, circuit breakers, fallback de modèles). -Industrialisation IA : Concevoir les chaînes d'inférence (prompting, function calling, RAG, embeddings, agents) et valider les choix technologiques via des POCs et des Benchmarks. -Performance & Scalabilité : Arbitrer entre les traitements synchrones et asynchrones pour concilier débit, latence et coût face aux charges de production. 2. APIs Web Haute Performance & Streaming -Définition des APIs : Créer des APIs robustes et documentées sous FastAPI (contrats clairs, validation Pydantic, authentification unifiée et isolation par pays). -Asynchronisme & Temps réel : Maîtriser asyncio, la concurrence et le parallélisme. Implémenter le streaming des réponses LLM, la gestion fine des timeouts, du backpressure et de l'annulation des requêtes. -Observabilité & Sécurité : Intégrer nativement la télémétrie (logs, métriques, traces) et les guardrails de sécurité (Zero Trust, gestion des secrets, isolation des tokens). 3. Leadership Technique & Gouvernance -Gouvernance Inner Source : Être un membre influent de la communauté technique pour assurer la cohérence et la réutilisabilité des composants partagés. -Accompagnement des squads : Aider les équipes applicatives (IA Assistant, Search, Édition...) à intégrer vos capabilities IA avec un minimum de friction. -Culture Craftsmanship : Promouvoir au quotidien le Clean Code, les principes SOLID et les tests automatisés.
Dans le cadre du renforcement de nos équipes, nous recherchons un(e) Product Owner spécialisé(e) en Observabilité / APM, avec une forte expertise autour de Dynatrace. Vos missionsEn tant que Product Owner Observabilité, vous serez responsable du pilotage et de l'évolution des solutions de supervision et d'observabilité du SI. À ce titre, vos principales missions seront de : Porter la vision produit et définir la roadmap autour des solutions d'observabilité et d'APM (Application Performance Management) ; Recueillir, analyser et prioriser les besoins des équipes techniques et métiers ; Construire, maintenir et prioriser le Product Backlog ; Rédiger les User Stories et définir les critères d'acceptation ; Piloter les évolutions et accompagner leur mise en œuvre avec les différentes équipes ; Assurer le suivi des projets et des demandes à l'aide de Jira et Confluence ; Développer et promouvoir une véritable logique d'observabilité, reposant sur les trois piliers : Logs Métriques Traces Participer à la définition des standards de monitoring, dashboards, alerting et suivi de performance ; Contribuer à l'amélioration de la visibilité sur la performance, la disponibilité et la fiabilité des applications ; Accompagner les équipes dans l'adoption et l'exploitation des outils d'observabilité ; Assurer une veille technologique et proposer des axes d'amélioration continue.
Missions Fiabilité & Observabilité Concevoir et déployer une vraie stratégie d'observabilité (monitoring, alerting, dashboards) Centraliser et industrialiser les métriques (Logs / Metrics / Traces) Définir les SLO / KPI de disponibilité et de performance Passer d'outils dispersés à une vision unifiée Cloud & Déploiement Automatiser et fiabiliser les déploiements cloud Définir et maintenir l'Infrastructure as Code Participer à l'optimisation coûts, performance et scalabilité Définir et tester les politiques de sauvegarde Sécurité & conformité Être le référent sécurité cloud pour l'équipe Gérer les accès, certificats, vulnérabilités Garantir le respect des contraintes liées aux données de santé Transmission & collaboration Travailler en étroite collaboration avec architectes et développeurs Accompagner la montée en compétences du DevOps déjà en poste Contribuer à une vision plus stratégique à terme