Contexte de la mission • Renforcement d'une équipe Incident & Change au sein de la DSI • Intervention sur un système d'information à forts enjeux de disponibilité • Environnement métier couvrant le retail, l'e-commerce et la supply chain • Contribution à la sécurisation des opérations et des évolutions informatiques Votre rôle au quotidien • Piloter les incidents majeurs et coordonner les équipes techniques N2/N3 • Animer les cellules de crise jusqu'au rétablissement complet des services • Évaluer les impacts et les risques liés aux demandes de changement • Organiser les CAB, REX et plans d'actions associés Environnement technique • Outils ITSM : Jira et ServiceNow • Supervision et analyse : Grafana, PRTG, logs et alertes • Processus ITIL, Incident Management et Change Management • Environnements SI : magasins, ERP, e-commerce et logistique
🌟 Quel sera ton poste ? 🌟 💼 Poste : SRE DevOps IA/ML H/F 📍 Lieu : Paris (75) ou Rennes (35) 🏠 Télétravail : Flexible 📝 Contrat : Portage ou CDI 💸Rémunération : 45k-50k 👉 Contexte client : Tu rejoins un acteur majeur du numérique engagé dans le développement et l'industrialisation de solutions innovantes basées sur l'Intelligence Artificielle et le Machine Learning. Dans un contexte de transformation technologique et d'accélération des usages IA, les enjeux portent sur la fiabilisation, l'automatisation et l'optimisation des plateformes techniques supportant les produits et services stratégiques de l'entreprise. En tant que SRE DevOps IA/ML, tu interviens au cœur d'environnements critiques où la disponibilité, la performance et la résilience des plateformes sont essentielles pour accompagner les équipes Data, IA et Développement. Tu auras pour missions de : Concevoir, déployer et maintenir les infrastructures nécessaires aux plateformes IA/ML. Industrialiser et automatiser les processus de déploiement, d'exploitation et de supervision. Garantir la disponibilité, la performance et la résilience des services critiques. Mettre en œuvre les pratiques Site Reliability Engineering (SRE) afin d'améliorer la fiabilité des plateformes. Participer à l'optimisation des environnements d'entraînement et d'exécution des modèles de Machine Learning. Déployer et maintenir les solutions de monitoring, d'observabilité et d'alerting. Collaborer avec les équipes Data Science, IA et Développement pour industrialiser les chaînes de traitement et de déploiement. Participer à la gestion et à la résolution des incidents complexes. Contribuer à l'amélioration continue des plateformes, outils et processus. Rédiger et maintenir la documentation technique et les procédures d'exploitation. 🧰 Stack technique : DevOps & Automatisation : Git, CI/CD, Ansible, Terraform. Conteneurisation & Orchestration : Docker, Kubernetes. Observabilité : Prometheus, Grafana, ELK, monitoring et alerting. IA / Machine Learning : plateformes d'entraînement, de déploiement et d'exploitation de modèles IA/ML. Systèmes : Linux. Scripting : Python, Bash.
I. Contexte : Vous intégrerez l'équipe Global DevOps basée à Paris, sous la responsabilité du Head of DevSecOps. Dans le cadre de notre démarche d'excellence opérationnelle et de standardisation des pratiques DevSecOps au sein du Groupe, notre département IT souhaite mettre en place et animer une Communauté de Pratique dédiée à l'observabilité et à la supervision de nos applications métiers. En tant qu'expert Observabilité/Supervision, vous serez chargé de définir et mettre en œuvre une stratégie d'observabilité complète (monitoring, logs, alerting, tracing) afin de garantir une visibilité en temps réel sur l'état de santé, les performances et le comportement de nos applications. Ces solutions permettront une détection proactive des incidents, un diagnostic rapide des problèmes et assureront la disponibilité de nos services critiques. L'environnement applicatif est hybride, composé de solutions cloud (D365, Power Apps, services Azure, Data product Fabric) et d'applications hébergées on-premise sur serveurs Windows (sites web, serveurs IIS, etc.). II. Missions : · Agir en tant que référent technique pour contribuer à la construction et à l'implémentation des composants de supervision et des pipelines d'observabilité, en appliquant les meilleures pratiques techniques. · Fournir une expertise et, si nécessaire, participer à la conception, l'intégration et le déploiement des solutions de supervision (dashboards, collecte de logs, tracing, détection d'anomalies basée sur l'IA, etc.). · Collaborer avec les équipes de développement, d'exploitation et de sécurité pour intégrer les outils et pratiques d'observabilité dans les pipelines CI/CD. · Apporter son expertise lors des incidents et des analyses de causes racines. · Identifier les besoins spécifiques de chaque équipe et définir des plans d'accompagnement. · Développer et maintenir des tableaux de bord et des rapports pour visualiser les performances applicatives. · Analyser et interpréter les métriques pour identifier les tendances et détecter les problèmes de manière proactive. · Définir la gouvernance, les règles de fonctionnement et les objectifs de la Communauté. · Mettre en place des outils collaboratifs (wiki, canaux Teams). · Organiser et animer des sessions régulières de la communauté · Favoriser les échanges inter-équipes et le partage de connaissances. · Co-construire des standards techniques et des guidelines avec les équipes. · Rédiger des guides de bonnes pratiques et de la documentation technique. · Assurer une veille active sur les technologies et pratiques d'observabilité. · Évaluer et tester de nouveaux outils du marché. · Proposer des POC et des expérimentations innovantes.
🌟 Quel sera ton poste ? 🌟 💼 Poste : SRE DevOps IA/ML H/F 📍 Lieu : Paris (75) ou Rennes (35) 🏠 Télétravail : Flexible 📝 Contrat : Portage ou CDI 💸Rémunération : 45k-50k 👉 Contexte client : Tu rejoins un acteur majeur du numérique engagé dans le développement et l'industrialisation de solutions innovantes basées sur l'Intelligence Artificielle et le Machine Learning. Dans un contexte de transformation technologique et d'accélération des usages IA, les enjeux portent sur la fiabilisation, l'automatisation et l'optimisation des plateformes techniques supportant les produits et services stratégiques de l'entreprise. En tant que SRE DevOps IA/ML, tu interviens au cœur d'environnements critiques où la disponibilité, la performance et la résilience des plateformes sont essentielles pour accompagner les équipes Data, IA et Développement. Tu auras pour missions de : Concevoir, déployer et maintenir les infrastructures nécessaires aux plateformes IA/ML. Industrialiser et automatiser les processus de déploiement, d'exploitation et de supervision. Garantir la disponibilité, la performance et la résilience des services critiques. Mettre en œuvre les pratiques Site Reliability Engineering (SRE) afin d'améliorer la fiabilité des plateformes. Participer à l'optimisation des environnements d'entraînement et d'exécution des modèles de Machine Learning. Déployer et maintenir les solutions de monitoring, d'observabilité et d'alerting. Collaborer avec les équipes Data Science, IA et Développement pour industrialiser les chaînes de traitement et de déploiement. Participer à la gestion et à la résolution des incidents complexes. Contribuer à l'amélioration continue des plateformes, outils et processus. Rédiger et maintenir la documentation technique et les procédures d'exploitation. 🧰 Stack technique : DevOps & Automatisation : Git, CI/CD, Ansible, Terraform. Conteneurisation & Orchestration : Docker, Kubernetes. Observabilité : Prometheus, Grafana, ELK, monitoring et alerting. IA / Machine Learning : plateformes d'entraînement, de déploiement et d'exploitation de modèles IA/ML. Systèmes : Linux. Scripting : Python, Bash.
Contexte : Au sein du Pôle Tech Foundation, la mission s'inscrit dans le Domaine d'Expertise Automatisation et Observabilité, avec pour objectif d'accompagner les projets de transformation liés aux enjeux d'observabilité, de supervision et de métrologie. Dans un contexte de transformation technologique et organisationnelle, les activités portent sur l'évolution, l'industrialisation et l'amélioration continue des solutions de supervision et d'observabilité déployées à grande échelle. L'environnement est fortement industrialisé, automatisé, sécurisé, et opère à grande échelle (≈ 50 000 serveurs) avec des exigences élevées de performance, robustesse et scalabilité. Missions : Accompagner les projets de transformation autour de l'Observabilité (BUILD). Contribuer à la rationalisation des solutions et technologies de supervision des environnements Open, Réseau et Natif. Garantir l'opérabilité de la plateforme Zabbix et des pratiques de Monitoring as Code. Contribuer à la mise en œuvre de nouveaux composants techniques industrialisés, sécurisés, packagés et automatisés (approche DevOps). Optimiser et automatiser les actes d'administration liés aux choix et modèles d'implémentation des composants. Assurer le support d'expertise en lien avec l'éditeur et les équipes de support (RUN). Assurer une veille technologique et anticiper les évolutions produit. Veiller au contrôle qualité et à l'amélioration continue des plateformes Zabbix. Environnement technique : Supervision Open Zabbix Métrologie & Dashboarding : Grafana, InfluxDB Hypervision : Netcool Operation Insight (NOI) Contexte DevOps / automatisation / production industrialisée Environnement sécurisé et haute performance
Vous intervenez sur la gestion et l'administration des systèmes de gestion de données de l'entreprise, en assurant la cohérence, la qualité et la sécurité. Vous participerez à la définition et la mise en œuvre des bases de données et des progiciels retenus. Missions Administration et exploitation des bases de données · Installer, configurer, administrer et maintenir les systèmes de gestion de bases de données · Effectuer le choix d'implémentation et créer les bases en lien avec les équipes système et les chefs de projets · Mettre en exploitation les bases de données et automatiser les procédures associées · Gérer les droits d'accès et les autorisations · Mettre en œuvre les procédures de sauvegarde, de restauration, de journalisation et de reprise après incident Performance, supervision et sécurisation des bases de données · Mettre en place et exploiter les outils de supervision des bases de données · Surveiller la disponibilité, l'intégrité et le fonctionnement des bases · Analyser et optimiser les traitements, les requêtes et les paramètres des bases · Garantir la sécurité des données et la maîtrise des accès · Analyser et résoudre les incidents et problématiques techniques liés aux bases de données Evolution et support des environnements de données · Effectuer le support technique de second niveau pour l'ensemble des bases de données · Accompagner les utilisateurs et les équipes projets sur les problématiques techniques liées aux SGBD · Suivre et contrôler les montées de version des bases existantes et progiciels retenus par l'entreprise · Tester et valider techniquement les nouvelles versions avant leur mise en production · Définir et maintenir les normes, standards et procédures d'utilisation et d'exploitation des SGBD · Documenter la structure des bases et les procédures d'exploitation et de production · Assurer une veille technologique sur les SGBD et les outils associés
Rejoignez une équipe dédiée à l'évolution des infrastructures et au support des services IT au sein d'un acteur majeur du secteur de l'assurance. En tant qu'expert, vous contribuerez à la généralisation du déploiement des outils Elasticsearch, à leur évolution, ainsi qu'à des projets fonctionnels et techniques. Votre mission inclura la production de livrables tels qu'un document d'intégration des données dans une plateforme Elasticsearch. Intégré à une unité spécialisée dans les infrastructures Unix, vous évoluerez dans un contexte dynamique, marqué par une forte évolution technologique et des projets transversaux ambitieux. L'accent est mis sur l'innovation et la collaboration au sein d'une équipe pluridisciplinaire.
ACCROCHE SI TU ADORES GARDER TON CALME QUAND TOUT S'EMBALLE, CETTE ANNONCE EST FAITE POUR TOI CE QUE TU RECHERCHES : Gérer les incidents critiques avec rigueur et sang-froid Coordonner les équipes pour un retour à la normale rapide et structuré Relever des défis opérationnels dans des environnements sensibles et exigeants Donner un nouveau souffle à ta carrière Alors nous avons la mission idéale pour toi Au sein d'un acteur stratégique du secteur de la finance, tu participeras à la gestion des incidents majeurs, assureras la communication entre les parties prenantes et veilleras à la continuité des services : Qualification et priorisation des incidents, tu réaliseras Mobilisation et coordination des équipes techniques, tu piloteras Communication claire et régulière aux parties prenantes, tu assureras Suivi des plans de résolution et des délais, tu garantiras Analyse post-incident et plan d'amélioration continue, tu coordonneras Mise à jour des procédures et des outils de gestion d'incident, tu impulseras Participation aux comités de pilotage ITSM, tu contribueras QUI TU ES : Diplômé(e) de la formation qui va bien Expérience de 10 ans minimum en gestion des incidents ou en production IT Bonne maîtrise des environnements IT complexes (infra, réseau, applications) Connaissance des outils ITSM : Grafana, Dynatrace, ELK (Elasticsearch, Logstash, Kibana) À l'aise avec Oracle, PostgreSQL, SQL Server AU-DELÀ DES COMPÉTENCES TECHNIQUES, TU ES / AS : Réactif(ve) : tu sais agir vite et bien en situation de crise Structuré(e) : tu poses un cadre clair même en pleine turbulence Communicant(e) : tu sais rassurer, expliquer et coordonner sans stress Résilient(e) : tu gardes la tête froide et prends des décisions posées Pragmatique : tu identifies les vraies priorités sans te disperser Autonome : tu pilotes un incident de bout en bout avec méthode Esprit de synthèse : tu rédiges des rapports clairs et utiles Engagé(e) : tu es le garant de la stabilité et de la confiance dans les services IT
Vous intégrerez une équipe technique travaillant sur des applications backend modernes, avec une forte utilisation des services AWS et une architecture orientée événements. Missions Concevoir et développer des services backend en Node.js / TypeScript Participer à la conception et à l'évolution d'une architecture Event Driven Développer et maintenir des AWS Lambda en TypeScript Concevoir et intégrer des APIs via API Gateway Travailler avec les services AWS : S3, SNS/SQS, RDS, CloudWatch, Systems Manager, CodePipeline Participer à la mise en place et au maintien des pipelines CI/CD avec Jenkins Garantir la qualité du code : tests unitaires, revues de code et documentation OpenAPI Participer à la supervision et au monitoring des applications avec New Relic et Grafana Utiliser LocalStack dans les environnements de développement et de test
Contexte Dans le cadre de projets d'innovation technologique menés chez un grand compte, nous recherchons un Ingénieur Développeur / Intégrateur spécialisé en Edge Computing. Vous rejoindrez une équipe d'experts travaillant sur la conception, l'intégration et l'expérimentation de solutions Edge destinées à des environnements industriels. Les travaux portent notamment sur des plateformes de virtualisation et de conteneurisation, l'intégration de protocoles industriels, l'automatisation des déploiements ainsi que la supervision des infrastructures. Missions Vous interviendrez notamment sur : L'intégration et la configuration de plateformes Edge Computing Le développement et l'intégration de composants techniques Le déploiement et l'administration d'environnements Linux La mise en œuvre de solutions de conteneurisation avec Docker et/ou LXC L'automatisation des déploiements et configurations avec Ansible L'intégration et la configuration de protocoles de communication industriels La réalisation de PoC et démonstrateurs techniques La préparation et l'exécution des tests d'intégration et de validation L'analyse et la résolution d'incidents techniques La mise en place et l'exploitation d'outils de monitoring et d'observabilité La documentation des architectures, configurations et procédures La participation aux réflexions autour de l'industrialisation des solutions expérimentées La prise en compte des contraintes de cybersécurité propres aux environnements industriels Environnement technique Linux Docker LXC Ansible Grafana Prometheus Edge Computing / Edge IIoT Virtualisation et conteneurisation Protocoles industriels : IEC 60870-5-104, Modbus, MQTT Réseaux et systèmes industriels Environnements IT/OT Cybersécurité industrielle
Projet Développement et industrialisation d'une plateforme Data sur GCP permettant l'ingestion, la transformation et la mise à disposition de données pour des outils de recherche et d'analyse métier,. Activités - Concevoir et maintenir les pipelines d'ingestion de données publiques et internes. - Développer et industrialiser les traitements et transformations de données avec SQL, Python et dbt. - Mettre en place et maintenir les workflows d'orchestration avec Argo Workflows / Airflow. - Stocker, structurer et exposer les données via BigQuery et GCS, puis assurer leur connexion aux outils d'analyse métier. - Déployer et maintenir les composants Data sur GCP, notamment via Cloud Run, et gérer les droits d'accès avec IAM. - Industrialiser l'infrastructure avec Terraform et contribuer aux chaînes CI/CD GitLab. - Participer au monitoring, à la gouvernance et à la qualité des données ainsi qu'à l'amélioration de l'expérience utilisateur des outils internes.
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations.
Objectifs et livrables :Concevoir, déployer et optimiser les configurations Dynatrace (dashboards, alerting, SLO...) Définir et appliquer les standards d'instrumentation (traces, métriques, logs) Industrialiser les processus d'observabilité (automatisation, pipelines) Fiabiliser et unifier les données issues des différents outils d'observabilité Collaborer avec les équipes Dev/SRE/OPS pour intégrer l'observabilité dans les projets Concevoir des tableaux de bord orientés exploitation et décision Participer aux rituels SCRUM et contribuer à l'animation technique du produit Observabilité
Zenith est un cabinet de recrutement spécialisé dans l'IT. Créé il y a 5 ans, Zenith génère aujourd'hui un CA de près de 10 M€ et se développe à vitesse grand V. Notre marque de fabrique : une persévérance à toute épreuve et un positionnement qualitatif renforcé par notre outil maison boosté à l'IA Zenith App est une solutions maison utilisés par nos consultants en missions et client et couvre le CRM qui a été complètement intégrés. Sur notre roadmap 2026-2027, Nous souhaitons développer notre parseur de CV et intégrer la fonctionnalité d'ATS pour les gestions de nos offre (Application Tracking System) Pour renforcer notre équipe existante constitué d'un PO et de 5 développeurs, nous recherchons un dev full stack React / Django Vous serez chargé du développement des évolutions de notre plateforme de recrutement pour progressivement prendre en charge de grosses évolutions avec le support de l'équipe développement Environnement technique : Django Rest, React JS MUI, Cloudflare, Scaleway (Hosting), Grafana, Slack, Google, Yousign, Pennylane, mistral En tant que membre à part entière, vos missions seront de : Réaliser les développement back sur les nouvelles fonctionnalités (80%) Assurer la maintenance de l'existant (20%) Réaliser des codes reviews de l'équipe Faire de propositions d'améliorations et de réduction de la dette technique Votre profil : - 2 à 5 années d'expérience professionnel sur Django et React - Vous privilégiez les solutions robustes, durables, maintenables - Vous aimez le travail en équipe Ce que nous apportons: Évoluer dans une start-up à forte croissance avec perspective dévolution Une équipe mixte IT/ recrutement Des supers locaux dans le 8ème à Paris à côté de St Lazare Avantages : Salaire sur 12 mois Tickets restaurants Intéressement et participation RTT : 7 jours Possibilité de travailler à distance dès que possible