Dans le cadre de son ambitieux programme DRIVE 2030, AGL modernise en profondeur son système d'information afin d'accompagner la croissance du groupe MSC et de digitaliser ses activités logistiques. Ce programme stratégique, lancé pour une durée de 5 ans, vise notamment à : Remplacer les différents Transport Management Systems (TMS) par une plateforme unique. Digitaliser et optimiser les processus métiers. Standardiser les bonnes pratiques au sein des filiales. Moderniser l'ensemble des échanges entre le TMS et le système d'information. Vous rejoindrez une équipe internationale d'une quarantaine de collaborateurs basée au siège parisien et travaillerez en étroite collaboration avec les équipes Infrastructure, Applicatives, Run, Métiers et les filiales internationales. En tant qu'Expert Monitoring & Observabilité, vous serez garant de la supervision des applications critiques et de la stratégie d'observabilité du programme. Définition de la stratégie d'observabilitéDéfinir les standards de monitoring avant chaque mise en production. Identifier les composants critiques et les parcours utilisateurs à superviser. Définir les métriques, logs, traces et événements nécessaires au pilotage des applications. Participer à la feuille de route Datadog & Splunk. Structurer l'observabilité autour des notions de disponibilité, performance, capacité, erreurs et saturation. Mise en œuvre de la supervision DatadogDéployer et administrer les solutions Datadog. Configurer les intégrations et la collecte des métriques. Concevoir des dashboards adaptés aux équipes Run, Infrastructure, Applicatives et Management. Superviser les API, services, URL, certificats, traitements batch et files d'attente. Mettre en place les Service Maps afin de cartographier les dépendances applicatives. Créer les monitors, alertes composites et mécanismes de détection d'anomalies. Corréler métriques, traces et logs. Automatiser le déploiement des dashboards et des configurations.Supervision Splunk Déployer et administrer la collecte des logs. Construire les dashboards et alertes. Optimiser l'exploitation des données de supervision. Industrialisation du système d'alertingDéfinir des seuils d'alerte pertinents. Réduire les faux positifs et limiter le bruit opérationnel. Classifier les alertes selon leur criticité. Définir les workflows d'escalade. Documenter chaque alerte (diagnostic, actions, responsables, escalade). Intégrer les alertes aux outils de communication et de gestion des incidents. Participer à l'automatisation des incidents via ServiceNow.
ContexteDans le cadre d'un programme international de transformation digitale, nous recherchons un Expert Monitoring / Observability afin de concevoir, déployer et industrialiser une plateforme de supervision pour une application métier critique à forte volumétrie. Vous interviendrez sur un environnement stratégique nécessitant une haute disponibilité et accompagnerez les équipes techniques durant les phases de Build, Go-Live et Run. Votre mission sera de garantir une visibilité complète sur la performance des applications, d'anticiper les incidents et d'améliorer en continu la qualité de service grâce à une stratégie d'observabilité robuste. Vous évoluerez dans un contexte international et collaborerez avec des équipes Infrastructure, Production, Développement et Management. Vos missionsConcevoir et mettre en œuvre une architecture d'observabilité de bout en bout (Logs, Metrics, Traces, APM). Développer et maintenir des dashboards, monitors et alertes sur Datadog et Splunk. Définir les indicateurs de performance et de qualité de service (SLI, SLO, SLA). Industrialiser les modèles de supervision via des templates et standards de monitoring. Automatiser le déploiement des dashboards et des configurations de monitoring à l'aide d'outils IaC (Terraform, Ansible ou équivalent). Intégrer les solutions d'observabilité dans les pipelines CI/CD. Collaborer avec les équipes de développement pour améliorer l'instrumentation des applications (logs structurés, tracing distribué, APM). Analyser les incidents complexes grâce à la corrélation des logs, métriques, traces et données APM. Accompagner la transition des applications du Build vers le Run et contribuer à l'amélioration continue des processus d'exploitation. Produire des reportings et recommandations destinés aux équipes techniques et aux parties prenantes.
Ce poste consiste à assurer l'administration, l'exploitation et l'évolution de plateformes de supervision d'infrastructures dans un environnement informatique international comptant plusieurs dizaines de milliers de serveurs. Le consultant intervient sur des solutions de monitoring, participe à l'intégration de nouvelles fonctionnalités, automatise les tâches d'exploitation via des pratiques DevOps et veille à la disponibilité ainsi qu'à la performance des infrastructures. Il contribue également à l'industrialisation des processus, au maintien en conditions opérationnelles des plateformes et à la rédaction de la documentation technique associée, au sein d'une équipe en charge d'outils stratégiques de supervision et d'observabilité.
Ingénieur de Production - Expert Monitoring & Observabilité (Operations Bridge Suite) 1. Contexte Au sein d'une Direction des Systèmes d'Information d'un grand groupe international, vous intégrerez une équipe en charge des services de production informatique. Cette équipe a pour mission de garantir la disponibilité, la performance et la fiabilité des infrastructures et des applications critiques. Dans un contexte de transformation des plateformes de supervision et de développement de l'observabilité, vous contribuerez à l'évolution des solutions de monitoring afin d'améliorer la qualité de service, la maîtrise des risques opérationnels et l'efficacité des opérations IT. Informations complémentaires : Démarrage : Septembre Durée de mission : 3 ans Télétravail : 2 jours à distance / 3 jours sur site 2. Missions En tant qu'Expert Monitoring & Observabilité, vous serez chargé(e) de : Assurer le suivi quotidien de la production des outils de monitoring (qualité de service, disponibilité, KPI, indicateurs de performance). Accompagner les équipes techniques et les projets dans la définition et la mise en œuvre de leurs besoins en supervision et observabilité. Concevoir, configurer et maintenir les solutions de monitoring basées sur la suite OpenText Operations Bridge (Operations Bridge Manager, Network Node Manager, Optic Data Lake, HSO) dans des environnements on-premise et Cloud (AWS, GCP). Déployer les pratiques d'observabilité en s'appuyant sur les standards OpenTelemetry. Participer aux comités de suivi et assurer une communication régulière avec les équipes techniques et les parties prenantes. Contribuer à l'amélioration continue de la plateforme : renforcement de la stabilité des solutions de supervision ; développement de nouvelles capacités de surveillance ; définition et suivi de KPI par typologie d'événements et d'équipements ; optimisation des processus de monitoring.
Contexte Nous recherchons un Senior System Engineer Virtualization pour renforcer une équipe Infrastructure et intervenir sur des environnements critiques de virtualisation, stockage, sauvegarde, haute disponibilité et Disaster Recovery. Le consultant jouera un rôle clé dans le maintien de la performance, de la disponibilité et de la continuité des services IT dans le secteur public belge. Le posteLe System Engineer Virtualization & Storage assure quotidiennement la gestion et l'optimisation des systèmes et de l'infrastructure afin de garantir la performance et la disponibilité des services. Il gère les systèmes et infrastructures des datacenters nécessaires au fonctionnement des applications hébergées. Il est également responsable de la préparation et de la mise en œuvre des nouvelles installations, des changements et des mises à niveau.
Contexte de la missionDans le cadre de l'exploitation d'une prestation critique hébergée sur un Cloud privé, nous recherchons un Ingénieur de Production / Site Reliability Engineering (SRE) afin d'intégrer une équipe de 5 ingénieurs en charge du maintien en conditions opérationnelles (MCO) d'une plateforme stratégique pilotée par un ministère. Vous contribuerez à garantir la disponibilité, la fiabilité et la performance des applications en production tout en accompagnant la transformation vers un modèle SRE et Cloud. Vos missionsAssurer le MCO des applications et infrastructures en environnement Cloud privé. Garantir le respect des SLA et le traitement des tickets Jira. Superviser les plateformes, assurer le monitoring et l'observabilité des systèmes. Analyser les incidents, identifier les causes racines et mettre en œuvre des actions correctives durables. Automatiser les opérations d'exploitation via Ansible, scripts Bash et outils DevOps. Participer aux déploiements applicatifs et infrastructures (CI/CD, GitOps). Gérer les environnements Recette, Préproduction et Production. Administrer les plateformes Docker et Kubernetes. Optimiser les performances, la disponibilité et la résilience des services. Maintenir et enrichir la documentation d'exploitation. Collaborer avec les équipes de développement, infrastructure et Service Delivery. Compétences indispensablesAnsible Docker MySQL Observabilité / Monitoring Linux GitLab CI / GitOps Bash / scripting Kubernetes Gestion des incidents de production Français courant Compétences appréciéesZabbix Grafana OpenSearch Redis Rundeck Rancher RKE2 NGINX Vault Morpheus CMP S3 Airflow Réseau (LAN/WAN, routage, Load Balancer, TLS, PKI) ITIL ISO 27001 / ISO 9001 Soft SkillsExcellente capacité d'analyse et de résolution d'incidents. Résistance au stress et gestion des priorités. Esprit d'équipe et sens du service. Forte autonomie. Bonnes capacités de communication. Force de proposition et démarche d'amélioration continue. Capacité à évoluer dans un environnement critique. LivrablesRespect des SLA et traitement des tickets Jira. Documentation d'exploitation. Automatisation des procédures. Mise en production des évolutions. Suivi de la disponibilité et des performances des plateformes.
METSYS est un intégrateur de solutions Cloud, Microsoft et Cybersécurité. Pour l'un de nos clients grands-comptes, de forte renommée dans son secteur d'activité, nous recherchons un.e Expert.e Observability et Monitoring / DevSecOps, pour un démarrage en septembre à Paris 8ème arrondissement. En tant qu'Expert.e Observabilité / Monitoring, vous serez chargé.e de définir et de mettre en œuvre une stratégie globale d'observabilité (supervision, journalisation, alerting, traçabilité) afin de garantir une visibilité en temps réel sur l'état de santé, les performances et le comportement des applications de notre Client.
Contexte de la missionL'OPS assure la conduite et l'exploitation des applications afin d'en garantir la disponibilité et le maintien en condition opérationnelle, tout en contribuant à la boucle d'amélioration continue. Il coordonne les différents intervenants sur le cycle de vie des applications dont il a la charge (il peut en gérer plusieurs en parallèle). Assurer la disponibilité des applications, traiter les incidents et demandes de travaux (DT) Suivre et capitaliser sur la résolution des incidents, proposer des améliorations/industrialisations Coordonner les intervenants, identifier les points de blocage et solutions de contournement Sécuriser les changements et leur impact utilisateurs (planification, pilotage) Piloter l'exploitant applicatif de niveau 1 Contribuer aux volets Assistance Applicative, Conduite des Échanges et Gestion des Accès
En tant que DevOps, vous travaillerez en étroite collaboration avec les équipes OPS, DEV, QA et Release Management. Vous intégrerez une équipe dynamique et expérimentée, où vous contribuerez à la gestion, à l'amélioration continue et à la modernisation d'une plateforme e-commerce hébergée de manière hybride (On Premise + Cloud) et en lien avec des solutions partenaires. Vous aurez l'opportunité d'évoluer dans un environnement technique diversifié propice à l'initiative et à l'évolution. Profil : De formation supérieure en informatique, vous justifiez déjà d'une solide expérience sur un poste similaire de Devops/SRE d'au minimum 10 ans. Missions : · Maintenir en condition opérationnelle les infrastructures virtualisées en diagnostiquant les pannes et les dysfonctionnements · Configurer et dimensionner les plateformes en fonction des performances requises · Industrialiser les architectures cibles et automatiser la configuration des ressources techniques (CI / CD) · Implémenter et administrer les outils de supervision pour garantir la haute disponibilité des infrastructures · Participer à la modernisation et à l'amélioration continue de la plateforme e-commerce · Veiller à la sauvegarde des données, à la sécurité des accès et à la fiabilité des solutions déployées · Participer aux phases de validation technique lors des mises en production ou des évolutions · Maintenir à jour et enrichir la documentation technique Compétences requises : · Infrastructure: VMWare vsphere, Windows, Linux · Maitrise de Docker pour créer, gérer et déployer des conteneurs · Expérience en solution d'orchestration de conteneur : Kubernetes · De bonnes connaissances réseaux (protocoles, NLB F5, DNS, DHCP…) · Expertise en monitoring et logging (OpenTelemetry , Victoria Metrix, Grafana, Dynatrace) · Maitrise outils CI/CD (Azure Devops) · Maitrise en automatisation (Ansible) et en gestion des configurations IaC (Terraform, Terragrunt) · Maitrise des architectures microservices et de leur gestion · Compétences en scripting (powershell, python…) · Bonnes connaissances : Web server Microsoft IIS et Nginx, RabbitMQ, Active Directory, Vault Disponibilité de la plateforme 24/7 impliquant des astreintes techniques en rotation avec les membres de l'équipe.
Dans le cadre du maintien en conditions opérationnelles et de l'évolution des infrastructures d'un environnement de production critique, nous recherchons un(e) Expert Réseau & Infrastructure justifiant d'au moins 7 ans d'expérience. Vous intégrerez une Squad Agile et collaborerez avec les équipes Infrastructure, Production, Réseaux, Sécurité et les équipes projets afin de garantir la disponibilité, la performance, la sécurité et la fiabilité des plateformes. Tâches à réaliser : Dans le cadre de cette mission, vous serez amené(e) à : Administration et exploitation Assurer le maintien en conditions opérationnelles des infrastructures et des plateformes d'hébergement. Administrer et optimiser les infrastructures réseau (LAN, WAN, gestion des flux, interconnexions et sécurité réseau). Gérer et faire évoluer les environnements VMware, les infrastructures de stockage et les solutions de sauvegarde. Garantir la disponibilité, les performances et la capacité des infrastructures. Support et exploitation Prendre en charge les incidents et problèmes de niveau N2/N3 sur les environnements systèmes et réseaux. Réaliser les analyses techniques afin d'identifier les causes racines et mettre en oeuvre des solutions durables. Participer à l'amélioration continue de la qualité de service. Évolution des infrastructures Participer aux projets de déploiement, de migration et de modernisation des infrastructures. Contribuer aux évolutions des socles techniques, à leur standardisation et à la réduction de la dette technique. Formuler des recommandations techniques et participer aux choix d'architecture d'infrastructure. Sécurité Mettre en oeuvre les mesures de sécurité opérationnelle. Gérer les vulnérabilités et le durcissement des systèmes. Veiller au respect des standards de sécurité des systèmes d'information. Assurer le suivi des ouvertures et fermetures de flux réseau. Supervision et automatisation Superviser les infrastructures et améliorer la fiabilité des services grâce aux outils de monitoring. Développer et maintenir des scripts d'automatisation, notamment avec Ansible. Produire et maintenir la documentation technique ainsi que les procédures d'exploitation.
Contexte Dans le cadre de la montée en maturité de la plateforme Salesforce d'un grand compte du secteur assurance, la mission vise à accompagner les équipes en Maintenance en Conditions Opérationnelles (MCO) et les équipes Agile dans l'analyse des incidents techniques, la supervision de la plateforme et l'amélioration des performances. La prestation s'exerce en collaboration étroite avec la Design Authority, le MCO et les équipes Agile. L'enjeu principal est de rendre ces équipes autonomes dans la gestion courante des incidents, la Design Authority restant le support d'expertise sur les cas les plus complexes. Rôle et responsabilités principales Exploiter et promouvoir les outils de monitoring et d'observabilité Salesforce (Portail KPI, Event Monitoring, Smart Observer, Analytics, etc.). Analyser les incidents techniques et les problématiques de performance à l'aide des outils de supervision (Kibana, Elastic Search, logs Salesforce, monitoring des flux, etc.). Formaliser les bonnes pratiques d'investigation, de diagnostic et de résolution des incidents. Accompagner la montée en compétence des équipes MCO et Agile par le coaching, le transfert de connaissances et la documentation. Diffuser les bonnes pratiques Salesforce en matière de développement, d'architecture et de performance. Travailler en collaboration étroite avec la Design Authority, le MCO et les équipes Agile. Livrables attendus Documentation des bonnes pratiques d'investigation, de diagnostic et de résolution des incidents. Supports de transfert de compétences et de coaching à destination des équipes MCO et Agile. Recommandations et bonnes pratiques Salesforce en développement, architecture et performance.
Dans le cadre d'un programme de transformation d'envergure au sein d'un grand groupe, nous recherchons un Expert Zabbix / Architecte Solution afin de rejoindre une équipe spécialisée dans l'Automatisation et l'Observabilité. Vous évoluerez dans un environnement technologique moderne, industrialisé et fortement automatisé, au sein d'infrastructures critiques à très grande échelle. Missions :Accompagner les projets de transformation autour de l'Observabilité (BUILD) Contribuer à la rationalisation des solutions et technologies de supervision Garantir l'opérabilité de la plateforme Zabbix et du Monitoring as Code Participer à la conception et à l'industrialisation de nouvelles solutions techniques sécurisées et automatisées Automatiser les actes d'administration et optimiser les processus d'exploitation Assurer le support d'expertise de niveau 3 et accompagner les équipes de support Réaliser une veille technologique continue et contribuer aux évolutions de la plateforme Participer à l'amélioration continue des solutions de supervision Environnement technique : Zabbix Grafana InfluxDB Netcool Operation Insight (NOI) Monitoring as Code DevOps Perl Shell Python Java
Nous recherchons pour l'un de nos clients grands comptes du secteur de l'énergie un Data Engineer Python / Big Data afin d'intervenir sur le développement d'une plateforme Big Data robuste et scalable, destinée à centraliser, normaliser et distribuer des indicateurs métiers à l'échelle internationale. Contexte de la mission La plateforme a pour objectif de gérer un volume important de données provenant de plusieurs pays. Elle permettra de centraliser différents indicateurs, de standardiser les vues et de faciliter leur exploitation par les différentes parties prenantes. Le consultant interviendra au sein d'une équipe majoritairement basée à Paris, avec de possibles déplacements ponctuels à Lyon et Bruxelles. Missions principales Dans le cadre de cette mission, vous serez amené à : Concevoir et développer des composants de data ingestion. Participer au traitement, à la normalisation et à l'optimisation des données. Mettre en place des pipelines de distribution de données vers différents consommateurs. Contribuer à l'amélioration du framework commun : monitoring, CI/CD, tests, performance, résilience, qualité de code. Appliquer les standards internes en matière d'architecture et de développement. Collaborer avec les équipes projets afin de promouvoir les bonnes pratiques techniques. Participer à la conception d'une architecture Big Data scalable et maintenable. Compétences attendues Python V3 Big Data Architecture & Technologies Datalake Data pipelines Data modeling CI/CD Testing Monitoring Performance optimization Environnements distribués AWS Cloud, un plus
Vorstone recherche un Ingénieur DEVOPS Système Ansible pouun de nos clients basé à Marseille/Aix-en Provence. En tant qu'ingénieur DevOps intégré à l'équipe Systèmes, votre rôle est de piloter le maintien et l'évolution des scripts et produits applicatifs. Vous agirez soit en délégation de l'équipe Cloud & DevOps, et sous la responsabilité directe de l'équipe Systèmes, garantissant ainsi une continuité opérationnelle optimale. Domaines d'intervention : Observabilité & Monitoring : Mise en place et maintenance des outils d'observabilité pour l'ensemble des produits du Train et de la System Team, assurant une visibilité proactive sur la santé des systèmes. Accompagnement des équipes Agiles vers l'auto-suffisance technique via : La création de guidelines et de User Guides. L'animation de trainings dédiés. L'intégration de features spécifiques sur des outils clés comme EDB, Liquibase, ou Kasten. Intégration Continue (CI) : Déploiement et gestion des chaînes CI (notamment via Ansible Tower). Je veille à ce que ces solutions restent alignées avec les roadmaps de la System Team et du Cloud & DevOps. Automatisation des Tests : Conception et implémentation de solutions de tests automatisés pour sécuriser les cycles de livraison. Expertise Régilienne : Apport d'un haut niveau d'expertise technique sur les fonctions régaliennes au profit de la System Team, garantissant la conformité et la robustesse des infrastructures.
ContexteDans le cadre d'un programme stratégique de transformation digitale, nous recherchons un Migration Technical Lead pour accompagner le déploiement d'une nouvelle plateforme d'IA Agentique. Cette plateforme constituera le socle technologique des futurs projets d'Intelligence Artificielle de l'entreprise. Elle permettra de développer, orchestrer, sécuriser, héberger et superviser des agents IA autonomes capables d'interagir entre eux au sein d'une architecture multi-agents. Vous rejoindrez une équipe intervenant sur un projet innovant mêlant Cloud, DevOps, Platform Engineering et Intelligence Artificielle Générative. Vos missions En tant que Migration Technical Lead, vous serez le référent technique des équipes projets durant leur migration vers cette nouvelle plateforme d'IA. À ce titre, vous serez amené(e) à : Accompagnement des projetsAccompagner les équipes dans la migration de leurs applications vers la plateforme IA. Comprendre les besoins des différents projets et proposer les meilleures approches techniques. Identifier les risques techniques liés aux migrations. Garantir une migration fluide et sécurisée des applications. Support techniqueAnalyser les incidents et problématiques rencontrés lors des migrations. Qualifier et suivre les demandes via Jira et ServiceNow. Proposer des solutions techniques adaptées. Coordonner les actions de support avec les différentes équipes. DocumentationRédiger les guides de migration et les bonnes pratiques. Alimenter la documentation technique sous Confluence. Capitaliser les retours d'expérience afin d'améliorer les processus de migration. IndustrialisationParticiper à l'amélioration des pipelines CI/CD. Développer les scripts et composants nécessaires à l'automatisation des migrations. Contribuer aux outils facilitant l'intégration des projets sur la nouvelle plateforme. Collaboration transverseTravailler en étroite collaboration avec les équipes Cloud, DevOps, MLOps, Sécurité et Développement. Participer aux échanges techniques et accompagner les équipes dans la résolution des problématiques complexes. Être un véritable facilitateur entre les différentes parties prenantes. Environnement techniqueCloudGoogle Cloud Platform (GCP) Google Kubernetes Engine (GKE) AWS ou Azure (selon les projets) DevOps / Platform EngineeringGitLab CI/CD ArgoCD Docker Kubernetes API ManagementKong Apigee ObservabilitéDynatrace Monitoring Logging Intelligence Artificielle GénérativeLLM (Large Language Models) Mistral AI Google Gemini Plateformes d'IA Agentique Architecture multi-agents
Nous recherchons pour l'un de nos clients un(e) Ingénieur IA – Google Cloud Platform (H/F). Pour le département IT Operations & Finance, nous recherchons un profil disposant d'une forte expertise en ingénierie IA afin de concevoir des agents IA, mettre en place des échanges agent à agent, et les intégrer dans un environnement Google Cloud Platform. L'objectif est de passer d'une preuve de concept à des solutions fiables, sécurisées et industrialisées, grâce à une approche mêlant développement Python, API, orchestration d'agents, observabilité et CI/CD. Missions principales Concevoir et développer des agents IA pour certains cas d'usage métiers. Développer des API et services Python asynchrones avec FastAPI. Conteneuriser les applications et les déployer sur Cloud Run. Mettre en place des serveurs MCP pour exposer de manière sécurisée des outils et données internes aux agents. Développer des workflows d'agents à l'aide du framework Concevoir des mécanismes de communication agent à agent basés sur des événements et/ou du RPC. Définir les schémas de messages, le routage, les mécanismes de retry et la gestion d'état. Intégrer les solutions avec Vertex AI ou un équivalent pour les appels modèles, les filtres de sécurité et les évaluations. Mettre en place l'observabilité : logs, traces, métriques, monitoring. Définir des guardrails de sécurité : DLP, gestion des secrets, IAM. Documenter l'architecture, les procédures d'exploitation et assurer la passation à l'équipe. Accompagner l'équipe métier dans l'adoption de cas d'usage liés à l'IA générative.