RIDCHA DATA
Nous recherchons, pour un grand groupe européen de la distribution B2B, un Ingénieur de Production Linux confirmé au sein d'une équipe Exploitation / Production à taille humaine. Contrairement aux grandes DSI où les périmètres sont éclatés entre de nombreuses équipes, ici une seule équipe polyvalente porte l'ensemble du Run et de la MCO, en collaboration étroite avec les équipes réseau, infrastructure, sécurité et projets. L'environnement compte de 1 400 à 1 500 machines virtuelles, hébergées majoritairement sur Nutanix. L'enjeu du poste : aider l'équipe à sortir du mode « pompier » pour aller vers plus d'industrialisation et d'automatisation. Les missionsAdministration Linux et socle Nutanix (cœur du poste) Linux : administration et exploitation du parc de production — installation, durcissement, industrialisation, scripting et automatisation (shell, Python, Ansible), diagnostic et résolution des incidents systèmes Nutanix : administration du socle AHV / Prism, déploiement de nouveaux nœuds, gestion du stockage et des sauvegardes, accompagnement du décommissionnement VMware Kubernetes (NKP) : contribuer au maintien et à la montée en puissance de la plateforme Nutanix Kubernetes Platform Data center : installation et remplacement de matériel, interventions en salle serveur Run et maintien en condition opérationnelle Traiter en autonomie les tickets d'incidents et de demandes de service (qualification, reproduction, diagnostic, résolution) Surveiller les backlogs quotidiens et veiller au respect des seuils Traiter les alarmes de supervision et proposer des remédiations de fond plutôt que des corrections répétées Préparer, planifier et exécuter les campagnes de patching Linux et Windows Rédiger et sécuriser les changements dans l'outil ITSM Réaliser certaines mises en production applicatives et en assurer le run Rédiger et maintenir les procédures d'exploitation (Confluence) Création de jobs d'ordonnancement et de flux à la demande des chefs de projets Amélioration continue (le vrai challenge du poste) Concevoir une « météo des services » / vue d'état de la production, aujourd'hui inexistante Identifier les tâches manuelles et récurrentes, les scripter et les automatiser Prendre du recul sur les incidents récurrents pour traiter les causes racines Participer aux projets de build (Nutanix, Kubernetes, intégration de nouveaux périmètres) aux côtés des équipes infrastructure Périmètres secondaires Participation au plan de remédiation issu d'un audit Microsoft 365 Suivi de partenaires infogérants (AS/400, CMDB) Environnement techniqueVirtualisation : Nutanix AHV (plateforme principale) ; VMware ESXi résiduel en cours de décommissionnement Systèmes : Linux majoritaire (Red Hat / dérivés) ; Windows Server 2016 → 2022 Conteneurs : Nutanix Kubernetes Platform (NKP) Ordonnancement & flux : OpCon ; GoAnywhere (MFT) Patching & conformité : Foreman (Linux), Tanium (Windows) Sauvegarde : Veeam, HYCU, Barman (PostgreSQL) Automatisation / IaC : Shell, PowerShell, Ansible, Terraform, GitLab Supervision : Centreon, ELK Publication d'applications : Citrix Virtual Apps ITSM & doc : EasyVista, Jira, Confluence