Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations. Profil recherché Vous êtes certifié Kubernetes, justifiez d'une expérience professionnelle minimum de 8 ans dans un poste similaire, et maîtrisez les environnements suivants : Infrastructure : Linux Ubuntu, Kubernetes, Docker, GPU NVIDIA (drivers, CUDA, MIG), Ansible, gestion des environnements distribués. Observabilité : Prometheus, Grafana Stockage : systèmes de fichiers distribués, stockage haute performance et stockage objet Réseau : comprendre l'architecture réseau d'un cluster (VLAN, Load balancing...) Méthodes : ITIL/ITSM, gestion des incidents et des changements, documentation d'exploitation.
Nous cherchons un ingénieur systèmes chargé de gérer, de sécuriser et de faire évoluer son infrastructure informatique centrale. À ce poste, vous devrez concilier l'excellence opérationnelle au quotidien (Run) et des projets d'optimisation architecturale à fort impact (Build). Vous serez le pilier technique de nos environnements virtualisés, de nos stratégies de sauvegarde robustes et de notre cadre moderne de gouvernance des identités. Principales responsabilités Virtualisation et systèmes centraux : Gérer et optimiser l infrastructure VMware vSphere (ESXi, vCenter, clusters HA/DRS) ainsi que la topologie de serveurs hybrides Windows/Linux. Intervenir en tant qu'expert en matière d'Active Directory, de DNS, de DHCP et de stratégies de groupe. Gestion des identités et des accès (IAM) : Assurer le déploiement, la gouvernance du cycle de vie et la sécurité de notre architecture d'identité hybride à l'aide de Microsoft Entra ID et d'Okta (y compris l'authentification unique (SSO), l'authentification multifactorielle (MFA), l'accès conditionnel, SAML et OAuth 2.0). Sauvegarde et reprise après sinistre : Concevoir, valider et maintenir des stratégies de continuité d'activité infaillibles à l'aide de Veeam Backup & Replication, en mettant l'accent sur les sauvegardes immuables et la réplication multisite. Fourniture d'applications et de postes de travail : Administrer et optimiser notre écosystème Citrix Virtual Apps and Desktops, en gérant les plateformes Netscaler, Delivery Controllers et StoreFront. Opérations et automatisation : Assurer la résolution des incidents de niveau 2/3, automatiser les workflows répétitifs à l'aide de PowerShell ou Bash, et utiliser Zabbix/Nagios pour surveiller de manière préventive l'état de santé du système. Expertise technologique Virtualisation VMware vSphere, ESXi, vCenter, conception de clusters HA et DRS. Identité et gestion des accès (IAM) Microsoft Entra ID, Okta, SAML, OAuth 2.0, OIDC, provisionnement SCIM. Protection des données Veeam Backup & Replication, sauvegardes « air-gapped » / immuables, exécution de plans de reprise après sinistre (DRP). Systèmes d'exploitation Windows Server (de 2012 à 2025), Active Directory. Compétences de base en RHEL/Ubuntu. Mise à disposition des applications Citrix Workspace (v13/v14), Netscaler, StoreFront, Delivery Controllers. Surveillance et ITSM Zabbix, Nagios, ServiceNow, et conformité aux cadres ITIL.
Le poste comporte une forte composante sécurisation des infrastructures (Hardening) en complément des activités d'audit et de conformité. Le collaborateur assurera également la supervision technique de 2 personnes et participera aux différentes activités d'ingénierie, de déploiement et de maintien en condition opérationnelle des environnements IT. Missions principales Ingénierie Systèmes & Réseaux • Participer aux réunions techniques et ateliers d'architecture. • Définir, déployer et maintenir les environnements IT et Réseau. • Participer à la conception des solutions techniques répondant aux exigences du projet. • Assurer le traitement des incidents, anomalies et demandes d'évolution. • Participer aux phases d'intégration, de validation et d'essais techniques. • Rédiger et maintenir la documentation technique et de sécurité. Cybersécurité, Audit & Hardening Le poste est fortement orienté vers la sécurisation opérationnelle des systèmes. Audit de sécurité • Réalisation d'audits techniques des environnements Windows et Linux. • Analyse des vulnérabilités et des écarts de conformité. • Élaboration des plans de remédiation. • Accompagnement des équipes dans l'application des recommandations de sécurité. Hardening des serveurs Windows (70 % de l'activité) • Désactivation des services et fonctionnalités inutiles. • Renforcement des politiques de sécurité (GPO, politique de mots de passe, restrictions d'accès). • Gestion et revue des comptes à privilèges. • Durcissement Active Directory. • Application des correctifs de sécurité. • Réduction de la surface d'exposition des systèmes. • Contrôle et maintien de la conformité sécurité. Hardening des serveurs Linux (30 % de l'activité) • Désactivation des services inutiles. • Renforcement des paramètres de sécurité du système d'exploitation. • Gestion des comptes, groupes et privilèges. • Sécurisation des accès SSH. • Application des correctifs et remédiation des vulnérabilités. • Contrôle régulier de la conformité des environnements Linux. Encadrement et coordination • Supervision fonctionnelle de 2 collaborateurs techniques. • Répartition des tâches et suivi de l'avancement. • Contrôle qualité des livrables. • Support technique de niveau expert auprès des équipes projet. • Participation à l'identification et au suivi des risques techniques. • Coordination avec les différentes parties prenantes du projet. Compétences techniques requises Environnement Windows (70 %) • Windows Server 2016 / 2019 / 2022. • Active Directory. • GPO. • DNS / DHCP. • PowerShell. • VMware ou Hyper-V. • Gestion des sauvegardes et PRA/PCA. • Sécurisation des environnements Microsoft. • Gestion des vulnérabilités et remédiation. Environnement Linux (30 %) • RedHat, CentOS, Rocky Linux ou Ubuntu. • Administration système avancée. • Gestion des services et des performances. • Scripting Shell. • Sécurisation des environnements Linux. • Gestion des mises à jour et correctifs de sécurité.