Find your next tech and IT Job or contract Prometheus

Your search returns 42 results.
Contractor
Permanent
Fixed term

Job VacancyExpert kubernetes /ia (h/f) : kubernetes, prometheus

Gamme solutions
Published on
Ansible
Docker
GPU

12 months
Fontenay-aux-Roses, Ile-de-France
EXPERT KUBERNETES / IA (H/F)Contexte de la missionNous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l'exploitation, la disponibilité, la performance et la stabilité d'un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage. Le profil recherché devra également contribuer à l'automatisation de l'exploitation, au traitement des incidents et à l'amélioration continue de l'infrastructure. Missions principales Maintien en condition opérationnelle – MCO Garantir la disponibilité, la performance et la stabilité du cluster IA. Administrer les nœuds GPU/CPU, les infrastructures de stockage et les composants réseau. Assurer le suivi et l'optimisation des ressources de l'infrastructure. Piloter les opérations de maintenance et les mises à jour techniques. Administration Linux Installer, configurer et administrer les environnements Linux Ubuntu. Réaliser les opérations d'optimisation et de troubleshooting. Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés. Kubernetes Administrer et exploiter les environnements Kubernetes. Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA). Assurer le maintien en conditions opérationnelles des clusters. Piloter les mises à jour des composants Kubernetes. Gérer les problématiques liées aux ressources et à la capacité des clusters. Supervision et observabilité Mettre en place et maintenir la supervision des infrastructures. Exploiter Prometheus et Grafana pour le monitoring et l'analyse des performances. Identifier les anomalies et anticiper les incidents grâce à une approche proactive. Automatisation Automatiser les tâches d'administration et d'exploitation avec Ansible. Développer et maintenir des scripts Bash et Python. Optimiser les processus opérationnels afin de réduire les tâches manuelles. Gestion des jobs IA / GPU Assurer l'ordonnancement des tâches et jobs GPU. Gérer les quotas, priorités et ressources GPU. Optimiser l'allocation des ressources CPU/GPU. Gestion des incidents Prendre en charge les incidents techniques complexes. Réaliser les analyses de causes racines et les post-mortems. Définir et suivre les plans d'actions correctifs. Coordonner les interventions avec les différentes équipes techniques. Documentation Rédiger et maintenir la documentation d'exploitation. Formaliser les procédures techniques et les consignes de maintenance. Garantir la traçabilité et la continuité des opérations.
View this job
Contractor
Permanent
Fixed term

Job VacancyIngénieur infrastructures virtualisées

R&S TELECOM
Published on
Ansible
AWS Cloud
Git

6 months
Vélizy-Villacoublay, Ile-de-France
Exécutée au sein de l'équipe en charge de l'intégration, de la mise en production et de l'exploitation des socles de virtualisation pour la 5GC, la Prestation comporte principalement des activités de BUILD : Pilotage de projets sur les outils d'exploitation et de déploiement/configuration pour les nouvelles architectures Caas sur Bare Metal (Clusters Kubernetes adaptés 5GC) selon les besoins des équipes Run. Proposition de réalisation des outils d'exploitation et de déploiement pour gérer au mieux les infrastructures hébergeant des containers (Fault management, Performances management et Configuration management) Réalisation directe ou pilotage des développements dans les services outils, par les fournisseurs de socle ou autres Partenaires retenus, Être partie prenante de la démarche devops avec les développeurs et les testeurs Construire le plan de déploiement de la phase d'études à la mise en production, assurer la communication et veiller à toujours être synchronisé avec le projet global pour tenir les objectifs couts et délais. Veiller au respect des standards de sécurité Réalisation ou pilotage des tests de recette et participation aux suivis de VSR en production Rédaction des modes opératoires d'exploitation et des guides d'utilisation des outils. Sélection et mise en forme des données de monitoring et de configuration des socles pour les exploitants et déployeurs. Présentation/formation techniques sur les projets à destination des équipes de RUN Fourniture du bilan projet, modélisant les étapes de déploiement, les capitalisations et toute la documentation projet. Garantir l'intégrité permanente des services et des produits au fil des itérations et incréments. Compétences : Kubernetes, orchestrateur de containers, RedHat, Ansible , Prométheus,, Kibana, Python, Infra systèmes, 5ans exp +, diplômé(e) d'un BAC+4/5 en Ingénierie Informatique Animation de réunions et rédaction de CR de réunions, aisance écrit et oral en français et anglais, rigueur, autonomie et travail en équipe, capacité à synthétiser et vulgariser à l'écrit et à l'oral des sujets techniques complexes. Savoir lire et comprendre du code est un plus (Python et shell, pratiquer Infrastructure as code : GIT, Terraform, AWS Cloud Formation, YAML K8S, Ansible…)
View this job
Contractor
Permanent
Fixed term

Job VacancyExpert conteneurisation / devsecops : kubernetes, docker

Gamme solutions
Published on
Ansible
Bash
DevSecOps

3 months
10k-40k €
100-400 €
Osny, Ile-de-France
Mission au sein d'un centre informatique d'une administration publique, site d'Osny (95). Présence quotidienne sur site, pas de télétravail. Démarrage au plus tard mi-octobre 2026. Durée : 3 mois initiaux, prolongation possible. CONTEXTE Le client construit sa future approche de conteneurisation. Trois agents seront mobilisés à temps plein sur le chantier. L'expert travaille quotidiennement à leurs côtés avec un double objectif : concevoir et mettre en œuvre une première solution opérationnelle, et faire monter ces agents en compétences jusqu'à l'autonomie. Le besoin est en phase de cadrage : des expérimentations existent, mais la cible technologique et l'architecture restent à définir. MISSIONS - Analyser l'existant et les expérimentations déjà réalisées - Faire préciser le besoin, les usages et les exigences d'exploitation - Participer à la définition de l'architecture et de la trajectoire de conteneurisation - Identifier un premier périmètre réalisable sur les 3 mois - Concevoir, configurer et mettre en œuvre la solution retenue - Industrialiser les déploiements, CI/CD et automatisation - Prendre en compte réseau, sécurité, supervision, journalisation, sauvegarde et reprise - Assurer un transfert de compétences permanent par la pratique - Produire la documentation d'exploitation STACK Conteneurisation : Docker, Kubernetes, Rancher IaC : Helm, Terraform, Ansible Réseau et sécurité K8s : CNI, Ingress, Service Mesh, Network et Security Policies Observabilité : Prometheus, Grafana, ELK / Elasticsearch CI/CD : GitLab CI, Jenkins Complémentaire : Linux, Bash, Python, DevSecOps, environnements on-premise
View this job
Contractor

Contractor jobIngénieur DevOps expérimenté Plateforme GPU

VISIAN
Published on
Azure
Bash
Docker

1 year
Paris, France
CONTEXTE ET ENVIRONNEMENT Le pôle conçoit et opère des plateformes « as a service » facilitant la mise en place d'architectures modernes, distribuées et hautement résilientes pour l'ensemble des entités du groupe. Le poste s'inscrit au sein de l'équipe GenAI du domaine d'expertise Data & IA, avec pour mission le déploiement, l'industrialisation et l'exploitation de la plateforme GPUaaS et LLMaaS On-Premise. Cette initiative majeure vise à offrir des solutions agentiques souveraines et sécurisées pour l'ensemble des entités du groupe. PÉRIMÈTRE D'INTERVENTION Le périmètre s'étend de la conception du service à son maintien en condition opérationnelle en production. Le candidat évoluera dans un environnement technique complexe, distribué, sécurisé et hautement disponible, au sein d'une équipe dédiée aux produits et services d'intelligence artificielle. MISSIONS PRINCIPALES • Industrialiser et automatiser le déploiement de plateforme dans un environnement on premise sécurisés • Contribuer à l'évolution de l'architectures de la plateforme • Participer à la mise en place de services managés en intégrant les contraintes de sécurité, compliance et gouvernance • Documenter les offres et services et assurer leur mise en production • Réaliser des présentations et démos pour promouvoir les offres et services • Maintenir en conditions opérationnelles et de sécurité les plateformes IA déployées (run) • Collaborer au sein d'une dev team selon les méthodes agiles • Participer aux daily meetings animés par la Product Owner • Contribuer aux réunions de co-construction de la roadmap • Prendre en charge les éléments de la backlog formalisée par la Product Owner • Participer à l'ensemble des rituels de la squad, de la plateforme et du pôle • Participer aux astreintes techniques du pôle
View this job
Contractor
Permanent

Job VacancyTech Lead OpenStack (H/F) | Marseille (13)

VISIAN
Published on
Ansible
Gitlab
GitLab CI

3 years
52k-62k €
400-500 €
Marseille, Provence-Alpes-Côte d'Azur
Le contexte Nous recherchons un Tech Lead OpenStack sur Marseille. OpenStack est le socle cible du groupe pour l'ensemble de ses infrastructures. La plateforme porte déjà les deux tiers de ses machines virtuelles, sur plus de vingt clusters répartis en plusieurs générations, avec une trajectoire claire de consolidation sur la génération la plus récente. L'équipe OpenStack est jeune et en croissance. Le client recherche un profil expérimenté, capable de porter la plateforme, de la faire évoluer et d'élever le niveau technique de l'équipe. Vos missions Porter et faire évoluer la plateforme : Être le référent technique de la plateforme OpenStack Faire évoluer l'architecture de la génération cible Préparer et conduire les montées de version Accompagner la migration des applications et le décommissionnement des anciennes générations Garantir le run : Prendre en charge les incidents complexes et l'analyse des causes racines Piloter le capacity planning et l'ajout de nouveaux hyperviseurs Assurer le patch management et le maintien en conditions opérationnelles Faire grandir l'équipe : Accompagner la montée en compétence des membres de l'équipe Définir les standards, les bonnes pratiques et la documentation Travailler avec le Product Owner et les équipes voisines
View this job
Contractor
Permanent
Fixed term

Job VacancyExpert Kubernetes /IA H/F

SPIE ICS
Published on
AI Agent
Grafana
Kubernetes

12 months
40k-70k €
400-650 €
Fontenay-aux-Roses, Ile-de-France
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F). Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support. Vos missions : Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations. Profil recherché Vous êtes certifié Kubernetes, justifiez d'une expérience professionnelle minimum de 8 ans dans un poste similaire, et maîtrisez les environnements suivants : Infrastructure : Linux Ubuntu, Kubernetes, Docker, GPU NVIDIA (drivers, CUDA, MIG), Ansible, gestion des environnements distribués. Observabilité : Prometheus, Grafana Stockage : systèmes de fichiers distribués, stockage haute performance et stockage objet Réseau : comprendre l'architecture réseau d'un cluster (VLAN, Load balancing...) Méthodes : ITIL/ITSM, gestion des incidents et des changements, documentation d'exploitation.
View this job
Permanent

Job VacancyTech Lead Devops

CONCRETIO SERVICES
Published on
Ansible
Azure DevOps
Cloud

Ile-de-France, France
En tant que référent technique DevOps pour l'ensemble du groupe, vous serez le gardien de notre excellence technique et le moteur de notre innovation. Votre mission est d'harmoniser nos pratiques et de guider nos choix technologiques. Sans être manager, votre leadership par l'influence sera la clé pour fédérer notre communauté technique, casser les silos et garantir l'efficacité de nos systèmes à long terme. Vos Responsabilités Concrètes Construire et piloter la vision technique DevOps : Vous définirez et maintiendrez la roadmap de nos outils clés (CI/CD, conteneurisation, observabilité, IaC) et identifierez les innovations qui feront la différence pour nous demain. Fédérer et faire grandir notre communauté technique : Vous animerez notre guilde DevOps à travers des ateliers, des démos et des sessions de partage pour diffuser les bonnes pratiques et renforcer la collaboration entre les équipes. Agir en tant qu'expert et mentor : Vous conseillez les équipes sur les choix d'architecture complexes et les accompagnerez dans la résolution de leurs problèmes techniques les plus ardus. Garantir la qualité et la sécurité de notre delivery : Vous mettrez en place des indicateurs de performance (métriques DORA) et intégrerez les meilleures pratiques de sécurité (DevSecOps) au cœur de nos pipelines, en collaboration étroite avec le RSSI. Piloter la Fiabilité et la Performance de nos Services en Production: Votre mission ultime est de garantir que nos services sont non seulement fonctionnels, mais aussi rapides, résilients et efficients pour nos utilisateurs. Profil recherché Le Profil que nous recherchons Titulaire d'un diplôme Bac+5 en école d'ingénieur, université ou équivalent, avec une spécialisation en informatique, systèmes distribués, cloud computing ou DevOps. Une certification Cloud (Azure, AWS, GCP) ou DevOps est un plus apprécié.
View this job
Permanent
Contractor

Job VacancyExpert AWS Production / SRE

CAT-AMANIA
Published on
Bash
Docker
GitHub Actions

1 year
40k-45k €
400-550 €
Tours, Centre-Val de Loire
Dans le cadre du renforcement d'une équipe en charge d'environnements Cloud critiques, nous recherchons un Expert AWS Production pour accompagner l'exploitation, la sécurisation et l'évolution des infrastructures hébergées sur AWS. Tu interviens sur des environnements à forts enjeux de disponibilité et de performance, avec une forte dimension RUN, automatisation, observabilité et résilience. Tes missions principales : Assurer le maintien en conditions opérationnelles des environnements AWS Superviser la disponibilité, les performances et la capacité des infrastructures Cloud Analyser et résoudre les incidents de production complexes Réaliser les analyses de causes racines et piloter les actions correctives associées Mettre en place et améliorer les dispositifs de monitoring, alerting et observabilité Sécuriser et fiabiliser les architectures AWS existantes Accompagner les mises en production et les déploiements Automatiser les tâches d'exploitation et d'administration récurrentes Industrialiser les environnements via l'Infrastructure as Code Optimiser les performances et les coûts des ressources Cloud Participer à l'amélioration des procédures et standards d'exploitation Apporter une expertise technique aux équipes Infrastructure, DevOps, Sécurité et Développement Contribuer aux problématiques de PRA/PCA, haute disponibilité et résilience
View this job

Connecting Tech-Talent

Free-Work, THE platform for all IT professionals.

Free-workers
Resources
About
Recruiters area
2026 © Free-Work / AGSI SAS
Follow us