Dans le cadre du renforcement d'une équipe en charge d'environnements Cloud critiques, nous recherchons un Expert AWS Production pour accompagner l'exploitation, la sécurisation et l'évolution des infrastructures hébergées sur AWS. Tu interviens sur des environnements à forts enjeux de disponibilité et de performance, avec une forte dimension RUN, automatisation, observabilité et résilience. Tes missions principales : Assurer le maintien en conditions opérationnelles des environnements AWS Superviser la disponibilité, les performances et la capacité des infrastructures Cloud Analyser et résoudre les incidents de production complexes Réaliser les analyses de causes racines et piloter les actions correctives associées Mettre en place et améliorer les dispositifs de monitoring, alerting et observabilité Sécuriser et fiabiliser les architectures AWS existantes Accompagner les mises en production et les déploiements Automatiser les tâches d'exploitation et d'administration récurrentes Industrialiser les environnements via l'Infrastructure as Code Optimiser les performances et les coûts des ressources Cloud Participer à l'amélioration des procédures et standards d'exploitation Apporter une expertise technique aux équipes Infrastructure, DevOps, Sécurité et Développement Contribuer aux problématiques de PRA/PCA, haute disponibilité et résilience
Informations clés Localisation : Montpellier ou Guyancourt (78) — 2 jours de télétravail par semaine TJM max : 550 € Démarrage : ASAP Durée : Mission longue durée (projection jusqu'en 08/2029) Contexte de la mission Au sein du pôle Data & IA, vous intégrez l'équipe Big Data en charge de la conception et de l'exploitation de plateformes « as a service ». L'objectif est de déployer des architectures modernes, distribuées et hautement résilientes. En tant qu'Ingénieur Big Data Senior, vous participerez à la conception, l'implémentation et l'administration d'une infrastructure Cloud Hybride. Une solide expertise sur Google Cloud Platform (GCP) ainsi que sur les infrastructures On-Premise est requise. Le périmètre couvre l'ensemble du cycle de vie des services, de leur conception jusqu'à leur maintien en condition opérationnelle (MCO). Missions principales Infrastructures & Plateformes : Participer à la mise en œuvre, l'administration et l'optimisation continue de la plateforme Big Data et Data Engineering. Infrastructure as Code (IaC) : Développer et maintenir les scripts d'infrastructures avec Terraform et Terragrunt. CI/CD & GitOps : Automatiser et maintenir les pipelines de déploiement continu sous GitLab CI/CD, en appliquant les meilleures pratiques Cloud, DevOps et GitOps. MCO & Observabilité : Assurer le maintien en condition opérationnelle des plateformes, puis déployer et maintenir les outils de monitoring et d'alerting. Collaboration & Documentation : Travailler en synergie avec les équipes applicatives, infra et DevOps, et rédiger la documentation technique et d'exploitation.
Vos missions **Exploitation & Administration OpenShift AI** - Administration et maintien en conditions opérationnelles des plateformes OpenShift AI - Traitement des incidents et demandes de support - Supervision de l'environnement Kubernetes/OpenShift - Patching et montées de version - Gestion des workloads, namespaces, quotas et déploiements - Gestion des certificats, accès et configurations de la plateforme **Infrastructure & Plateforme** - Administration des clusters OpenShift sur infrastructures VMware et BareMetal - Gestion des ressources GPU - Administration du stockage et de la persistance des données - Gestion des composants réseau OpenShift (Ingress, Network Policies, exposition des services) **OpenShift AI & MLOps** - Administration des Data Science Projects et Workbenches - Gestion des services de Model Serving (ModelMesh) - Déploiement et exploitation de pipelines ML - Optimisation des ressources GPU pour les usages IA - Accompagnement des équipes Data Science et IA **Automatisation & Industrialisation** - Mise en œuvre des pratiques GitOps et CI/CD - Déploiement d'applications via Helm - Administration d'ArgoCD et des pipelines Tekton - Automatisation des opérations récurrentes - Participation aux projets de transformation de la plateforme **Formation & Accompagnement** - Formation des équipes en charge du RUN - Montée en compétence du Service Owner - Documentation des procédures et bonnes pratiques - Transfert de connaissances vers les équipes d'exploitation
Contexte de la prestation La prestation se déroulera au sein de la Direction des Technologies de France Télévisions / Media Factory / Ingénierie Supply chain et Diffusion, entité en charge des systèmes permettant l'alimentation en médias et la diffusion des chaînes Nationales, des chaînes du réseau Outre-Mer et des chaînes régionales. Ces systèmes sont principalement opérés par le CDE (Centre de Diffusion et d'Échanges) dont les services audiovisuels comprennent la diffusion de F2, F3, F4, F5, franceinfo et de chaînes thématiques, et le CDA actuellement en construction (Centre de Diffusion et d'Acquisition) pour les chaînes du réseau Outre-Mer et le réseau régional de F3. Prestation attendue Dans ce cadre, France Télévisions recherche une prestation d'expertise infra IT de supervision des systèmes broadcast de Supply chain et de diffusion consistant à mettre en place la supervision d'une infra broadcast de Supply chain et de diffusions dont les outils principaux sont Prometheus et Grafana.
Dans un contexte de production informatique, vous interviendrez sur le maintien en condition opérationnelle et la cybersécurité d'un parc de serveurs Linux, ainsi que sur les middlewares associés. Vos principales responsabilités : Assurer le MCO et la cybersécurité des environnements Linux Suivre l'état de l'art et traiter les incidents et demandes Participer à l'intégration de nouveaux outils et aux projets d'évolution du périmètre Intervenir rapidement en cas d'incident afin de réduire au maximum le délai de rétablissement du service Traiter les demandes de mise en service et contribuer à leur industrialisation Assurer le support aux utilisateurs et aux équipes techniques
Dans le cadre du renforcement d'une équipe d'exploitation, nous recherchons un Ingénieur d'exploitation / SRE – SYSOPS chargé d'assurer la fiabilité, la performance et la disponibilité des applications et infrastructures en production. Vous intervenez notamment sur : Le maintien en conditions opérationnelles (MCO) des systèmes, applications et flux. La surveillance et l'observabilité des environnements afin d'anticiper et résoudre les incidents. La gestion des environnements de recette, préproduction et production. L'analyse des incidents, la recherche des causes racines et la mise en œuvre d'actions correctives. L'automatisation des opérations et des déploiements via CI/CD, GitOps et Infrastructure as Code. L'administration et la supervision d'environnements Kubernetes / Rancher. L'optimisation des performances, de la résilience et de la haute disponibilité. La gestion et la supervision d'infrastructures Cloud. La mise en place et le maintien de la documentation et des procédures d'exploitation. La collaboration avec les équipes développement, infrastructure et production dans une démarche SRE / DevOps.
Contexte : Dans le cadre d'un projet à forts enjeux de disponibilité et de sécurité, nous recherchons un Senior DevOps / SRE disposant d'une solide expertise DBA pour intervenir sur une plateforme SaaS critique. Le consultant interviendra en collaboration avec les équipes Ops afin d'assurer le maintien en conditions opérationnelles, la fiabilité, la sécurité et la scalabilité de la plateforme et de ses différents composants. Missions : Administration et maintien en conditions opérationnelles de la plateforme ; Gestion des composants OpenSearch et ClickHouse ; Administration et maintien des différents services et dépendances : Kafka, RabbitMQ, etc. ; Accompagnement des équipes Ops sur les problématiques de disponibilité et de fiabilité ; Mise en place et maintien d'architectures hautement disponibles et sans Single Point of Failure (SPoF) ; Automatisation des déploiements et des opérations ; Gestion et optimisation des environnements Kubernetes ; Monitoring, supervision et amélioration de l'observabilité ; Analyse et résolution d'incidents complexes ; Scripting et automatisation en Bash / Python ; Participation à l'amélioration continue des pratiques DevOps / SRE.
Dans le cadre de nos projets de transformation cloud et d'infrastructure, nous recherchons un(e) Ingénieur DevOps / Cloud expérimenté(e), maîtrisant les environnements Kubernetes et les plateformes cloud Azure et AWS. Missions principales : Conception, déploiement et administration d'infrastructures Kubernetes (on-premise & AKS) Mise en place et maintien de pipelines CI/CD (Azure DevOps, Jenkins, ArgoCD, GitLab CI/CD) Provisionnement d'infrastructure as Code avec Terraform et Ansible Déploiement et configuration des stacks de supervision : Prometheus, Grafana, Dynatrace Gestion des incidents (niveaux 2 et 3), rédaction de post-mortems Collaboration avec les équipes de développement pour le déploiement d'applicatifs conteneurisés Mise en œuvre des bonnes pratiques de sécurité cloud (gestion des certificats, privatisation des endpoints, IAM)
Contexte : Nous recherchons un Ingénieur DevOps spécialisé Kubernetes pour rejoindre une équipe intervenant sur des infrastructures cloud et des plateformes applicatives. Vous serez intégré à une équipe en charge de l'exploitation, de l'administration et de l'évolution de plusieurs environnements GCP / OpenShift, ainsi que des services associés. Responsabilités : - Administrer et maintenir des clusters Kubernetes / OpenShift ; - Participer au déploiement et à l'évolution des applications conteneurisées - Gérer les environnements GCP et les services Cloud SQL / PostgreSQL ; - Administrer et maintenir des infrastructures RabbitMQ ; - Automatiser les déploiements et opérations d'exploitation avec Helm et GitLab ; - Mettre en place et maintenir la supervision des plateformes avec Prometheus et Grafana ; - Participer à l'amélioration de la fiabilité, de la performance et de l'automatisation des infrastructures ; - Contribuer aux activités de résolution d'incidents.
- Intégrer et déployer les applications sur les plateformes Kubernetes - Administrer et maintenir les environnements Kubernetes - Déployer et configurer les composants techniques via Ansible - Développer et maintenir des playbooks Ansible - Automatiser les opérations d'installation, de configuration et de déploiement - Participer à l'industrialisation des processus d'intégration et de mise en production - Mettre en œuvre et maintenir les chaînes CI/CD - Assurer le suivi des déploiements et analyser les incidents techniques - Participer à l'optimisation et à la fiabilisation des environnements - Réaliser les opérations de maintenance et d'évolution des plateformes - Collaborer avec les équipes de développement, infrastructure et production - Rédiger et maintenir la documentation technique. ENVIRONNEMENT TECHNIQUE : Kubernetes, Docker, Helm, Ansible, Linux RedHat, Bash, Git, Gitlab, Prometheus, Grafana, ELK, etc.
Panda Services est une Entreprise de Services du Numérique spécialisée en Ingénierie Informatique, présente sur le marché depuis plus de 22 ans, réalisant pour ses clients des prestations de haut niveau en assistance technique. Nous recherchons un/e Ingénieur/e Système Confirmé pour assurer le Run de l'administration système, en relais d'un ingénieur référent pendant sa mobilisation sur un projet de conteneurisation Kubernetes. Localisation = 95 Périmètre technique : Serveurs Linux et Windows Virtualisation Sauvegardes Gestion des correctifs Gestion des incidents Automatisation Documentation technique Missions et responsabilités Administrer les serveurs Linux (Red Hat, CentOS, Ubuntu) et Windows Server : gestion des comptes, services, configurations et accès, dans le respect du principe du moindre privilège. Gérer les sauvegardes et restaurations ainsi que les contrôles associés (NetBackup, Veeam ou équivalent) : suivi des jobs, traitement des échecs et tests de restauration. Appliquer les mises à jour, correctifs de sécurité et évolutions de configuration, conformément aux procédures de changement en vigueur. Administrer les environnements virtualisés (VMware ou RHEV) : création, modification et suivi des machines virtuelles, ainsi que contrôle des ressources. Prendre en charge les incidents système, de leur diagnostic à leur résolution, avec escalade lorsque nécessaire. Superviser les systèmes à l'aide des outils de monitoring (Prometheus, Grafana) et traiter les alertes. Automatiser les tâches récurrentes à l'aide d'Ansible, Bash ou Python. Maintenir à jour la documentation technique, les consignes et les procédures d'exploitation. Assurer la passation et le transfert de connaissances avec l'équipe en place tout au long de la prestation. Livrables Continuité des activités d'administration système pendant toute la durée de la prestation. Tableaux de bord périodiques d'activité, de disponibilité et d'incidents. Traçabilité des demandes, incidents, changements et interventions dans l'outil de ticketing. Documentation technique, consignes et procédures maintenues à jour. Scripts et automatisations produits, accompagnés de leur documentation. Comptes rendus d'intervention et de suivi. Bilan de fin de prestation et transfert des informations nécessaires à la continuité de l'activité. Compétences recherchées Compétences obligatoires : Systèmes d'exploitation : Red Hat, CentOS, Ubuntu, Windows Server Virtualisation : VMware, RHEV Sauvegarde : NetBackup, Veeam ou équivalent Supervision : Prometheus, Grafana Automatisation / scripting : Ansible, Bash, Python Expérience Minimum 3 ans d'expérience sur une fonction similaire. Profil confirmé en administration système et exploitation.
Description du poste : Nous recherchons un consultant freelance expert en infrastructures de bases de données pour prendre en charge le déploiement et l'architecture complète d'une infrastructure MongoDB dans un environnement exigeant. Vous interviendrez de A à Z sur le projet, assurerez l'accompagnement des équipes et contribuerez à la fiabilité opérationnelle du service. Missions : • Build de l'infrastructure MongoDB : déploiement de A à Z des clusters (replica sets, sécurité, sauvegardes) et participation à la définition et à l'évolution de l'architecture cible. • Automatisation : conception et maintenance des playbooks et rôles Ansible pour industrialiser les installations, configurations et montées de version. • Observabilité : développement de scripts Python de supervision et intégration aux outils de monitoring (Dynatrace, Prometheus, Grafana) pour anticiper les incidents. • Run & accompagnement : troubleshooting et résolution d'incidents complexes, participation au régime d'astreintes, conseil aux équipes clientes sur leurs configurations MongoDB.
Contexte : Dans le cadre de l'équipe Platform & Monitoring, notre client recherche un Intégrateur DevOps / Platform Engineer chargé de piloter l'automatisation de la chaîne CI/CD et la gestion des services d'infrastructure. La plateforme s'appuie notamment sur Kubernetes et une stack de monitoring comprenant Grafana, Loki, Mimir et Prometheus. L'objectif est de disposer d'une plateforme fortement automatisée, sécurisée, fiable et scalable. MISSIONS Concevoir et maintenir les modules Infrastructure as Code (IaC) avec Terragrunt / OpenTofu / Terraform pour des déploiements Kubernetes multi-environnements. Construire et optimiser les pipelines GitLab CI, incluant runners et auto-scaling. Gérer l'IAM avec Keycloak : OIDC, SSO, RBAC, realms, clients et fédération. Administrer le registre de conteneurs Harbor : signature d'images, réplication et analyse des vulnérabilités. Déployer et administrer l'infrastructure Cloud sur Microsoft Azure / AKS. Gérer les déploiements Kubernetes avec Helm et Flux / GitOps. Automatiser via scripting Bash, Python ou Go. Garantir la fiabilité, la sécurité et l'observabilité de la plateforme. Compétences indispensables Expertise attendue : OpenTofu / Terraform Terragrunt GitLab CI/CD Kubernetes Helm Flux / GitOps Azure / AKS Keycloak Harbor Scripting Bash, Python ou Go Linux Monitoring / Observabilité : Grafana Loki Mimir Prometheus