Dans le cadre du renforcement d'une équipe d'exploitation, nous recherchons un Ingénieur d'exploitation / SRE – SYSOPS chargé d'assurer la fiabilité, la performance et la disponibilité des applications et infrastructures en production. Vous intervenez notamment sur : Le maintien en conditions opérationnelles (MCO) des systèmes, applications et flux. La surveillance et l'observabilité des environnements afin d'anticiper et résoudre les incidents. La gestion des environnements de recette, préproduction et production. L'analyse des incidents, la recherche des causes racines et la mise en œuvre d'actions correctives. L'automatisation des opérations et des déploiements via CI/CD, GitOps et Infrastructure as Code. L'administration et la supervision d'environnements Kubernetes / Rancher. L'optimisation des performances, de la résilience et de la haute disponibilité. La gestion et la supervision d'infrastructures Cloud. La mise en place et le maintien de la documentation et des procédures d'exploitation. La collaboration avec les équipes développement, infrastructure et production dans une démarche SRE / DevOps.
Vos missions **Exploitation & Administration OpenShift AI** - Administration et maintien en conditions opérationnelles des plateformes OpenShift AI - Traitement des incidents et demandes de support - Supervision de l'environnement Kubernetes/OpenShift - Patching et montées de version - Gestion des workloads, namespaces, quotas et déploiements - Gestion des certificats, accès et configurations de la plateforme **Infrastructure & Plateforme** - Administration des clusters OpenShift sur infrastructures VMware et BareMetal - Gestion des ressources GPU - Administration du stockage et de la persistance des données - Gestion des composants réseau OpenShift (Ingress, Network Policies, exposition des services) **OpenShift AI & MLOps** - Administration des Data Science Projects et Workbenches - Gestion des services de Model Serving (ModelMesh) - Déploiement et exploitation de pipelines ML - Optimisation des ressources GPU pour les usages IA - Accompagnement des équipes Data Science et IA **Automatisation & Industrialisation** - Mise en œuvre des pratiques GitOps et CI/CD - Déploiement d'applications via Helm - Administration d'ArgoCD et des pipelines Tekton - Automatisation des opérations récurrentes - Participation aux projets de transformation de la plateforme **Formation & Accompagnement** - Formation des équipes en charge du RUN - Montée en compétence du Service Owner - Documentation des procédures et bonnes pratiques - Transfert de connaissances vers les équipes d'exploitation
Dans un contexte de production informatique, vous interviendrez sur le maintien en condition opérationnelle et la cybersécurité d'un parc de serveurs Linux, ainsi que sur les middlewares associés. Vos principales responsabilités : Assurer le MCO et la cybersécurité des environnements Linux Suivre l'état de l'art et traiter les incidents et demandes Participer à l'intégration de nouveaux outils et aux projets d'évolution du périmètre Intervenir rapidement en cas d'incident afin de réduire au maximum le délai de rétablissement du service Traiter les demandes de mise en service et contribuer à leur industrialisation Assurer le support aux utilisateurs et aux équipes techniques
Contexte de la prestation La prestation se déroulera au sein de la Direction des Technologies de France Télévisions / Media Factory / Ingénierie Supply chain et Diffusion, entité en charge des systèmes permettant l'alimentation en médias et la diffusion des chaînes Nationales, des chaînes du réseau Outre-Mer et des chaînes régionales. Ces systèmes sont principalement opérés par le CDE (Centre de Diffusion et d'Échanges) dont les services audiovisuels comprennent la diffusion de F2, F3, F4, F5, franceinfo et de chaînes thématiques, et le CDA actuellement en construction (Centre de Diffusion et d'Acquisition) pour les chaînes du réseau Outre-Mer et le réseau régional de F3. Prestation attendue Dans ce cadre, France Télévisions recherche une prestation d'expertise infra IT de supervision des systèmes broadcast de Supply chain et de diffusion consistant à mettre en place la supervision d'une infra broadcast de Supply chain et de diffusions dont les outils principaux sont Prometheus et Grafana.
Dans le cadre de nos projets de transformation cloud et d'infrastructure, nous recherchons un(e) Ingénieur DevOps / Cloud expérimenté(e), maîtrisant les environnements Kubernetes et les plateformes cloud Azure et AWS. Missions principales : Conception, déploiement et administration d'infrastructures Kubernetes (on-premise & AKS) Mise en place et maintien de pipelines CI/CD (Azure DevOps, Jenkins, ArgoCD, GitLab CI/CD) Provisionnement d'infrastructure as Code avec Terraform et Ansible Déploiement et configuration des stacks de supervision : Prometheus, Grafana, Dynatrace Gestion des incidents (niveaux 2 et 3), rédaction de post-mortems Collaboration avec les équipes de développement pour le déploiement d'applicatifs conteneurisés Mise en œuvre des bonnes pratiques de sécurité cloud (gestion des certificats, privatisation des endpoints, IAM)
Contexte : Dans le cadre d'un projet à forts enjeux de disponibilité et de sécurité, nous recherchons un Senior DevOps / SRE disposant d'une solide expertise DBA pour intervenir sur une plateforme SaaS critique. Le consultant interviendra en collaboration avec les équipes Ops afin d'assurer le maintien en conditions opérationnelles, la fiabilité, la sécurité et la scalabilité de la plateforme et de ses différents composants. Missions : Administration et maintien en conditions opérationnelles de la plateforme ; Gestion des composants OpenSearch et ClickHouse ; Administration et maintien des différents services et dépendances : Kafka, RabbitMQ, etc. ; Accompagnement des équipes Ops sur les problématiques de disponibilité et de fiabilité ; Mise en place et maintien d'architectures hautement disponibles et sans Single Point of Failure (SPoF) ; Automatisation des déploiements et des opérations ; Gestion et optimisation des environnements Kubernetes ; Monitoring, supervision et amélioration de l'observabilité ; Analyse et résolution d'incidents complexes ; Scripting et automatisation en Bash / Python ; Participation à l'amélioration continue des pratiques DevOps / SRE.
🎯 MISSIONS : Intégré(e) aux équipes d'un de nos clients grand compte, vos missions seront les suivantes : - Automatiser et fiabiliser les déploiements applicatifs - Concevoir et maintenir les infrastructures Cloud et On-Premise - Mettre en œuvre les bonnes pratiques CI/CD - Superviser les environnements et optimiser les performances - Participer à l'amélioration continue de la sécurité et de l'exploitation Environnement technique : - Cloud : Azure, AWS ou GCP - Conteneurisation : Docker, Kubernetes (AKS, EKS) - CI/CD : Azure DevOps, GitLab CI/CD, Jenkins - Infrastructure as Code : Terraform, Ansible - Scripting : PowerShell, Bash, Python - Versionning : Git - Monitoring : Prometheus, Grafana, ELK, Datadog
- Intégrer et déployer les applications sur les plateformes Kubernetes - Administrer et maintenir les environnements Kubernetes - Déployer et configurer les composants techniques via Ansible - Développer et maintenir des playbooks Ansible - Automatiser les opérations d'installation, de configuration et de déploiement - Participer à l'industrialisation des processus d'intégration et de mise en production - Mettre en œuvre et maintenir les chaînes CI/CD - Assurer le suivi des déploiements et analyser les incidents techniques - Participer à l'optimisation et à la fiabilisation des environnements - Réaliser les opérations de maintenance et d'évolution des plateformes - Collaborer avec les équipes de développement, infrastructure et production - Rédiger et maintenir la documentation technique. ENVIRONNEMENT TECHNIQUE : Kubernetes, Docker, Helm, Ansible, Linux RedHat, Bash, Git, Gitlab, Prometheus, Grafana, ELK, etc.
Contexte : Nous recherchons un Ingénieur DevOps spécialisé Kubernetes pour rejoindre une équipe intervenant sur des infrastructures cloud et des plateformes applicatives. Vous serez intégré à une équipe en charge de l'exploitation, de l'administration et de l'évolution de plusieurs environnements GCP / OpenShift, ainsi que des services associés. Responsabilités : - Administrer et maintenir des clusters Kubernetes / OpenShift ; - Participer au déploiement et à l'évolution des applications conteneurisées - Gérer les environnements GCP et les services Cloud SQL / PostgreSQL ; - Administrer et maintenir des infrastructures RabbitMQ ; - Automatiser les déploiements et opérations d'exploitation avec Helm et GitLab ; - Mettre en place et maintenir la supervision des plateformes avec Prometheus et Grafana ; - Participer à l'amélioration de la fiabilité, de la performance et de l'automatisation des infrastructures ; - Contribuer aux activités de résolution d'incidents.
Vous rejoignez une équipe en charge de plateformes CI/CD pour assurer l'administration, l'exploitation et l'amélioration des services GitLab et Artifactory. Vos missions : • Créer, administrer et superviser des instances Artifactory et GitLab. • Mettre en œuvre les plateformes et assurer leur maintien en condition opérationnelle : mises en production, upgrades, analyse et résolution d'incidents. • Apporter votre expertise et assurer le support autour d'une instance spécifique soumise à de fortes contraintes de sécurité. • Mettre en place et améliorer les outils de supervision. • Développer des outils et scripts permettant d'automatiser, de piloter et de suivre les migrations de projets entre différentes instances. • Participer à l'amélioration continue des services. • Assurer le support technique auprès des utilisateurs et des équipes projet. Environnement technique : Artifactory, GitLab, Linux, Kubernetes, GitLab CI, Azure, PostgreSQL, Docker, Ansible, Python, Grafana, Prometheus, Vault, LDAP, Nginx et Kibana. Technologies complémentaires appréciées : MariaDB et Alertmanager.