Expert kubernetes /ia (h/f) : kubernetes, prometheus
Gamme solutionsSecteur publicPubliée il y a 2 jours
~ 750 – 950 €/jFourchette estimée par FreelanceScope à partir du niveau d'expérience demandé : la source ne publie pas de TJM pour cette mission.
- Lieu
- Fontenay-aux-Roses · Sur site
- Durée
- 6 mois
- Démarrage
- 28 septembre 2026
- Expérience
- Expert (10 ans et +)
- Langues
- Français
- Contrat
- Freelance
Situer cette mission
Repères calculés par FreelanceScope sur les missions ouvertes de son catalogue — ils ne proviennent pas de l'annonce et n'engagent pas l'entreprise.
- Le TJM de cette mission se situe au-dessus de la médiane des 237 missions de votre métier et de votre séniorité de notre catalogue, dont la médiane est de 430 €/jour (moitié centrale : 250 à 850 €/jour).
- 3 missions ingénieur devops sont ouvertes à Fontenay-aux-Roses en ce moment, sur 670 pour ce métier en France.
- 1 % des missions ingénieur devops de notre catalogue sont ouvertes en télétravail total.
- Compétences peu demandées ailleurs dans le catalogue : Prometheus (30 missions), Grafana (64 missions). À séniorité égale, une compétence rare se négocie mieux.
Profil expert (10 ans et +) · Comment ces repères sont calculés
La mission
Nous recherchons pour notre client un(e) Expert Kubernetes /IA (H/F).
Rôle principal : Garantir la disponibilité, performance et stabilité du cluster IA (GPU/CPU/réseau/stockage), automatiser son exploitation et assurer le support.
Vos missions :
Maintien en condition opérationnelle (MCO) du cluster IA, incluant la gestion des nœuds GPU/CPU, du stockage et du réseau. Administration des systèmes Linux : installation, configuration et optimisation. Exploitation et gestion des environnements Kubernetes : déploiement, montée en charge (scaling) et haute disponibilité (HA). Supervision et monitoring des infrastructures à l'aide d'outils tels que Prometheus et Grafana. Gestion des incidents techniques, analyse post-mortem et mise en place de plans d'action correctifs. Automatisation des tâches opérationnelles via Ansible et scripts Bash/Python. Gestion des jobs : ordonnancement des tâches GPU, gestion des quotas et priorités. Pilotage des mises à jour des systèmes d'exploitation, des pilotes NVIDIA et des composants Kubernetes. Gestion des incidents liés à l'infrastructure et coordination des interventions. Rédaction et mise à jour de la documentation d'exploitation pour assurer la traçabilité et la continuité des opérations.
Compétences attendues
Indispensables
- Kubernetes
- Linux
- Prometheus
- Grafana
- Ansible
- Python

