Ingénieur Système Hpc - Gpu - Slurm Réf. 2026-1400 H/F - Sorbonne Université– Services Universitaires
Publié le 29 juillet 2026Les missions du poste
Dans un contexte national et international marqué par la compétition autour de l'intelligence artificielle, Sorbonne Université a créé le Sorbonne Cluster for Artificial Intelligence (SCAI), qui réunit un ensemble stratégique de disciplines de l'IA moderne. Son ambition est de renforcer l'excellence de la recherche interdisciplinaire en favorisant les échanges entre chercheurs, enseignants, étudiants et partenaires industriels.Le candidat ou la candidate rejoint une équipe en charge de l'administration, de la maintenance et de l'évolution du cluster PostGenAI@Paris, projet académique majeur porté par Sorbonne Université, lauréat de l'appel « IA-Cluster » (France 2030), doté de 35 M€ sur 5 ans. Ce cluster rassemble un large consortium d'acteurs académiques (CNRS, Inria, Inserm, UTC, MNHN, AP-HP, Cnam, Sciences Po, Onera...) et plus de 60 partenaires industriels, avec pour objectif de devenir un pôle d'excellence international en IA post-générative à l'horizon 2030.L'infrastructure HPC repose sur des noeuds GPU NVIDIA sous Debian GNU/Linux, avec l'ordonnanceur SLURM pour la gestion des ressources. Elle répond aux besoins de recherche et de formation en IA du consortium.Stack technique principale : Debian GNU/Linux, GPU NVIDIA (CUDA), SLURM, réseau 25/100G, stockage NFS/Ceph, supervision Prometheus/Grafana, automatisation Ansible/Bash/Python, authentification SSH/LDAP/SSO.
Fonctions : Ingénieur.e Système HPC / GPU / SLURMCatégorie : BCorps : TECHBAP : ECDD de 12 mois.Missions principales :1. Administration systèmeDéploiement et maintenance des noeuds de calcul GPU sous DebianDéploiement et maintenance de noeuds proxmox, vm et dockerGestion des mises à jour système, des pilotes NVIDIA et des librairies CUDAConfiguration et optimisation du réseau haute performance (bonding, VLAN)Mise en oeuvre et gestion des systèmes de fichiers distribués (NFS, CEPH, CephFS)Automatisation des déploiements via Ansible2. Administration SLURMInstallation, configuration et mise à jour de SLURM (slurmctld, slurmd, slurmdbd)Définition des partitions, QOS, comptes et limites de ressourcesIntégration des GPU NVIDIA dans les ressources SLURM (GRES)Surveillance des jobs, diagnostics et interventions sur les noeuds en défautRédaction et mise à jour des procédures SLURM à destination des utilisateurs3. Support utilisateurs et opérateursSupport de niveau 2/3 pour les utilisateurs de la plateforme HPCAccompagnement des utilisateurs sur l'optimisation de leurs soumissions SLURMParticipation aux réunions techniques et rédaction des comptes-rendusRédaction de la documentation technique et des runbooks4. Supervision et performanceMise en place et maintenance des outils de supervision (Prometheus, Grafana)Analyse des performances GPU (utilisation, mémoire, température, bande passante NVLink)Optimisation des politiques d'ordonnancement selon la charge de la plateformeGestion des incidents et participation aux astreintes selon planning
Le profil recherché
Compétences techniques indispensables :Solide maîtrise de Linux/Debian : administration système, packaging, systemd, réseauExpérience confirmée sur SLURM : configuration, partitions, GRES GPU, accountingBonne connaissance de l'écosystème NVIDIA : drivers, CUDA, NVML, DCGMMaîtrise des outils d'automatisation : Ansible, Bash, PythonExpérience sur les réseaux : Bonding, Vlan, routageCompétences appréciées :Connaissance de systèmes de fichiers distribués : Ceph, cephfsPratique de la supervision avec Prometheus, Grafana, AlertmanagerNotions de MPI (OpenMPI, MVAPICH2) et de librairies de calcul (cuBLAS, NCCL)Expérience avec des frameworks IA/ML : PyTorch, TensorFlow (usage sur HPC)Connaissances en gestion de version : Git, GitLab CIQualités personnelles :Rigueur, méthode et sens de la documentationAutonomie et capacité à gérer les priorités en environnement de productionBon relationnel et goût pour le travail en équipeCuriosité technique et veille active sur l'écosystème HPC/GPU
Compétences requises
- Bash
- Python
- Travail en équipe
- Autonomie
- NFS
- packaging
- Création d'une base documentaire
- Routage
- Qualité de service (QoS)
- Git
- Ansible
- Grafana
- TensorFlow
- Analyse de la performance de la promotion
- Linux
- Debian
- VLAN
- Administration système et réseau
- Prometheus