HPC & IA
Slurm vs Kubernetes pour HPC et IA
Slurm domine le batch HPC et les gros jobs d’entraînement. Kubernetes brille pour les services et l’inférence. Les plateformes modernes font souvent cohabiter les deux.
Écrit par
YAPIO
Publié le
14 juil. 2026
Pourquoi Slurm gagne encore sur le batch
Slurm a été conçu pour du hardware rare et cher partagé par beaucoup d’utilisateurs : files, fair-share, préemption, réservations et gang scheduling. Les gros jobs d’entraînement IA héritent du même problème que le HPC scientifique, allocations multi-nœuds exclusives et gestion propre des pannes.
Si votre charge centrale est « soumettre un job, attendre N GPU, tourner des heures », Slurm reste le choix professionnel par défaut.
Où Kubernetes a sa place
Kubernetes excelle sur les services longue durée : APIs d’inférence, microservices, CI, notebooks et plans de contrôle MLOps. Les opérateurs GPU et device plugins rendent les accélérateurs ordonnancables. Il est moins naturel pour le batch exclusif de plusieurs heures sans opérateurs supplémentaires (ex. Slurm-on-K8s).
Beaucoup d’équipes séparent donc : Slurm pour le batch d’entraînement, Kubernetes pour le serving et les services plateforme, ou adoptent des opérateurs qui expriment des clusters Slurm comme ressources Kubernetes.