Slurm, gang scheduling, MPI, topologie optimisée
Le calcul intensif sans file d'attente ni facturation opaque
Vos simulations méritent mieux qu'un supercalculateur mutualisé saturé ou une facture cloud imprévisible. Un cluster HPC dédié met la puissance là où sont vos équipes, avec un ordonnancement que vous contrôlez.
Cas d'usage
- Simulation numérique : CFD, éléments finis, dynamique moléculaire
- Recherche : génomique, chimie computationnelle, climat
- Ingénierie : crash tests virtuels, optimisation, rendu
- Batch massif : risque financier, Monte-Carlo, optimisation logistique
Architecture type
- Ordonnancement
- Slurm avec gang scheduling, partitions, QOS et fair-share : les jobs multi-nœuds démarrent ensemble, au plus près du fabric.
- Interconnexion
- InfiniBand ou RoCEv2 avec placement topology-aware pour les collectives MPI et NCCL.
- Stockage
- Scratch parallèle (Lustre, BeeGFS) pour les I/O intensives, tiering vers un stockage capacitaire.
- Environnements
- Modules, conteneurs Apptainer / Enroot et images reproductibles pour chaque équipe de recherche.
Ce que vous recevez
- 01
Cluster Slurm configuré : partitions, QOS, comptabilité des heures de calcul
- 02
Fabric validé par benchmarks MPI et NCCL
- 03
Stockage scratch et capacitaire opérationnels
- 04
Documentation utilisateurs et formation des admins
Questions fréquentes
- Slurm ou Kubernetes pour le HPC ?
- Slurm reste la référence pour les jobs multi-nœuds gang-schedulés et la comptabilité fine des heures de calcul. Kubernetes excelle pour les services longs et l'inférence. Les deux cohabitent très bien : c'est souvent notre recommandation.
- Pouvez-vous migrer un cluster existant ?
- Oui : audit de l'existant, plan de migration par étapes et bascule sans interruption des campagnes de calcul en cours.