Stockage IA
Ferme de stockage pour l’IA : Ceph, Lustre et NVMe, comment choisir
Des GPU affamées sont le matériel inactif le plus cher de votre datacenter. Le tiers de stockage décide si vos accélérateurs calculent ou attendent.
Écrit par
YAPIO
Publié le
19 juil. 2026
Partez des profils I/O, pas des brochures
Le stockage IA échoue quand il est dimensionné sur la capacité plutôt que sur le comportement. Les epochs de training lisent des millions de petits fichiers ou de grands shards séquentiels selon votre data loader. Le checkpoint d’un grand modèle écrit en rafale des dizaines à centaines de gigaoctets, depuis tous les nœuds à la fois, à intervalle strict. L’inférence veut des lectures à basse latence des poids au démarrage puis quasi zéro I/O. Trois profils, trois architectures gagnantes différentes.
Mesurez avant d’acheter : capturez les patterns de lecture d’un vrai run de training, notez taille et fréquence des checkpoints, et fixez une cible d’utilisation GPU pendant le chargement des données. Une ferme où les accélérateurs attendent le stockage 20 pour cent du temps a perdu en silence un cinquième de son budget.
Ceph, Lustre, NVMe-oF : choisir par rôle
Lustre est le système de fichiers parallèle de référence pour le débit séquentiel massif : des centaines de gigaoctets par seconde sur de nombreux clients, idéal pour les grands shards de training et les checkpoints en rafale. Son coût : de l’expertise opérationnelle et moins d’aisance sur les tempêtes de métadonnées de petits fichiers. Ceph est le magasin généraliste polyvalent : objet (compatible S3), bloc et fichier depuis un même cluster, auto-réparant, bien maîtrisé par les équipes plateforme. Il excelle pour les data lakes et le versionnage de datasets, mais demande un design soigné (OSD NVMe, erasure coding adapté) pour nourrir des nœuds de training voraces.
NVMe-oF n’est pas un système de fichiers mais un transport : il expose du flash distant à une latence quasi locale. Utilisez-le comme tiers chaud : scratch local pour l’epoch active, zone d’atterrissage des checkpoints avant drainage asynchrone vers Ceph ou Lustre. Le schéma mature est étagé : NVMe chaud, FS parallèle tiède, objet froid, avec une automatisation de cycle de vie qui déplace les données à la place des ingénieurs.
Règles de dimensionnement anti-regret
Trois règles issues du terrain. Un : dimensionnez la bande passante pour les rafales de checkpoint, pas pour la charge moyenne : si 64 nœuds vident chacun 4 Go dans votre fenêtre de checkpoint, le chemin d’écriture doit l’absorber, sinon le training cale sur tout le cluster. Deux : ne laissez jamais la capacité dépasser 70 pour cent sur le tiers chaud ; le rééquilibrage et la reconstruction exigent de la marge précisément quand vous n’en avez plus. Trois : planifiez la croissance dès le premier jour : les datasets triplent plus vite que les cycles d’achat, choisissez donc des systèmes qui grandissent par ajout de nœuds, pas par remplacement complet.
Une ferme de stockage conçue ainsi n’est pas un centre de coût accroché au budget GPU. C’est ce qui garde le budget GPU honnête. YAPIO dimensionne le tiers de stockage à partir de vos traces I/O réelles, dans le même audit que le calcul et le fabric.