Ceph, Lustre, NVMe-oF, tiering
Un GPU qui attend ses données est un GPU que vous payez à ne rien faire
Le stockage est le goulot d'étranglement le plus sous-estimé des infrastructures IA et HPC. Nous concevons des fermes de stockage dont le débit est dimensionné sur vos jobs, pas sur une fiche produit.
Cas d'usage
- Alimentation de clusters GPU : datasets, shuffling, checkpoints massifs
- Scratch parallèle pour campagnes HPC à I/O intensives
- Data lake on-prem : ingestion, archivage et conformité
- Sauvegarde et reprise d'activité avec réplication multi-sites
Architecture type
- Tier chaud
- NVMe local ou NVMe-oF pour le scratch et les checkpoints : latence minimale au plus près du compute.
- Parallèle
- Lustre ou BeeGFS pour le débit agrégé multi-nœuds : plusieurs centaines de Go/s soutenus.
- Capacitaire
- Ceph (bloc, objet S3, fichier) pour la capacité résiliente et le tiering automatique.
- Protection
- Erasure coding, snapshots, réplication asynchrone multi-sites et chiffrement au repos.
Ce que vous recevez
- 01
Étude I/O sur vos jobs réels : profils de lecture / écriture, débits cibles
- 02
Ferme déployée et benchmarkée (fio, IOR, mdtest)
- 03
Politique de tiering, snapshots et rétention configurée
- 04
Runbook d'exploitation et formation
Questions fréquentes
- Ceph ou Lustre pour l'IA ?
- Lustre gagne sur le débit parallèle brut pour l'entraînement à grande échelle ; Ceph gagne sur la polyvalence (S3, bloc, fichier) et la résilience opérationnelle. Beaucoup de fermes combinent les deux par tiers. L'étude I/O tranche avec vos chiffres.
- Quelle volumétrie minimale pour que ce soit pertinent ?
- Dès quelques centaines de téraoctets actifs ou dès que le stockage cloud dépasse quelques milliers d'euros par mois, une ferme dédiée mérite d'être chiffrée. Les frais de sortie (egress) du cloud font souvent pencher la balance plus tôt que prévu.