Fabric réseau
Pourquoi InfiniBand et RoCE comptent pour les clusters GPU
Quand les GPU attendent le réseau, vous brûlez de l’argent. La qualité du fabric décide combien de vos accélérateurs chers travaillent vraiment.
Écrit par
YAPIO
Publié le
15 juil. 2026
All-reduce et GPU idle
Le training distribué synchronise sans cesse les gradients entre GPU (souvent via all-reduce). Si l’interconnexion est lente ou congestionnée, les accélérateurs restent idle. InfiniBand et RoCE avec RDMA déplacent les données avec peu d’implication CPU et une latence plus basse que l’Ethernet classique pour ces motifs.
C’est pourquoi la « ferme réseau » ou le fabric haute vitesse est un élément de design de premier plan, pas une réflexion après coup une fois les GPU achetées.
Implications de design
Planifiez la topologie (fat-tree, rail-optimized), les partition keys pour l’isolation multi-tenant, et les chemins de stockage qui empruntent aussi le fabric quand c’est possible. Une ferme sans histoire réseau cohérente sous-performe quel que soit le nombre de GPU.