Cluster GPU bare metal, NVLink, InfiniBand / RoCEv2
Une ferme GPU qui travaille pour vous, pas pour un compteur horaire
À charge soutenue, louer des GPU à l'heure coûte plus cher que de posséder le matériel. Nous concevons des clusters bare metal dimensionnés sur vos jobs réels, validés par benchmarks avant mise en production.
Cas d'usage
- Entraînement et fine-tuning de modèles internes sur vos données propriétaires
- Inférence haut débit à coût marginal maîtrisé
- Rendu 3D, simulation et calcul accéléré
- Charges continues où le cloud à l'heure devient un gouffre budgétaire
Architecture type
- Compute
- Nœuds bare metal multi-GPU avec NVLink intra-nœud, sans hyperviseur : 100 % de la puissance pour vos jobs.
- Fabric
- InfiniBand NDR 400G ou RoCEv2 tuné (PFC, ECN, MTU 9000, DCQCN) selon le budget et l'échelle, validé par ib_write_bw et tests NCCL.
- Provisionnement
- Drivers, CUDA, firmware et images automatisés (Ansible, Terraform), reproductibles à chaque extension de parc.
- Observabilité
- DCGM, Prometheus et Grafana : utilisation GPU, santé du fabric et alerting dès le premier jour.
Ce que vous recevez
- 01
Dossier d'architecture chiffré : topologie, BOM matériel, coûts sur 3 ans
- 02
Cluster déployé, durci et benchmarké (NCCL all-reduce, bande passante fabric)
- 03
Monitoring et alerting opérationnels
- 04
Runbook complet et formation de vos équipes
Questions fréquentes
- InfiniBand est-il obligatoire pour une ferme GPU ?
- Non. Sous 128 GPU, un fabric RoCEv2 correctement tuné offre des performances équivalentes pour la plupart des charges d'entraînement, avec un coût nettement inférieur. Nous chiffrons les deux options dans chaque audit.
- On-prem, colocation ou cloud dédié ?
- Les trois sont possibles. Le choix dépend de votre contrainte électrique, de la résidence des données et du délai de mise en service. L'audit compare les scénarios avec des chiffres, pas des préférences.