L’ensemble des 6 centres de données opérationnels

Payé en crypto · Sans vérification d’identité · Accès root en moins de 5 minutes

Dimensionnement guide · 7 min de lecture

NVLink ou PCIe : celui dont votre tâche a besoin.

La liaison entre les cartes compte énormément pour un type d’usage, et pas du tout pour trois autres. Savoir lequel vous exécutez vaut plusieurs centaines de dollars par mois.

En bref

Exécuter un modèle par carte
La liaison n’a pas d’importance. Achetez du PCIe et consacrez la différence à davantage de cartes.
Répartir un modèle sur plusieurs cartes
Le parallélisme tensoriel se synchronise à chaque couche. NVLink justifie son coût.
Parallélisme de pipeline
Un transfert par micro-lot, pas par couche. Le PCIe convient généralement.
Entraînement multi-nœud
Nous ne le proposons pas — NVLink relie des cartes à l’intérieur d’un nœud, rien ne relie les nœuds entre eux.

La version courte

Si un modèle tient sur une seule carte, arrêtez votre lecture — rien de tout cela ne vous concerne, et la carte la moins chère qui contient votre modèle est le bon achat. Ce guide traite de ce qui se passe quand il ne tient pas et qu’il faut le répartir.

Ce qu’est chaque liaison

Types d’interconnexion, bande passante et topologie
LiaisonOù l’obtenirPar carte, dans chaque sensTopologie
NVLink 4 via NVSwitchGénération Hopper Cartes SXM sur une carte HGX — nœuds à 4 et 8 GPUA100 SXM4, H100 SXM5, H200 900 GB/s Tout-à-tout. Chaque carte communique avec toutes les autres à débit maximal, simultanément.
NVLink 5 via NVSwitchGénération Blackwell Nœuds B200 SXM64 et 8 GPU 1 800 GB/s Tout-à-tout, deux fois la génération précédente.
PCIe Gen5 ×16Nœuds PCIe actuels Toutes les cartes PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe 64 GB/s Via le complexe racine du CPU. Les cartes sur des sockets différents sont plus éloignées que les cartes sur le même socket.
PCIe Gen4 ×16Plateformes plus anciennes Certains châssis à 1 ou 2 GPU 32 GB/s Comme ci-dessus, à la moitié du débit.

Le ratio affiché est d’environ 14× entre NVLink 4 et PCIe Gen5. Ce chiffre est réel, mais ce n’est pas lui qui compte — ce qui compte, c’est la fréquence à laquelle votre tâche traverse la liaison.

Quand cela détermine votre vitesse

Un cas, et c’est celui dans lequel on se retrouve le plus souvent sans l’avoir prévu.

Parallélisme tensoriel

Chaque couche est découpée entre les cartes, si bien que chaque carte détient une tranche de chaque matrice de poids. Après chaque couche, les résultats partiels doivent être additionnés sur toutes les cartes — un all-reduce.

  • Sur un modèle de 70B, cela représente 80 synchronisations par token
  • Chacune d’elles attend la carte la plus lente
  • C’est là que les 14× de la liaison se traduisent en secondes réelles

Entraînement à grands lots

All-reduce de gradients à la fin de chaque étape, dimensionné par le nombre de paramètres plutôt que par le lot. Un modèle de 70B en BF16 déplace 140 GB sur la liaison à chaque étape.

  • Sur PCIe Gen5, environ deux secondes de transfert pur
  • Sur NVLink, plus proche d’un dixième de cela
  • Multiplié par chaque étape d’une exécution de plusieurs jours

Quand cela ne change rien

Trois usages courants où payer pour NVLink n’apporte aucun gain mesurable. Si vous êtes dans l’un de ces cas, les cartes PCIe vous donnent plus de VRAM par dollar.

Un modèle par carte. Quatre copies indépendantes d’un modèle de 24B sur quatre cartes ne sollicitent jamais la liaison. Quatre fois le débit, aucune synchronisation, aucun mode de défaillance.

Parallélisme de pipeline. Le modèle est découpé par groupes de couches, si bien qu’une carte transmet la main à la suivante une fois par micro-batch plutôt qu’une fois par couche. Les transferts sont assez rares pour que PCIe suive.

Diffusion et rendu. Génération d’images et de vidéos, Blender, Octane : chaque carte travaille sur sa propre trame ou sa propre image. Il n’y a rien à all-reduce.

L’erreur la plus coûteuse consiste à payer pour un parallélisme tensoriel dont vous n’aviez pas besoin. Un modèle qui tient sur une seule carte 80 GB, servi avec --tensor-parallel-size 4 parce que le nœud compte quatre cartes, est plus lent que le même modèle sur une seule d’entre elles. Le coût de synchronisation est réel et le bénéfice est nul. Ne répartissez le modèle que lorsqu’il ne tient pas.

La même tâche, des deux façons

Deux nœuds que nous louons, tous deux avec quatre cartes de 80 GB — même mémoire totale, même classe de carte, ne différant que par la liaison qui les relie. Les prix sont les nôtres, par mois.

Un nœud SXM à quatre cartes comparé à un nœud PCIe à quatre cartes
4 × NVIDIA A100 PCIe4 × NVIDIA A100 SXM4
Liaison entre les cartesPCIe 5.0 ×16NVLink 3 · 600 GB/s
VRAM totale320 GB320 GB
Bande passante mémoire par carte1,935 GB/s2,039 GB/s
Llama 3.3 70B en BF16, répartiGénération à flux unique, notre estimation prudente ~18 tok/s~19 tok/s
Prix $4,157/mois $4,395/mois

Notre modèle de débit est limité par la bande passante mémoire et se veut délibérément prudent — il ne modélise pas directement l’all-reduce, si bien que l’écart réel sur une tâche à parallélisme tensoriel est plus large que ne le suggère le tableau, pas plus étroit. Considérez ces chiffres comme un plancher pour les deux machines, l’essentiel étant le classement.

La mesurer vous-même

Faites-le dès le premier jour. Cela prend deux minutes et vous indique si la machine qui vous a été vendue a la topologie que vous avez payée.

Topologie, puis bande passante réelle
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4

Si topo -m affiche SYS entre deux cartes sur un nœud acheté pour du parallélisme tensoriel, ces deux cartes communiquent via le CPU et à travers les sockets — le pire cas possible sur la machine. Sur nos nœuds SXM, chaque paire affiche NV18 ; tout autre résultat est une anomalie, et c’est une anomalie que nous voulons connaître dès le premier jour.

Ce qu’il faut acheter

  1. Le modèle tient sur une seule carte ? Achetez une carte. Rien sur cette page ne s’applique, et la prime payée pour l’interconnexion, c’est de l’argent brûlé.
  2. Plusieurs modèles indépendants ou de nombreuses tâches indépendantes ? Achetez des cartes PCIe, autant que nécessaire. Vous obtenez plus de VRAM par dollar et vous ne traversez jamais la liaison.
  3. Un modèle unique, trop volumineux pour une seule carte, servi à faible concurrence ? PCIe fonctionne. Attendez-vous à ce que la répartition vous coûte plutôt qu’elle ne vous rapporte, et dimensionnez le nœud pour la mémoire plutôt que pour la vitesse.
  4. Un modèle unique, trop volumineux pour une seule carte, servant du trafic réel ou en cours d’entraînement ? C’est exactement le cas pour lequel NVLink existe. Achetez du SXM.
  5. Une seule tâche nécessitant plus de huit cartes ? Cela exige un fabric entre les nœuds, que nous ne vendons pas. Nous préférons vous le dire ici plutôt qu’après la facture — voir ce que nous ne proposons pas.

Le configurateur vous indique dans quel cas vous êtes : choisissez un modèle, et il indique, pour chaque nœud du catalogue, s’il tient sur une seule carte, doit être réparti, ou ne tient pas du tout. Le mot « réparti » est le moment où ce guide commence à compter.

Découvrez quels nœuds contiennent votre modèle sur une seule carte.

Le configurateur répond à cette question pour les 41 configurations, et affiche le prix de chacune.

Se connecter

Console, factures et accès hors bande.

Pas encore de compte ?

Il n’y a pas d’inscription séparée. Votre compte est créé au moment où vous passez votre première commande — vous choisissez l’e-mail et le mot de passe à l’étape de paiement, et la console est ouverte au moment où la machine l’est.

Configurer un serveur

Language