NVLink ou PCIe : celui dont votre tâche a besoin.
La liaison entre les cartes compte énormément pour un type d’usage, et pas du tout pour trois autres. Savoir lequel vous exécutez vaut plusieurs centaines de dollars par mois.
En bref
- Exécuter un modèle par carte
- La liaison n’a pas d’importance. Achetez du PCIe et consacrez la différence à davantage de cartes.
- Répartir un modèle sur plusieurs cartes
- Le parallélisme tensoriel se synchronise à chaque couche. NVLink justifie son coût.
- Parallélisme de pipeline
- Un transfert par micro-lot, pas par couche. Le PCIe convient généralement.
- Entraînement multi-nœud
- Nous ne le proposons pas — NVLink relie des cartes à l’intérieur d’un nœud, rien ne relie les nœuds entre eux.
La version courte
Si un modèle tient sur une seule carte, arrêtez votre lecture — rien de tout cela ne vous concerne, et la carte la moins chère qui contient votre modèle est le bon achat. Ce guide traite de ce qui se passe quand il ne tient pas et qu’il faut le répartir.
Ce qu’est chaque liaison
| Liaison | Où l’obtenir | Par carte, dans chaque sens | Topologie |
|---|---|---|---|
| NVLink 4 via NVSwitch | Cartes SXM sur une carte HGX — nœuds à 4 et 8 GPU | 900 GB/s | Tout-à-tout. Chaque carte communique avec toutes les autres à débit maximal, simultanément. |
| NVLink 5 via NVSwitch | Nœuds B200 SXM6 | 1 800 GB/s | Tout-à-tout, deux fois la génération précédente. |
| PCIe Gen5 ×16 | Toutes les cartes PCIe | 64 GB/s | Via le complexe racine du CPU. Les cartes sur des sockets différents sont plus éloignées que les cartes sur le même socket. |
| PCIe Gen4 ×16 | Certains châssis à 1 ou 2 GPU | 32 GB/s | Comme ci-dessus, à la moitié du débit. |
Le ratio affiché est d’environ 14× entre NVLink 4 et PCIe Gen5. Ce chiffre est réel, mais ce n’est pas lui qui compte — ce qui compte, c’est la fréquence à laquelle votre tâche traverse la liaison.
Quand cela détermine votre vitesse
Un cas, et c’est celui dans lequel on se retrouve le plus souvent sans l’avoir prévu.
Parallélisme tensoriel
Chaque couche est découpée entre les cartes, si bien que chaque carte détient une tranche de chaque matrice de poids. Après chaque couche, les résultats partiels doivent être additionnés sur toutes les cartes — un all-reduce.
- Sur un modèle de 70B, cela représente 80 synchronisations par token
- Chacune d’elles attend la carte la plus lente
- C’est là que les 14× de la liaison se traduisent en secondes réelles
Entraînement à grands lots
All-reduce de gradients à la fin de chaque étape, dimensionné par le nombre de paramètres plutôt que par le lot. Un modèle de 70B en BF16 déplace 140 GB sur la liaison à chaque étape.
- Sur PCIe Gen5, environ deux secondes de transfert pur
- Sur NVLink, plus proche d’un dixième de cela
- Multiplié par chaque étape d’une exécution de plusieurs jours
Quand cela ne change rien
Trois usages courants où payer pour NVLink n’apporte aucun gain mesurable. Si vous êtes dans l’un de ces cas, les cartes PCIe vous donnent plus de VRAM par dollar.
Un modèle par carte. Quatre copies indépendantes d’un modèle de 24B sur quatre cartes ne sollicitent jamais la liaison. Quatre fois le débit, aucune synchronisation, aucun mode de défaillance.
Parallélisme de pipeline. Le modèle est découpé par groupes de couches, si bien qu’une carte transmet la main à la suivante une fois par micro-batch plutôt qu’une fois par couche. Les transferts sont assez rares pour que PCIe suive.
Diffusion et rendu. Génération d’images et de vidéos, Blender, Octane : chaque carte travaille sur sa propre trame ou sa propre image. Il n’y a rien à all-reduce.
--tensor-parallel-size 4 parce que le nœud compte quatre cartes, est plus lent que le même modèle sur une seule d’entre elles. Le coût de synchronisation est réel et le bénéfice est nul. Ne répartissez le modèle que lorsqu’il ne tient pas.
La même tâche, des deux façons
Deux nœuds que nous louons, tous deux avec quatre cartes de 80 GB — même mémoire totale, même classe de carte, ne différant que par la liaison qui les relie. Les prix sont les nôtres, par mois.
| 4 × NVIDIA A100 PCIe | 4 × NVIDIA A100 SXM4 | |
|---|---|---|
| Liaison entre les cartes | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| VRAM totale | 320 GB | 320 GB |
| Bande passante mémoire par carte | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B en BF16, réparti | ~18 tok/s | ~19 tok/s |
| Prix | $4,157/mois | $4,395/mois |
Notre modèle de débit est limité par la bande passante mémoire et se veut délibérément prudent — il ne modélise pas directement l’all-reduce, si bien que l’écart réel sur une tâche à parallélisme tensoriel est plus large que ne le suggère le tableau, pas plus étroit. Considérez ces chiffres comme un plancher pour les deux machines, l’essentiel étant le classement.
La mesurer vous-même
Faites-le dès le premier jour. Cela prend deux minutes et vous indique si la machine qui vous a été vendue a la topologie que vous avez payée.
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m
# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status
# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
nvcr.io/nvidia/pytorch:25.02-py3 \
all_reduce_perf -b 8 -e 4G -f 2 -g 4
Si topo -m affiche SYS entre deux cartes sur un nœud acheté pour du parallélisme tensoriel, ces deux cartes communiquent via le CPU et à travers les sockets — le pire cas possible sur la machine. Sur nos nœuds SXM, chaque paire affiche NV18 ; tout autre résultat est une anomalie, et c’est une anomalie que nous voulons connaître dès le premier jour.
Ce qu’il faut acheter
- Le modèle tient sur une seule carte ? Achetez une carte. Rien sur cette page ne s’applique, et la prime payée pour l’interconnexion, c’est de l’argent brûlé.
- Plusieurs modèles indépendants ou de nombreuses tâches indépendantes ? Achetez des cartes PCIe, autant que nécessaire. Vous obtenez plus de VRAM par dollar et vous ne traversez jamais la liaison.
- Un modèle unique, trop volumineux pour une seule carte, servi à faible concurrence ? PCIe fonctionne. Attendez-vous à ce que la répartition vous coûte plutôt qu’elle ne vous rapporte, et dimensionnez le nœud pour la mémoire plutôt que pour la vitesse.
- Un modèle unique, trop volumineux pour une seule carte, servant du trafic réel ou en cours d’entraînement ? C’est exactement le cas pour lequel NVLink existe. Achetez du SXM.
- Une seule tâche nécessitant plus de huit cartes ? Cela exige un fabric entre les nœuds, que nous ne vendons pas. Nous préférons vous le dire ici plutôt qu’après la facture — voir ce que nous ne proposons pas.
Le configurateur vous indique dans quel cas vous êtes : choisissez un modèle, et il indique, pour chaque nœud du catalogue, s’il tient sur une seule carte, doit être réparti, ou ne tient pas du tout. Le mot « réparti » est le moment où ce guide commence à compter.
Découvrez quels nœuds contiennent votre modèle sur une seule carte.
Le configurateur répond à cette question pour les 41 configurations, et affiche le prix de chacune.
Autres guides
- Dimensionnement · 9 min
Choisir une carte pour les modèles d’image et de vidéo
Ce que FLUX, SDXL, SD 3.5 et Wan 2.1 demandent en VRAM, la carte du catalogue qui convient à chacun, et pourquoi la moins chère qui tient est rarement le bon choix.
Lire le guide - Dimensionnement · 10 min
Choisir un format de quantification
Ce que coûtent AWQ, GPTQ, GGUF et FP8 en mémoire, vitesse et qualité — et pourquoi le format aux poids les plus légers donne rarement le modèle le plus petit.
Lire le guide - Dimensionnement · 10 min
Faire tourner un modèle à mélange d’experts
Le nombre total de paramètres décide de la machine, les actifs de la vitesse. Ce qu’il faut en VRAM pour DeepSeek V3 et Qwen 3 235B, et quel nœud louer.
Lire le guide