NVLink ou PCIe: qual deles o seu job precisa.
O link entre as placas importa enormemente para um tipo de carga de trabalho e nada para outros três. Saber qual dos dois é o seu caso vale várias centenas de dólares por mês.
A resposta curta
- Rodando um modelo por placa
- O link é irrelevante. Compre PCIe e gaste a diferença em mais placas.
- Dividindo um modelo entre placas
- O paralelismo de tensores sincroniza a cada camada. Vale a pena pagar por NVLink.
- Paralelismo de pipeline
- Uma transferência por micro-batch, não por camada. O PCIe normalmente é suficiente.
- Treinamento multi-nó
- Não oferecemos isso — o NVLink conecta placas dentro de um nó, nada conecta nós entre si.
A versão resumida
Se um modelo cabe em uma placa, pare de ler — nada disso se aplica a você, e a placa mais barata que comporta seu modelo é a compra certa. Este guia é sobre o que acontece quando ele não cabe e você precisa dividi-lo.
O que é cada link
| Link | Onde você consegue isso | Por placa, em cada direção | Topologia |
|---|---|---|---|
| NVLink 4 via NVSwitch | Placas SXM em uma placa HGX — nós de 4 e 8 GPUs | 900 GB/s | All-to-all. Cada placa conversa com todas as outras à taxa máxima, simultaneamente. |
| NVLink 5 via NVSwitch | Nós B200 SXM6 | 1.800 GB/s | All-to-all, o dobro da geração anterior. |
| PCIe Gen5 ×16 | Todas as placas PCIe | 64 GB/s | Através do root complex da CPU. Placas em sockets diferentes ficam mais distantes do que placas no mesmo socket. |
| PCIe Gen4 ×16 | Alguns chassis de 1 e 2 GPUs | 32 GB/s | Como acima, na metade da taxa. |
A proporção de destaque é de aproximadamente 14× entre NVLink 4 e PCIe Gen5. Esse número é real, mas não é o número que importa — o que importa é com que frequência o seu job atravessa o link.
Quando ele decide sua velocidade
Um caso, e é o caso em que as pessoas mais frequentemente se encontram sem ter planejado para ele.
Paralelismo de tensores
Cada camada é dividida entre as placas, então cada placa guarda uma fatia de cada matriz de pesos. Depois de cada camada, os resultados parciais precisam ser somados entre todas as placas — um all-reduce.
- Em um modelo de 70B, isso são 80 sincronizações por token
- Todas elas esperam pela placa mais lenta
- É aqui que os 14× do link viram segundos reais
Treinamento com batch grande
All-reduce do gradiente ao final de cada step, dimensionado pelo número de parâmetros, não pelo batch. Um modelo de 70B em BF16 movimenta 140 GB pelo link a cada step.
- Pelo PCIe Gen5, cerca de dois segundos de transferência pura
- Pelo NVLink, perto de um décimo disso
- Multiplicado por cada step de uma execução de vários dias
Quando não muda nada
Três cargas de trabalho comuns em que pagar por NVLink não traz nenhum ganho mensurável. Se o seu caso é um destes, placas PCIe dão mais VRAM por dólar.
Um modelo por placa. Quatro cópias independentes de um modelo de 24B em quatro placas nunca tocam no link. Quatro vezes o throughput, sem sincronização, sem modo de falha.
Paralelismo de pipeline. O modelo é dividido por grupos de camadas, então uma placa repassa para a próxima uma vez por micro-batch, em vez de uma vez por camada. As transferências são raras o suficiente para o PCIe acompanhar.
Difusão e renderização. Geração de imagem e vídeo, Blender, Octane: cada placa trabalha no seu próprio frame ou na sua própria imagem. Não há nada para fazer all-reduce.
--tensor-parallel-size 4 porque o nó tem quatro placas, fica mais lento do que o mesmo modelo em apenas uma delas. O custo de sincronização é real e o ganho é zero. Faça sharding só quando o modelo não couber.
O mesmo job, dos dois jeitos
Dois nós que alugamos, ambos com quatro placas de 80 GB — a mesma memória total, a mesma classe de placa, diferindo apenas no link entre elas. Os preços são os nossos, por mês.
| 4 × NVIDIA A100 PCIe | 4 × NVIDIA A100 SXM4 | |
|---|---|---|
| Link entre placas | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| VRAM total | 320 GB | 320 GB |
| Largura de banda de memória por placa | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B em BF16, dividido | ~18 tok/s | ~19 tok/s |
| Preço | $4,157/mês | $4,395/mês |
Nosso modelo de throughput é limitado pela largura de banda de memória e é deliberadamente conservador — ele não modela o all-reduce diretamente, então a diferença real em um job com paralelismo de tensores é maior do que a tabela sugere, não menor. Trate estes números como um piso para as duas máquinas, e o que importa é a ordem entre elas.
Medindo você mesmo
Faça isso no primeiro dia. Leva dois minutos e mostra se a máquina que você comprou tem a topologia pela qual você pagou.
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m
# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status
# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
nvcr.io/nvidia/pytorch:25.02-py3 \
all_reduce_perf -b 8 -e 4G -f 2 -g 4
Se topo -m mostrar SYS entre duas placas em um nó que você comprou para paralelismo de tensores, essas duas placas estão se comunicando através da CPU e entre sockets — o pior caso possível na máquina. Nos nossos nós SXM, todo par reporta NV18; qualquer outra coisa é uma falha, e é algo que queremos saber logo no primeiro dia.
O que comprar
- O modelo cabe em uma placa? Compre uma placa. Nada nesta página se aplica, e o prêmio pago pela interconexão é dinheiro jogado fora.
- Vários modelos independentes ou muitos jobs independentes? Compre placas PCIe, quantas precisar. Você ganha mais VRAM por dólar e nunca atravessa o link.
- Um modelo grande demais para uma única placa, servido com baixa concorrência? O PCIe funciona. Espere que o sharding custe, em vez de trazer ganho, e dimensione o nó pela memória, não pela velocidade.
- Um modelo grande demais para uma única placa, servindo tráfego real ou sendo treinado? É para este caso que o NVLink existe. Compre SXM.
- Um único job precisando de mais de oito placas? Isso exige uma fabric entre nós, que não vendemos. Preferimos te avisar aqui do que depois da fatura — veja o que não oferecemos.
O configurador mostra em qual desses casos você está: escolha um modelo e ele informa, para cada nó do catálogo, se ele cabe em uma única placa, precisa ser dividido, ou não cabe de jeito nenhum. A palavra "dividido" é o momento em que este guia começa a importar.
Veja quais nós comportam seu modelo em uma única placa.
O configurador responde isso para todas as 41 configurações, e mostra o preço de cada uma.
Outros guias
- Dimensionamento · 9 min
Escolhendo uma placa para modelos de imagem e vídeo
O que FLUX, SDXL, SD 3.5 e Wan 2.1 precisam em VRAM, qual placa do nosso catálogo comporta cada um, e por que a mais barata que cabe raramente é a certa para alugar.
Ler o guia - Dimensionamento · 10 min
Escolhendo um formato de quantização
O que AWQ, GPTQ, GGUF e FP8 custam em memória, velocidade e qualidade — e por que o formato com os menores pesos raramente dá o menor modelo.
Ler o guia - Dimensionamento · 10 min
Rodando um modelo de mistura de especialistas
Parâmetros totais decidem a máquina, parâmetros ativos decidem a velocidade. O que o DeepSeek V3 e o Qwen 3 235B precisam em VRAM, e qual nó alugar para eles.
Ler o guia