Todos os 6 centros de dados operacionais

Pago em cripto · Sem verificação de identidade · Acesso root em em menos de 5 minutos

Dimensionamento guia · 7 min de leitura

NVLink ou PCIe: qual deles o seu job precisa.

O link entre as placas importa enormemente para um tipo de carga de trabalho e nada para outros três. Saber qual dos dois é o seu caso vale várias centenas de dólares por mês.

A resposta curta

Rodando um modelo por placa
O link é irrelevante. Compre PCIe e gaste a diferença em mais placas.
Dividindo um modelo entre placas
O paralelismo de tensores sincroniza a cada camada. Vale a pena pagar por NVLink.
Paralelismo de pipeline
Uma transferência por micro-batch, não por camada. O PCIe normalmente é suficiente.
Treinamento multi-nó
Não oferecemos isso — o NVLink conecta placas dentro de um nó, nada conecta nós entre si.

A versão resumida

Se um modelo cabe em uma placa, pare de ler — nada disso se aplica a você, e a placa mais barata que comporta seu modelo é a compra certa. Este guia é sobre o que acontece quando ele não cabe e você precisa dividi-lo.

O que é cada link

Tipos de interconexão, largura de banda e topologia
LinkOnde você consegue issoPor placa, em cada direçãoTopologia
NVLink 4 via NVSwitchGeração Hopper Placas SXM em uma placa HGX — nós de 4 e 8 GPUsA100 SXM4, H100 SXM5, H200 900 GB/s All-to-all. Cada placa conversa com todas as outras à taxa máxima, simultaneamente.
NVLink 5 via NVSwitchGeração Blackwell Nós B200 SXM6de 4 e 8 GPUs 1.800 GB/s All-to-all, o dobro da geração anterior.
PCIe Gen5 ×16Nós PCIe atuais Todas as placas PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe 64 GB/s Através do root complex da CPU. Placas em sockets diferentes ficam mais distantes do que placas no mesmo socket.
PCIe Gen4 ×16Plataformas mais antigas Alguns chassis de 1 e 2 GPUs 32 GB/s Como acima, na metade da taxa.

A proporção de destaque é de aproximadamente 14× entre NVLink 4 e PCIe Gen5. Esse número é real, mas não é o número que importa — o que importa é com que frequência o seu job atravessa o link.

Quando ele decide sua velocidade

Um caso, e é o caso em que as pessoas mais frequentemente se encontram sem ter planejado para ele.

Paralelismo de tensores

Cada camada é dividida entre as placas, então cada placa guarda uma fatia de cada matriz de pesos. Depois de cada camada, os resultados parciais precisam ser somados entre todas as placas — um all-reduce.

  • Em um modelo de 70B, isso são 80 sincronizações por token
  • Todas elas esperam pela placa mais lenta
  • É aqui que os 14× do link viram segundos reais

Treinamento com batch grande

All-reduce do gradiente ao final de cada step, dimensionado pelo número de parâmetros, não pelo batch. Um modelo de 70B em BF16 movimenta 140 GB pelo link a cada step.

  • Pelo PCIe Gen5, cerca de dois segundos de transferência pura
  • Pelo NVLink, perto de um décimo disso
  • Multiplicado por cada step de uma execução de vários dias

Quando não muda nada

Três cargas de trabalho comuns em que pagar por NVLink não traz nenhum ganho mensurável. Se o seu caso é um destes, placas PCIe dão mais VRAM por dólar.

Um modelo por placa. Quatro cópias independentes de um modelo de 24B em quatro placas nunca tocam no link. Quatro vezes o throughput, sem sincronização, sem modo de falha.

Paralelismo de pipeline. O modelo é dividido por grupos de camadas, então uma placa repassa para a próxima uma vez por micro-batch, em vez de uma vez por camada. As transferências são raras o suficiente para o PCIe acompanhar.

Difusão e renderização. Geração de imagem e vídeo, Blender, Octane: cada placa trabalha no seu próprio frame ou na sua própria imagem. Não há nada para fazer all-reduce.

O erro mais caro é comprar paralelismo de tensores que você não precisava. Um modelo que cabe em uma única placa de 80 GB, servido com --tensor-parallel-size 4 porque o nó tem quatro placas, fica mais lento do que o mesmo modelo em apenas uma delas. O custo de sincronização é real e o ganho é zero. Faça sharding só quando o modelo não couber.

O mesmo job, dos dois jeitos

Dois nós que alugamos, ambos com quatro placas de 80 GB — a mesma memória total, a mesma classe de placa, diferindo apenas no link entre elas. Os preços são os nossos, por mês.

Um nó SXM de quatro placas comparado com um nó PCIe de quatro placas
4 × NVIDIA A100 PCIe4 × NVIDIA A100 SXM4
Link entre placasPCIe 5.0 ×16NVLink 3 · 600 GB/s
VRAM total320 GB320 GB
Largura de banda de memória por placa1,935 GB/s2,039 GB/s
Llama 3.3 70B em BF16, divididoGeração de fluxo único, nossa estimativa conservadora ~18 tok/s~19 tok/s
Preço $4,157/mês $4,395/mês

Nosso modelo de throughput é limitado pela largura de banda de memória e é deliberadamente conservador — ele não modela o all-reduce diretamente, então a diferença real em um job com paralelismo de tensores é maior do que a tabela sugere, não menor. Trate estes números como um piso para as duas máquinas, e o que importa é a ordem entre elas.

Medindo você mesmo

Faça isso no primeiro dia. Leva dois minutos e mostra se a máquina que você comprou tem a topologia pela qual você pagou.

Topologia, depois a largura de banda real
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4

Se topo -m mostrar SYS entre duas placas em um nó que você comprou para paralelismo de tensores, essas duas placas estão se comunicando através da CPU e entre sockets — o pior caso possível na máquina. Nos nossos nós SXM, todo par reporta NV18; qualquer outra coisa é uma falha, e é algo que queremos saber logo no primeiro dia.

O que comprar

  1. O modelo cabe em uma placa? Compre uma placa. Nada nesta página se aplica, e o prêmio pago pela interconexão é dinheiro jogado fora.
  2. Vários modelos independentes ou muitos jobs independentes? Compre placas PCIe, quantas precisar. Você ganha mais VRAM por dólar e nunca atravessa o link.
  3. Um modelo grande demais para uma única placa, servido com baixa concorrência? O PCIe funciona. Espere que o sharding custe, em vez de trazer ganho, e dimensione o nó pela memória, não pela velocidade.
  4. Um modelo grande demais para uma única placa, servindo tráfego real ou sendo treinado? É para este caso que o NVLink existe. Compre SXM.
  5. Um único job precisando de mais de oito placas? Isso exige uma fabric entre nós, que não vendemos. Preferimos te avisar aqui do que depois da fatura — veja o que não oferecemos.

O configurador mostra em qual desses casos você está: escolha um modelo e ele informa, para cada nó do catálogo, se ele cabe em uma única placa, precisa ser dividido, ou não cabe de jeito nenhum. A palavra "dividido" é o momento em que este guia começa a importar.

Veja quais nós comportam seu modelo em uma única placa.

O configurador responde isso para todas as 41 configurações, e mostra o preço de cada uma.

Entrar

Console, faturas e acesso fora de banda.

Ainda não tem uma conta?

Não existe cadastro separado. Sua conta é criada enquanto você faz seu primeiro pedido — você escolhe o e-mail e a senha na etapa de pagamento, e o console já está aberto quando a máquina estiver pronta.

Configurar um servidor

Language