Dimensionamento guia · 7 min de leitura

# NVLink ou PCIe: qual deles o seu job precisa.

O link entre as placas importa enormemente para um tipo de carga de trabalho e nada para outros três. Saber qual dos dois é o seu caso vale várias centenas de dólares por mês.

A resposta curta

- **Rodando um modelo por placa:** O link é irrelevante. Compre PCIe e gaste a diferença em mais placas.
- **Dividindo um modelo entre placas:** O paralelismo de tensores sincroniza **a cada camada**. Vale a pena pagar por NVLink.
- **Paralelismo de pipeline:** Uma transferência por micro-batch, não por camada. O PCIe normalmente é suficiente.
- **Treinamento multi-nó:** Não oferecemos isso — o NVLink conecta placas *dentro* de um nó, nada conecta nós entre si.

## A versão resumida

Se um modelo cabe em uma placa, pare de ler — nada disso se aplica a você, e a placa mais barata que comporta seu modelo é a compra certa. Este guia é sobre o que acontece quando ele não cabe e você precisa dividi-lo.

## O que é cada link

**Tipos de interconexão, largura de banda e topologia**

| Link | Onde você consegue isso | Por placa, em cada direção | Topologia |
|---|---|---|---|
| NVLink 4 via NVSwitch Geração Hopper | Placas SXM em uma placa HGX — nós de 4 e 8 GPUsA100 SXM4, H100 SXM5, H200 | 900 GB/s | All-to-all. Cada placa conversa com todas as outras à taxa máxima, simultaneamente. |
| NVLink 5 via NVSwitch Geração Blackwell | Nós B200 SXM6de 4 e 8 GPUs | 1.800 GB/s | All-to-all, o dobro da geração anterior. |
| PCIe Gen5 ×16 Nós PCIe atuais | Todas as placas PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe | 64 GB/s | Através do root complex da CPU. Placas em sockets diferentes ficam mais distantes do que placas no mesmo socket. |
| PCIe Gen4 ×16 Plataformas mais antigas | Alguns chassis de 1 e 2 GPUs | 32 GB/s | Como acima, na metade da taxa. |

A proporção de destaque é de aproximadamente **14×** entre NVLink 4 e PCIe Gen5. Esse número é real, mas não é o número que importa — o que importa é com que frequência o seu job atravessa o link.

## Quando ele decide sua velocidade

Um caso, e é o caso em que as pessoas mais frequentemente se encontram sem ter planejado para ele.

### Paralelismo de tensores

Cada camada é dividida entre as placas, então cada placa guarda uma fatia de cada matriz de pesos. Depois de cada camada, os resultados parciais precisam ser somados entre todas as placas — um all-reduce.

- Em um modelo de 70B, isso são 80 sincronizações por token
- Todas elas esperam pela placa mais lenta
- É aqui que os 14× do link viram segundos reais

### Treinamento com batch grande

All-reduce do gradiente ao final de cada step, dimensionado pelo número de parâmetros, não pelo batch. Um modelo de 70B em BF16 movimenta 140 GB pelo link a cada step.

- Pelo PCIe Gen5, cerca de dois segundos de transferência pura
- Pelo NVLink, perto de um décimo disso
- Multiplicado por cada step de uma execução de vários dias

## Quando não muda nada

Três cargas de trabalho comuns em que pagar por NVLink não traz nenhum ganho mensurável. Se o seu caso é um destes, placas PCIe dão mais VRAM por dólar.

**Um modelo por placa.** Quatro cópias independentes de um modelo de 24B em quatro placas nunca tocam no link. Quatro vezes o throughput, sem sincronização, sem modo de falha.

**Paralelismo de pipeline.** O modelo é dividido por *grupos* de camadas, então uma placa repassa para a próxima uma vez por micro-batch, em vez de uma vez por camada. As transferências são raras o suficiente para o PCIe acompanhar.

**Difusão e renderização.** Geração de imagem e vídeo, Blender, Octane: cada placa trabalha no seu próprio frame ou na sua própria imagem. Não há nada para fazer all-reduce.

**O erro mais caro é comprar paralelismo de tensores que você não precisava.** Um modelo que cabe em uma única placa de 80 GB, servido com `--tensor-parallel-size 4` porque o nó tem quatro placas, fica *mais lento* do que o mesmo modelo em apenas uma delas. O custo de sincronização é real e o ganho é zero. Faça sharding só quando o modelo não couber.

## O mesmo job, dos dois jeitos

Dois nós que alugamos, ambos com quatro placas de 80 GB — a mesma memória total, a mesma classe de placa, diferindo apenas no link entre elas. Os preços são os nossos, por mês.

**Um nó SXM de quatro placas comparado com um nó PCIe de quatro placas**

|  | [4 × NVIDIA A100 PCIe](https://gpuserver.io/pt/gpu/a100-80gb) | [4 × NVIDIA A100 SXM4](https://gpuserver.io/pt/gpu/a100-sxm4) |
|---|---|---|
| Link entre placas | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| VRAM total | 320 GB | 320 GB |
| Largura de banda de memória por placa | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B em BF16, dividido Geração de fluxo único, nossa estimativa conservadora | ~18 tok/s | ~19 tok/s |
| Preço | $4,157/mês | $4,395/mês |

Nosso modelo de throughput é limitado pela largura de banda de memória e é deliberadamente conservador — ele não modela o all-reduce diretamente, então a diferença real em um job com paralelismo de tensores é *maior* do que a tabela sugere, não menor. Trate estes números como um piso para as duas máquinas, e o que importa é a ordem entre elas.

## Medindo você mesmo

Faça isso no primeiro dia. Leva dois minutos e mostra se a máquina que você comprou tem a topologia pela qual você pagou.

Topologia, depois a largura de banda real

```
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4
```

Se `topo -m` mostrar `SYS` entre duas placas em um nó que você comprou para paralelismo de tensores, essas duas placas estão se comunicando através da CPU e entre sockets — o pior caso possível na máquina. Nos nossos nós SXM, todo par reporta `NV18`; qualquer outra coisa é uma falha, e é algo que queremos saber logo no primeiro dia.

## O que comprar

1. **O modelo cabe em uma placa?** Compre uma placa. Nada nesta página se aplica, e o prêmio pago pela interconexão é dinheiro jogado fora.
2. **Vários modelos independentes ou muitos jobs independentes?** Compre placas PCIe, quantas precisar. Você ganha mais VRAM por dólar e nunca atravessa o link.
3. **Um modelo grande demais para uma única placa, servido com baixa concorrência?** O PCIe funciona. Espere que o sharding custe, em vez de trazer ganho, e dimensione o nó pela memória, não pela velocidade.
4. **Um modelo grande demais para uma única placa, servindo tráfego real ou sendo treinado?** É para este caso que o NVLink existe. Compre SXM.
5. **Um único job precisando de mais de oito placas?** Isso exige uma fabric entre nós, que não vendemos. Preferimos te avisar aqui do que depois da fatura — veja [o que não oferecemos](https://gpuserver.io/pt/network#limits).

O [configurador](https://gpuserver.io/pt/configure) mostra em qual desses casos você está: escolha um modelo e ele informa, para cada nó do catálogo, se ele cabe em uma única placa, precisa ser dividido, ou não cabe de jeito nenhum. A palavra "dividido" é o momento em que este guia começa a importar.

## Veja quais nós comportam seu modelo em uma única placa.

O configurador responde isso para todas as 41 configurações, e mostra o preço de cada uma.

[Abrir o configurador](https://gpuserver.io/pt/configure) [Ler os guias](https://gpuserver.io/pt/guides)

## Outros guias

- [Dimensionamento · 9 min Escolhendo uma placa para modelos de imagem e vídeo O que FLUX, SDXL, SD 3.5 e Wan 2.1 precisam em VRAM, qual placa do nosso catálogo comporta cada um, e por que a mais barata que cabe raramente é a certa para alugar. Ler o guia](https://gpuserver.io/pt/guides/gpu-for-flux-sdxl)
- [Dimensionamento · 10 min Escolhendo um formato de quantização O que AWQ, GPTQ, GGUF e FP8 custam em memória, velocidade e qualidade — e por que o formato com os menores pesos raramente dá o menor modelo. Ler o guia](https://gpuserver.io/pt/guides/awq-vs-gptq-vs-fp8)
- [Dimensionamento · 10 min Rodando um modelo de mistura de especialistas Parâmetros totais decidem a máquina, parâmetros ativos decidem a velocidade. O que o DeepSeek V3 e o Qwen 3 235B precisam em VRAM, e qual nó alugar para eles. Ler o guia](https://gpuserver.io/pt/guides/mixture-of-experts)

---

Fonte: https://gpuserver.io/pt/guides/nvlink-vs-pcie/. Este arquivo é gerado a partir dos mesmos dados que o site; se um número aqui divergir de uma página, a página prevalece e este arquivo está desatualizado — a fonte canônica é https://gpuserver.io/.
