NVLink o PCIe: cuál necesita su trabajo.
El enlace entre las tarjetas importa muchísimo para un tipo de carga de trabajo y nada en absoluto para otros tres. Saber cuál está ejecutando vale varios cientos de dólares al mes.
La respuesta corta
- Ejecutar un modelo por tarjeta
- El enlace es irrelevante. Compre PCIe y gaste la diferencia en más tarjetas.
- Repartir un modelo entre varias tarjetas
- El paralelismo de tensores sincroniza en cada capa. Merece la pena pagar por NVLink.
- Paralelismo de canalización
- Una transferencia por micro-lote, no por capa. PCIe suele bastar.
- Entrenamiento multinodo
- No lo ofrecemos — NVLink une tarjetas dentro de un nodo, nada une nodos entre sí.
La versión corta
Si un modelo cabe en una tarjeta, deje de leer — nada de esto le concierne, y la tarjeta más barata que aloje su modelo es la compra correcta. Esta guía trata de lo que ocurre cuando no cabe y hay que repartirlo.
Qué es cada enlace
| Enlace | Dónde lo consigue | Por tarjeta, en cada sentido | Topología |
|---|---|---|---|
| NVLink 4 a través de NVSwitch | Tarjetas SXM en una placa HGX — nodos de 4 y 8 GPU | 900 GB/s | Todos con todos. Cada tarjeta habla con todas las demás a la velocidad máxima, de forma simultánea. |
| NVLink 5 a través de NVSwitch | Nodos B200 SXM6 | 1.800 GB/s | Todos con todos, el doble que la generación anterior. |
| PCIe Gen5 ×16 | Todas las tarjetas PCIe | 64 GB/s | A través del complejo raíz de la CPU. Las tarjetas en sockets distintos están más alejadas entre sí que las que comparten socket. |
| PCIe Gen4 ×16 | Algunos chasis de 1 y 2 GPU | 32 GB/s | Como arriba, a la mitad de la velocidad. |
La proporción destacada es de aproximadamente 14× entre NVLink 4 y PCIe Gen5. Ese número es real, pero no es el que importa — lo que importa es con qué frecuencia su trabajo cruza el enlace.
Cuándo decide su velocidad
Un caso, y es el caso en el que la gente se encuentra más a menudo sin haberlo planeado.
Paralelismo de tensores
Cada capa se reparte entre las tarjetas, de modo que cada tarjeta tiene una porción de cada matriz de pesos. Después de cada capa, los resultados parciales deben sumarse entre todas las tarjetas: un all-reduce.
- En un modelo de 70B, son 80 sincronizaciones por token
- Todas ellas esperan a la tarjeta más lenta
- Aquí es donde el 14× del enlace se convierte en segundos reales
Entrenamiento con lotes grandes
All-reduce del gradiente al final de cada paso, cuyo tamaño depende del número de parámetros y no del lote. Un modelo de 70B en BF16 mueve 140 GB por el enlace en cada paso.
- Por PCIe Gen5, unos dos segundos de transferencia pura
- Por NVLink, cerca de una décima parte de eso
- Multiplicado por cada paso de una ejecución de varios días
Cuándo no cambia nada
Tres cargas de trabajo habituales en las que pagar por NVLink no le compra nada medible. Si está en uno de estos casos, las tarjetas PCIe le dan más VRAM por dólar.
Un modelo por tarjeta. Cuatro copias independientes de un modelo de 24B en cuatro tarjetas nunca tocan el enlace. Cuatro veces el rendimiento, sin sincronización, sin modo de fallo.
Paralelismo de canalización. El modelo se divide por grupos de capas, de modo que una tarjeta se lo pasa a la siguiente una vez por micro-lote en lugar de una vez por capa. Las transferencias son lo bastante escasas para que PCIe dé abasto.
Difusión y renderizado. Generación de imagen y vídeo, Blender, Octane: cada tarjeta trabaja en su propio fotograma o su propia imagen. No hay nada que sincronizar mediante all-reduce.
--tensor-parallel-size 4 porque el nodo tiene cuatro tarjetas, es más lento que el mismo modelo en una sola. El coste de sincronización es real y el beneficio es cero. Reparta el modelo solo cuando no quepa.
El mismo trabajo, de las dos formas
Dos nodos que alquilamos, ambos con cuatro tarjetas de 80 GB — la misma memoria total, la misma clase de tarjeta, y solo difieren en el enlace entre ellas. Los precios son los nuestros, al mes.
| 4 × NVIDIA A100 PCIe | 4 × NVIDIA A100 SXM4 | |
|---|---|---|
| Enlace entre tarjetas | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| VRAM total | 320 GB | 320 GB |
| Ancho de banda de memoria por tarjeta | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B en BF16, repartido | ~18 tok/s | ~19 tok/s |
| Precio | $4,157/mes | $4,395/mes |
Nuestro modelo de rendimiento está limitado por el ancho de banda de memoria y es deliberadamente conservador — no modela el all-reduce directamente, así que la diferencia real en un trabajo con paralelismo de tensores es mayor de lo que sugiere la tabla, no menor. Tome estas cifras como un suelo para ambas máquinas, y el orden entre ellas como lo importante.
Medirlo usted mismo
Hágalo el primer día. Lleva dos minutos y le dice si la máquina que le vendieron tiene la topología que pagó.
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m
# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status
# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
nvcr.io/nvidia/pytorch:25.02-py3 \
all_reduce_perf -b 8 -e 4G -f 2 -g 4
Si topo -m muestra SYS entre dos tarjetas de un nodo que compró para paralelismo de tensores, esas dos tarjetas se están comunicando a través de la CPU y entre sockets distintos — el peor caso posible en la máquina. En nuestros nodos SXM, cada par muestra NV18; cualquier otra cosa es un fallo, y es de los que queremos que nos reporte el primer día.
Qué comprar
- ¿El modelo cabe en una tarjeta? Compre una tarjeta. Nada de esta página se aplica, y el sobrecoste de interconexión es dinero tirado a la hoguera.
- ¿Varios modelos independientes o muchos trabajos independientes? Compre tarjetas PCIe, tantas como necesite. Obtiene más VRAM por dólar y nunca cruza el enlace.
- ¿Un modelo demasiado grande para una sola tarjeta, servido con poca concurrencia? PCIe funciona. Espere que el sharding le cueste en vez de beneficiarle, y dimensione el nodo por memoria más que por velocidad.
- ¿Un modelo demasiado grande para una sola tarjeta, sirviendo tráfico real o en entrenamiento? Es el caso para el que existe NVLink. Compre SXM.
- ¿Un solo trabajo que necesita más de ocho tarjetas? Eso exige una malla entre nodos, que no vendemos. Preferimos decírselo aquí antes que después de la factura — vea lo que no ofrecemos.
El configurador le dice en cuál de estos casos está: elija un modelo y le indica, para cada nodo del catálogo, si cabe en una sola tarjeta, hay que repartirlo o no cabe en absoluto. La palabra «repartir» es el momento en que esta guía empieza a importar.
Vea qué nodos alojan su modelo en una sola tarjeta.
El configurador responde a eso para las 41 configuraciones, y le muestra el precio de cada una.
Otras guías
- Dimensionamiento · 9 min
Elegir una tarjeta para modelos de imagen y vídeo
Cuánta VRAM necesitan FLUX, SDXL, SD 3.5 y Wan 2.1, qué tarjeta de nuestro catálogo aloja cada uno, y por qué la más barata que cabe rara vez es la más indicada.
Leer la guía - Dimensionamiento · 10 min
Elegir un formato de cuantización
Lo que cuestan AWQ, GPTQ, GGUF y FP8 en memoria, velocidad y calidad — y por qué el formato con los pesos más pequeños rara vez da el modelo más pequeño.
Leer la guía - Dimensionamiento · 10 min
Ejecutar un modelo de mezcla de expertos
Los parámetros totales deciden la máquina; los activos, la velocidad. Cuánta VRAM necesitan DeepSeek V3 y Qwen 3 235B, y qué nodo alquilar para ellos.
Leer la guía