Todos los 6 centros de datos operativos

Pagado en cripto · Sin verificación de identidad · Acceso root en en menos de 5 minutos

Guía de Dimensionamiento · 7 min de lectura

NVLink o PCIe: cuál necesita su trabajo.

El enlace entre las tarjetas importa muchísimo para un tipo de carga de trabajo y nada en absoluto para otros tres. Saber cuál está ejecutando vale varios cientos de dólares al mes.

La respuesta corta

Ejecutar un modelo por tarjeta
El enlace es irrelevante. Compre PCIe y gaste la diferencia en más tarjetas.
Repartir un modelo entre varias tarjetas
El paralelismo de tensores sincroniza en cada capa. Merece la pena pagar por NVLink.
Paralelismo de canalización
Una transferencia por micro-lote, no por capa. PCIe suele bastar.
Entrenamiento multinodo
No lo ofrecemos — NVLink une tarjetas dentro de un nodo, nada une nodos entre sí.

La versión corta

Si un modelo cabe en una tarjeta, deje de leer — nada de esto le concierne, y la tarjeta más barata que aloje su modelo es la compra correcta. Esta guía trata de lo que ocurre cuando no cabe y hay que repartirlo.

Qué es cada enlace

Tipos de interconexión, ancho de banda y topología
EnlaceDónde lo consiguePor tarjeta, en cada sentidoTopología
NVLink 4 a través de NVSwitchGeneración Hopper Tarjetas SXM en una placa HGX — nodos de 4 y 8 GPUA100 SXM4, H100 SXM5, H200 900 GB/s Todos con todos. Cada tarjeta habla con todas las demás a la velocidad máxima, de forma simultánea.
NVLink 5 a través de NVSwitchGeneración Blackwell Nodos B200 SXM64 y 8 GPU 1.800 GB/s Todos con todos, el doble que la generación anterior.
PCIe Gen5 ×16Nodos PCIe actuales Todas las tarjetas PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe 64 GB/s A través del complejo raíz de la CPU. Las tarjetas en sockets distintos están más alejadas entre sí que las que comparten socket.
PCIe Gen4 ×16Plataformas más antiguas Algunos chasis de 1 y 2 GPU 32 GB/s Como arriba, a la mitad de la velocidad.

La proporción destacada es de aproximadamente 14× entre NVLink 4 y PCIe Gen5. Ese número es real, pero no es el que importa — lo que importa es con qué frecuencia su trabajo cruza el enlace.

Cuándo decide su velocidad

Un caso, y es el caso en el que la gente se encuentra más a menudo sin haberlo planeado.

Paralelismo de tensores

Cada capa se reparte entre las tarjetas, de modo que cada tarjeta tiene una porción de cada matriz de pesos. Después de cada capa, los resultados parciales deben sumarse entre todas las tarjetas: un all-reduce.

  • En un modelo de 70B, son 80 sincronizaciones por token
  • Todas ellas esperan a la tarjeta más lenta
  • Aquí es donde el 14× del enlace se convierte en segundos reales

Entrenamiento con lotes grandes

All-reduce del gradiente al final de cada paso, cuyo tamaño depende del número de parámetros y no del lote. Un modelo de 70B en BF16 mueve 140 GB por el enlace en cada paso.

  • Por PCIe Gen5, unos dos segundos de transferencia pura
  • Por NVLink, cerca de una décima parte de eso
  • Multiplicado por cada paso de una ejecución de varios días

Cuándo no cambia nada

Tres cargas de trabajo habituales en las que pagar por NVLink no le compra nada medible. Si está en uno de estos casos, las tarjetas PCIe le dan más VRAM por dólar.

Un modelo por tarjeta. Cuatro copias independientes de un modelo de 24B en cuatro tarjetas nunca tocan el enlace. Cuatro veces el rendimiento, sin sincronización, sin modo de fallo.

Paralelismo de canalización. El modelo se divide por grupos de capas, de modo que una tarjeta se lo pasa a la siguiente una vez por micro-lote en lugar de una vez por capa. Las transferencias son lo bastante escasas para que PCIe dé abasto.

Difusión y renderizado. Generación de imagen y vídeo, Blender, Octane: cada tarjeta trabaja en su propio fotograma o su propia imagen. No hay nada que sincronizar mediante all-reduce.

El error más caro es comprar paralelismo de tensores que no necesitaba. Un modelo que cabe en una sola tarjeta de 80 GB, servido con --tensor-parallel-size 4 porque el nodo tiene cuatro tarjetas, es más lento que el mismo modelo en una sola. El coste de sincronización es real y el beneficio es cero. Reparta el modelo solo cuando no quepa.

El mismo trabajo, de las dos formas

Dos nodos que alquilamos, ambos con cuatro tarjetas de 80 GB — la misma memoria total, la misma clase de tarjeta, y solo difieren en el enlace entre ellas. Los precios son los nuestros, al mes.

Un nodo SXM de cuatro tarjetas frente a un nodo PCIe de cuatro tarjetas
4 × NVIDIA A100 PCIe4 × NVIDIA A100 SXM4
Enlace entre tarjetasPCIe 5.0 ×16NVLink 3 · 600 GB/s
VRAM total320 GB320 GB
Ancho de banda de memoria por tarjeta1,935 GB/s2,039 GB/s
Llama 3.3 70B en BF16, repartidoGeneración de flujo único, nuestra estimación conservadora ~18 tok/s~19 tok/s
Precio $4,157/mes $4,395/mes

Nuestro modelo de rendimiento está limitado por el ancho de banda de memoria y es deliberadamente conservador — no modela el all-reduce directamente, así que la diferencia real en un trabajo con paralelismo de tensores es mayor de lo que sugiere la tabla, no menor. Tome estas cifras como un suelo para ambas máquinas, y el orden entre ellas como lo importante.

Medirlo usted mismo

Hágalo el primer día. Lleva dos minutos y le dice si la máquina que le vendieron tiene la topología que pagó.

Topología, y luego ancho de banda real
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4

Si topo -m muestra SYS entre dos tarjetas de un nodo que compró para paralelismo de tensores, esas dos tarjetas se están comunicando a través de la CPU y entre sockets distintos — el peor caso posible en la máquina. En nuestros nodos SXM, cada par muestra NV18; cualquier otra cosa es un fallo, y es de los que queremos que nos reporte el primer día.

Qué comprar

  1. ¿El modelo cabe en una tarjeta? Compre una tarjeta. Nada de esta página se aplica, y el sobrecoste de interconexión es dinero tirado a la hoguera.
  2. ¿Varios modelos independientes o muchos trabajos independientes? Compre tarjetas PCIe, tantas como necesite. Obtiene más VRAM por dólar y nunca cruza el enlace.
  3. ¿Un modelo demasiado grande para una sola tarjeta, servido con poca concurrencia? PCIe funciona. Espere que el sharding le cueste en vez de beneficiarle, y dimensione el nodo por memoria más que por velocidad.
  4. ¿Un modelo demasiado grande para una sola tarjeta, sirviendo tráfico real o en entrenamiento? Es el caso para el que existe NVLink. Compre SXM.
  5. ¿Un solo trabajo que necesita más de ocho tarjetas? Eso exige una malla entre nodos, que no vendemos. Preferimos decírselo aquí antes que después de la factura — vea lo que no ofrecemos.

El configurador le dice en cuál de estos casos está: elija un modelo y le indica, para cada nodo del catálogo, si cabe en una sola tarjeta, hay que repartirlo o no cabe en absoluto. La palabra «repartir» es el momento en que esta guía empieza a importar.

Vea qué nodos alojan su modelo en una sola tarjeta.

El configurador responde a eso para las 41 configuraciones, y le muestra el precio de cada una.

Iniciar sesión

Consola, facturas y acceso fuera de banda.

¿Aún no tiene cuenta?

No hay un registro aparte. Su cuenta se crea mientras realiza su primer pedido — elige el correo electrónico y la contraseña en el paso de pago, y la consola está abierta para cuando lo está la máquina.

Configurar un servidor

Language