Guía de Dimensionamiento · 7 min de lectura

# NVLink o PCIe: cuál necesita su trabajo.

El enlace entre las tarjetas importa muchísimo para un tipo de carga de trabajo y nada en absoluto para otros tres. Saber cuál está ejecutando vale varios cientos de dólares al mes.

La respuesta corta

- **Ejecutar un modelo por tarjeta:** El enlace es irrelevante. Compre PCIe y gaste la diferencia en más tarjetas.
- **Repartir un modelo entre varias tarjetas:** El paralelismo de tensores sincroniza en **cada capa**. Merece la pena pagar por NVLink.
- **Paralelismo de canalización:** Una transferencia por micro-lote, no por capa. PCIe suele bastar.
- **Entrenamiento multinodo:** No lo ofrecemos — NVLink une tarjetas *dentro* de un nodo, nada une nodos entre sí.

## La versión corta

Si un modelo cabe en una tarjeta, deje de leer — nada de esto le concierne, y la tarjeta más barata que aloje su modelo es la compra correcta. Esta guía trata de lo que ocurre cuando no cabe y hay que repartirlo.

## Qué es cada enlace

**Tipos de interconexión, ancho de banda y topología**

| Enlace | Dónde lo consigue | Por tarjeta, en cada sentido | Topología |
|---|---|---|---|
| NVLink 4 a través de NVSwitch Generación Hopper | Tarjetas SXM en una placa HGX — nodos de 4 y 8 GPUA100 SXM4, H100 SXM5, H200 | 900 GB/s | Todos con todos. Cada tarjeta habla con todas las demás a la velocidad máxima, de forma simultánea. |
| NVLink 5 a través de NVSwitch Generación Blackwell | Nodos B200 SXM64 y 8 GPU | 1.800 GB/s | Todos con todos, el doble que la generación anterior. |
| PCIe Gen5 ×16 Nodos PCIe actuales | Todas las tarjetas PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe | 64 GB/s | A través del complejo raíz de la CPU. Las tarjetas en sockets distintos están más alejadas entre sí que las que comparten socket. |
| PCIe Gen4 ×16 Plataformas más antiguas | Algunos chasis de 1 y 2 GPU | 32 GB/s | Como arriba, a la mitad de la velocidad. |

La proporción destacada es de aproximadamente **14×** entre NVLink 4 y PCIe Gen5. Ese número es real, pero no es el que importa — lo que importa es con qué frecuencia su trabajo cruza el enlace.

## Cuándo decide su velocidad

Un caso, y es el caso en el que la gente se encuentra más a menudo sin haberlo planeado.

### Paralelismo de tensores

Cada capa se reparte entre las tarjetas, de modo que cada tarjeta tiene una porción de cada matriz de pesos. Después de cada capa, los resultados parciales deben sumarse entre todas las tarjetas: un all-reduce.

- En un modelo de 70B, son 80 sincronizaciones por token
- Todas ellas esperan a la tarjeta más lenta
- Aquí es donde el 14× del enlace se convierte en segundos reales

### Entrenamiento con lotes grandes

All-reduce del gradiente al final de cada paso, cuyo tamaño depende del número de parámetros y no del lote. Un modelo de 70B en BF16 mueve 140 GB por el enlace en cada paso.

- Por PCIe Gen5, unos dos segundos de transferencia pura
- Por NVLink, cerca de una décima parte de eso
- Multiplicado por cada paso de una ejecución de varios días

## Cuándo no cambia nada

Tres cargas de trabajo habituales en las que pagar por NVLink no le compra nada medible. Si está en uno de estos casos, las tarjetas PCIe le dan más VRAM por dólar.

**Un modelo por tarjeta.** Cuatro copias independientes de un modelo de 24B en cuatro tarjetas nunca tocan el enlace. Cuatro veces el rendimiento, sin sincronización, sin modo de fallo.

**Paralelismo de canalización.** El modelo se divide por *grupos* de capas, de modo que una tarjeta se lo pasa a la siguiente una vez por micro-lote en lugar de una vez por capa. Las transferencias son lo bastante escasas para que PCIe dé abasto.

**Difusión y renderizado.** Generación de imagen y vídeo, Blender, Octane: cada tarjeta trabaja en su propio fotograma o su propia imagen. No hay nada que sincronizar mediante all-reduce.

**El error más caro es comprar paralelismo de tensores que no necesitaba.** Un modelo que cabe en una sola tarjeta de 80 GB, servido con `--tensor-parallel-size 4` porque el nodo tiene cuatro tarjetas, es *más lento* que el mismo modelo en una sola. El coste de sincronización es real y el beneficio es cero. Reparta el modelo solo cuando no quepa.

## El mismo trabajo, de las dos formas

Dos nodos que alquilamos, ambos con cuatro tarjetas de 80 GB — la misma memoria total, la misma clase de tarjeta, y solo difieren en el enlace entre ellas. Los precios son los nuestros, al mes.

**Un nodo SXM de cuatro tarjetas frente a un nodo PCIe de cuatro tarjetas**

|  | [4 × NVIDIA A100 PCIe](https://gpuserver.io/es/gpu/a100-80gb) | [4 × NVIDIA A100 SXM4](https://gpuserver.io/es/gpu/a100-sxm4) |
|---|---|---|
| Enlace entre tarjetas | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| VRAM total | 320 GB | 320 GB |
| Ancho de banda de memoria por tarjeta | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B en BF16, repartido Generación de flujo único, nuestra estimación conservadora | ~18 tok/s | ~19 tok/s |
| Precio | $4,157/mes | $4,395/mes |

Nuestro modelo de rendimiento está limitado por el ancho de banda de memoria y es deliberadamente conservador — no modela el all-reduce directamente, así que la diferencia real en un trabajo con paralelismo de tensores es *mayor* de lo que sugiere la tabla, no menor. Tome estas cifras como un suelo para ambas máquinas, y el orden entre ellas como lo importante.

## Medirlo usted mismo

Hágalo el primer día. Lleva dos minutos y le dice si la máquina que le vendieron tiene la topología que pagó.

Topología, y luego ancho de banda real

```
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4
```

Si `topo -m` muestra `SYS` entre dos tarjetas de un nodo que compró para paralelismo de tensores, esas dos tarjetas se están comunicando a través de la CPU y entre sockets distintos — el peor caso posible en la máquina. En nuestros nodos SXM, cada par muestra `NV18`; cualquier otra cosa es un fallo, y es de los que queremos que nos reporte el primer día.

## Qué comprar

1. **¿El modelo cabe en una tarjeta?** Compre una tarjeta. Nada de esta página se aplica, y el sobrecoste de interconexión es dinero tirado a la hoguera.
2. **¿Varios modelos independientes o muchos trabajos independientes?** Compre tarjetas PCIe, tantas como necesite. Obtiene más VRAM por dólar y nunca cruza el enlace.
3. **¿Un modelo demasiado grande para una sola tarjeta, servido con poca concurrencia?** PCIe funciona. Espere que el sharding le cueste en vez de beneficiarle, y dimensione el nodo por memoria más que por velocidad.
4. **¿Un modelo demasiado grande para una sola tarjeta, sirviendo tráfico real o en entrenamiento?** Es el caso para el que existe NVLink. Compre SXM.
5. **¿Un solo trabajo que necesita más de ocho tarjetas?** Eso exige una malla entre nodos, que no vendemos. Preferimos decírselo aquí antes que después de la factura — vea [lo que no ofrecemos](https://gpuserver.io/es/network#limits).

El [configurador](https://gpuserver.io/es/configure) le dice en cuál de estos casos está: elija un modelo y le indica, para cada nodo del catálogo, si cabe en una sola tarjeta, hay que repartirlo o no cabe en absoluto. La palabra «repartir» es el momento en que esta guía empieza a importar.

## Vea qué nodos alojan su modelo en una sola tarjeta.

El configurador responde a eso para las 41 configuraciones, y le muestra el precio de cada una.

[Abrir el configurador](https://gpuserver.io/es/configure) [Leer las guías](https://gpuserver.io/es/guides)

## Otras guías

- [Dimensionamiento · 9 min Elegir una tarjeta para modelos de imagen y vídeo Cuánta VRAM necesitan FLUX, SDXL, SD 3.5 y Wan 2.1, qué tarjeta de nuestro catálogo aloja cada uno, y por qué la más barata que cabe rara vez es la más indicada. Leer la guía](https://gpuserver.io/es/guides/gpu-for-flux-sdxl)
- [Dimensionamiento · 10 min Elegir un formato de cuantización Lo que cuestan AWQ, GPTQ, GGUF y FP8 en memoria, velocidad y calidad — y por qué el formato con los pesos más pequeños rara vez da el modelo más pequeño. Leer la guía](https://gpuserver.io/es/guides/awq-vs-gptq-vs-fp8)
- [Dimensionamiento · 10 min Ejecutar un modelo de mezcla de expertos Los parámetros totales deciden la máquina; los activos, la velocidad. Cuánta VRAM necesitan DeepSeek V3 y Qwen 3 235B, y qué nodo alquilar para ellos. Leer la guía](https://gpuserver.io/es/guides/mixture-of-experts)

---

Fuente: https://gpuserver.io/es/guides/nvlink-vs-pcie/. Este archivo se genera a partir de los mismos datos que el sitio web; si una cifra aquí difiere de la de una página, prevalece la página y este archivo está desactualizado: la fuente canónica es https://gpuserver.io/.
