Расчёт · руководство · 7 мин на чтение

# NVLink или PCIe: что нужно именно вашей задаче.

Линк между картами имеет огромное значение для одного типа нагрузки и не имеет никакого — для трёх других. Знание того, какая нагрузка у вас, стоит нескольких сотен долларов в месяц.

Коротко

- **Одна модель на карту:** Линк не имеет значения. Берите PCIe и потратьте разницу на дополнительные карты.
- **Разделение одной модели между картами:** Тензорный параллелизм синхронизируется на **каждом слое**. За NVLink стоит платить.
- **Конвейерный параллелизм:** Одна передача на микробатч, а не на слой. PCIe обычно справляется.
- **Обучение на нескольких узлах:** Мы этого не предлагаем — NVLink соединяет карты *внутри* узла, между узлами не соединяет ничто.

## Коротко

Если модель помещается на одну карту, дальше можно не читать — ничто из этого к вам не относится, и правильная покупка — самая дешёвая карта, которая её вмещает. Это руководство о том, что происходит, когда модель не помещается и её приходится разделять между картами.

## Что представляет собой каждый линк

**Типы интерконнекта, пропускная способность и топология**

| Линк | Где вы это получаете | На карту, в каждую сторону | Топология |
|---|---|---|---|
| NVLink 4 через NVSwitch Поколение Hopper | Карты SXM на плате HGX — узлы на 4 и 8 GPUA100 SXM4, H100 SXM5, H200 | 900 GB/s | All-to-all. Каждая карта одновременно общается с каждой другой на полной скорости. |
| NVLink 5 через NVSwitch Поколение Blackwell | Узлы B200 SXM64- и 8-GPU | 1 800 GB/s | All-to-all, вдвое быстрее предыдущего поколения. |
| PCIe Gen5 ×16 Текущие узлы PCIe | Все карты PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe | 64 GB/s | Через корневой комплекс CPU. Карты на разных сокетах находятся дальше друг от друга, чем карты на одном. |
| PCIe Gen4 ×16 Более старые платформы | Некоторые шасси на 1 и 2 GPU | 32 GB/s | То же самое, но на половинной скорости. |

Заголовочное соотношение между NVLink 4 и PCIe Gen5 — примерно **14×**. Это число реально, но важно не оно — важно, как часто ваша задача пересекает линк.

## Когда именно от этого зависит скорость

Один случай — и именно в нём люди чаще всего оказываются, не планируя этого.

### Тензорный параллелизм

Каждый слой разрезается между картами, поэтому каждая карта хранит часть каждой матрицы весов. После каждого слоя частичные результаты нужно просуммировать по всем картам — это all-reduce.

- На модели 70B это 80 синхронизаций на токен
- Каждая из них ждёт самую медленную карту
- Именно здесь 14× на линке превращаются в реальные секунды

### Обучение с большим батчем

Gradient all-reduce в конце каждого шага, объём которого зависит от числа параметров, а не от размера батча. Модель 70B в BF16 передаёт по линку 140 GB за шаг.

- По PCIe Gen5 — примерно две секунды чистой передачи
- По NVLink — примерно десятая часть от этого
- Умножено на каждый шаг многодневного запуска

## Когда это ничего не меняет

Три распространённые нагрузки, при которых плата за NVLink не даёт ничего измеримого. Если это ваш случай, карты PCIe дадут больше VRAM за доллар.

**Одна модель на карту.** Четыре независимые копии модели 24B на четырёх картах вообще не задействуют линк. Четырёхкратная пропускная способность, никакой синхронизации, никакого сценария отказа.

**Конвейерный параллелизм.** Модель делится на *группы* слоёв, поэтому карта передаёт эстафету следующей раз на микробатч, а не раз на слой. Передачи данных достаточно редки, чтобы PCIe справлялся.

**Диффузия и рендеринг.** Генерация изображений и видео, Blender, Octane: каждая карта работает над своим кадром или своим изображением. Синхронизировать через all-reduce здесь просто нечего.

**Самая дорогая ошибка — купить тензорный параллелизм, который вам не был нужен.** Модель, которая помещается на одну карту 80 GB, но обслуживается с `--tensor-parallel-size 4`, потому что на узле четыре карты, работает *медленнее*, чем та же модель на одной из них. Затраты на синхронизацию реальны, а выигрыш — нулевой. Разделяйте модель между картами только тогда, когда она не помещается.

## Одна и та же задача, оба варианта

Два узла из нашей аренды, у обоих по четыре карты 80 GB — одинаковый суммарный объём памяти, один класс карт, различается только линк между ними. Цены наши, за месяц.

**Узел SXM на четыре карты в сравнении с узлом PCIe на четыре карты**

|  | [4 × NVIDIA A100 PCIe](https://gpuserver.io/ru/gpu/a100-80gb) | [4 × NVIDIA A100 SXM4](https://gpuserver.io/ru/gpu/a100-sxm4) |
|---|---|---|
| Линк между картами | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| Всего VRAM | 320 GB | 320 GB |
| Пропускная способность памяти на карту | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B в BF16, разделена между картами Генерация в один поток, наша консервативная оценка | ~18 ток/с | ~19 ток/с |
| Цена | $4,157/мес | $4,395/мес |

Наша модель пропускной способности ограничена пропускной способностью памяти и намеренно консервативна — она не моделирует all-reduce напрямую, поэтому реальный разрыв на задаче с тензорным параллелизмом *шире*, чем показывает таблица, а не уже. Считайте эти цифры нижней границей для обеих машин, а важен здесь именно порядок.

## Измерить самостоятельно

Сделайте это в первый же день. Это займёт две минуты и покажет, действительно ли у купленной машины та топология, за которую вы заплатили.

Сначала топология, затем реальная пропускная способность

```
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4
```

Если `topo -m` показывает `SYS` между двумя картами на узле, купленном под тензорный параллелизм, значит эти две карты общаются через CPU и через разные сокеты — худший случай на этой машине. На наших узлах SXM каждая пара показывает `NV18`; всё остальное — неисправность, и мы хотим узнать о ней в первый же день.

## Что покупать

1. **Модель помещается на одну карту?** Купите одну карту. Ничто на этой странице к вам не относится, а наценка за интерконнект — деньги на ветер.
2. **Несколько независимых моделей или много независимых задач?** Берите карты PCIe, сколько нужно. Вы получаете больше VRAM за доллар и никогда не пересекаете линк.
3. **Одна модель, которая не помещается на одну карту, обслуживается с низкой конкурентностью?** PCIe подойдёт. Ожидайте, что разделение между картами скорее обойдётся вам в убыток, чем в выигрыш, и подбирайте узел по памяти, а не по скорости.
4. **Одна модель, которая не помещается на одну карту, обслуживает реальный трафик или обучается?** Именно для этого случая существует NVLink. Берите SXM.
5. **Одной задаче нужно больше восьми карт?** Для этого нужна фабрика между узлами, а её мы не продаём. Мы предпочитаем сказать вам об этом здесь, а не после инвойса — см. [что мы не предлагаем](https://gpuserver.io/ru/network#limits).

[Конфигуратор](https://gpuserver.io/ru/configure) покажет, какой из этих случаев — ваш: выберите модель, и для каждого узла в каталоге он сообщит, помещается ли она на одну карту, требует ли разделения или не помещается вовсе. Слово «разделение» — момент, с которого это руководство начинает иметь значение.

## Посмотреть, какие узлы вмещают вашу модель на одной карте.

Конфигуратор отвечает на это для всех 41 конфигураций и показывает цену каждой.

[Открыть конфигуратор](https://gpuserver.io/ru/configure) [Читать руководства](https://gpuserver.io/ru/guides)

## Другие руководства

- [Расчёт · 9 мин Выбор карты для моделей изображений и видео Сколько VRAM нужно FLUX, SDXL, SD 3.5 и Wan 2.1, какая карта каталога держит каждую и почему дешёвая подходящая карта редко оказывается лучшим выбором. Читать руководство](https://gpuserver.io/ru/guides/gpu-for-flux-sdxl)
- [Расчёт · 10 мин Выбор формата квантования Во что обходятся AWQ, GPTQ, GGUF и FP8 по памяти, скорости и качеству — и почему формат с самыми лёгкими весами редко даёт самую маленькую модель. Читать руководство](https://gpuserver.io/ru/guides/awq-vs-gptq-vs-fp8)
- [Расчёт · 10 мин Запуск модели на основе смеси экспертов Общее число параметров определяет машину, активные параметры — скорость. Сколько VRAM нужно DeepSeek V3 и Qwen 3 235B, и какой узел для них арендовать. Читать руководство](https://gpuserver.io/ru/guides/mixture-of-experts)

---

Источник: https://gpuserver.io/ru/guides/nvlink-vs-pcie/. Этот файл формируется на основе тех же данных, что и сайт; если цифра здесь отличается от страницы сайта, приоритет у страницы, а этот файл устарел — канонический источник: https://gpuserver.io/.
