NVLink или PCIe: что нужно именно вашей задаче.
Линк между картами имеет огромное значение для одного типа нагрузки и не имеет никакого — для трёх других. Знание того, какая нагрузка у вас, стоит нескольких сотен долларов в месяц.
Коротко
- Одна модель на карту
- Линк не имеет значения. Берите PCIe и потратьте разницу на дополнительные карты.
- Разделение одной модели между картами
- Тензорный параллелизм синхронизируется на каждом слое. За NVLink стоит платить.
- Конвейерный параллелизм
- Одна передача на микробатч, а не на слой. PCIe обычно справляется.
- Обучение на нескольких узлах
- Мы этого не предлагаем — NVLink соединяет карты внутри узла, между узлами не соединяет ничто.
Коротко
Если модель помещается на одну карту, дальше можно не читать — ничто из этого к вам не относится, и правильная покупка — самая дешёвая карта, которая её вмещает. Это руководство о том, что происходит, когда модель не помещается и её приходится разделять между картами.
Что представляет собой каждый линк
| Линк | Где вы это получаете | На карту, в каждую сторону | Топология |
|---|---|---|---|
| NVLink 4 через NVSwitch | Карты SXM на плате HGX — узлы на 4 и 8 GPU | 900 GB/s | All-to-all. Каждая карта одновременно общается с каждой другой на полной скорости. |
| NVLink 5 через NVSwitch | Узлы B200 SXM6 | 1 800 GB/s | All-to-all, вдвое быстрее предыдущего поколения. |
| PCIe Gen5 ×16 | Все карты PCIe | 64 GB/s | Через корневой комплекс CPU. Карты на разных сокетах находятся дальше друг от друга, чем карты на одном. |
| PCIe Gen4 ×16 | Некоторые шасси на 1 и 2 GPU | 32 GB/s | То же самое, но на половинной скорости. |
Заголовочное соотношение между NVLink 4 и PCIe Gen5 — примерно 14×. Это число реально, но важно не оно — важно, как часто ваша задача пересекает линк.
Когда именно от этого зависит скорость
Один случай — и именно в нём люди чаще всего оказываются, не планируя этого.
Тензорный параллелизм
Каждый слой разрезается между картами, поэтому каждая карта хранит часть каждой матрицы весов. После каждого слоя частичные результаты нужно просуммировать по всем картам — это all-reduce.
- На модели 70B это 80 синхронизаций на токен
- Каждая из них ждёт самую медленную карту
- Именно здесь 14× на линке превращаются в реальные секунды
Обучение с большим батчем
Gradient all-reduce в конце каждого шага, объём которого зависит от числа параметров, а не от размера батча. Модель 70B в BF16 передаёт по линку 140 GB за шаг.
- По PCIe Gen5 — примерно две секунды чистой передачи
- По NVLink — примерно десятая часть от этого
- Умножено на каждый шаг многодневного запуска
Когда это ничего не меняет
Три распространённые нагрузки, при которых плата за NVLink не даёт ничего измеримого. Если это ваш случай, карты PCIe дадут больше VRAM за доллар.
Одна модель на карту. Четыре независимые копии модели 24B на четырёх картах вообще не задействуют линк. Четырёхкратная пропускная способность, никакой синхронизации, никакого сценария отказа.
Конвейерный параллелизм. Модель делится на группы слоёв, поэтому карта передаёт эстафету следующей раз на микробатч, а не раз на слой. Передачи данных достаточно редки, чтобы PCIe справлялся.
Диффузия и рендеринг. Генерация изображений и видео, Blender, Octane: каждая карта работает над своим кадром или своим изображением. Синхронизировать через all-reduce здесь просто нечего.
--tensor-parallel-size 4, потому что на узле четыре карты, работает медленнее, чем та же модель на одной из них. Затраты на синхронизацию реальны, а выигрыш — нулевой. Разделяйте модель между картами только тогда, когда она не помещается.
Одна и та же задача, оба варианта
Два узла из нашей аренды, у обоих по четыре карты 80 GB — одинаковый суммарный объём памяти, один класс карт, различается только линк между ними. Цены наши, за месяц.
| 4 × NVIDIA A100 PCIe | 4 × NVIDIA A100 SXM4 | |
|---|---|---|
| Линк между картами | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| Всего VRAM | 320 GB | 320 GB |
| Пропускная способность памяти на карту | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B в BF16, разделена между картами | ~18 ток/с | ~19 ток/с |
| Цена | $4,157/мес | $4,395/мес |
Наша модель пропускной способности ограничена пропускной способностью памяти и намеренно консервативна — она не моделирует all-reduce напрямую, поэтому реальный разрыв на задаче с тензорным параллелизмом шире, чем показывает таблица, а не уже. Считайте эти цифры нижней границей для обеих машин, а важен здесь именно порядок.
Измерить самостоятельно
Сделайте это в первый же день. Это займёт две минуты и покажет, действительно ли у купленной машины та топология, за которую вы заплатили.
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m
# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status
# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
nvcr.io/nvidia/pytorch:25.02-py3 \
all_reduce_perf -b 8 -e 4G -f 2 -g 4
Если topo -m показывает SYS между двумя картами на узле, купленном под тензорный параллелизм, значит эти две карты общаются через CPU и через разные сокеты — худший случай на этой машине. На наших узлах SXM каждая пара показывает NV18; всё остальное — неисправность, и мы хотим узнать о ней в первый же день.
Что покупать
- Модель помещается на одну карту? Купите одну карту. Ничто на этой странице к вам не относится, а наценка за интерконнект — деньги на ветер.
- Несколько независимых моделей или много независимых задач? Берите карты PCIe, сколько нужно. Вы получаете больше VRAM за доллар и никогда не пересекаете линк.
- Одна модель, которая не помещается на одну карту, обслуживается с низкой конкурентностью? PCIe подойдёт. Ожидайте, что разделение между картами скорее обойдётся вам в убыток, чем в выигрыш, и подбирайте узел по памяти, а не по скорости.
- Одна модель, которая не помещается на одну карту, обслуживает реальный трафик или обучается? Именно для этого случая существует NVLink. Берите SXM.
- Одной задаче нужно больше восьми карт? Для этого нужна фабрика между узлами, а её мы не продаём. Мы предпочитаем сказать вам об этом здесь, а не после инвойса — см. что мы не предлагаем.
Конфигуратор покажет, какой из этих случаев — ваш: выберите модель, и для каждого узла в каталоге он сообщит, помещается ли она на одну карту, требует ли разделения или не помещается вовсе. Слово «разделение» — момент, с которого это руководство начинает иметь значение.
Посмотреть, какие узлы вмещают вашу модель на одной карте.
Конфигуратор отвечает на это для всех 41 конфигураций и показывает цену каждой.
Другие руководства
- Расчёт · 9 мин
Выбор карты для моделей изображений и видео
Сколько VRAM нужно FLUX, SDXL, SD 3.5 и Wan 2.1, какая карта каталога держит каждую и почему дешёвая подходящая карта редко оказывается лучшим выбором.
Читать руководство - Расчёт · 10 мин
Выбор формата квантования
Во что обходятся AWQ, GPTQ, GGUF и FP8 по памяти, скорости и качеству — и почему формат с самыми лёгкими весами редко даёт самую маленькую модель.
Читать руководство - Расчёт · 10 мин
Запуск модели на основе смеси экспертов
Общее число параметров определяет машину, активные параметры — скорость. Сколько VRAM нужно DeepSeek V3 и Qwen 3 235B, и какой узел для них арендовать.
Читать руководство