Все 6 дата-центров работают

Оплата в криптовалюте · Без проверки личности · Root-доступ через менее 5 минут

Расчёт · руководство · 7 мин на чтение

NVLink или PCIe: что нужно именно вашей задаче.

Линк между картами имеет огромное значение для одного типа нагрузки и не имеет никакого — для трёх других. Знание того, какая нагрузка у вас, стоит нескольких сотен долларов в месяц.

Коротко

Одна модель на карту
Линк не имеет значения. Берите PCIe и потратьте разницу на дополнительные карты.
Разделение одной модели между картами
Тензорный параллелизм синхронизируется на каждом слое. За NVLink стоит платить.
Конвейерный параллелизм
Одна передача на микробатч, а не на слой. PCIe обычно справляется.
Обучение на нескольких узлах
Мы этого не предлагаем — NVLink соединяет карты внутри узла, между узлами не соединяет ничто.

Коротко

Если модель помещается на одну карту, дальше можно не читать — ничто из этого к вам не относится, и правильная покупка — самая дешёвая карта, которая её вмещает. Это руководство о том, что происходит, когда модель не помещается и её приходится разделять между картами.

Что представляет собой каждый линк

Типы интерконнекта, пропускная способность и топология
ЛинкГде вы это получаетеНа карту, в каждую сторонуТопология
NVLink 4 через NVSwitchПоколение Hopper Карты SXM на плате HGX — узлы на 4 и 8 GPUA100 SXM4, H100 SXM5, H200 900 GB/s All-to-all. Каждая карта одновременно общается с каждой другой на полной скорости.
NVLink 5 через NVSwitchПоколение Blackwell Узлы B200 SXM64- и 8-GPU 1 800 GB/s All-to-all, вдвое быстрее предыдущего поколения.
PCIe Gen5 ×16Текущие узлы PCIe Все карты PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe 64 GB/s Через корневой комплекс CPU. Карты на разных сокетах находятся дальше друг от друга, чем карты на одном.
PCIe Gen4 ×16Более старые платформы Некоторые шасси на 1 и 2 GPU 32 GB/s То же самое, но на половинной скорости.

Заголовочное соотношение между NVLink 4 и PCIe Gen5 — примерно 14×. Это число реально, но важно не оно — важно, как часто ваша задача пересекает линк.

Когда именно от этого зависит скорость

Один случай — и именно в нём люди чаще всего оказываются, не планируя этого.

Тензорный параллелизм

Каждый слой разрезается между картами, поэтому каждая карта хранит часть каждой матрицы весов. После каждого слоя частичные результаты нужно просуммировать по всем картам — это all-reduce.

  • На модели 70B это 80 синхронизаций на токен
  • Каждая из них ждёт самую медленную карту
  • Именно здесь 14× на линке превращаются в реальные секунды

Обучение с большим батчем

Gradient all-reduce в конце каждого шага, объём которого зависит от числа параметров, а не от размера батча. Модель 70B в BF16 передаёт по линку 140 GB за шаг.

  • По PCIe Gen5 — примерно две секунды чистой передачи
  • По NVLink — примерно десятая часть от этого
  • Умножено на каждый шаг многодневного запуска

Когда это ничего не меняет

Три распространённые нагрузки, при которых плата за NVLink не даёт ничего измеримого. Если это ваш случай, карты PCIe дадут больше VRAM за доллар.

Одна модель на карту. Четыре независимые копии модели 24B на четырёх картах вообще не задействуют линк. Четырёхкратная пропускная способность, никакой синхронизации, никакого сценария отказа.

Конвейерный параллелизм. Модель делится на группы слоёв, поэтому карта передаёт эстафету следующей раз на микробатч, а не раз на слой. Передачи данных достаточно редки, чтобы PCIe справлялся.

Диффузия и рендеринг. Генерация изображений и видео, Blender, Octane: каждая карта работает над своим кадром или своим изображением. Синхронизировать через all-reduce здесь просто нечего.

Самая дорогая ошибка — купить тензорный параллелизм, который вам не был нужен. Модель, которая помещается на одну карту 80 GB, но обслуживается с --tensor-parallel-size 4, потому что на узле четыре карты, работает медленнее, чем та же модель на одной из них. Затраты на синхронизацию реальны, а выигрыш — нулевой. Разделяйте модель между картами только тогда, когда она не помещается.

Одна и та же задача, оба варианта

Два узла из нашей аренды, у обоих по четыре карты 80 GB — одинаковый суммарный объём памяти, один класс карт, различается только линк между ними. Цены наши, за месяц.

Узел SXM на четыре карты в сравнении с узлом PCIe на четыре карты
4 × NVIDIA A100 PCIe4 × NVIDIA A100 SXM4
Линк между картамиPCIe 5.0 ×16NVLink 3 · 600 GB/s
Всего VRAM320 GB320 GB
Пропускная способность памяти на карту1,935 GB/s2,039 GB/s
Llama 3.3 70B в BF16, разделена между картамиГенерация в один поток, наша консервативная оценка ~18 ток/с~19 ток/с
Цена $4,157/мес $4,395/мес

Наша модель пропускной способности ограничена пропускной способностью памяти и намеренно консервативна — она не моделирует all-reduce напрямую, поэтому реальный разрыв на задаче с тензорным параллелизмом шире, чем показывает таблица, а не уже. Считайте эти цифры нижней границей для обеих машин, а важен здесь именно порядок.

Измерить самостоятельно

Сделайте это в первый же день. Это займёт две минуты и покажет, действительно ли у купленной машины та топология, за которую вы заплатили.

Сначала топология, затем реальная пропускная способность
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4

Если topo -m показывает SYS между двумя картами на узле, купленном под тензорный параллелизм, значит эти две карты общаются через CPU и через разные сокеты — худший случай на этой машине. На наших узлах SXM каждая пара показывает NV18; всё остальное — неисправность, и мы хотим узнать о ней в первый же день.

Что покупать

  1. Модель помещается на одну карту? Купите одну карту. Ничто на этой странице к вам не относится, а наценка за интерконнект — деньги на ветер.
  2. Несколько независимых моделей или много независимых задач? Берите карты PCIe, сколько нужно. Вы получаете больше VRAM за доллар и никогда не пересекаете линк.
  3. Одна модель, которая не помещается на одну карту, обслуживается с низкой конкурентностью? PCIe подойдёт. Ожидайте, что разделение между картами скорее обойдётся вам в убыток, чем в выигрыш, и подбирайте узел по памяти, а не по скорости.
  4. Одна модель, которая не помещается на одну карту, обслуживает реальный трафик или обучается? Именно для этого случая существует NVLink. Берите SXM.
  5. Одной задаче нужно больше восьми карт? Для этого нужна фабрика между узлами, а её мы не продаём. Мы предпочитаем сказать вам об этом здесь, а не после инвойса — см. что мы не предлагаем.

Конфигуратор покажет, какой из этих случаев — ваш: выберите модель, и для каждого узла в каталоге он сообщит, помещается ли она на одну карту, требует ли разделения или не помещается вовсе. Слово «разделение» — момент, с которого это руководство начинает иметь значение.

Посмотреть, какие узлы вмещают вашу модель на одной карте.

Конфигуратор отвечает на это для всех 41 конфигураций и показывает цену каждой.

Войти

Консоль, инвойсы и внеполосный доступ.

Ещё нет аккаунта?

Отдельной регистрации нет. Ваш аккаунт создаётся, когда вы оформляете первый заказ — email и пароль вы указываете на шаге оплаты, и консоль открыта уже к моменту готовности машины.

Настроить сервер

Language