Все 6 дата-центров работают

Оплата в криптовалюте · Без проверки личности · Root-доступ через менее 5 минут

Расчёт · руководство · 10 мин на чтение

Во что смесь экспертов обходится на самом деле.

Название вроде «235B-A22B» содержит два числа, и почти все читают не то, что нужно. Одно из них решает, что вы арендуете; другое — насколько быстро это отвечает. Между ними может быть десятикратная разница.

Коротко

Общее число параметров определяет машину
DeepSeek V3 671B-A37B (MoE) в 4-bit нужно 386 GB при контексте 8k. Плотной модели размером с её активные параметры потребовалось бы 22 GB — на 17.6× меньше.
Активные параметры определяют скорость
На каждый токен читается лишь часть весов, поэтому генерация идёт быстрее, чем у плотной модели той же массы — но маршрутизация тут же забирает обратно большую часть этого преимущества.
Самый дешёвый узел, который её вмещает
8 × NVIDIA A100 PCIe за $7,906 в месяц. Это почти никогда не тот вариант, который стоит арендовать.
Тот, который стоит арендовать
4 × NVIDIA B200 SXM6 за $11,790 — 1.5× денег за 2.8× пропускной способности.

Коротко

Смесь экспертов разбивает feed-forward часть каждого слоя на множество небольших сетей и пропускает каждый токен лишь через немногие из них. Опубликованное название фиксирует оба факта: общее число параметров и число тех, что активны для любого отдельного токена. Первое нужно целиком держать в памяти, а второе — читать только на каждый токен. Это одно предложение — весь смысл руководства, и перепутать их местами — самая дорогая ошибка, которую мы видим у людей ещё до оформления заказа.

В результате получается модель со странной структурой затрат: арендуется она как гигант, а работает как модель среднего размера. Выгода это или ловушка, целиком зависит от того, какое из этих двух чисел оказывается вашим узким местом.

Подбираете размер машины? Используйте общее число параметров. Каждый эксперт должен находиться в памяти, потому что заранее нельзя знать, какие из них понадобятся следующему токену. Маршрутизация решается на уровне токена, во время выполнения.

Оцениваете скорость? Начните с числа активных параметров, а затем сделайте большую скидку. Генерация читает только активные веса — в этом весь смысл, но маршрутизатор, диспетчеризация экспертов и трафик между картами обходятся не бесплатно и плохо масштабируются в пределах узла.

Обслуживаете длинный контекст или много пользователей? Смотрите на то, как устроено внимание, а не на число параметров. У самых крупных моделей на этой странице самый маленький KV-кэш на токен, и после определённой длины это полностью переворачивает рейтинг.

Нужно только качество? Плотная модель, которая помещается на одну карту, проще, дешевле и быстрее в эксплуатации, чем смесь экспертов, разделённая между восемью картами. Обращайтесь к MoE, когда ни одна плотная модель не даёт нужного вам ответа, а не потому, что название звучит внушительно.

Арифметика ниже — та же самая, что использует конфигуратор, по тому же каталогу. Если вы ещё не выяснили, сколько памяти вообще нужно модели, начните с этой формулы — здесь показано, что меняется, когда модель становится смесью экспертов.

Как читать название

В ходу три обозначения, и все они кодируют одну и ту же пару чисел, поэтому путаница и не исчезает. Как только вы научитесь их читать, вопрос подбора размера решается сам собой.

235B-A22BОбщее число, затем активноеСамое понятное обозначение из трёх. 235 миллиардов параметров живут в памяти; 22 миллиарда из них считываются для любого отдельного токена. Буква A означает активные, и это число, которое не говорит вам, что арендовать.
671B-A37BТо же обозначение, но крупнееПри таком размере разрыв намеренно доведён до абсурда: доля активных параметров — меньше шести процентов. Из этих 37 не следует ничего о том, какая машина вам нужна.
8×22BЧисло экспертов, затем размер экспертаБолее старое обозначение, и то, которое вводит в заблуждение сильнее всего. Оно не означает 176 миллиардов параметров, потому что внимание и эмбеддинги общие, а не продублированные; и не означает 22 миллиарда, потому что на токен активны два эксперта, а не один.
A22B, A37BСреднее, а не гарантияЧисло активных параметров — это то, во что маршрутизация обходится на типичном тексте. Это не потолок: батч, чьи токены расходятся по множеству экспертов, затрагивает большую часть модели, и это одна из причин, почему измеренная пропускная способность оказывается ниже арифметической оценки.
Модели на основе смеси экспертов в нашем каталоге для подбора размера: общее число параметров против активных
Модель Всего параметров Активные на токен Доля активных
Mixtral 8×22B (MoE)56 слоёв 141 B 39 B 28 %
Qwen 3 235B-A22B (MoE)94 слоёв 235 B 22 B 9 %
DeepSeek V3 671B-A37B (MoE)61 слоёв 671 B 37 B 6 %
Llama 3.3 70BПлотная, для сравнения 70 B 70 B 100 %

Последний столбец — тот, который стоит запомнить. Плотная модель читает всё, что хранит; смесь экспертов читает лишь срез. Всё необычное в этих моделях — и хорошее, и плохое — вытекает именно из этой строки.

Память, которую вы арендуете на самом деле

Вот вся ловушка в одной таблице. Средний столбец — это то, что модели нужно на машине; следующий за ним столбец — это то, на что заложился бы читатель, воспринявший число активных параметров буквально. Последний столбец — счёт за это неверное прочтение.

Сколько VRAM нужно при 4-bit с контекстом 8k, против того, что предполагает число активных параметров
Модель Веса при 4-bit Всего требуется Если бы считать по активному размеру Перерасход
Mixtral 8×22B (MoE) 71 GB 83 GBпри 8k 24 GB 3.4×
Qwen 3 235B-A22B (MoE) 118 GB 137 GBпри 8k 14 GB 9.5×
DeepSeek V3 671B-A37B (MoE) 336 GB 386 GBпри 8k 22 GB 17.6×

Читайте последний столбец как ошибку в покупке. Тот, кто подбирает размер только по числу активных параметров, отправится искать одну карту, а в итоге ему понадобится целый узел — не чуть более крупная машина, а машина совершенно другой категории и другой цены.

Нет, вы не можете держать неиспользуемых экспертов на диске. Это первое, что приходит в голову всем, и серверные стеки инференса действительно это предлагают. Проблема в том, что маршрутизация решается на уровне токена: набор нужных экспертов меняется по несколько раз на каждое сгенерированное слово, поэтому карта, которая держит лишь часть, тратит время на подкачку весов через PCIe вместо вычислений. В результате модель не немного медленнее — она работает на малой доле своей скорости. Подкачка — способ заставить модель запуститься на машине, которая не может её вместить, а не способ её обслуживать.

Что покупают активные параметры

Генерация ограничена пропускной способностью памяти: каждый новый токен требует повторного чтения весов, которые в нём участвуют. Смесь экспертов читает только свой активный срез, поэтому потолок её скорости задаётся числом намного меньшим, чем предполагает её размер. Эта часть обещания — правда, и именно поэтому такие модели вообще существуют.

Таблица ниже помещает каждую модель на одну и ту же машину — 8 × NVIDIA A100 PCIe за $7,906 в месяц, самый дешёвый узел в нашем каталоге, который вмещает их все одновременно. Сравнивать цифры пропускной способности, снятые на разных машинах, — не сравнивать ничего.

Генерация в один поток на одном узле: смеси экспертов против плотных моделей
Модель Всего Чтение на токен Расчётные токены/с
DeepSeek V3 671B-A37B (MoE)Смесь экспертов · разделено между 8 картами 671 B 18.5 GB 37один поток
Llama 3.1 405BПлотная · разделено между 8 картами 405 B 202.5 GB 19один поток
Qwen 3 235B-A22B (MoE)Смесь экспертов · разделено между 8 картами 235 B 11.0 GB 62один поток
Mixtral 8×22B (MoE)Смесь экспертов · разделено между 8 картами 141 B 19.5 GB 35один поток
Llama 3.3 70BПлотная · на одной карте 70 B 35.0 GB 25один поток

Две строки, которые стоит сравнить, — это самая крупная смесь экспертов и самая крупная плотная модель, потому что обе разделены между всеми картами узла. Смесь — модель значительно крупнее, и всё же она генерирует быстрее, поскольку читает на каждый токен лишь свою часть — ради этого компромисса архитектура и существует. Строки с пометкой на одной карте читайте иначе: эти модели занимают всего одну карту узла и оставляют свободными остальные семь, а это более дешёвая машина, которую можно выбрать, а не более медленная.

Эти цифры уже несут в себе большой штраф, и так и должно быть. Чистая арифметика по активным параметрам сильно завышает прогноз для смеси экспертов. Наша первая версия этого расчёта именно так и ошибалась — почти в пять раз против опубликованных измерений для самой крупной модели на этой странице. Маршрутизация стоит отдельного прохода, экспертам приходится обмениваться активациями между картами на каждом слое, а батч затрагивает больше экспертов, чем предполагает среднее значение. Теперь расчёт применяет намеренно консервативную поправку, откалиброванную по измеренным цифрам, а не подобранную — поэтому он скорее занижает, чем завышает. Считайте каждое число здесь нижней границей, которую нужно превзойти на реальной машине, а не целевым показателем для планирования.

Второе, что скрывает арифметика: смесь экспертов сложнее качественно разделить между картами. Плотная модель, разделённая между картами, синхронизируется один раз за слой; смеси же приходится ещё и направлять токены на ту карту, где находится нужный эксперт, а это другой и менее предсказуемый характер трафика. Это одна из немногих нагрузок, где интерконнект по-настоящему оправдывает свою цену, а не просто фигурирует в счёте.

Половина, которая дешевеет

До сих пор все новости были плохими для крупных моделей. Вот компенсация, и она значительная, хотя её почти никогда не упоминают при сравнении: у моделей с наибольшим числом параметров на этой странице самый маленький KV-кэш на токен. Кэш задаётся устройством внимания — слоями, KV-головами, размерностью головы — и никак не зависит от того, сколько экспертов стоит за вниманием.

KV-кэш на токен и во что обходится один поток на каждой длине контекста
Модель Кэш на токен 4k 8k 32k 128k
Mixtral 8×22B (MoE)8 KV-голов 224 KiB 0.9 GB 1.8 GB 7.0 GB 28.0 GB
Qwen 3 235B-A22B (MoE)4 KV-голов 188 KiB 0.7 GB 1.5 GB 5.9 GB 23.5 GB
DeepSeek V3 671B-A37B (MoE)Latent attention 70 KiB 0.3 GB 0.5 GB 2.2 GB 8.8 GB
Llama 3.3 70B8 KV-голов 320 KiB 1.3 GB 2.5 GB 10.0 GB 40.0 GB
Llama 3.1 405B8 KV-голов 504 KiB 2.0 GB 3.9 GB 15.8 GB 63.0 GB

Эти столбцы даны в расчёте на один параллельный запрос. Умножьте на число людей, использующих эндпоинт одновременно, — и рейтинг в последнем столбце определяет вашу машину куда сильнее, чем веса.

У DeepSeek V3 671B-A37B (MoE) — самый маленький кэш в списке: 70 KiB на токен. По сравнению с Llama 3.3 70B при 320 KiB это разница в 4.6× раз в пользу более крупной модели. Она сжимает кэш, проецируя ключи и значения в маленький общий латентный вектор вместо того, чтобы хранить их по каждой голове. Поэтому модель, которую дороже всего загрузить, — та же самая, которую дешевле всего держать занятой — и именно поэтому она остаётся пригодной для длинного контекста, и именно поэтому арифметика переворачивается, как только вы обслуживаете больше, чем горстку людей одновременно.

Практический смысл таков: веса — это фиксированный входной билет, а кэш — текущие расходы. Смесь экспертов берёт огромную плату за вход, а затем небольшую текущую плату за каждого пользователя. Плотная модель сравнимого качества устроена наоборот. Что из двух окажется для вас дешевле, решают параллелизм и длина контекста, а не число параметров на карточке модели.

Какие машины их вмещают

При 4-bit, при опорном контексте и с учётом самого дешёвого узла в нашем каталоге, который вмещает каждую модель — будь то на одной карте или разделённой между картами узла. Это входные билеты, а не рекомендации; следующий раздел объясняет почему.

Самая дешёвая конфигурация в нашей аренде, которая вмещает каждую модель на основе смеси экспертов
Модель Требуется Самый дешёвый узел, который её вмещает В месяц Токены/с
Mixtral 8×22B (MoE) 83 GB 4 × NVIDIA L496 GB всего · 24 GB на карту $564 4
Qwen 3 235B-A22B (MoE) 137 GB 8 × NVIDIA L4192 GB всего · 24 GB на карту $1,106 10
DeepSeek V3 671B-A37B (MoE) 386 GB 8 × NVIDIA A100 PCIe640 GB всего · 80 GB на карту $7,906 37

Каждая из них — многокарточный узел, и это честный итог этой страницы: ничто в нашем каталоге не вмещает такую модель на одной карте, какой бы маленькой её ни делало число активных параметров. Полный каталог содержит остальные конфигурации, а конфигуратор проведёт ту же самую проверку для вашей модели и контекста.

Самый дешёвый узел — неверный выбор

Помещаться в память — это порог, а не цель. Как только модель разделена между картами узла, пропускная способность зависит от пропускной способности памяти тех карт, между которыми она разделена — а пропускная способность на доллар отличается более чем вдвое между конфигурациями, которые в равной мере проходят один и тот же порог по памяти. Вот DeepSeek V3 671B-A37B (MoE) на каждом узле, который её вмещает, отсортированные по цене, с единственным по-настоящему важным столбцом справа.

Каждый узел, который вмещает DeepSeek V3 671B-A37B (MoE), с месячной ценой за один токен в секунду
Конфигурация VRAM В месяц Токены/с $ за токен/с
8 × NVIDIA A100 PCIeGN-A10080×8 640 GB $7,906 37 $213.68
8 × NVIDIA A100 SXM4GN-A100SXM×8 640 GB $8,355 39 $214.23
4 × NVIDIA H200 SXM5GN-H200×4 564 GB $8,405 62 $135.56
8 × NVIDIA H100 PCIeGN-H100PCIE×8 640 GB $10,568 38 $278.11
8 × NVIDIA H100 SXM5GN-H100SXM×8 640 GB $11,509 64 $179.83
4 × NVIDIA B200 SXM6GN-B200×4 720 GB $11,790 103 $114.47
8 × NVIDIA H200 SXM5GN-H200×8 1128 GB $15,945 91 $175.22
8 × NVIDIA B200 SXM6GN-B200×8 1440 GB $22,351 152 $147.05

Зелёная ячейка — лучшее соотношение цены и результата в списке, и это не самая дешёвая строка. Переход от $7,906 к $11,790 умножает счёт на 1.5×, а пропускную способность — на 2.8× — вы платите больше, а каждый токен обходится дешевле. Сортировать каталог по цене и брать первую подходящую машину — верный способ потратить бюджет на обслуживание дважды.

Одна оговорка насчёт этого столбца, и она применима к любой таблице цены за пропускную способность, которую вы когда-либо прочтёте: здесь используется генерация в один поток. При непрерывном батчинге совокупная скорость в каждой строке растёт в несколько раз, и растёт не в одинаковое число раз — узел, у которого после весов остаётся больше свободной памяти, вмещает больше параллельных последовательностей. Порядок в рейтинге устойчив; абсолютные цифры консервативны. Экономику этой совокупной скорости мы разбираем отдельно.

Когда смесь экспертов — правильный выбор

По порядку. Остановитесь на первой строке, которая описывает вас.

  1. Если плотная модель помещается на одну карту, этого достаточно. Берите её и не оглядывайтесь. Одна карта означает отсутствие разделения между картами, вопроса об интерконнекте и трафика маршрутизации экспертов, а также машину, которая стоит малую долю цены узла. Большинству продуктов, которым кажется, что им нужна передовая открытая модель, на самом деле нужна хорошая модель на 32B.
  2. Вам нужно качество, а контекст у вас длинный. Вот где смесь экспертов — действительно лучший из доступных инструментов: вы платите один раз за веса, а маленький кэш означает, что машина продолжает обслуживать длинные разговоры, не падая. Подбирайте узел по весам, а затем проверяйте таблицу кэша для вашего реального контекста.
  3. Вам нужно качество, и вы обслуживаете много людей одновременно. Тот же ответ и та же причина, и преимущество растёт с параллелизмом. Фиксированные затраты амортизируются на все потоки, а затраты на каждый поток остаются низкими.
  4. Вам нужно качество, но лишь изредка. Тогда вы арендуете большой узел, чтобы держать его прогретым несколько часов в неделю, — а это худшее из возможных применений месячного срока. Либо соберите работу в один присест, либо используйте для неё готовый эндпоинт, а собственную машину оставьте для постоянной нагрузки.
  5. Вы хотите её файнтюнить. Это другая задача и более крупная машина: обучение затрагивает каждого эксперта и требует состояния оптимизатора для всех них, поэтому память, которая при инференсе была лишь неудобством, становится непозволительной. Адаптерный файнтюнинг плотной модели — реалистичный путь почти для всех.

На какой бы строке вы ни остановились, первое число, которое нужно проверить, — это общее число параметров в той точности, в которой вы собираетесь их обслуживать. Всё остальное на этой странице — скорость, кэш, цена за токен в секунду — становится важным только после того, как модель уже загружена в память. Конфигуратор проводит полную проверку по каждому узлу, который мы сдаём в аренду, и применяет к оценке пропускной способности ту же поправку на маршрутизацию, что и таблицы выше. Если вы хотите сначала увидеть арифметику памяти целиком, для этого есть отдельное руководство; а если вы ещё не определились с форматом чисел, этот выбор нужно сделать раньше.

Проверьте свою собственную смесь экспертов на реальных машинах.

Конфигуратор содержит все узлы, которые мы сдаём в аренду, применяет ту же арифметику, что и эта страница, и говорит вам, какие из них вмещают вашу модель, прежде чем вы хоть за что-то заплатите.

Войти

Консоль, инвойсы и внеполосный доступ.

Ещё нет аккаунта?

Отдельной регистрации нет. Ваш аккаунт создаётся, когда вы оформляете первый заказ — email и пароль вы указываете на шаге оплаты, и консоль открыта уже к моменту готовности машины.

Настроить сервер

Language