Во что смесь экспертов обходится на самом деле.
Название вроде «235B-A22B» содержит два числа, и почти все читают не то, что нужно. Одно из них решает, что вы арендуете; другое — насколько быстро это отвечает. Между ними может быть десятикратная разница.
Коротко
- Общее число параметров определяет машину
- DeepSeek V3 671B-A37B (MoE) в 4-bit нужно 386 GB при контексте 8k. Плотной модели размером с её активные параметры потребовалось бы 22 GB — на 17.6× меньше.
- Активные параметры определяют скорость
- На каждый токен читается лишь часть весов, поэтому генерация идёт быстрее, чем у плотной модели той же массы — но маршрутизация тут же забирает обратно большую часть этого преимущества.
- Самый дешёвый узел, который её вмещает
- 8 × NVIDIA A100 PCIe за $7,906 в месяц. Это почти никогда не тот вариант, который стоит арендовать.
- Тот, который стоит арендовать
- 4 × NVIDIA B200 SXM6 за $11,790 — 1.5× денег за 2.8× пропускной способности.
Коротко
Смесь экспертов разбивает feed-forward часть каждого слоя на множество небольших сетей и пропускает каждый токен лишь через немногие из них. Опубликованное название фиксирует оба факта: общее число параметров и число тех, что активны для любого отдельного токена. Первое нужно целиком держать в памяти, а второе — читать только на каждый токен. Это одно предложение — весь смысл руководства, и перепутать их местами — самая дорогая ошибка, которую мы видим у людей ещё до оформления заказа.
В результате получается модель со странной структурой затрат: арендуется она как гигант, а работает как модель среднего размера. Выгода это или ловушка, целиком зависит от того, какое из этих двух чисел оказывается вашим узким местом.
Подбираете размер машины? Используйте общее число параметров. Каждый эксперт должен находиться в памяти, потому что заранее нельзя знать, какие из них понадобятся следующему токену. Маршрутизация решается на уровне токена, во время выполнения.
Оцениваете скорость? Начните с числа активных параметров, а затем сделайте большую скидку. Генерация читает только активные веса — в этом весь смысл, но маршрутизатор, диспетчеризация экспертов и трафик между картами обходятся не бесплатно и плохо масштабируются в пределах узла.
Обслуживаете длинный контекст или много пользователей? Смотрите на то, как устроено внимание, а не на число параметров. У самых крупных моделей на этой странице самый маленький KV-кэш на токен, и после определённой длины это полностью переворачивает рейтинг.
Нужно только качество? Плотная модель, которая помещается на одну карту, проще, дешевле и быстрее в эксплуатации, чем смесь экспертов, разделённая между восемью картами. Обращайтесь к MoE, когда ни одна плотная модель не даёт нужного вам ответа, а не потому, что название звучит внушительно.
Арифметика ниже — та же самая, что использует конфигуратор, по тому же каталогу. Если вы ещё не выяснили, сколько памяти вообще нужно модели, начните с этой формулы — здесь показано, что меняется, когда модель становится смесью экспертов.
Как читать название
В ходу три обозначения, и все они кодируют одну и ту же пару чисел, поэтому путаница и не исчезает. Как только вы научитесь их читать, вопрос подбора размера решается сам собой.
| Модель | Всего параметров | Активные на токен | Доля активных |
|---|---|---|---|
| Mixtral 8×22B (MoE) | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) | 671 B | 37 B | 6 % |
| Llama 3.3 70B | 70 B | 70 B | 100 % |
Последний столбец — тот, который стоит запомнить. Плотная модель читает всё, что хранит; смесь экспертов читает лишь срез. Всё необычное в этих моделях — и хорошее, и плохое — вытекает именно из этой строки.
Память, которую вы арендуете на самом деле
Вот вся ловушка в одной таблице. Средний столбец — это то, что модели нужно на машине; следующий за ним столбец — это то, на что заложился бы читатель, воспринявший число активных параметров буквально. Последний столбец — счёт за это неверное прочтение.
| Модель | Веса при 4-bit | Всего требуется | Если бы считать по активному размеру | Перерасход |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB | 22 GB | 17.6× |
Читайте последний столбец как ошибку в покупке. Тот, кто подбирает размер только по числу активных параметров, отправится искать одну карту, а в итоге ему понадобится целый узел — не чуть более крупная машина, а машина совершенно другой категории и другой цены.
Что покупают активные параметры
Генерация ограничена пропускной способностью памяти: каждый новый токен требует повторного чтения весов, которые в нём участвуют. Смесь экспертов читает только свой активный срез, поэтому потолок её скорости задаётся числом намного меньшим, чем предполагает её размер. Эта часть обещания — правда, и именно поэтому такие модели вообще существуют.
Таблица ниже помещает каждую модель на одну и ту же машину — 8 × NVIDIA A100 PCIe за $7,906 в месяц, самый дешёвый узел в нашем каталоге, который вмещает их все одновременно. Сравнивать цифры пропускной способности, снятые на разных машинах, — не сравнивать ничего.
| Модель | Всего | Чтение на токен | Расчётные токены/с |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) | 671 B | 18.5 GB | 37 |
| Llama 3.1 405B | 405 B | 202.5 GB | 19 |
| Qwen 3 235B-A22B (MoE) | 235 B | 11.0 GB | 62 |
| Mixtral 8×22B (MoE) | 141 B | 19.5 GB | 35 |
| Llama 3.3 70B | 70 B | 35.0 GB | 25 |
Две строки, которые стоит сравнить, — это самая крупная смесь экспертов и самая крупная плотная модель, потому что обе разделены между всеми картами узла. Смесь — модель значительно крупнее, и всё же она генерирует быстрее, поскольку читает на каждый токен лишь свою часть — ради этого компромисса архитектура и существует. Строки с пометкой на одной карте читайте иначе: эти модели занимают всего одну карту узла и оставляют свободными остальные семь, а это более дешёвая машина, которую можно выбрать, а не более медленная.
Второе, что скрывает арифметика: смесь экспертов сложнее качественно разделить между картами. Плотная модель, разделённая между картами, синхронизируется один раз за слой; смеси же приходится ещё и направлять токены на ту карту, где находится нужный эксперт, а это другой и менее предсказуемый характер трафика. Это одна из немногих нагрузок, где интерконнект по-настоящему оправдывает свою цену, а не просто фигурирует в счёте.
Половина, которая дешевеет
До сих пор все новости были плохими для крупных моделей. Вот компенсация, и она значительная, хотя её почти никогда не упоминают при сравнении: у моделей с наибольшим числом параметров на этой странице самый маленький KV-кэш на токен. Кэш задаётся устройством внимания — слоями, KV-головами, размерностью головы — и никак не зависит от того, сколько экспертов стоит за вниманием.
| Модель | Кэш на токен | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |
Эти столбцы даны в расчёте на один параллельный запрос. Умножьте на число людей, использующих эндпоинт одновременно, — и рейтинг в последнем столбце определяет вашу машину куда сильнее, чем веса.
Практический смысл таков: веса — это фиксированный входной билет, а кэш — текущие расходы. Смесь экспертов берёт огромную плату за вход, а затем небольшую текущую плату за каждого пользователя. Плотная модель сравнимого качества устроена наоборот. Что из двух окажется для вас дешевле, решают параллелизм и длина контекста, а не число параметров на карточке модели.
Какие машины их вмещают
При 4-bit, при опорном контексте и с учётом самого дешёвого узла в нашем каталоге, который вмещает каждую модель — будь то на одной карте или разделённой между картами узла. Это входные билеты, а не рекомендации; следующий раздел объясняет почему.
| Модель | Требуется | Самый дешёвый узел, который её вмещает | В месяц | Токены/с |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | 4 × NVIDIA L4 | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | 8 × NVIDIA L4 | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | 8 × NVIDIA A100 PCIe | $7,906 | 37 |
Каждая из них — многокарточный узел, и это честный итог этой страницы: ничто в нашем каталоге не вмещает такую модель на одной карте, какой бы маленькой её ни делало число активных параметров. Полный каталог содержит остальные конфигурации, а конфигуратор проведёт ту же самую проверку для вашей модели и контекста.
Самый дешёвый узел — неверный выбор
Помещаться в память — это порог, а не цель. Как только модель разделена между картами узла, пропускная способность зависит от пропускной способности памяти тех карт, между которыми она разделена — а пропускная способность на доллар отличается более чем вдвое между конфигурациями, которые в равной мере проходят один и тот же порог по памяти. Вот DeepSeek V3 671B-A37B (MoE) на каждом узле, который её вмещает, отсортированные по цене, с единственным по-настоящему важным столбцом справа.
| Конфигурация | VRAM | В месяц | Токены/с | $ за токен/с |
|---|---|---|---|---|
| 8 × NVIDIA A100 PCIe | 640 GB | $7,906 | 37 | $213.68 |
| 8 × NVIDIA A100 SXM4 | 640 GB | $8,355 | 39 | $214.23 |
| 4 × NVIDIA H200 SXM5 | 564 GB | $8,405 | 62 | $135.56 |
| 8 × NVIDIA H100 PCIe | 640 GB | $10,568 | 38 | $278.11 |
| 8 × NVIDIA H100 SXM5 | 640 GB | $11,509 | 64 | $179.83 |
| 4 × NVIDIA B200 SXM6 | 720 GB | $11,790 | 103 | $114.47 |
| 8 × NVIDIA H200 SXM5 | 1128 GB | $15,945 | 91 | $175.22 |
| 8 × NVIDIA B200 SXM6 | 1440 GB | $22,351 | 152 | $147.05 |
Зелёная ячейка — лучшее соотношение цены и результата в списке, и это не самая дешёвая строка. Переход от $7,906 к $11,790 умножает счёт на 1.5×, а пропускную способность — на 2.8× — вы платите больше, а каждый токен обходится дешевле. Сортировать каталог по цене и брать первую подходящую машину — верный способ потратить бюджет на обслуживание дважды.
Одна оговорка насчёт этого столбца, и она применима к любой таблице цены за пропускную способность, которую вы когда-либо прочтёте: здесь используется генерация в один поток. При непрерывном батчинге совокупная скорость в каждой строке растёт в несколько раз, и растёт не в одинаковое число раз — узел, у которого после весов остаётся больше свободной памяти, вмещает больше параллельных последовательностей. Порядок в рейтинге устойчив; абсолютные цифры консервативны. Экономику этой совокупной скорости мы разбираем отдельно.
Когда смесь экспертов — правильный выбор
По порядку. Остановитесь на первой строке, которая описывает вас.
- Если плотная модель помещается на одну карту, этого достаточно. Берите её и не оглядывайтесь. Одна карта означает отсутствие разделения между картами, вопроса об интерконнекте и трафика маршрутизации экспертов, а также машину, которая стоит малую долю цены узла. Большинству продуктов, которым кажется, что им нужна передовая открытая модель, на самом деле нужна хорошая модель на 32B.
- Вам нужно качество, а контекст у вас длинный. Вот где смесь экспертов — действительно лучший из доступных инструментов: вы платите один раз за веса, а маленький кэш означает, что машина продолжает обслуживать длинные разговоры, не падая. Подбирайте узел по весам, а затем проверяйте таблицу кэша для вашего реального контекста.
- Вам нужно качество, и вы обслуживаете много людей одновременно. Тот же ответ и та же причина, и преимущество растёт с параллелизмом. Фиксированные затраты амортизируются на все потоки, а затраты на каждый поток остаются низкими.
- Вам нужно качество, но лишь изредка. Тогда вы арендуете большой узел, чтобы держать его прогретым несколько часов в неделю, — а это худшее из возможных применений месячного срока. Либо соберите работу в один присест, либо используйте для неё готовый эндпоинт, а собственную машину оставьте для постоянной нагрузки.
- Вы хотите её файнтюнить. Это другая задача и более крупная машина: обучение затрагивает каждого эксперта и требует состояния оптимизатора для всех них, поэтому память, которая при инференсе была лишь неудобством, становится непозволительной. Адаптерный файнтюнинг плотной модели — реалистичный путь почти для всех.
На какой бы строке вы ни остановились, первое число, которое нужно проверить, — это общее число параметров в той точности, в которой вы собираетесь их обслуживать. Всё остальное на этой странице — скорость, кэш, цена за токен в секунду — становится важным только после того, как модель уже загружена в память. Конфигуратор проводит полную проверку по каждому узлу, который мы сдаём в аренду, и применяет к оценке пропускной способности ту же поправку на маршрутизацию, что и таблицы выше. Если вы хотите сначала увидеть арифметику памяти целиком, для этого есть отдельное руководство; а если вы ещё не определились с форматом чисел, этот выбор нужно сделать раньше.
Проверьте свою собственную смесь экспертов на реальных машинах.
Конфигуратор содержит все узлы, которые мы сдаём в аренду, применяет ту же арифметику, что и эта страница, и говорит вам, какие из них вмещают вашу модель, прежде чем вы хоть за что-то заплатите.
Другие руководства
- Стоимость · 6 мин
Когда помесячная аренда выгоднее почасовой
Точка безубыточности на реальных цифрах, три статьи расходов, которые почасовая цена скрывает до счёта, и ловушка простоя, утраивающая оценку.
Читать руководство - Стоимость · 9 мин
Self-hosting против API с оплатой за токен
Точка безубыточности между оплатой API за токен и арендой GPU на наших ценах и пропускной способности — и четыре момента, которые арифметика не учитывает.
Читать руководство - Практика · 11 мин
Llama 3.3 70B на одном узле
От доставленной машины до OpenAI-совместимого эндпоинта: флаги, которые действительно важны, и два флага, которые незаметно вдвое снижают пропускную способность.
Читать руководство