Расчёт · руководство · 10 мин на чтение

# Во что смесь экспертов обходится на самом деле.

Название вроде «235B-A22B» содержит два числа, и почти все читают не то, что нужно. Одно из них решает, что вы арендуете; другое — насколько быстро это отвечает. Между ними может быть десятикратная разница.

Коротко

- **Общее число параметров определяет машину:** **DeepSeek V3 671B-A37B (MoE)** в 4-bit нужно **386 GB** при контексте 8k. Плотной модели размером с её *активные* параметры потребовалось бы 22 GB — на **17.6×** меньше.
- **Активные параметры определяют скорость:** На каждый токен читается лишь часть весов, поэтому генерация идёт быстрее, чем у плотной модели той же массы — но маршрутизация тут же забирает обратно большую часть этого преимущества.
- **Самый дешёвый узел, который её вмещает:** [8 × NVIDIA A100 PCIe](https://gpuserver.io/ru/gpu/a100-80gb) за **$7,906** в месяц. Это почти никогда не тот вариант, который стоит арендовать.
- **Тот, который стоит арендовать:** [4 × NVIDIA B200 SXM6](https://gpuserver.io/ru/gpu/b200) за **$11,790** — 1.5× денег за 2.8× пропускной способности.

## Коротко

Смесь экспертов разбивает feed-forward часть каждого слоя на множество небольших сетей и пропускает каждый токен лишь через немногие из них. Опубликованное название фиксирует оба факта: общее число параметров и число тех, что активны для любого отдельного токена. *Первое нужно целиком держать в памяти, а второе — читать только на каждый токен.* Это одно предложение — весь смысл руководства, и перепутать их местами — самая дорогая ошибка, которую мы видим у людей ещё до оформления заказа.

В результате получается модель со странной структурой затрат: арендуется она как гигант, а работает как модель среднего размера. Выгода это или ловушка, целиком зависит от того, какое из этих двух чисел оказывается вашим узким местом.

**Подбираете размер машины?** Используйте общее число параметров. Каждый эксперт должен находиться в памяти, потому что заранее нельзя знать, какие из них понадобятся следующему токену. Маршрутизация решается на уровне токена, во время выполнения.

**Оцениваете скорость?** Начните с числа активных параметров, а затем сделайте большую скидку. Генерация читает только активные веса — в этом весь смысл, но маршрутизатор, диспетчеризация экспертов и трафик между картами обходятся не бесплатно и плохо масштабируются в пределах узла.

**Обслуживаете длинный контекст или много пользователей?** Смотрите на то, как устроено внимание, а не на число параметров. У самых крупных моделей на этой странице *самый маленький* KV-кэш на токен, и после определённой длины это полностью переворачивает рейтинг.

**Нужно только качество?** Плотная модель, которая помещается на одну карту, проще, дешевле и быстрее в эксплуатации, чем смесь экспертов, разделённая между восемью картами. Обращайтесь к MoE, когда ни одна плотная модель не даёт нужного вам ответа, а не потому, что название звучит внушительно.

Арифметика ниже — та же самая, что использует [конфигуратор](https://gpuserver.io/ru/configure), по тому же каталогу. Если вы ещё не выяснили, сколько памяти вообще нужно модели, начните с [этой формулы](https://gpuserver.io/ru/guides/vram-sizing) — здесь показано, что меняется, когда модель становится смесью экспертов.

## Как читать название

В ходу три обозначения, и все они кодируют одну и ту же пару чисел, поэтому путаница и не исчезает. Как только вы научитесь их читать, вопрос подбора размера решается сам собой.

235B-A22B Общее число, затем активное Самое понятное обозначение из трёх. 235 миллиардов параметров живут в памяти; 22 миллиарда из них считываются для любого отдельного токена. Буква A означает *активные*, и это число, которое **не** говорит вам, что арендовать.

671B-A37B То же обозначение, но крупнее При таком размере разрыв намеренно доведён до абсурда: доля активных параметров — меньше шести процентов. Из этих 37 не следует ничего о том, какая машина вам нужна.

8×22B Число экспертов, затем размер эксперта Более старое обозначение, и то, которое вводит в заблуждение сильнее всего. Оно не означает 176 миллиардов параметров, потому что внимание и эмбеддинги общие, а не продублированные; и не означает 22 миллиарда, потому что на токен активны два эксперта, а не один.

A22B, A37B Среднее, а не гарантия Число активных параметров — это то, во что маршрутизация обходится на типичном тексте. Это не потолок: батч, чьи токены расходятся по множеству экспертов, затрагивает большую часть модели, и это одна из причин, почему измеренная пропускная способность оказывается ниже арифметической оценки.

**Модели на основе смеси экспертов в нашем каталоге для подбора размера: общее число параметров против активных**

| Модель | Всего параметров | Активные на токен | Доля активных |
|---|---|---|---|
| Mixtral 8×22B (MoE) 56 слоёв | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) 94 слоёв | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) 61 слоёв | 671 B | 37 B | 6 % |
| Llama 3.3 70B Плотная, для сравнения | 70 B | 70 B | 100 % |

Последний столбец — тот, который стоит запомнить. Плотная модель читает всё, что хранит; смесь экспертов читает лишь срез. Всё необычное в этих моделях — и хорошее, и плохое — вытекает именно из этой строки.

## Память, которую вы арендуете на самом деле

Вот вся ловушка в одной таблице. Средний столбец — это то, что модели нужно на машине; следующий за ним столбец — это то, на что заложился бы читатель, воспринявший число активных параметров буквально. Последний столбец — счёт за это неверное прочтение.

**Сколько VRAM нужно при 4-bit с контекстом 8k, против того, что предполагает число активных параметров**

| Модель | Веса при 4-bit | Всего требуется | Если бы считать по активному размеру | Перерасход |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB при 8k | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB при 8k | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB при 8k | 22 GB | 17.6× |

Читайте последний столбец как ошибку в покупке. Тот, кто подбирает размер только по числу активных параметров, отправится искать одну карту, а в итоге ему понадобится целый узел — не чуть более крупная машина, а машина совершенно другой категории и другой цены.

**Нет, вы не можете держать неиспользуемых экспертов на диске.** Это первое, что приходит в голову всем, и серверные стеки инференса действительно это предлагают. Проблема в том, что маршрутизация решается на уровне токена: набор нужных экспертов меняется по несколько раз на каждое сгенерированное слово, поэтому карта, которая держит лишь часть, тратит время на подкачку весов через PCIe вместо вычислений. В результате модель не немного медленнее — она работает на малой доле своей скорости. Подкачка — способ заставить модель *запуститься* на машине, которая не может её вместить, а не способ её *обслуживать*.

## Что покупают активные параметры

Генерация ограничена пропускной способностью памяти: каждый новый токен требует повторного чтения весов, которые в нём участвуют. Смесь экспертов читает только свой активный срез, поэтому потолок её скорости задаётся числом намного меньшим, чем предполагает её размер. Эта часть обещания — правда, и именно поэтому такие модели вообще существуют.

Таблица ниже помещает каждую модель на *одну и ту же* машину — [8 × NVIDIA A100 PCIe](https://gpuserver.io/ru/gpu/a100-80gb) за $7,906 в месяц, самый дешёвый узел в нашем каталоге, который вмещает их все одновременно. Сравнивать цифры пропускной способности, снятые на разных машинах, — не сравнивать ничего.

**Генерация в один поток на одном узле: смеси экспертов против плотных моделей**

| Модель | Всего | Чтение на токен | Расчётные токены/с |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) Смесь экспертов · разделено между 8 картами | 671 B | 18.5 GB | 37 один поток |
| Llama 3.1 405B Плотная · разделено между 8 картами | 405 B | 202.5 GB | 19 один поток |
| Qwen 3 235B-A22B (MoE) Смесь экспертов · разделено между 8 картами | 235 B | 11.0 GB | 62 один поток |
| Mixtral 8×22B (MoE) Смесь экспертов · разделено между 8 картами | 141 B | 19.5 GB | 35 один поток |
| Llama 3.3 70B Плотная · на одной карте | 70 B | 35.0 GB | 25 один поток |

Две строки, которые стоит сравнить, — это самая крупная смесь экспертов и самая крупная плотная модель, потому что обе разделены между всеми картами узла. Смесь — модель значительно крупнее, и всё же она генерирует быстрее, поскольку читает на каждый токен лишь свою часть — ради этого компромисса архитектура и существует. Строки с пометкой *на одной карте* читайте иначе: эти модели занимают всего одну карту узла и оставляют свободными остальные семь, а это более дешёвая машина, которую можно выбрать, а не более медленная.

**Эти цифры уже несут в себе большой штраф, и так и должно быть.** Чистая арифметика по активным параметрам сильно завышает прогноз для смеси экспертов. Наша первая версия этого расчёта именно так и ошибалась — почти в пять раз против опубликованных измерений для самой крупной модели на этой странице. Маршрутизация стоит отдельного прохода, экспертам приходится обмениваться активациями между картами на каждом слое, а батч затрагивает больше экспертов, чем предполагает среднее значение. Теперь расчёт применяет намеренно консервативную поправку, откалиброванную по измеренным цифрам, а не подобранную — поэтому он скорее занижает, чем завышает. Считайте каждое число здесь нижней границей, которую нужно превзойти на реальной машине, а не целевым показателем для планирования.

Второе, что скрывает арифметика: смесь экспертов сложнее качественно разделить между картами. Плотная модель, разделённая между картами, синхронизируется один раз за слой; смеси же приходится ещё и направлять токены на ту карту, где находится нужный эксперт, а это другой и менее предсказуемый характер трафика. Это одна из немногих нагрузок, где [интерконнект по-настоящему оправдывает свою цену](https://gpuserver.io/ru/guides/nvlink-vs-pcie), а не просто фигурирует в счёте.

## Половина, которая дешевеет

До сих пор все новости были плохими для крупных моделей. Вот компенсация, и она значительная, хотя её почти никогда не упоминают при сравнении: у моделей с наибольшим числом параметров на этой странице *самый маленький* KV-кэш на токен. Кэш задаётся устройством внимания — слоями, KV-головами, размерностью головы — и никак не зависит от того, сколько экспертов стоит за вниманием.

**KV-кэш на токен и во что обходится один поток на каждой длине контекста**

| Модель | Кэш на токен | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) 8 KV-голов | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) 4 KV-голов | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) Latent attention | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B 8 KV-голов | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B 8 KV-голов | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |

Эти столбцы даны в расчёте на *один параллельный запрос*. Умножьте на число людей, использующих эндпоинт одновременно, — и рейтинг в последнем столбце определяет вашу машину куда сильнее, чем веса.

**У DeepSeek V3 671B-A37B (MoE) — самый маленький кэш в списке: 70 KiB на токен.** По сравнению с Llama 3.3 70B при 320 KiB это разница в **4.6×** раз в пользу более крупной модели. Она сжимает кэш, проецируя ключи и значения в маленький общий латентный вектор вместо того, чтобы хранить их по каждой голове. Поэтому модель, которую дороже всего загрузить, — та же самая, которую дешевле всего держать занятой — и именно поэтому она остаётся пригодной для длинного контекста, и именно поэтому арифметика переворачивается, как только вы обслуживаете больше, чем горстку людей одновременно.

Практический смысл таков: веса — это фиксированный входной билет, а кэш — текущие расходы. Смесь экспертов берёт огромную плату за вход, а затем небольшую текущую плату за каждого пользователя. Плотная модель сравнимого качества устроена наоборот. Что из двух окажется для вас дешевле, решают параллелизм и длина контекста, а не число параметров на карточке модели.

## Какие машины их вмещают

При 4-bit, при опорном контексте и с учётом самого дешёвого узла в нашем каталоге, который вмещает каждую модель — будь то на одной карте или разделённой между картами узла. Это входные билеты, а не рекомендации; следующий раздел объясняет почему.

**Самая дешёвая конфигурация в нашей аренде, которая вмещает каждую модель на основе смеси экспертов**

| Модель | Требуется | Самый дешёвый узел, который её вмещает | В месяц | Токены/с |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | [4 × NVIDIA L4](https://gpuserver.io/ru/gpu/nvidia-l4) 96 GB всего · 24 GB на карту | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | [8 × NVIDIA L4](https://gpuserver.io/ru/gpu/nvidia-l4) 192 GB всего · 24 GB на карту | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | [8 × NVIDIA A100 PCIe](https://gpuserver.io/ru/gpu/a100-80gb) 640 GB всего · 80 GB на карту | $7,906 | 37 |

Каждая из них — многокарточный узел, и это честный итог этой страницы: ничто в нашем каталоге не вмещает такую модель на одной карте, какой бы маленькой её ни делало число активных параметров. [Полный каталог](https://gpuserver.io/ru/#catalog) содержит остальные конфигурации, а [конфигуратор](https://gpuserver.io/ru/configure) проведёт ту же самую проверку для вашей модели и контекста.

## Самый дешёвый узел — неверный выбор

Помещаться в память — это порог, а не цель. Как только модель разделена между картами узла, пропускная способность зависит от пропускной способности памяти тех карт, между которыми она разделена — а пропускная способность на доллар отличается более чем вдвое между конфигурациями, которые в равной мере проходят один и тот же порог по памяти. Вот DeepSeek V3 671B-A37B (MoE) на каждом узле, который её вмещает, отсортированные по цене, с единственным по-настоящему важным столбцом справа.

**Каждый узел, который вмещает DeepSeek V3 671B-A37B (MoE), с месячной ценой за один токен в секунду**

| Конфигурация | VRAM | В месяц | Токены/с | $ за токен/с |
|---|---|---|---|---|
| [8 × NVIDIA A100 PCIe](https://gpuserver.io/ru/gpu/a100-80gb) GN-A10080×8 | 640 GB | $7,906 | 37 | $213.68 |
| [8 × NVIDIA A100 SXM4](https://gpuserver.io/ru/gpu/a100-sxm4) GN-A100SXM×8 | 640 GB | $8,355 | 39 | $214.23 |
| [4 × NVIDIA H200 SXM5](https://gpuserver.io/ru/gpu/h200) GN-H200×4 | 564 GB | $8,405 | 62 | $135.56 |
| [8 × NVIDIA H100 PCIe](https://gpuserver.io/ru/gpu/h100-pcie) GN-H100PCIE×8 | 640 GB | $10,568 | 38 | $278.11 |
| [8 × NVIDIA H100 SXM5](https://gpuserver.io/ru/gpu/h100-sxm5) GN-H100SXM×8 | 640 GB | $11,509 | 64 | $179.83 |
| [4 × NVIDIA B200 SXM6](https://gpuserver.io/ru/gpu/b200) GN-B200×4 | 720 GB | $11,790 | 103 | $114.47 |
| [8 × NVIDIA H200 SXM5](https://gpuserver.io/ru/gpu/h200) GN-H200×8 | 1128 GB | $15,945 | 91 | $175.22 |
| [8 × NVIDIA B200 SXM6](https://gpuserver.io/ru/gpu/b200) GN-B200×8 | 1440 GB | $22,351 | 152 | $147.05 |

Зелёная ячейка — лучшее соотношение цены и результата в списке, и это не самая дешёвая строка. Переход от $7,906 к $11,790 умножает счёт на 1.5×, а пропускную способность — на 2.8× — вы платите больше, а каждый токен обходится дешевле. Сортировать каталог по цене и брать первую подходящую машину — верный способ потратить бюджет на обслуживание дважды.

Одна оговорка насчёт этого столбца, и она применима к любой таблице цены за пропускную способность, которую вы когда-либо прочтёте: здесь используется генерация в один поток. При непрерывном батчинге совокупная скорость в каждой строке растёт в несколько раз, и растёт не в одинаковое число раз — узел, у которого после весов остаётся больше свободной памяти, вмещает больше параллельных последовательностей. Порядок в рейтинге устойчив; абсолютные цифры консервативны. [Экономику этой совокупной скорости](https://gpuserver.io/ru/guides/api-vs-self-hosting) мы разбираем отдельно.

## Когда смесь экспертов — правильный выбор

По порядку. Остановитесь на первой строке, которая описывает вас.

1. **Если плотная модель помещается на одну карту, этого достаточно.** Берите её и не оглядывайтесь. Одна карта означает отсутствие разделения между картами, вопроса об интерконнекте и трафика маршрутизации экспертов, а также машину, которая стоит малую долю цены узла. Большинству продуктов, которым кажется, что им нужна передовая открытая модель, на самом деле нужна хорошая модель на 32B.
2. **Вам нужно качество, а контекст у вас длинный.** Вот где смесь экспертов — действительно лучший из доступных инструментов: вы платите один раз за веса, а маленький кэш означает, что машина продолжает обслуживать длинные разговоры, не падая. Подбирайте узел по весам, а затем проверяйте таблицу кэша для вашего реального контекста.
3. **Вам нужно качество, и вы обслуживаете много людей одновременно.** Тот же ответ и та же причина, и преимущество растёт с параллелизмом. Фиксированные затраты амортизируются на все потоки, а затраты на каждый поток остаются низкими.
4. **Вам нужно качество, но лишь изредка.** Тогда вы арендуете большой узел, чтобы держать его прогретым несколько часов в неделю, — а это худшее из возможных применений месячного срока. Либо соберите работу в один присест, либо используйте для неё готовый эндпоинт, а собственную машину оставьте для постоянной нагрузки.
5. **Вы хотите её файнтюнить.** Это другая задача и более крупная машина: обучение затрагивает каждого эксперта и требует состояния оптимизатора для всех них, поэтому память, которая при инференсе была лишь неудобством, становится непозволительной. [Адаптерный файнтюнинг](https://gpuserver.io/ru/guides/lora-finetune) плотной модели — реалистичный путь почти для всех.

На какой бы строке вы ни остановились, первое число, которое нужно проверить, — это общее число параметров в той точности, в которой вы собираетесь их обслуживать. Всё остальное на этой странице — скорость, кэш, цена за токен в секунду — становится важным только после того, как модель уже загружена в память. [Конфигуратор](https://gpuserver.io/ru/configure) проводит полную проверку по каждому узлу, который мы сдаём в аренду, и применяет к оценке пропускной способности ту же поправку на маршрутизацию, что и таблицы выше. Если вы хотите сначала увидеть арифметику памяти целиком, [для этого есть отдельное руководство](https://gpuserver.io/ru/guides/vram-sizing); а если вы ещё не определились с форматом чисел, [этот выбор нужно сделать раньше](https://gpuserver.io/ru/guides/awq-vs-gptq-vs-fp8).

## Проверьте свою собственную смесь экспертов на реальных машинах.

Конфигуратор содержит все узлы, которые мы сдаём в аренду, применяет ту же арифметику, что и эта страница, и говорит вам, какие из них вмещают вашу модель, прежде чем вы хоть за что-то заплатите.

[Открыть конфигуратор](https://gpuserver.io/ru/configure) [Читать руководства](https://gpuserver.io/ru/guides)

## Другие руководства

- [Стоимость · 6 мин Когда помесячная аренда выгоднее почасовой Точка безубыточности на реальных цифрах, три статьи расходов, которые почасовая цена скрывает до счёта, и ловушка простоя, утраивающая оценку. Читать руководство](https://gpuserver.io/ru/guides/monthly-vs-hourly)
- [Стоимость · 9 мин Self-hosting против API с оплатой за токен Точка безубыточности между оплатой API за токен и арендой GPU на наших ценах и пропускной способности — и четыре момента, которые арифметика не учитывает. Читать руководство](https://gpuserver.io/ru/guides/api-vs-self-hosting)
- [Практика · 11 мин Llama 3.3 70B на одном узле От доставленной машины до OpenAI-совместимого эндпоинта: флаги, которые действительно важны, и два флага, которые незаметно вдвое снижают пропускную способность. Читать руководство](https://gpuserver.io/ru/guides/serve-llama-70b)

---

Источник: https://gpuserver.io/ru/guides/mixture-of-experts/. Этот файл формируется на основе тех же данных, что и сайт; если цифра здесь отличается от страницы сайта, приоритет у страницы, а этот файл устарел — канонический источник: https://gpuserver.io/.
