O que uma mistura de especialistas realmente custa.
Um nome como “235B-A22B” contém dois números, e quase todo mundo lê o errado. Um deles decide o que você aluga; o outro decide a velocidade com que ele responde. A diferença entre eles pode chegar a um fator de dez.
A resposta curta
- Parâmetros totais decidem a máquina
- DeepSeek V3 671B-A37B (MoE) em 4 bits precisa de 386 GB com 8k de contexto. Um modelo denso do tamanho dos seus parâmetros ativos precisaria de 22 GB — 17.6× menos.
- Parâmetros ativos decidem a velocidade
- Apenas uma fração dos pesos é lida por token, então ela gera mais rápido do que um modelo denso de mesma massa — mas o roteamento toma de volta boa parte dessa vantagem.
- O nó mais barato que o comporta
- 8 × NVIDIA A100 PCIe a $7,906 por mês. Quase nunca é o certo para alugar.
- O que vale a pena alugar
- 4 × NVIDIA B200 SXM6 a $11,790 — 1.5× o preço por 2.8× o throughput.
A versão resumida
Uma mistura de especialistas divide a parte feed-forward de cada camada em muitas redes pequenas e envia cada token por apenas alguns deles. O nome publicado registra os dois fatos: o número total de parâmetros, e o número que fica ativo para cada token. Você precisa manter todo o primeiro na memória, e só lê o segundo por token. Essa única frase é o guia inteiro, e invertê-la é o erro mais caro que vemos as pessoas cometerem antes de finalizar um pedido.
A consequência é um modelo com um formato de custo estranho: ele é alugado como um gigante e roda como um modelo de porte médio. Se isso é uma vantagem ou uma armadilha depende inteiramente de qual dos dois números é o seu gargalo.
Dimensionando a máquina? Use o total. Todo especialista precisa estar residente, porque não é possível saber de antemão quais serão necessários para o próximo token. O roteamento é decidido por token, em tempo de execução.
Estimando a velocidade? Comece pela contagem de ativos, depois aplique um desconto grande. A geração lê apenas os pesos ativos, que é exatamente o ponto — mas o roteador, o despacho aos especialistas e o tráfego entre placas não são gratuitos, e escalam mal ao longo de um nó.
Está servindo contexto longo ou muitos usuários? Olhe para o design da atenção, não para a contagem de parâmetros. Os maiores modelos desta página têm o menor cache de chave/valor por token, e a partir de um certo comprimento isso inverte o ranking por completo.
Só quer a qualidade? Um modelo denso que cabe em uma placa é mais fácil, mais barato e mais rápido de operar do que uma mistura de especialistas dividida entre oito placas. Recorra a um MoE quando nada denso oferece a resposta que você precisa, não porque o nome parece impressionante.
A aritmética abaixo é a mesma que o configurador roda, sobre o mesmo catálogo. Se você ainda não calculou quanta memória um modelo precisa no geral, essa fórmula vem primeiro — esta página é o que muda quando o modelo é uma mistura de especialistas.
Lendo o nome
Três convenções de nomenclatura estão em circulação, e todas codificam o mesmo par de números, por isso a confusão persiste. Depois que você souber lê-las, a questão do dimensionamento se resolve sozinha.
| Modelo | Parâmetros totais | Ativos por token | Parcela de ativos |
|---|---|---|---|
| Mixtral 8×22B (MoE) | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) | 671 B | 37 B | 6 % |
| Llama 3.3 70B | 70 B | 70 B | 100 % |
A última coluna é a que você deve lembrar. Um modelo denso lê tudo o que armazena; uma mistura de especialistas lê uma fatia. Tudo o que há de estranho nesses modelos — bom e ruim — vem dessa única linha.
A memória que você realmente aluga
Aqui está toda a armadilha em uma única tabela. A coluna do meio é o que o modelo precisa na máquina; a coluna seguinte é o que um leitor que tomasse o número de ativos ao pé da letra teria orçado. A última coluna é a conta dessa leitura errada.
| Modelo | Pesos em 4 bits | Total necessário | Se tivesse o tamanho ativo | Excesso |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB | 22 GB | 17.6× |
Leia a última coluna como um erro de compra. Quem dimensiona apenas pela contagem de ativos sairia procurando uma única placa e acabaria precisando de um nó inteiro — não uma máquina um pouco maior, mas uma categoria de máquina diferente, a um preço diferente.
O que os parâmetros ativos compram
A geração é limitada pela largura de banda de memória: cada novo token exige reler os pesos que participam dele. Uma mistura de especialistas lê apenas sua fatia ativa, então o teto da sua velocidade é definido por um número muito menor do que seu tamanho sugere. Essa parte da promessa é real, e é por isso que esses modelos existem.
A tabela abaixo coloca todos os modelos na mesma máquina — 8 × NVIDIA A100 PCIe a $7,906 por mês, o nó mais barato do nosso catálogo que comporta todos eles ao mesmo tempo. Comparar números de throughput obtidos em máquinas diferentes não compara nada.
| Modelo | Total | Leitura por token | Tokens/s estimados |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) | 671 B | 18.5 GB | 37 |
| Llama 3.1 405B | 405 B | 202.5 GB | 19 |
| Qwen 3 235B-A22B (MoE) | 235 B | 11.0 GB | 62 |
| Mixtral 8×22B (MoE) | 141 B | 19.5 GB | 35 |
| Llama 3.3 70B | 70 B | 35.0 GB | 25 |
As duas linhas que vale a pena comparar são a maior mistura de especialistas e o maior modelo denso, porque ambos são divididos pelo nó inteiro. A mistura é o modelo maior, por uma margem ampla, e mesmo assim gera mais rápido, já que lê apenas uma fração de si mesma por token — essa é a troca que a arquitetura existe para fazer. Leia de forma diferente as linhas marcadas como em uma placa: esses modelos ocupam uma única placa do nó e deixam as outras sete livres, o que é uma máquina mais barata esperando para ser escolhida, não uma mais lenta.
A segunda coisa que a aritmética esconde é que uma mistura de especialistas é mais difícil de dividir bem entre placas. Um modelo denso dividido entre placas sincroniza uma vez por camada; uma mistura também precisa rotear tokens para a placa que guarda o especialista escolhido, o que é um padrão de tráfego diferente e menos previsível. Esta é uma das poucas cargas de trabalho em que a interconexão realmente justifica seu preço, em vez de apenas aparecer na fatura.
A metade que fica mais barata
Até agora, tudo foram más notícias para os modelos grandes. Eis a compensação, e é uma grande, que quase nenhuma comparação menciona: os modelos com mais parâmetros nesta página têm o menor cache de chave/valor por token. O cache é definido pelo design da atenção — camadas, cabeças de chave/valor, dimensão da cabeça — e não tem nada a ver com quantos especialistas ficam por trás da atenção.
| Modelo | Cache por token | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |
Essas colunas são por requisição simultânea. Multiplique pelo número de pessoas usando o endpoint ao mesmo tempo, e o ranking na última coluna decide sua máquina muito mais do que os pesos.
A leitura prática: os pesos são uma taxa de entrada fixa, o cache é o custo de operação. Uma mistura de especialistas cobra uma taxa de entrada enorme e depois um custo de operação pequeno por usuário. Um modelo denso de capacidade comparável funciona ao contrário. Qual dos dois é mais barato para você depende da concorrência e do comprimento de contexto, não da contagem de parâmetros na ficha do modelo.
Quais máquinas os comportam
Em 4 bits, com o contexto de referência, considerando o nó mais barato do nosso catálogo que comporta cada modelo — seja em uma placa ou dividido pelo nó. Estes são os bilhetes de entrada, não recomendações; a próxima seção explica o porquê.
| Modelo | Necessário | Nó mais barato que o comporta | Por mês | Tokens/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | 4 × NVIDIA L4 | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | 8 × NVIDIA L4 | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | 8 × NVIDIA A100 PCIe | $7,906 | 37 |
Cada um destes é um nó de várias placas, e essa é a manchete honesta desta página: nada em nosso catálogo comporta um desses modelos em uma única placa, por menor que a contagem de ativos os faça parecer. O catálogo completo tem o restante das configurações, e o configurador vai rodar essa mesma verificação com o seu próprio modelo e contexto.
O nó mais barato é o errado
Caber é um limiar, não uma meta. Uma vez que um modelo é dividido entre as placas de um nó, o throughput depende da largura de banda de memória dessas placas — e a largura de banda por dólar varia por mais de um fator de dois entre configurações que atendem à mesma exigência de memória. Aqui está DeepSeek V3 671B-A37B (MoE) em cada nó que o comporta, ordenado por preço, com a única coluna que importa à direita.
| Configuração | VRAM | Por mês | Tokens/s | $ por token/s |
|---|---|---|---|---|
| 8 × NVIDIA A100 PCIe | 640 GB | $7,906 | 37 | $213.68 |
| 8 × NVIDIA A100 SXM4 | 640 GB | $8,355 | 39 | $214.23 |
| 4 × NVIDIA H200 SXM5 | 564 GB | $8,405 | 62 | $135.56 |
| 8 × NVIDIA H100 PCIe | 640 GB | $10,568 | 38 | $278.11 |
| 8 × NVIDIA H100 SXM5 | 640 GB | $11,509 | 64 | $179.83 |
| 4 × NVIDIA B200 SXM6 | 720 GB | $11,790 | 103 | $114.47 |
| 8 × NVIDIA H200 SXM5 | 1128 GB | $15,945 | 91 | $175.22 |
| 8 × NVIDIA B200 SXM6 | 1440 GB | $22,351 | 152 | $147.05 |
A célula verde é o melhor custo-benefício da lista, e não é a linha mais barata. Ir de $7,906 para $11,790 multiplica a fatura por 1.5× e o throughput por 2.8× — você paga mais, e cada token custa menos. Ordenar um catálogo por preço e escolher a primeira máquina que cabe é a forma como um orçamento de serving acaba sendo gasto duas vezes.
Uma ressalva sobre essa coluna, válida para qualquer tabela de preço por throughput que você venha a ler: ela usa geração em fluxo único. Sob processamento contínuo por lotes, o agregado sobe várias vezes mais em cada linha, e não sobe pelo mesmo múltiplo em todas — um nó com mais memória livre depois dos pesos comporta mais sequências simultâneas. O ranking é estável; os valores absolutos são conservadores. A economia desse agregado é discutida separadamente.
Quando uma mistura de especialistas é a resposta certa
Em ordem. Pare na primeira linha que descreve você.
- Um modelo denso que cabe em uma placa já resolve. Nesse caso, escolha-o e não olhe para trás. Uma única placa significa nenhum sharding, nenhuma questão de interconexão, nenhum tráfego de roteamento entre especialistas, e uma máquina que custa uma fração de um nó. A maioria dos produtos que pensa precisar de um modelo aberto de fronteira precisa mesmo é de um bom 32B.
- Você precisa da qualidade e seu contexto é longo. É aqui que uma mistura de especialistas é genuinamente o melhor instrumento disponível: você paga uma vez pelos pesos, e o cache pequeno faz a máquina continuar servindo conversas longas sem travar. Dimensione o nó pelos pesos, depois confira a tabela de cache para o seu contexto real.
- Você precisa da qualidade e atende muitas pessoas ao mesmo tempo. Mesma resposta, mesmo motivo, e a vantagem cresce com a concorrência. O custo fixo é amortizado entre todos os fluxos, enquanto o custo por fluxo permanece baixo.
- Você precisa da qualidade, mas só ocasionalmente. Nesse caso, você estaria alugando um nó grande só para mantê-lo aquecido por algumas horas por semana, o pior uso possível de um prazo mensal. Ou agrupe o trabalho para rodar tudo de uma vez, ou use um endpoint hospedado para esse caso e reserve sua própria máquina para a carga constante.
- Você quer fazer fine-tuning de um. Problema diferente, máquina maior: o treinamento toca todo especialista e precisa do estado do otimizador para todos eles, então a memória que já complicava a inferência se torna proibitiva. O fine-tuning de adaptadores em um modelo denso é o caminho realista para quase todo mundo.
Qualquer que seja a linha em que você parou, o primeiro número a conferir é a contagem total de parâmetros, na precisão que você pretende usar para servir. Tudo o mais nesta página — a velocidade, o cache, o preço por token por segundo — só passa a importar quando o modelo está residente. O configurador roda essa verificação inteira contra cada nó que alugamos, e aplica a mesma correção de roteamento à estimativa de throughput que as tabelas acima. Se preferir ver a aritmética de memória completa primeiro, ela é um guia à parte; se você ainda não decidiu um formato numérico, essa escolha vem antes desta.
Compare sua própria mistura de especialistas com máquinas reais.
O configurador conhece cada nó que alugamos, aplica a mesma aritmética desta página, e diz quais deles comportam o seu modelo antes de você pagar qualquer coisa.
Outros guias
- Custo · 6 min
Quando o aluguel mensal supera o por hora
O ponto de equilíbrio calculado com números reais, três custos que um preço por hora esconde até a fatura, e a armadilha do tempo ocioso que triplica uma estimativa.
Ler o guia - Custo · 9 min
Hospedagem própria contra uma API por token
O ponto de equilíbrio entre pagar uma API por token e alugar uma GPU, calculado com nossos preços e throughput — e as quatro coisas que a aritmética deixa de fora.
Ler o guia - Prática · 11 min
Servindo o Llama 3.3 70B em um nó
De uma máquina entregue a um endpoint compatível com OpenAI, com as flags que importam e as duas que reduzem seu throughput pela metade, silenciosamente.
Ler o guia