Todos os 6 centros de dados operacionais

Pago em cripto · Sem verificação de identidade · Acesso root em em menos de 5 minutos

Dimensionamento guia · 10 min de leitura

O que uma mistura de especialistas realmente custa.

Um nome como “235B-A22B” contém dois números, e quase todo mundo lê o errado. Um deles decide o que você aluga; o outro decide a velocidade com que ele responde. A diferença entre eles pode chegar a um fator de dez.

A resposta curta

Parâmetros totais decidem a máquina
DeepSeek V3 671B-A37B (MoE) em 4 bits precisa de 386 GB com 8k de contexto. Um modelo denso do tamanho dos seus parâmetros ativos precisaria de 22 GB — 17.6× menos.
Parâmetros ativos decidem a velocidade
Apenas uma fração dos pesos é lida por token, então ela gera mais rápido do que um modelo denso de mesma massa — mas o roteamento toma de volta boa parte dessa vantagem.
O nó mais barato que o comporta
8 × NVIDIA A100 PCIe a $7,906 por mês. Quase nunca é o certo para alugar.
O que vale a pena alugar
4 × NVIDIA B200 SXM6 a $11,790 — 1.5× o preço por 2.8× o throughput.

A versão resumida

Uma mistura de especialistas divide a parte feed-forward de cada camada em muitas redes pequenas e envia cada token por apenas alguns deles. O nome publicado registra os dois fatos: o número total de parâmetros, e o número que fica ativo para cada token. Você precisa manter todo o primeiro na memória, e só lê o segundo por token. Essa única frase é o guia inteiro, e invertê-la é o erro mais caro que vemos as pessoas cometerem antes de finalizar um pedido.

A consequência é um modelo com um formato de custo estranho: ele é alugado como um gigante e roda como um modelo de porte médio. Se isso é uma vantagem ou uma armadilha depende inteiramente de qual dos dois números é o seu gargalo.

Dimensionando a máquina? Use o total. Todo especialista precisa estar residente, porque não é possível saber de antemão quais serão necessários para o próximo token. O roteamento é decidido por token, em tempo de execução.

Estimando a velocidade? Comece pela contagem de ativos, depois aplique um desconto grande. A geração lê apenas os pesos ativos, que é exatamente o ponto — mas o roteador, o despacho aos especialistas e o tráfego entre placas não são gratuitos, e escalam mal ao longo de um nó.

Está servindo contexto longo ou muitos usuários? Olhe para o design da atenção, não para a contagem de parâmetros. Os maiores modelos desta página têm o menor cache de chave/valor por token, e a partir de um certo comprimento isso inverte o ranking por completo.

Só quer a qualidade? Um modelo denso que cabe em uma placa é mais fácil, mais barato e mais rápido de operar do que uma mistura de especialistas dividida entre oito placas. Recorra a um MoE quando nada denso oferece a resposta que você precisa, não porque o nome parece impressionante.

A aritmética abaixo é a mesma que o configurador roda, sobre o mesmo catálogo. Se você ainda não calculou quanta memória um modelo precisa no geral, essa fórmula vem primeiro — esta página é o que muda quando o modelo é uma mistura de especialistas.

Lendo o nome

Três convenções de nomenclatura estão em circulação, e todas codificam o mesmo par de números, por isso a confusão persiste. Depois que você souber lê-las, a questão do dimensionamento se resolve sozinha.

235B-A22BTotal, depois ativosA mais clara das três. 235 bilhões de parâmetros residem na memória; 22 bilhões deles são lidos a cada token. A letra A significa ativo, e é o número que não diz o que você deve alugar.
671B-A37BMesma convenção, maiorNesse tamanho, a diferença se torna absurda de propósito: a parcela de ativos está abaixo de seis por cento. Nada sobre a máquina que você precisa decorre do 37.
8×22BEspecialistas, depois tamanho do especialistaA convenção mais antiga, e a que mais engana. Não significa 176 bilhões de parâmetros, porque a atenção e os embeddings são compartilhados, não duplicados; e também não significa 22 bilhões, porque dois especialistas ficam ativos por token, não um.
A22B, A37BUma média, não uma garantiaA contagem de ativos é o que o roteamento custa em texto típico. Não é um teto: um lote cujos tokens acabam se espalhando por muitos especialistas toca uma parte maior do modelo, o que é uma das razões pelas quais o throughput medido fica abaixo da aritmética.
Os modelos de mistura de especialistas do nosso catálogo de dimensionamento, parâmetros totais contra ativos
Modelo Parâmetros totais Ativos por token Parcela de ativos
Mixtral 8×22B (MoE)56 camadas 141 B 39 B 28 %
Qwen 3 235B-A22B (MoE)94 camadas 235 B 22 B 9 %
DeepSeek V3 671B-A37B (MoE)61 camadas 671 B 37 B 6 %
Llama 3.3 70BDenso, para comparação 70 B 70 B 100 %

A última coluna é a que você deve lembrar. Um modelo denso lê tudo o que armazena; uma mistura de especialistas lê uma fatia. Tudo o que há de estranho nesses modelos — bom e ruim — vem dessa única linha.

A memória que você realmente aluga

Aqui está toda a armadilha em uma única tabela. A coluna do meio é o que o modelo precisa na máquina; a coluna seguinte é o que um leitor que tomasse o número de ativos ao pé da letra teria orçado. A última coluna é a conta dessa leitura errada.

VRAM necessária em 4 bits com 8k de contexto, contra o que a contagem de parâmetros ativos sugere
Modelo Pesos em 4 bits Total necessário Se tivesse o tamanho ativo Excesso
Mixtral 8×22B (MoE) 71 GB 83 GBem 8k 24 GB 3.4×
Qwen 3 235B-A22B (MoE) 118 GB 137 GBem 8k 14 GB 9.5×
DeepSeek V3 671B-A37B (MoE) 336 GB 386 GBem 8k 22 GB 17.6×

Leia a última coluna como um erro de compra. Quem dimensiona apenas pela contagem de ativos sairia procurando uma única placa e acabaria precisando de um nó inteiro — não uma máquina um pouco maior, mas uma categoria de máquina diferente, a um preço diferente.

Não, você não pode manter os especialistas não usados no disco. É a primeira ideia que todo mundo tem, e as stacks de serving realmente oferecem isso. O problema é que o roteamento é decidido por token: o conjunto de especialistas necessário muda várias vezes a cada palavra gerada, então uma placa que guarda apenas um subconjunto passa o tempo buscando pesos que faltam pelo PCIe, em vez de computar. O resultado não é um modelo um pouco mais lento, é um que roda a uma pequena fração da sua velocidade. O offloading é uma forma de fazer um modelo rodar em uma máquina que não consegue contê-lo, não uma forma de servi-lo.

O que os parâmetros ativos compram

A geração é limitada pela largura de banda de memória: cada novo token exige reler os pesos que participam dele. Uma mistura de especialistas lê apenas sua fatia ativa, então o teto da sua velocidade é definido por um número muito menor do que seu tamanho sugere. Essa parte da promessa é real, e é por isso que esses modelos existem.

A tabela abaixo coloca todos os modelos na mesma máquina — 8 × NVIDIA A100 PCIe a $7,906 por mês, o nó mais barato do nosso catálogo que comporta todos eles ao mesmo tempo. Comparar números de throughput obtidos em máquinas diferentes não compara nada.

Geração em fluxo único em um nó, misturas de especialistas contra modelos densos
Modelo Total Leitura por token Tokens/s estimados
DeepSeek V3 671B-A37B (MoE)Mistura de especialistas · dividido entre 8 placas 671 B 18.5 GB 37um fluxo
Llama 3.1 405BDenso · dividido entre 8 placas 405 B 202.5 GB 19um fluxo
Qwen 3 235B-A22B (MoE)Mistura de especialistas · dividido entre 8 placas 235 B 11.0 GB 62um fluxo
Mixtral 8×22B (MoE)Mistura de especialistas · dividido entre 8 placas 141 B 19.5 GB 35um fluxo
Llama 3.3 70BDenso · em uma placa 70 B 35.0 GB 25um fluxo

As duas linhas que vale a pena comparar são a maior mistura de especialistas e o maior modelo denso, porque ambos são divididos pelo nó inteiro. A mistura é o modelo maior, por uma margem ampla, e mesmo assim gera mais rápido, já que lê apenas uma fração de si mesma por token — essa é a troca que a arquitetura existe para fazer. Leia de forma diferente as linhas marcadas como em uma placa: esses modelos ocupam uma única placa do nó e deixam as outras sete livres, o que é uma máquina mais barata esperando para ser escolhida, não uma mais lenta.

Esses números já carregam uma penalidade grande, e é assim que deve ser. A aritmética pura de parâmetros ativos superestima muito uma mistura de especialistas. A primeira versão do nosso estimador fazia exatamente isso, e errava por um fator de aproximadamente cinco em relação a medições publicadas para o maior modelo desta página. O roteamento custa uma passagem própria, os especialistas precisam trocar ativações entre placas a cada camada, e o lote se espalha por mais especialistas do que a média sugere. O estimador agora aplica uma correção deliberadamente conservadora, calibrada com base em números medidos em vez de escolhidos — por isso ele tende a ficar baixo, não alto. Trate cada número aqui como um piso a superar na máquina, não uma meta de planejamento.

A segunda coisa que a aritmética esconde é que uma mistura de especialistas é mais difícil de dividir bem entre placas. Um modelo denso dividido entre placas sincroniza uma vez por camada; uma mistura também precisa rotear tokens para a placa que guarda o especialista escolhido, o que é um padrão de tráfego diferente e menos previsível. Esta é uma das poucas cargas de trabalho em que a interconexão realmente justifica seu preço, em vez de apenas aparecer na fatura.

A metade que fica mais barata

Até agora, tudo foram más notícias para os modelos grandes. Eis a compensação, e é uma grande, que quase nenhuma comparação menciona: os modelos com mais parâmetros nesta página têm o menor cache de chave/valor por token. O cache é definido pelo design da atenção — camadas, cabeças de chave/valor, dimensão da cabeça — e não tem nada a ver com quantos especialistas ficam por trás da atenção.

Cache de chave/valor por token, e quanto custa um fluxo em cada comprimento de contexto
Modelo Cache por token 4k 8k 32k 128k
Mixtral 8×22B (MoE)8 cabeças KV 224 KiB 0.9 GB 1.8 GB 7.0 GB 28.0 GB
Qwen 3 235B-A22B (MoE)4 cabeças KV 188 KiB 0.7 GB 1.5 GB 5.9 GB 23.5 GB
DeepSeek V3 671B-A37B (MoE)Atenção latente 70 KiB 0.3 GB 0.5 GB 2.2 GB 8.8 GB
Llama 3.3 70B8 cabeças KV 320 KiB 1.3 GB 2.5 GB 10.0 GB 40.0 GB
Llama 3.1 405B8 cabeças KV 504 KiB 2.0 GB 3.9 GB 15.8 GB 63.0 GB

Essas colunas são por requisição simultânea. Multiplique pelo número de pessoas usando o endpoint ao mesmo tempo, e o ranking na última coluna decide sua máquina muito mais do que os pesos.

DeepSeek V3 671B-A37B (MoE) carrega o menor cache da lista, com 70 KiB por token. Em comparação com Llama 3.3 70B a 320 KiB, isso é um fator de 4.6× a favor do modelo maior. Ele comprime o cache projetando chaves e valores em um pequeno vetor latente compartilhado, em vez de armazená-los por cabeça. Assim, o modelo que custa mais para carregar é o que custa menos para manter ocupado — por isso ele continua utilizável em contexto longo, e por isso a aritmética se inverte assim que você atende mais que um punhado de pessoas ao mesmo tempo.

A leitura prática: os pesos são uma taxa de entrada fixa, o cache é o custo de operação. Uma mistura de especialistas cobra uma taxa de entrada enorme e depois um custo de operação pequeno por usuário. Um modelo denso de capacidade comparável funciona ao contrário. Qual dos dois é mais barato para você depende da concorrência e do comprimento de contexto, não da contagem de parâmetros na ficha do modelo.

Quais máquinas os comportam

Em 4 bits, com o contexto de referência, considerando o nó mais barato do nosso catálogo que comporta cada modelo — seja em uma placa ou dividido pelo nó. Estes são os bilhetes de entrada, não recomendações; a próxima seção explica o porquê.

A configuração mais barata que alugamos que comporta cada modelo de mistura de especialistas
Modelo Necessário Nó mais barato que o comporta Por mês Tokens/s
Mixtral 8×22B (MoE) 83 GB 4 × NVIDIA L496 GB no total · 24 GB por placa $564 4
Qwen 3 235B-A22B (MoE) 137 GB 8 × NVIDIA L4192 GB no total · 24 GB por placa $1,106 10
DeepSeek V3 671B-A37B (MoE) 386 GB 8 × NVIDIA A100 PCIe640 GB no total · 80 GB por placa $7,906 37

Cada um destes é um nó de várias placas, e essa é a manchete honesta desta página: nada em nosso catálogo comporta um desses modelos em uma única placa, por menor que a contagem de ativos os faça parecer. O catálogo completo tem o restante das configurações, e o configurador vai rodar essa mesma verificação com o seu próprio modelo e contexto.

O nó mais barato é o errado

Caber é um limiar, não uma meta. Uma vez que um modelo é dividido entre as placas de um nó, o throughput depende da largura de banda de memória dessas placas — e a largura de banda por dólar varia por mais de um fator de dois entre configurações que atendem à mesma exigência de memória. Aqui está DeepSeek V3 671B-A37B (MoE) em cada nó que o comporta, ordenado por preço, com a única coluna que importa à direita.

Todo nó que comporta DeepSeek V3 671B-A37B (MoE), com o preço mensal de um token por segundo
Configuração VRAM Por mês Tokens/s $ por token/s
8 × NVIDIA A100 PCIeGN-A10080×8 640 GB $7,906 37 $213.68
8 × NVIDIA A100 SXM4GN-A100SXM×8 640 GB $8,355 39 $214.23
4 × NVIDIA H200 SXM5GN-H200×4 564 GB $8,405 62 $135.56
8 × NVIDIA H100 PCIeGN-H100PCIE×8 640 GB $10,568 38 $278.11
8 × NVIDIA H100 SXM5GN-H100SXM×8 640 GB $11,509 64 $179.83
4 × NVIDIA B200 SXM6GN-B200×4 720 GB $11,790 103 $114.47
8 × NVIDIA H200 SXM5GN-H200×8 1128 GB $15,945 91 $175.22
8 × NVIDIA B200 SXM6GN-B200×8 1440 GB $22,351 152 $147.05

A célula verde é o melhor custo-benefício da lista, e não é a linha mais barata. Ir de $7,906 para $11,790 multiplica a fatura por 1.5× e o throughput por 2.8× — você paga mais, e cada token custa menos. Ordenar um catálogo por preço e escolher a primeira máquina que cabe é a forma como um orçamento de serving acaba sendo gasto duas vezes.

Uma ressalva sobre essa coluna, válida para qualquer tabela de preço por throughput que você venha a ler: ela usa geração em fluxo único. Sob processamento contínuo por lotes, o agregado sobe várias vezes mais em cada linha, e não sobe pelo mesmo múltiplo em todas — um nó com mais memória livre depois dos pesos comporta mais sequências simultâneas. O ranking é estável; os valores absolutos são conservadores. A economia desse agregado é discutida separadamente.

Quando uma mistura de especialistas é a resposta certa

Em ordem. Pare na primeira linha que descreve você.

  1. Um modelo denso que cabe em uma placa já resolve. Nesse caso, escolha-o e não olhe para trás. Uma única placa significa nenhum sharding, nenhuma questão de interconexão, nenhum tráfego de roteamento entre especialistas, e uma máquina que custa uma fração de um nó. A maioria dos produtos que pensa precisar de um modelo aberto de fronteira precisa mesmo é de um bom 32B.
  2. Você precisa da qualidade e seu contexto é longo. É aqui que uma mistura de especialistas é genuinamente o melhor instrumento disponível: você paga uma vez pelos pesos, e o cache pequeno faz a máquina continuar servindo conversas longas sem travar. Dimensione o nó pelos pesos, depois confira a tabela de cache para o seu contexto real.
  3. Você precisa da qualidade e atende muitas pessoas ao mesmo tempo. Mesma resposta, mesmo motivo, e a vantagem cresce com a concorrência. O custo fixo é amortizado entre todos os fluxos, enquanto o custo por fluxo permanece baixo.
  4. Você precisa da qualidade, mas só ocasionalmente. Nesse caso, você estaria alugando um nó grande só para mantê-lo aquecido por algumas horas por semana, o pior uso possível de um prazo mensal. Ou agrupe o trabalho para rodar tudo de uma vez, ou use um endpoint hospedado para esse caso e reserve sua própria máquina para a carga constante.
  5. Você quer fazer fine-tuning de um. Problema diferente, máquina maior: o treinamento toca todo especialista e precisa do estado do otimizador para todos eles, então a memória que já complicava a inferência se torna proibitiva. O fine-tuning de adaptadores em um modelo denso é o caminho realista para quase todo mundo.

Qualquer que seja a linha em que você parou, o primeiro número a conferir é a contagem total de parâmetros, na precisão que você pretende usar para servir. Tudo o mais nesta página — a velocidade, o cache, o preço por token por segundo — só passa a importar quando o modelo está residente. O configurador roda essa verificação inteira contra cada nó que alugamos, e aplica a mesma correção de roteamento à estimativa de throughput que as tabelas acima. Se preferir ver a aritmética de memória completa primeiro, ela é um guia à parte; se você ainda não decidiu um formato numérico, essa escolha vem antes desta.

Compare sua própria mistura de especialistas com máquinas reais.

O configurador conhece cada nó que alugamos, aplica a mesma aritmética desta página, e diz quais deles comportam o seu modelo antes de você pagar qualquer coisa.

Entrar

Console, faturas e acesso fora de banda.

Ainda não tem uma conta?

Não existe cadastro separado. Sua conta é criada enquanto você faz seu primeiro pedido — você escolhe o e-mail e a senha na etapa de pagamento, e o console já está aberto quando a máquina estiver pronta.

Configurar um servidor

Language