Todos os 6 centros de dados operacionais

Pago em cripto · Sem verificação de identidade · Acesso root em em menos de 5 minutos

Dimensionamento guia · 10 min de leitura

Quantas pessoas uma GPU realmente atende.

Uma máquina que comporta o seu modelo não é uma máquina que atende os seus usuários. Os pesos são um pedágio, pago uma vez; o que sobra depois deles é todo o orçamento que você tem para atender pessoas. Essa sobra — não o tamanho da placa — decide a sua capacidade, e ela muda muito mais rápido do que a memória.

A resposta curta

A capacidade é a sobra, não a placa
Llama 3.3 70B em 4 bits reserva 40 GB antes de atender qualquer pessoa. Cada requisição simultânea depois dessa custa mais 2.9 GB.
Por isso a memória paga duas vezes
Na mesma placa, ir de 48 GB para 240 GB multiplica a memória por 5.0× e o número de vagas por 35×. Os pesos já estão pagos.
A pior compra da pré-seleção
NVIDIA L40S por $714 ao mês comporta 2 requisições simultâneas — $357.00 por vaga.
A melhor custa menos
4 × NVIDIA L4 por $564 comporta 19 — $29.68 por vaga, com uma fatura mais barata.

A versão resumida

Todo guia que diz se um modelo cabe está respondendo a uma pergunta sobre uma única requisição. Um produto não é uma única requisição. No momento em que duas pessoas usam o seu endpoint ao mesmo tempo, a máquina precisa de uma segunda cópia da conversa na memória — e uma terceira, e uma quadragésima — enquanto os pesos em si ficam armazenados exatamente uma vez.

Então o número que decide quantas pessoas você consegue atender não é o tamanho da placa. É o tamanho da placa menos o modelo, dividido pelo que custa uma conversa. Os dois termos são conhecidos antes de você pedir qualquer coisa, o que faz da capacidade uma das poucas coisas em machine learning que dá para calcular no papel e acertar.

Os pesos são um pedágio. Pago uma vez, na entrada, seja qual for o seu tráfego. Eles não crescem com os seus usuários e nunca voltam.

O cache de chave/valor é o aluguel. Pago por requisição simultânea, enquanto essa requisição estiver aberta, e proporcional à duração da conversa.

A capacidade é o que sobra, dividido pelo aluguel. É por isso que uma máquina com o dobro de memória muitas vezes atende dez vezes mais pessoas, em vez de apenas o dobro.

E por que a máquina mais barata que cabe costuma ser o pior custo-benefício. Ela cabe porque quase não sobra nada, e o que sobra é a única parte que você está realmente comprando.

Tudo abaixo segue a mesma aritmética do configurador, no mesmo catálogo, em 4 bits com 8k de contexto. Se a fórmula de memória em si for nova para você, ela tem um guia só dela — esta página é o que acontece com ela quando mais de uma pessoa aparece.

O que sobra depois dos pesos

Pegue o modelo de referência deste site e coloque-o em cada tamanho de nó construído a partir da mesma placa. Mesmo silício, mesmo preço por placa, tudo igual — só a quantidade de memória muda. Observe as duas últimas colunas se movendo em velocidades completamente diferentes.

Requisições simultâneas para Llama 3.3 70B em 4 bits e 8k de contexto, em cada nó construído a partir da mesma placa
Memória Sobra depois dos pesos Requisições simultâneas Por mês
NVIDIA L4 24 GB não o comporta $125
2 × NVIDIA L4 48 GB 8 GB 2 $285
4 × NVIDIA L4 96 GB 56 GB 19 $564
8 × NVIDIA L4 192 GB 152 GB 52 $1,106
10 × NVIDIA L4 240 GB 200 GB 69 $1,371

A primeira linha é a lição inteira: uma placa que nem sequer comporta os pesos não atende ninguém, e não chega nem perto. As linhas seguintes ganham memória em passos iguais e ganham vagas em passos cada vez maiores, porque o pedágio de 40 GB é pago na primeira linha e nunca mais.

A aritmética, em uma linha. vagas = (memória − pesos) ÷ cache_por_requisição. Para Llama 3.3 70B em 4 bits, isso é 40 GB de pedágio e 2.9 GB de aluguel por conversa aberta. Subtraia antes de dividir — fazer na ordem contrária é como uma máquina acaba comprada para uma demonstração e o erro só aparece em produção.

O que um usuário realmente custa

Agora os mesmos modelos, ordenados da forma como um comprador os ordena: mais barato primeiro. A última coluna é o preço mensal dividido pelo número de pessoas que a máquina comporta de uma vez — a única coluna que compara duas máquinas com honestidade quando você está construindo algo além de uma demonstração.

Uma suposição, declarada porque muda cada número: cada número de vagas vale para uma única instância do modelo distribuída por todo o nó, que é o que --tensor-parallel-size oferece. Os pesos ficam armazenados uma vez, e cada placa contribui com a sua memória restante para o mesmo pool de conversas. Rode duas cópias separadas no mesmo nó, em vez disso, e você paga o pedágio duas vezes, por um total menor de vagas.

Os dez nós mais baratos que comportam Llama 3.3 70B, com o que cada um custa por usuário simultâneo
Memória Por mês Requisições simultâneas Por usuário
2 × NVIDIA L42 placas · 24 GB cada 48 GB $285 2 $142.50
NVIDIA RTX A6000Uma placa · 48 GB 48 GB $286 2 $143.00
2 × NVIDIA RTX 40902 placas · 24 GB cada 48 GB $416 2 $208.00
4 × NVIDIA L44 placas · 24 GB cada 96 GB $564 19 $29.68
2 × NVIDIA RTX A60002 placas · 48 GB cada 96 GB $597 19 $31.42
2 × NVIDIA RTX 50902 placas · 32 GB cada 64 GB $692 8 $86.50
NVIDIA L40SUma placa · 48 GB 48 GB $714 2 $357.00
2 × NVIDIA A100 PCIe2 placas · 40 GB cada 80 GB $802 13 $61.69
4 × NVIDIA RTX 40904 placas · 24 GB cada 96 GB $814 19 $42.84
NVIDIA A100 PCIeUma placa · 80 GB 80 GB $1,091 13 $83.92

Leia as duas células coloridas junto com a sua coluna de preço. NVIDIA L40S custa $714 ao mês e comporta 2; 4 × NVIDIA L4 custa $564 — menos dinheiro — e comporta 19. Isso é 10× as vagas por 0.79× da fatura, e a mais cara é a que a maioria das pré-seleções mantém, porque é a única em que o modelo cabe em uma única placa.

Isto não é um argumento contra máquinas de uma única placa. Um modelo que cabe em uma única placa não precisa de sharding, de interconexão, nem de flags de paralelismo tensorial, e responde a um único usuário mais rápido do que o mesmo modelo dividido entre quatro placas. Se a sua carga é uma requisição de cada vez — um job em lote, uma ferramenta interna, uma demonstração — essa máquina é a compra certa, e a coluna por usuário é irrelevante para você. Essa coluna só passa a importar quando as pessoas chegam ao mesmo tempo, e a partir daí importa enormemente.

Em todo o catálogo, e não apenas nas dez primeiras linhas, o melhor preço por vaga para este modelo é 8 × NVIDIA RTX A6000 por $2,239 ao mês: 119 requisições simultâneas, a $18.82 cada. É uma fatura bem maior do que qualquer coisa na pré-seleção acima, e ainda assim é a forma mais barata de acomodar um usuário — e é essa frase que decide se você está dimensionando um produto ou um protótipo.

O tamanho do contexto é o outro multiplicador

Tudo acima presumiu 8k de contexto. Essa suposição pesa mais do que a escolha da máquina. O cache é pago por token, além de por usuário, então o mesmo nó acomoda um número completamente diferente de pessoas dependendo de quanto você deixa uma conversa crescer.

Uma máquina, quatro modelos, quatro tamanhos de contexto. O nó é 8 × NVIDIA L4 por $1,106 ao mês — o mais barato do nosso catálogo que comporta os quatro modelos ao mesmo tempo, de modo que todo número abaixo é medido contra a mesma memória.

Requisições simultâneas em um nó, por modelo e tamanho do contexto, em 4 bits
Modelo Cache por token 4k 8k 32k 128k
Llama 3.1 8B4 GB de pesos 128 KiB 325 162 40 10
Qwen 3 32B16 GB de pesos 256 KiB 150 75 18 4
Llama 3.3 70B35 GB de pesos 320 KiB 105 52 13 3
Qwen 3 235B-A22B (MoE)118 GB de pesos 188 KiB 67 33 8 2

Em uma única máquina, sem nenhuma alteração, Llama 3.3 70B passa de 105 usuários simultâneos para 3 — um fator de 35× — só por causa de um número que você define na linha de comando. Nada no hardware mudou.

Duas coisas decorrem disso. A primeira é que a coluna de contexto que você deve ler é a que você realmente atende, não a que a ficha do modelo anuncia — um modelo que suporta 128k não obriga você a reservá-lo. A segunda é que o cache por token varia enormemente entre modelos de tamanho semelhante, porque ele é definido pelo design de atenção, e não pelo número de parâmetros; os maiores modelos dessa tabela têm alguns dos menores caches, o que é o fato mais contraintuitivo de toda essa área.

Quatro formas de recuperar capacidade

Em ordem decrescente de quanto entregam pelo quanto custam. A primeira é praticamente grátis e quase sempre fica sem ser aproveitada.

Limite o contexto declaradoGrátis, e o maior ganhoOs stacks de inferência reservam cache para o tamanho máximo que você declara, não o tamanho que você usa. Declarar 128k e servir 8k desperdiça dezesseis vezes a memória que você precisava — e essa memória era toda a sua capacidade em vagas. Defina --max-model-len para o seu teto real desde o primeiro dia.
Quantize o cache para 8 bitsPraticamente dobra as vagasQuantizar os pesos para 4 bits não faz nada ao cache: ele permanece em 16 bits em todo stack comum, a menos que você peça. Pedir é uma única flag, o custo em qualidade costuma ser invisível em cargas de trabalho de chat, e a tabela abaixo mostra o que isso retorna.
Quantize ainda mais os pesosAjuda uma vez, depois paraReduzir os pesos pela metade repassa a diferença diretamente para o cache, então isso compra vagas em uma máquina lotada. Mas é um ganho único contra um pedágio fixo, e custa qualidade — qual formato custa quanto é uma decisão à parte.
Alugue a sobra, não a placaO ajuste estruturalToda alavanca acima age na margem. Migrar para um nó cuja memória excede os seus pesos por uma margem ampla muda a natureza do problema, e é a única das quatro que continua compensando conforme você cresce.
Requisições simultâneas no mesmo nó com cache de 16 bits e com cache de 8 bits, em 8k de contexto
Modelo cache de 16 bits cache de 8 bits Vagas ganhas
Llama 3.1 8B 162 325 +163
Qwen 3 32B 75 150 +75
Llama 3.3 70B 52 105 +53
Qwen 3 235B-A22B (MoE) 33 67 +34

Mesmo nó, mesmos pesos, mesmo dinheiro. A única mudança é a precisão em que o cache é armazenado, e é essa a diferença entre uma máquina que atende uma equipe e uma máquina que atende um produto.

Vagas não são o mesmo que atendimento

Uma correção antes de dimensionar qualquer coisa com os números acima, e é essa correção que mantém esta página honesta. Tudo aqui conta quantas conversas a máquina consegue manter abertas. Isso não promete que todas estejam sendo respondidas rapidamente.

Memória e largura de banda são dois tetos diferentes. Em 8 × NVIDIA L4, Llama 3.3 70B tem espaço para 52 conversas simultâneas, enquanto um único usuário sozinho nessa máquina vê cerca de 17 tokens por segundo. Preencher todas as 52 vagas não dá a cada uma delas 17 tokens por segundo — a geração compartilha a mesma largura de banda de memória, então o total agregado sobe com o processamento em lote e a taxa por usuário cai. O teto de largura de banda é atingido bem antes do teto de memória.

Use o número de vagas como teto, não como meta. Uma máquina carregada até a última vaga é uma máquina em que todo mundo está esperando. O número de vagas indica qual hardware sequer é capaz da sua concorrência — ele elimina as máquinas que não são, o que representa a maior parte da pré-seleção — e então você mede a taxa que realmente quer por usuário e se afasta do teto. Dimensionar pelo teto é o segundo erro mais comum na hora de comprar a máquina errada, logo depois de ignorar o cache por completo.

A boa notícia é que os dois tetos se movem juntos: as máquinas com uma grande quantidade de memória sobrando depois dos pesos são, com poucas exceções, também as máquinas com mais largura de banda. Escolher pela margem raramente custa velocidade. Configurar o stack de inferência na máquina que você escolher é um guia à parte, e as flags que ele cobre são onde esses números se transformam em resultado real.

Escolhendo para o seu próprio número de usuários

Em ordem. Pare na primeira linha que descrever a sua carga.

  1. Uma requisição de cada vez. Jobs em lote, uma ferramenta interna, um único desenvolvedor. Compre a máquina mais barata que comporte o modelo em uma única placa e pare de ler — toda coluna desta página responde a uma pergunta que você não tem.
  2. Um punhado de pessoas, ocasionalmente. Uma ferramenta de equipe, um produto inicial. Calcule o seu pico de requisições simultâneas, não o número de usuários: cem usuários cadastrados raramente significam mais que um punhado de simultâneos. Depois, escolha a máquina mais barata cujo número de vagas fique confortavelmente acima desse pico.
  3. Um produto real, com tráfego real. Ordene o catálogo por preço por vaga em vez de por preço, limite o seu contexto ao que você realmente atende, reduza o cache para 8 bits, e espere que a vencedora seja uma máquina que você não teria pré-selecionado pelo preço mensal.
  4. Documentos longos ou conversas longas. Leia primeiro a tabela de contexto, depois a tabela de máquinas. A partir de 32k, o cache domina tão completamente que a escolha do modelo importa menos do que o design de atenção por trás dele.
  5. Tráfego instável e imprevisível. Dimensione para o pico que você não pode falhar, porque o cache não pode ser emprestado quando se esgota — uma requisição que não tem onde colocar a sua conversa espera na fila. Se o pico for raro e enorme, uma API cobrada por token para o excedente sai mais barata do que uma máquina dimensionada para um pico que acontece duas vezes por mês.

Seja qual for a linha em que você parou, faça a subtração antes de mais nada: pegue a memória da máquina, remova os pesos do seu modelo na precisão em que você vai servir, e veja o que sobra. Essa sobra é o produto que você está alugando. O configurador roda a mesma aritmética em cada nó que operamos, e quanto custa um mês disso é calculado à parte.

Dimensione a máquina para os usuários, não para o modelo.

O configurador reúne todo nó que alugamos, roda a mesma aritmética de memória desta página, e mostra o que sobra depois que o seu modelo é carregado — antes de você pagar por qualquer coisa.

Entrar

Console, faturas e acesso fora de banda.

Ainda não tem uma conta?

Não existe cadastro separado. Sua conta é criada enquanto você faz seu primeiro pedido — você escolhe o e-mail e a senha na etapa de pagamento, e o console já está aberto quando a máquina estiver pronta.

Configurar um servidor

Language