Quantas pessoas uma GPU realmente atende.
Uma máquina que comporta o seu modelo não é uma máquina que atende os seus usuários. Os pesos são um pedágio, pago uma vez; o que sobra depois deles é todo o orçamento que você tem para atender pessoas. Essa sobra — não o tamanho da placa — decide a sua capacidade, e ela muda muito mais rápido do que a memória.
A resposta curta
- A capacidade é a sobra, não a placa
- Llama 3.3 70B em 4 bits reserva 40 GB antes de atender qualquer pessoa. Cada requisição simultânea depois dessa custa mais 2.9 GB.
- Por isso a memória paga duas vezes
- Na mesma placa, ir de 48 GB para 240 GB multiplica a memória por 5.0× e o número de vagas por 35×. Os pesos já estão pagos.
- A pior compra da pré-seleção
- NVIDIA L40S por $714 ao mês comporta 2 requisições simultâneas — $357.00 por vaga.
- A melhor custa menos
- 4 × NVIDIA L4 por $564 comporta 19 — $29.68 por vaga, com uma fatura mais barata.
A versão resumida
Todo guia que diz se um modelo cabe está respondendo a uma pergunta sobre uma única requisição. Um produto não é uma única requisição. No momento em que duas pessoas usam o seu endpoint ao mesmo tempo, a máquina precisa de uma segunda cópia da conversa na memória — e uma terceira, e uma quadragésima — enquanto os pesos em si ficam armazenados exatamente uma vez.
Então o número que decide quantas pessoas você consegue atender não é o tamanho da placa. É o tamanho da placa menos o modelo, dividido pelo que custa uma conversa. Os dois termos são conhecidos antes de você pedir qualquer coisa, o que faz da capacidade uma das poucas coisas em machine learning que dá para calcular no papel e acertar.
Os pesos são um pedágio. Pago uma vez, na entrada, seja qual for o seu tráfego. Eles não crescem com os seus usuários e nunca voltam.
O cache de chave/valor é o aluguel. Pago por requisição simultânea, enquanto essa requisição estiver aberta, e proporcional à duração da conversa.
A capacidade é o que sobra, dividido pelo aluguel. É por isso que uma máquina com o dobro de memória muitas vezes atende dez vezes mais pessoas, em vez de apenas o dobro.
E por que a máquina mais barata que cabe costuma ser o pior custo-benefício. Ela cabe porque quase não sobra nada, e o que sobra é a única parte que você está realmente comprando.
Tudo abaixo segue a mesma aritmética do configurador, no mesmo catálogo, em 4 bits com 8k de contexto. Se a fórmula de memória em si for nova para você, ela tem um guia só dela — esta página é o que acontece com ela quando mais de uma pessoa aparece.
O que sobra depois dos pesos
Pegue o modelo de referência deste site e coloque-o em cada tamanho de nó construído a partir da mesma placa. Mesmo silício, mesmo preço por placa, tudo igual — só a quantidade de memória muda. Observe as duas últimas colunas se movendo em velocidades completamente diferentes.
| Nó | Memória | Sobra depois dos pesos | Requisições simultâneas | Por mês |
|---|---|---|---|---|
| NVIDIA L4 | 24 GB | — | não o comporta | $125 |
| 2 × NVIDIA L4 | 48 GB | 8 GB | 2 | $285 |
| 4 × NVIDIA L4 | 96 GB | 56 GB | 19 | $564 |
| 8 × NVIDIA L4 | 192 GB | 152 GB | 52 | $1,106 |
| 10 × NVIDIA L4 | 240 GB | 200 GB | 69 | $1,371 |
A primeira linha é a lição inteira: uma placa que nem sequer comporta os pesos não atende ninguém, e não chega nem perto. As linhas seguintes ganham memória em passos iguais e ganham vagas em passos cada vez maiores, porque o pedágio de 40 GB é pago na primeira linha e nunca mais.
vagas = (memória − pesos) ÷ cache_por_requisição. Para Llama 3.3 70B em 4 bits, isso é 40 GB de pedágio e 2.9 GB de aluguel por conversa aberta. Subtraia antes de dividir — fazer na ordem contrária é como uma máquina acaba comprada para uma demonstração e o erro só aparece em produção.
O que um usuário realmente custa
Agora os mesmos modelos, ordenados da forma como um comprador os ordena: mais barato primeiro. A última coluna é o preço mensal dividido pelo número de pessoas que a máquina comporta de uma vez — a única coluna que compara duas máquinas com honestidade quando você está construindo algo além de uma demonstração.
Uma suposição, declarada porque muda cada número: cada número de vagas vale para uma única instância do modelo distribuída por todo o nó, que é o que --tensor-parallel-size oferece. Os pesos ficam armazenados uma vez, e cada placa contribui com a sua memória restante para o mesmo pool de conversas. Rode duas cópias separadas no mesmo nó, em vez disso, e você paga o pedágio duas vezes, por um total menor de vagas.
| Nó | Memória | Por mês | Requisições simultâneas | Por usuário |
|---|---|---|---|---|
| 2 × NVIDIA L4 | 48 GB | $285 | 2 | $142.50 |
| NVIDIA RTX A6000 | 48 GB | $286 | 2 | $143.00 |
| 2 × NVIDIA RTX 4090 | 48 GB | $416 | 2 | $208.00 |
| 4 × NVIDIA L4 | 96 GB | $564 | 19 | $29.68 |
| 2 × NVIDIA RTX A6000 | 96 GB | $597 | 19 | $31.42 |
| 2 × NVIDIA RTX 5090 | 64 GB | $692 | 8 | $86.50 |
| NVIDIA L40S | 48 GB | $714 | 2 | $357.00 |
| 2 × NVIDIA A100 PCIe | 80 GB | $802 | 13 | $61.69 |
| 4 × NVIDIA RTX 4090 | 96 GB | $814 | 19 | $42.84 |
| NVIDIA A100 PCIe | 80 GB | $1,091 | 13 | $83.92 |
Leia as duas células coloridas junto com a sua coluna de preço. NVIDIA L40S custa $714 ao mês e comporta 2; 4 × NVIDIA L4 custa $564 — menos dinheiro — e comporta 19. Isso é 10× as vagas por 0.79× da fatura, e a mais cara é a que a maioria das pré-seleções mantém, porque é a única em que o modelo cabe em uma única placa.
Em todo o catálogo, e não apenas nas dez primeiras linhas, o melhor preço por vaga para este modelo é 8 × NVIDIA RTX A6000 por $2,239 ao mês: 119 requisições simultâneas, a $18.82 cada. É uma fatura bem maior do que qualquer coisa na pré-seleção acima, e ainda assim é a forma mais barata de acomodar um usuário — e é essa frase que decide se você está dimensionando um produto ou um protótipo.
O tamanho do contexto é o outro multiplicador
Tudo acima presumiu 8k de contexto. Essa suposição pesa mais do que a escolha da máquina. O cache é pago por token, além de por usuário, então o mesmo nó acomoda um número completamente diferente de pessoas dependendo de quanto você deixa uma conversa crescer.
Uma máquina, quatro modelos, quatro tamanhos de contexto. O nó é 8 × NVIDIA L4 por $1,106 ao mês — o mais barato do nosso catálogo que comporta os quatro modelos ao mesmo tempo, de modo que todo número abaixo é medido contra a mesma memória.
| Modelo | Cache por token | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Llama 3.1 8B | 128 KiB | 325 | 162 | 40 | 10 |
| Qwen 3 32B | 256 KiB | 150 | 75 | 18 | 4 |
| Llama 3.3 70B | 320 KiB | 105 | 52 | 13 | 3 |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 67 | 33 | 8 | 2 |
Em uma única máquina, sem nenhuma alteração, Llama 3.3 70B passa de 105 usuários simultâneos para 3 — um fator de 35× — só por causa de um número que você define na linha de comando. Nada no hardware mudou.
Duas coisas decorrem disso. A primeira é que a coluna de contexto que você deve ler é a que você realmente atende, não a que a ficha do modelo anuncia — um modelo que suporta 128k não obriga você a reservá-lo. A segunda é que o cache por token varia enormemente entre modelos de tamanho semelhante, porque ele é definido pelo design de atenção, e não pelo número de parâmetros; os maiores modelos dessa tabela têm alguns dos menores caches, o que é o fato mais contraintuitivo de toda essa área.
Quatro formas de recuperar capacidade
Em ordem decrescente de quanto entregam pelo quanto custam. A primeira é praticamente grátis e quase sempre fica sem ser aproveitada.
--max-model-len para o seu teto real desde o primeiro dia.| Modelo | cache de 16 bits | cache de 8 bits | Vagas ganhas |
|---|---|---|---|
| Llama 3.1 8B | 162 | 325 | +163 |
| Qwen 3 32B | 75 | 150 | +75 |
| Llama 3.3 70B | 52 | 105 | +53 |
| Qwen 3 235B-A22B (MoE) | 33 | 67 | +34 |
Mesmo nó, mesmos pesos, mesmo dinheiro. A única mudança é a precisão em que o cache é armazenado, e é essa a diferença entre uma máquina que atende uma equipe e uma máquina que atende um produto.
Vagas não são o mesmo que atendimento
Uma correção antes de dimensionar qualquer coisa com os números acima, e é essa correção que mantém esta página honesta. Tudo aqui conta quantas conversas a máquina consegue manter abertas. Isso não promete que todas estejam sendo respondidas rapidamente.
Memória e largura de banda são dois tetos diferentes. Em 8 × NVIDIA L4, Llama 3.3 70B tem espaço para 52 conversas simultâneas, enquanto um único usuário sozinho nessa máquina vê cerca de 17 tokens por segundo. Preencher todas as 52 vagas não dá a cada uma delas 17 tokens por segundo — a geração compartilha a mesma largura de banda de memória, então o total agregado sobe com o processamento em lote e a taxa por usuário cai. O teto de largura de banda é atingido bem antes do teto de memória.
A boa notícia é que os dois tetos se movem juntos: as máquinas com uma grande quantidade de memória sobrando depois dos pesos são, com poucas exceções, também as máquinas com mais largura de banda. Escolher pela margem raramente custa velocidade. Configurar o stack de inferência na máquina que você escolher é um guia à parte, e as flags que ele cobre são onde esses números se transformam em resultado real.
Escolhendo para o seu próprio número de usuários
Em ordem. Pare na primeira linha que descrever a sua carga.
- Uma requisição de cada vez. Jobs em lote, uma ferramenta interna, um único desenvolvedor. Compre a máquina mais barata que comporte o modelo em uma única placa e pare de ler — toda coluna desta página responde a uma pergunta que você não tem.
- Um punhado de pessoas, ocasionalmente. Uma ferramenta de equipe, um produto inicial. Calcule o seu pico de requisições simultâneas, não o número de usuários: cem usuários cadastrados raramente significam mais que um punhado de simultâneos. Depois, escolha a máquina mais barata cujo número de vagas fique confortavelmente acima desse pico.
- Um produto real, com tráfego real. Ordene o catálogo por preço por vaga em vez de por preço, limite o seu contexto ao que você realmente atende, reduza o cache para 8 bits, e espere que a vencedora seja uma máquina que você não teria pré-selecionado pelo preço mensal.
- Documentos longos ou conversas longas. Leia primeiro a tabela de contexto, depois a tabela de máquinas. A partir de 32k, o cache domina tão completamente que a escolha do modelo importa menos do que o design de atenção por trás dele.
- Tráfego instável e imprevisível. Dimensione para o pico que você não pode falhar, porque o cache não pode ser emprestado quando se esgota — uma requisição que não tem onde colocar a sua conversa espera na fila. Se o pico for raro e enorme, uma API cobrada por token para o excedente sai mais barata do que uma máquina dimensionada para um pico que acontece duas vezes por mês.
Seja qual for a linha em que você parou, faça a subtração antes de mais nada: pegue a memória da máquina, remova os pesos do seu modelo na precisão em que você vai servir, e veja o que sobra. Essa sobra é o produto que você está alugando. O configurador roda a mesma aritmética em cada nó que operamos, e quanto custa um mês disso é calculado à parte.
Dimensione a máquina para os usuários, não para o modelo.
O configurador reúne todo nó que alugamos, roda a mesma aritmética de memória desta página, e mostra o que sobra depois que o seu modelo é carregado — antes de você pagar por qualquer coisa.
Outros guias
- Custo · 6 min
Quando o aluguel mensal supera o por hora
O ponto de equilíbrio calculado com números reais, três custos que um preço por hora esconde até a fatura, e a armadilha do tempo ocioso que triplica uma estimativa.
Ler o guia - Custo · 9 min
Hospedagem própria contra uma API por token
O ponto de equilíbrio entre pagar uma API por token e alugar uma GPU, calculado com nossos preços e throughput — e as quatro coisas que a aritmética deixa de fora.
Ler o guia - Prática · 11 min
Servindo o Llama 3.3 70B em um nó
De uma máquina entregue a um endpoint compatível com OpenAI, com as flags que importam e as duas que reduzem seu throughput pela metade, silenciosamente.
Ler o guia