Quanto custa um milhão de tokens, das duas formas.
Uma API cobra por token e nada enquanto você está ocioso. Uma máquina cobra por mês e nada por token. Qual das duas é mais barata é uma simples divisão — e a resposta depende muito mais de quão ocupada você mantém a máquina do que do preço de qualquer uma delas.
A resposta curta
- O ponto de equilíbrio é um volume
- Não é um preço. $692 por mês compra tantos tokens quanto a máquina consegue realmente produzir — a questão é se você tem trabalho suficiente para isso.
- Contra uma API de ponta
- Um único fluxo sem processamento em lote no nosso nó mais barato já custa $6.42 por milhão. Isso é menos do que os $15.00 cobrados por um modelo fechado de ponta, antes de você agrupar qualquer coisa em lote.
- Contra os mesmos pesos abertos
- Você precisa de aproximadamente 7.1× o seu throughput de fluxo único para superar $0.90 por milhão. É para isso que serve o processamento contínuo por lotes, e isso é rotina.
- Onde a API continua vencendo
- Tráfego instável, volume baixo, e qualquer modelo cujos pesos ninguém vende a você.
A versão resumida
Quase toda comparação entre essas duas opções que você vai ler chega a um único número — "self-hosting é dez vezes mais barato", "a API é mais barata até você ficar enorme" — e ambas cometem o mesmo erro, que é citar um custo por token para uma máquina que não é cobrada por token. Uma GPU alugada tem exatamente um preço, e ele não muda: quer você gere um bilhão de tokens neste mês, quer nenhum, a fatura é idêntica. Então a pergunta honesta não é "quanto custa um token aqui", mas "quantos tokens eu preciso gerar antes que o preço fixo supere o medidor".
Esse número é uma divisão, e ela é feita abaixo com os nossos próprios preços e o nosso próprio modelo de throughput — o mesmo que o configurador usa. Tudo depois disso trata das duas coisas que decidem se você consegue alcançar esse volume: o processamento em lotes e as horas em que você deixa a máquina ociosa.
A aritmética
Quatro linhas. A terceira é a que vale a pena escrever num quadro branco; a quarta é a que as pessoas pulam, e pular essa é o que transforma uma estimativa sólida numa errada.
# 1. What the API charges. Linear in what you use, zero when you stop.
api_cost_per_month = output_tokens_per_month / 1e6 × api_price_per_million
# 2. What the machine charges. A constant. Tokens are free once you own the hours.
machine_cost_per_month = monthly_price
# 3. Set them equal. This is the break-even VOLUME, in output tokens per month.
break_even_tokens = monthly_price / api_price_per_million × 1e6
# 4. And the only question that matters: can the machine produce that many?
# 730 hours is the month we bill, so 2,628,000 seconds of it.
sustained_tokens_per_second = break_even_tokens / 2,628,000
A linha 4 é uma taxa sustentada, não um pico. Uma máquina que atinge 600 tokens por segundo durante uma hora por dia e fica ociosa nas outras vinte e três horas tem uma taxa sustentada de 25, e para a fatura não importa qual dos dois números você está considerando.
O que um fluxo único custa
Comece pelo pior caso, porque é o único número que pode ser afirmado sem suposições: uma requisição de cada vez, sem processamento em lotes, com a máquina ociosa no restante do tempo. Todo nó abaixo executa Llama 3.3 70B em 4-bit (AWQ, GPTQ), e o throughput é a nossa própria estimativa conservadora — aquela que é limitada pela largura de banda de memória, e não medida em um dia bom.
| Nó | Como ele executa o modelo | Por mês | Um fluxo | Custo por milhão |
|---|---|---|---|---|
| 2 × NVIDIA RTX 5090 | Repartido entre todas as 2 placas | $692 | 41 tok/s | $6.42 |
| 2 × NVIDIA RTX 4090 | Repartido entre todas as 2 placas | $416 | 23 tok/s | $6.88 |
| 4 × NVIDIA RTX 5090 | Repartido entre todas as 4 placas | $1,345 | 68 tok/s | $7.53 |
| 4 × NVIDIA RTX 4090 | Repartido entre todas as 4 placas | $814 | 38 tok/s | $8.15 |
| 2 × NVIDIA A100 PCIe | Repartido entre todas as 2 placas | $802 | 36 tok/s | $8.48 |
| 8 × NVIDIA RTX 5090 | Repartido entre todas as 8 placas | $2,584 | 100 tok/s | $9.83 |
Leia isso como um teto, nunca como um orçamento. É o que um token custa se você fizer a máquina responder a uma pergunta de cada vez e deixá-la ociosa pelo resto do mês — a forma menos eficiente que existe de possuir uma GPU. Toda pilha de serving real faz melhor do que isso, e as duas próximas seções tratam de quanto melhor.
O ponto de equilíbrio, por nível
Pegue a linha mais barata acima — 2 × NVIDIA RTX 5090 a $692 por mês — e pergunte quanto trabalho ela precisa fazer para superar cada nível do mercado de APIs.
| O que você pagaria em vez disso | Por 1M de saída | Volume de equilíbrio | Taxa sustentada | Em comparação com um fluxo único |
|---|---|---|---|---|
| Modelo proprietário de ponta | $15.00 | 46M | 18 tok/s | Já mais barato |
| Modelo proprietário de nível intermediário | $4.00 | 173M | 66 tok/s | 1.6× |
| 70B de pesos abertos, provedor especializado Mesmos pesos | $0.90 | 769M | 293 tok/s | 7.1× |
| 70B de pesos abertos, serverless mais barato Mesmos pesos | $0.40 | 1,730M | 658 tok/s | 16.1× |
A última coluna é o artigo inteiro. Onde diz "já mais barato", um único fluxo sem processamento em lotes em uma máquina $692 supera a API, e não há nada a pensar. Onde mostra um múltiplo, a máquina ainda pode vencer — mas só se você realmente alimentá-la, o que é o assunto da próxima seção.
O processamento em lote é o jogo todo
Gerar um token exige ler os pesos ativos na memória uma vez. Gerar cem tokens para cem requisições diferentes também exige lê-los uma única vez — os mesmos pesos atendem a todas as requisições do lote. É por isso que uma pilha de serving com processamento contínuo por lotes produz muitas vezes mais tokens por segundo do que um único fluxo no mesmo hardware, e por isso que a proporção na última coluna dessa tabela chega a ser alcançável.
O que o processamento em lotes oferece
O throughput agregado sobe de forma acentuada com a concorrência enquanto os pesos continuam sendo o gargalo, depois se estabiliza conforme o cache KV preenche a placa e a própria aritmética se torna o limite.
- Grandes múltiplos sobre um único fluxo são comuns, não otimistas
- Não custa nada, além da memória que os caches extras consomem
- O vLLM faz isso por padrão — você não o configura, você o alimenta
O que isso custa para você
O throughput não escala linearmente com a concorrência, e a latência por requisição piora conforme o lote cresce. Sessenta e quatro fluxos não dão sessenta e quatro vezes mais tokens.
- Cada fluxo vê tokens mais lentos do que veria sozinho
- O cache KV é o que se esgota primeiro — dimensione-o de propósito
- Um slot de lote ocioso não gera nada: concorrência que você não tem não vale nada
A consequência prática: trate o múltiplo na tabela de ponto de equilíbrio como uma meta de throughput, não uma contagem de usuários. Uma meta de dez vezes o fluxo único não significa "dez usuários"; significa que o servidor precisa ter, em média, dez vezes a sua taxa sem processamento em lotes, o que costuma exigir bem mais de dez requisições simultâneas e bem menos de cem. Meça isso na máquina antes de se comprometer com um número — é um único benchmark, e ele resolve a questão.
As horas ociosas pelas quais você ainda paga
Tudo acima supôs que a carga se distribui uniformemente ao longo do mês. Nunca se distribui. Uma máquina alugada por mês é paga no domingo às 04:00, e os tokens que você não gerou naquele momento não são transferidos para depois. Divida a semana que você realmente atende pela semana que você realmente paga:
| Quando a carga chega | Horas por semana | Taxa de pico necessária | Custo efetivo por milhão |
|---|---|---|---|
| Continuously, 24/7 | 168 h | A taxa sustentada | $6.42 |
| Doze horas por dia | 84 h | 2.0× | $12.84 |
| Horário comercial, dias úteis | 40 h | 4.2× | $26.97 |
| Duas horas por dia | 14 h | 12.0× | $77.07 |
A terceira linha é onde vivem a maioria das ferramentas internas, e ela multiplica silenciosamente o seu ponto de equilíbrio por mais de quatro. Essa é a razão mais comum para uma estimativa de hospedagem própria dar errado — não o preço do token, não o hardware, mas a suposição de que uma semana de trabalho é uma semana inteira.
Por que o seu prompt é quase gratuito
Uma assimetria pesa fortemente a favor de possuir a máquina, e nenhuma comparação de preço por token revela isso. Uma API cobra pelos tokens de entrada — geralmente entre um quarto e um terço do preço de saída, por token. Na sua própria GPU, os tokens de entrada são processados na etapa de prefill, que trata o prompt inteiro em paralelo e é limitada pela aritmética, não pela largura de banda de memória. O prefill roda a uma ordem de grandeza mais tokens por segundo do que a geração.
O que a aritmética deixa de fora
Quatro coisas que nunca aparecem numa tabela de custo por token, e que decidem a questão pelo menos tanto quanto os números.
Toda requisição vai a algum lugar. Uma API vê seus prompts, e seus prompts são seu produto, os documentos dos seus clientes, ou seu código. Numa máquina que você aluga, os pesos e o tráfego ficam na máquina — e nunca perguntamos quem você é, para começo de conversa. Isso não é um item de custo, mas para algumas cargas de trabalho é a decisão inteira.
Modelos ficam obsoletos; o seu não. Um modelo hospedado pode mudar, ganhar uma nova versão com comportamento diferente, ou ser aposentado numa agenda que não é a sua. Um conjunto de pesos no seu próprio NVMe se comporta igual daqui a um ano, o que importa muito se você fez avaliações em cima dele.
Um preço fixo é um tipo diferente de número. Cobrança por medição significa que um bug, um loop de repetição ou um pico de tráfego vira uma fatura da qual você só fica sabendo depois. Um prazo mensal não pode te surpreender: o pior cenário é a máquina ser lenta, não cara.
Alguém precisa operar. O custo honesto de fazer self-hosting inclui uma tarde de configuração e, de vez em quando, uma noite em que um driver ou um container dão problema. Nossa documentação existe para que isso seja uma tarde em vez de uma semana, mas não é zero, e fingir o contrário é como essas comparações perdem a credibilidade.
De que lado você está
Em ordem, parando na primeira que descrever a sua situação.
- Você precisa da qualidade de um modelo fechado de ponta. Nesse caso, este artigo não se aplica: ninguém aluga esses pesos para você. Use a API, e reavalie quando um modelo aberto reduzir a diferença na sua tarefa específica.
- Seu volume é baixo ou você ainda não sabe qual é. Use a API. É a forma mais barata de descobrir como o seu tráfego realmente se comporta, e o medidor é um instrumento de medição perfeitamente adequado.
- Seu tráfego é irregular e tolera fila. Use a API, ou divida: sua própria máquina para a carga base constante, um endpoint hospedado para os picos. Nada obriga a decisão a ser toda de um jeito só.
- Você está sustentando volume real, em lote, contra um modelo de pesos abertos. Este é o caso em que o hardware vence, e vence com folga — o preço fixo para de subir enquanto o medidor continua rodando. Confira o seu próprio número na tabela acima antes de acreditar nele.
- Os prompts são sensíveis, o modelo não pode mudar, ou a conta precisa ser conhecida com antecedência. Nesse caso, a aritmética é uma formalidade. Alugue a máquina que comporta seu modelo, e pague por ela sem dizer a ninguém quem você é.
Seja qual for a linha em que você parou, o número a conferir é o da tabela de ponto de equilíbrio para o seu modelo e o seu volume. O configurador informa, para cada nó que alugamos, se o seu modelo cabe em uma única placa, precisa ser repartido, e qual é a estimativa de throughput — que é tudo o que essa aritmética precisa. Se você ainda está decidindo entre alugar por mês ou pagar por hora, esse é um ponto de equilíbrio diferente, e ele também já foi calculado.
Calcule o seu próprio ponto de equilíbrio em uma máquina real.
O configurador fornece a estimativa de throughput e o preço mensal de cada nó do catálogo — os dois números que este guia divide.
Outros guias
- Prática · 11 min
Servindo o Llama 3.3 70B em um nó
De uma máquina entregue a um endpoint compatível com OpenAI, com as flags que importam e as duas que reduzem seu throughput pela metade, silenciosamente.
Ler o guia - Prática · 10 min
Fine-tuning de um modelo de 70B em uma placa
QLoRA em uma única GPU de 48 GB: o que cabe, quanto custa por mês, e por que o fine-tuning completo exige outra categoria de máquina.
Ler o guia - Pagamento · 8 min
Pagando um servidor em cripto
O que realmente acontece entre clicar em pagar e receber o root, qual moeda escolher, e os quatro erros que fazem perder dinheiro no primeiro pagamento.
Ler o guia