Todos os 6 centros de dados operacionais

Pago em cripto · Sem verificação de identidade · Acesso root em em menos de 5 minutos

Custo guia · 9 min de leitura

Quanto custa um milhão de tokens, das duas formas.

Uma API cobra por token e nada enquanto você está ocioso. Uma máquina cobra por mês e nada por token. Qual das duas é mais barata é uma simples divisão — e a resposta depende muito mais de quão ocupada você mantém a máquina do que do preço de qualquer uma delas.

A resposta curta

O ponto de equilíbrio é um volume
Não é um preço. $692 por mês compra tantos tokens quanto a máquina consegue realmente produzir — a questão é se você tem trabalho suficiente para isso.
Contra uma API de ponta
Um único fluxo sem processamento em lote no nosso nó mais barato já custa $6.42 por milhão. Isso é menos do que os $15.00 cobrados por um modelo fechado de ponta, antes de você agrupar qualquer coisa em lote.
Contra os mesmos pesos abertos
Você precisa de aproximadamente 7.1× o seu throughput de fluxo único para superar $0.90 por milhão. É para isso que serve o processamento contínuo por lotes, e isso é rotina.
Onde a API continua vencendo
Tráfego instável, volume baixo, e qualquer modelo cujos pesos ninguém vende a você.

A versão resumida

Quase toda comparação entre essas duas opções que você vai ler chega a um único número — "self-hosting é dez vezes mais barato", "a API é mais barata até você ficar enorme" — e ambas cometem o mesmo erro, que é citar um custo por token para uma máquina que não é cobrada por token. Uma GPU alugada tem exatamente um preço, e ele não muda: quer você gere um bilhão de tokens neste mês, quer nenhum, a fatura é idêntica. Então a pergunta honesta não é "quanto custa um token aqui", mas "quantos tokens eu preciso gerar antes que o preço fixo supere o medidor".

Esse número é uma divisão, e ela é feita abaixo com os nossos próprios preços e o nosso próprio modelo de throughput — o mesmo que o configurador usa. Tudo depois disso trata das duas coisas que decidem se você consegue alcançar esse volume: o processamento em lotes e as horas em que você deixa a máquina ociosa.

A aritmética

Quatro linhas. A terceira é a que vale a pena escrever num quadro branco; a quarta é a que as pessoas pulam, e pular essa é o que transforma uma estimativa sólida numa errada.

Volume de equilíbrio, e o que ele exige da máquina
# 1. What the API charges. Linear in what you use, zero when you stop.
api_cost_per_month = output_tokens_per_month / 1e6 × api_price_per_million

# 2. What the machine charges. A constant. Tokens are free once you own the hours.
machine_cost_per_month = monthly_price

# 3. Set them equal. This is the break-even VOLUME, in output tokens per month.
break_even_tokens = monthly_price / api_price_per_million × 1e6

# 4. And the only question that matters: can the machine produce that many?
#    730 hours is the month we bill, so 2,628,000 seconds of it.
sustained_tokens_per_second = break_even_tokens / 2,628,000

A linha 4 é uma taxa sustentada, não um pico. Uma máquina que atinge 600 tokens por segundo durante uma hora por dia e fica ociosa nas outras vinte e três horas tem uma taxa sustentada de 25, e para a fatura não importa qual dos dois números você está considerando.

O que um fluxo único custa

Comece pelo pior caso, porque é o único número que pode ser afirmado sem suposições: uma requisição de cada vez, sem processamento em lotes, com a máquina ociosa no restante do tempo. Todo nó abaixo executa Llama 3.3 70B em 4-bit (AWQ, GPTQ), e o throughput é a nossa própria estimativa conservadora — aquela que é limitada pela largura de banda de memória, e não medida em um dia bom.

Custo por milhão de tokens de saída num único fluxo sem lote, por nó
Como ele executa o modelo Por mês Um fluxo Custo por milhão
2 × NVIDIA RTX 509064 GB no total · PCIe 5.0 ×16 Repartido entre todas as 2 placas 43.1 GB necessários, 32 GB por placa $692 41 tok/s $6.42por 1M de saída
2 × NVIDIA RTX 409048 GB no total · PCIe 5.0 ×16 Repartido entre todas as 2 placas 43.1 GB necessários, 24 GB por placa $416 23 tok/s $6.88por 1M de saída
4 × NVIDIA RTX 5090128 GB no total · PCIe 5.0 ×16 Repartido entre todas as 4 placas 43.1 GB necessários, 32 GB por placa $1,345 68 tok/s $7.53por 1M de saída
4 × NVIDIA RTX 409096 GB no total · PCIe 5.0 ×16 Repartido entre todas as 4 placas 43.1 GB necessários, 24 GB por placa $814 38 tok/s $8.15por 1M de saída
2 × NVIDIA A100 PCIe80 GB no total · PCIe 5.0 ×16 Repartido entre todas as 2 placas 43.1 GB necessários, 40 GB por placa $802 36 tok/s $8.48por 1M de saída
8 × NVIDIA RTX 5090256 GB no total · PCIe 5.0 ×16 Repartido entre todas as 8 placas 43.1 GB necessários, 32 GB por placa $2,584 100 tok/s $9.83por 1M de saída

Leia isso como um teto, nunca como um orçamento. É o que um token custa se você fizer a máquina responder a uma pergunta de cada vez e deixá-la ociosa pelo resto do mês — a forma menos eficiente que existe de possuir uma GPU. Toda pilha de serving real faz melhor do que isso, e as duas próximas seções tratam de quanto melhor.

O ponto de equilíbrio, por nível

Pegue a linha mais barata acima — 2 × NVIDIA RTX 5090 a $692 por mês — e pergunte quanto trabalho ela precisa fazer para superar cada nível do mercado de APIs.

Volume mensal de equilíbrio e o throughput sustentado que ele exige
O que você pagaria em vez disso Por 1M de saída Volume de equilíbrio Taxa sustentada Em comparação com um fluxo único
Modelo proprietário de pontaO melhor modelo fechado do momento. Ninguém aluga os pesos dele para você. $15.00 46Mtokens por mês 18 tok/s24 horas por dia Já mais barato
Modelo proprietário de nível intermediárioO nível cavalo de batalha no qual a maioria dos produtos é realmente lançada. $4.00 173Mtokens por mês 66 tok/s24 horas por dia 1.6×do fluxo único
70B de pesos abertos, provedor especializado Mesmos pesosOs mesmos pesos que você mesmo executaria, servidos por outra pessoa. $0.90 769Mtokens por mês 293 tok/s24 horas por dia 7.1×do fluxo único
70B de pesos abertos, serverless mais barato Mesmos pesosO piso do mercado, geralmente com uma fila compartilhada por trás. $0.40 1,730Mtokens por mês 658 tok/s24 horas por dia 16.1×do fluxo único

A última coluna é o artigo inteiro. Onde diz "já mais barato", um único fluxo sem processamento em lotes em uma máquina $692 supera a API, e não há nada a pensar. Onde mostra um múltiplo, a máquina ainda pode vencer — mas só se você realmente alimentá-la, o que é o assunto da próxima seção.

As duas linhas de modelos proprietários não são uma disputa justa, e é a disputa em que a maioria das pessoas realmente está. Você não pode alugar os pesos de um modelo de fronteira, então "hospedar por conta própria" não é uma opção — a comparação real é um modelo fechado a $15.00 contra um aberto a $6.42 que é totalmente seu, e se o aberto é bom o suficiente para a sua tarefa. Essa é uma questão de qualidade, não de custo, e é a que vale a pena dedicar uma tarde antes que qualquer coisa dessa aritmética importe.

O processamento em lote é o jogo todo

Gerar um token exige ler os pesos ativos na memória uma vez. Gerar cem tokens para cem requisições diferentes também exige lê-los uma única vez — os mesmos pesos atendem a todas as requisições do lote. É por isso que uma pilha de serving com processamento contínuo por lotes produz muitas vezes mais tokens por segundo do que um único fluxo no mesmo hardware, e por isso que a proporção na última coluna dessa tabela chega a ser alcançável.

O que o processamento em lotes oferece

O throughput agregado sobe de forma acentuada com a concorrência enquanto os pesos continuam sendo o gargalo, depois se estabiliza conforme o cache KV preenche a placa e a própria aritmética se torna o limite.

  • Grandes múltiplos sobre um único fluxo são comuns, não otimistas
  • Não custa nada, além da memória que os caches extras consomem
  • O vLLM faz isso por padrão — você não o configura, você o alimenta

O que isso custa para você

O throughput não escala linearmente com a concorrência, e a latência por requisição piora conforme o lote cresce. Sessenta e quatro fluxos não dão sessenta e quatro vezes mais tokens.

  • Cada fluxo vê tokens mais lentos do que veria sozinho
  • O cache KV é o que se esgota primeiro — dimensione-o de propósito
  • Um slot de lote ocioso não gera nada: concorrência que você não tem não vale nada

A consequência prática: trate o múltiplo na tabela de ponto de equilíbrio como uma meta de throughput, não uma contagem de usuários. Uma meta de dez vezes o fluxo único não significa "dez usuários"; significa que o servidor precisa ter, em média, dez vezes a sua taxa sem processamento em lotes, o que costuma exigir bem mais de dez requisições simultâneas e bem menos de cem. Meça isso na máquina antes de se comprometer com um número — é um único benchmark, e ele resolve a questão.

As horas ociosas pelas quais você ainda paga

Tudo acima supôs que a carga se distribui uniformemente ao longo do mês. Nunca se distribui. Uma máquina alugada por mês é paga no domingo às 04:00, e os tokens que você não gerou naquele momento não são transferidos para depois. Divida a semana que você realmente atende pela semana que você realmente paga:

Como um ciclo de trabalho multiplica o throughput necessário enquanto ocupado
Quando a carga chega Horas por semana Taxa de pico necessária Custo efetivo por milhão
Continuously, 24/7Um endpoint que responde sempre que é chamado 168 h A taxa sustentada $6.42em um único fluxo
Doze horas por diaUm produto com um hemisfério de usuários 84 h 2.0×enquanto ocupada $12.84em um único fluxo
Horário comercial, dias úteisUma ferramenta interna usada pela sua própria equipe 40 h 4.2×enquanto ocupada $26.97em um único fluxo
Duas horas por diaUma tarefa em lote, ou uma demo que é aberta de vez em quando 14 h 12.0×enquanto ocupada $77.07em um único fluxo

A terceira linha é onde vivem a maioria das ferramentas internas, e ela multiplica silenciosamente o seu ponto de equilíbrio por mais de quatro. Essa é a razão mais comum para uma estimativa de hospedagem própria dar errado — não o preço do token, não o hardware, mas a suposição de que uma semana de trabalho é uma semana inteira.

Por que o seu prompt é quase gratuito

Uma assimetria pesa fortemente a favor de possuir a máquina, e nenhuma comparação de preço por token revela isso. Uma API cobra pelos tokens de entrada — geralmente entre um quarto e um terço do preço de saída, por token. Na sua própria GPU, os tokens de entrada são processados na etapa de prefill, que trata o prompt inteiro em paralelo e é limitada pela aritmética, não pela largura de banda de memória. O prefill roda a uma ordem de grandeza mais tokens por segundo do que a geração.

Quanto mais contexto você envia, melhor a hospedagem própria parece. Uma requisição com geração aumentada por recuperação, com um prompt de 20.000 tokens e uma resposta de 300 tokens, é dominada pela entrada numa fatura de API e pela saída na sua própria máquina. Duas cargas de trabalho com contas mensais idênticas num provedor podem ficar na proporção de dois para um no outro, na direção do hardware. Se seus prompts são longos — RAG, extração de documentos, sumarização de contexto longo — calcule com base na sua proporção de entrada para saída, e não apenas na saída.

O que a aritmética deixa de fora

Quatro coisas que nunca aparecem numa tabela de custo por token, e que decidem a questão pelo menos tanto quanto os números.

Toda requisição vai a algum lugar. Uma API vê seus prompts, e seus prompts são seu produto, os documentos dos seus clientes, ou seu código. Numa máquina que você aluga, os pesos e o tráfego ficam na máquina — e nunca perguntamos quem você é, para começo de conversa. Isso não é um item de custo, mas para algumas cargas de trabalho é a decisão inteira.

Modelos ficam obsoletos; o seu não. Um modelo hospedado pode mudar, ganhar uma nova versão com comportamento diferente, ou ser aposentado numa agenda que não é a sua. Um conjunto de pesos no seu próprio NVMe se comporta igual daqui a um ano, o que importa muito se você fez avaliações em cima dele.

Um preço fixo é um tipo diferente de número. Cobrança por medição significa que um bug, um loop de repetição ou um pico de tráfego vira uma fatura da qual você só fica sabendo depois. Um prazo mensal não pode te surpreender: o pior cenário é a máquina ser lenta, não cara.

Alguém precisa operar. O custo honesto de fazer self-hosting inclui uma tarde de configuração e, de vez em quando, uma noite em que um driver ou um container dão problema. Nossa documentação existe para que isso seja uma tarde em vez de uma semana, mas não é zero, e fingir o contrário é como essas comparações perdem a credibilidade.

De que lado você está

Em ordem, parando na primeira que descrever a sua situação.

  1. Você precisa da qualidade de um modelo fechado de ponta. Nesse caso, este artigo não se aplica: ninguém aluga esses pesos para você. Use a API, e reavalie quando um modelo aberto reduzir a diferença na sua tarefa específica.
  2. Seu volume é baixo ou você ainda não sabe qual é. Use a API. É a forma mais barata de descobrir como o seu tráfego realmente se comporta, e o medidor é um instrumento de medição perfeitamente adequado.
  3. Seu tráfego é irregular e tolera fila. Use a API, ou divida: sua própria máquina para a carga base constante, um endpoint hospedado para os picos. Nada obriga a decisão a ser toda de um jeito só.
  4. Você está sustentando volume real, em lote, contra um modelo de pesos abertos. Este é o caso em que o hardware vence, e vence com folga — o preço fixo para de subir enquanto o medidor continua rodando. Confira o seu próprio número na tabela acima antes de acreditar nele.
  5. Os prompts são sensíveis, o modelo não pode mudar, ou a conta precisa ser conhecida com antecedência. Nesse caso, a aritmética é uma formalidade. Alugue a máquina que comporta seu modelo, e pague por ela sem dizer a ninguém quem você é.

Seja qual for a linha em que você parou, o número a conferir é o da tabela de ponto de equilíbrio para o seu modelo e o seu volume. O configurador informa, para cada nó que alugamos, se o seu modelo cabe em uma única placa, precisa ser repartido, e qual é a estimativa de throughput — que é tudo o que essa aritmética precisa. Se você ainda está decidindo entre alugar por mês ou pagar por hora, esse é um ponto de equilíbrio diferente, e ele também já foi calculado.

Calcule o seu próprio ponto de equilíbrio em uma máquina real.

O configurador fornece a estimativa de throughput e o preço mensal de cada nó do catálogo — os dois números que este guia divide.

Entrar

Console, faturas e acesso fora de banda.

Ainda não tem uma conta?

Não existe cadastro separado. Sua conta é criada enquanto você faz seu primeiro pedido — você escolhe o e-mail e a senha na etapa de pagamento, e o console já está aberto quando a máquina estiver pronta.

Configurar um servidor

Language