Todos los 6 centros de datos operativos

Pagado en cripto · Sin verificación de identidad · Acceso root en en menos de 5 minutos

Guía de Coste · 9 min de lectura

Lo que cuesta un millón de tokens, de las dos formas.

Una API le factura por token y nada mientras está inactivo. Una máquina le factura al mes y nada por token. Cuál es más barata es una simple división: y la respuesta depende mucho más de lo ocupada que mantenga la máquina que del precio de cualquiera de las dos.

La respuesta corta

El punto de equilibrio es un volumen
No es un precio. $692 al mes le compra tantos tokens como la máquina pueda producir realmente — la pregunta es si usted tiene tanto trabajo.
Frente a una API de vanguardia
Un solo flujo sin agrupar en nuestro nodo más barato ya cuesta $6.42 por millón. Eso está por debajo de los $15.00 que cobra un modelo cerrado de primer nivel, antes de agrupar nada.
Frente a los mismos pesos abiertos
Necesita aproximadamente 7.1× su rendimiento de flujo único para superar $0.90 por millón. Para eso sirve el procesamiento continuo por lotes, y es algo habitual.
Dónde sigue ganando la API
Tráfico irregular, volumen bajo, y cualquier modelo cuyos pesos nadie le vende.

La versión corta

Casi todas las comparaciones entre estas dos opciones que leerá se resumen en una sola cifra — «el autoalojamiento es diez veces más barato», «la API es más barata hasta que se vuelve enorme» — y ambas cometen el mismo error, que es citar un coste por token para una máquina que no se factura por token. Una GPU alquilada tiene exactamente un precio y no se mueve: tanto si genera mil millones de tokens este mes como si no genera ninguno, la factura es idéntica. Así que la pregunta honesta no es «cuánto cuesta aquí un token» sino «cuántos tokens necesito generar antes de que el precio fijo supere al contador».

Ese número es una división, y se calcula más abajo con nuestros propios precios y nuestro propio modelo de rendimiento — el mismo que usa el configurador. Todo lo que sigue trata de las dos cosas que determinan si puede alcanzar ese volumen: el procesamiento por lotes y las horas que deja la máquina inactiva.

La aritmética

Cuatro líneas. La tercera es la que merece la pena escribir en una pizarra; la cuarta es la que la gente se salta, y saltársela es lo que convierte una estimación sólida en una equivocada.

Volumen de equilibrio, y qué exige de la máquina
# 1. What the API charges. Linear in what you use, zero when you stop.
api_cost_per_month = output_tokens_per_month / 1e6 × api_price_per_million

# 2. What the machine charges. A constant. Tokens are free once you own the hours.
machine_cost_per_month = monthly_price

# 3. Set them equal. This is the break-even VOLUME, in output tokens per month.
break_even_tokens = monthly_price / api_price_per_million × 1e6

# 4. And the only question that matters: can the machine produce that many?
#    730 hours is the month we bill, so 2,628,000 seconds of it.
sustained_tokens_per_second = break_even_tokens / 2,628,000

La línea 4 es una tasa sostenida, no un pico. Una máquina que alcanza 600 tokens por segundo durante una hora al día y permanece inactiva las otras veintitrés tiene una tasa sostenida de 25, y a la factura le da igual de cuál de los dos hable usted.

Lo que cuesta un flujo único

Empiece por el peor caso, porque es la única cifra que puede indicarse sin suposiciones: una solicitud a la vez, sin procesamiento por lotes, con la máquina inactiva el resto del tiempo. Cada nodo de abajo ejecuta Llama 3.3 70B a 4-bit (AWQ, GPTQ), y el rendimiento es nuestra propia estimación conservadora — la que está limitada por el ancho de banda de memoria y no medida en un buen día.

Coste por millón de tokens de salida en un solo flujo sin agrupar, por nodo
Nodo Cómo ejecuta el modelo Al mes Un flujo único Coste por millón
2 × NVIDIA RTX 509064 GB en total · PCIe 5.0 ×16 Repartido entre las 2 tarjetas 43.1 GB necesarios, 32 GB por tarjeta $692 41 tok/s $6.42por 1M de salida
2 × NVIDIA RTX 409048 GB en total · PCIe 5.0 ×16 Repartido entre las 2 tarjetas 43.1 GB necesarios, 24 GB por tarjeta $416 23 tok/s $6.88por 1M de salida
4 × NVIDIA RTX 5090128 GB en total · PCIe 5.0 ×16 Repartido entre las 4 tarjetas 43.1 GB necesarios, 32 GB por tarjeta $1,345 68 tok/s $7.53por 1M de salida
4 × NVIDIA RTX 409096 GB en total · PCIe 5.0 ×16 Repartido entre las 4 tarjetas 43.1 GB necesarios, 24 GB por tarjeta $814 38 tok/s $8.15por 1M de salida
2 × NVIDIA A100 PCIe80 GB en total · PCIe 5.0 ×16 Repartido entre las 2 tarjetas 43.1 GB necesarios, 40 GB por tarjeta $802 36 tok/s $8.48por 1M de salida
8 × NVIDIA RTX 5090256 GB en total · PCIe 5.0 ×16 Repartido entre las 8 tarjetas 43.1 GB necesarios, 32 GB por tarjeta $2,584 100 tok/s $9.83por 1M de salida

Lea esto como un techo, nunca como un presupuesto. Es lo que cuesta un token si hace que la máquina responda una pregunta a la vez y la deja inactiva el resto del mes — la forma menos eficiente de tener una GPU que existe. Cualquier pila de servicio real lo hace mejor, y las dos secciones siguientes tratan de cuánto mejor.

El punto de equilibrio, por nivel

Tome la fila más barata de arriba — 2 × NVIDIA RTX 5090 a $692 al mes — y pregúntese cuánto trabajo tiene que hacer para superar a cada nivel del mercado de las API.

Volumen mensual de equilibrio y el rendimiento sostenido que exige
Lo que pagaría en su lugar Por 1M de salida Volumen de equilibrio Tasa sostenida Frente a un flujo único
Modelo propietario de vanguardiaEl mejor modelo cerrado del momento. Nadie le alquila sus pesos. $15.00 46Mtokens al mes 18 tok/slas 24 horas del día Ya más barato
Modelo propietario de nivel medioEl nivel de referencia en el que se despliegan realmente la mayoría de los productos. $4.00 173Mtokens al mes 66 tok/slas 24 horas del día 1.6×del flujo único
70B de pesos abiertos, proveedor especializado Los mismos pesosLos mismos pesos que ejecutaría usted mismo, servidos por otra persona. $0.90 769Mtokens al mes 293 tok/slas 24 horas del día 7.1×del flujo único
70B de pesos abiertos, la opción serverless más barata Los mismos pesosEl suelo del mercado, normalmente con una cola compartida detrás. $0.40 1,730Mtokens al mes 658 tok/slas 24 horas del día 16.1×del flujo único

La última columna es todo el artículo. Donde dice «ya más barato», un flujo sin procesamiento por lotes en una máquina $692 supera a la API y no hay nada que pensar. Donde muestra un múltiplo, la máquina aún puede ganar — pero solo si realmente la mantiene ocupada, que es la siguiente sección.

Las dos filas de modelos propietarios no son una pelea justa, y es la pelea en la que está la mayoría. No puede alquilar los pesos de un modelo de frontera, así que «alojarlo usted mismo en su lugar» no es una opción — la comparación real es un modelo cerrado a $15.00 frente a uno abierto a $6.42 que usted posee por completo, y si el abierto es lo bastante bueno para su tarea. Esa es una cuestión de calidad, no de coste, y es la que merece una tarde de dedicación antes de que importe nada de esta aritmética.

El procesamiento por lotes lo es todo

Generar un token requiere leer los pesos activos de la memoria una vez. Generar cien tokens para cien solicitudes distintas también requiere leerlos una sola vez — los mismos pesos sirven a todas las solicitudes del lote. Por eso una pila de servicio con procesamiento continuo por lotes produce muchas veces más tokens por segundo que un flujo único en el mismo hardware, y por eso la proporción de la última columna de esa tabla es alcanzable.

Lo que le da el procesamiento por lotes

El rendimiento agregado sube de forma pronunciada con la concurrencia mientras los pesos siguen siendo el cuello de botella, y luego se estabiliza a medida que la caché KV llena la tarjeta y la propia aritmética se convierte en el límite.

  • Múltiplos grandes sobre un flujo único son lo habitual, no una estimación optimista
  • No le cuesta nada, salvo la memoria que ocupan las cachés adicionales
  • vLLM lo hace por defecto — no lo configura, lo alimenta

Lo que le cuesta

El rendimiento no escala linealmente con la concurrencia, y la latencia por solicitud empeora a medida que crece el lote. Sesenta y cuatro flujos no le dan sesenta y cuatro veces los tokens.

  • Cada flujo ve tokens más lentos de los que vería solo
  • La caché KV es lo primero que se agota — dimensiónela de forma deliberada
  • Una ranura de lote inactiva no genera nada: la concurrencia que no tiene no vale nada

La consecuencia práctica: trate el múltiplo de la tabla de punto de equilibrio como un objetivo de rendimiento, no como un número de usuarios. Un objetivo de diez veces el flujo único no significa «diez usuarios»; significa que el servidor debe promediar diez veces su tasa sin procesamiento por lotes, lo que normalmente requiere bastante más de diez solicitudes simultáneas y bastante menos de cien. Mídalo en la máquina antes de comprometerse con una cifra — es un solo benchmark, y zanja la discusión.

Las horas inactivas que sigue pagando

Todo lo anterior suponía que la carga se reparte de forma uniforme a lo largo del mes. Nunca es así. Una máquina alquilada al mes se paga también el domingo a las 04:00, y los tokens que no generó entonces no se trasladan. Divida la semana que realmente sirve entre la semana que realmente paga:

Cómo un ciclo de trabajo multiplica el rendimiento necesario mientras está ocupado
Cuando llega la carga Horas a la semana Tasa máxima necesaria Coste efectivo por millón
Continuously, 24/7Un endpoint que responde cada vez que se le llama 168 h La tasa sostenida $6.42en un flujo único
Doce horas al díaUn producto con un hemisferio de usuarios 84 h 2.0×mientras está ocupado $12.84en un flujo único
Horario laboral, días laborablesUna herramienta interna que usa su propio equipo 40 h 4.2×mientras está ocupado $26.97en un flujo único
Dos horas al díaUn trabajo por lotes, o una demo que se abre de vez en cuando 14 h 12.0×mientras está ocupado $77.07en un flujo único

La tercera fila es donde vive la mayoría de las herramientas internas, y multiplica en silencio su punto de equilibrio por más de cuatro. Esa es, con diferencia, la razón más común por la que una estimación de alojamiento propio resulta errónea — no el precio del token, no el hardware, sino suponer que una semana laboral es una semana entera.

Por qué su prompt es casi gratis

Hay una asimetría que favorece claramente ser propietario de la máquina, y ninguna comparación de precio por token la muestra. Una API le cobra por los tokens de entrada — normalmente entre un cuarto y un tercio del precio de salida, por token. En su propia GPU, los tokens de entrada se procesan en la pasada de prefill, que maneja todo el prompt en paralelo y está limitada por el cómputo, no por el ancho de banda de memoria. El prefill funciona a un orden de magnitud más tokens por segundo que la generación.

Cuanto más contexto envíe, mejor sale el alojamiento propio. Una solicitud con recuperación aumentada, con un prompt de 20.000 tokens y una respuesta de 300 tokens, está dominada por la entrada en una factura de API y por la salida en su propia máquina. Dos cargas de trabajo con facturas mensuales idénticas en un proveedor pueden diferir dos a uno en el otro, a favor del hardware. Si sus prompts son largos — RAG, extracción de documentos, resumen de contexto largo — haga la aritmética sobre su proporción de entrada a salida, no solo sobre la salida.

Lo que la aritmética deja fuera

Cuatro cosas que nunca aparecen en una tabla de coste por token, y que deciden la cuestión al menos tan a menudo como las cifras.

Toda solicitud va a alguna parte. Una API ve sus prompts, y sus prompts son su producto, los documentos de sus clientes o su código. En una máquina que alquila, los pesos y el tráfico se quedan en la máquina — y nunca le preguntamos quién es, para empezar. Eso no es una partida más, pero para algunas cargas de trabajo es toda la decisión.

Los modelos quedan obsoletos; el suyo no. Un modelo alojado puede cambiar, recibir una nueva versión con un comportamiento distinto, o retirarse según un calendario que no es el suyo. Un conjunto de pesos en su propio NVMe se comporta igual dentro de un año, lo cual importa mucho si ha evaluado contra él.

Un precio fijo es un tipo de cifra distinto. La facturación por medición significa que un error, un bucle de reintentos o una ráfaga de tráfico se convierte en una factura de la que se entera después. Un plazo mensual no puede sorprenderle: el peor caso es que la máquina vaya lenta, no que sea cara.

Alguien tiene que ejecutarlo. El coste honesto del autoalojamiento incluye una tarde de configuración y, de vez en cuando, una noche en la que un controlador o un contenedor se comporta mal. Nuestra documentación existe para que eso sea una tarde y no una semana, pero no es cero, y fingir lo contrario es lo que hace que estas comparaciones pierdan su credibilidad.

En qué lado está usted

En orden, y deténgase en la primera que le describa.

  1. Necesita la calidad de un modelo cerrado de vanguardia. Entonces este artículo no se aplica: nadie le alquila esos pesos. Use la API, y vuelva a valorarlo cuando un modelo abierto reduzca la distancia en su tarea concreta.
  2. Su volumen es bajo, o todavía no lo sabe. Use la API. Es la forma más barata de averiguar cómo es realmente su tráfico, y el contador es un instrumento de medida perfectamente válido.
  3. Su tráfico es irregular y tolera una cola. Use la API, o repártalo: su propia máquina para la carga base constante, un endpoint alojado para los picos. Nada obliga a que la decisión sea toda en un solo sentido.
  4. Mantiene un volumen real y por lotes contra un modelo de pesos abiertos. Este es el caso en que gana el hardware, y gana por mucho — el precio fijo deja de moverse mientras el contador sigue corriendo. Compruebe su propia cifra en la tabla de arriba antes de creérsela.
  5. Los prompts son sensibles, el modelo no debe cambiar, o la factura debe conocerse de antemano. Entonces la aritmética es una formalidad. Alquile la máquina que aloja su modelo, y páguela sin decirle a nadie quién es.

Sea cual sea la línea en la que se haya detenido, la cifra que hay que comprobar es la de la tabla de punto de equilibrio para su modelo y su volumen. El configurador indica, para cada nodo que alquilamos, si su modelo cabe en una sola tarjeta, si hay que repartirlo, y cuál es la estimación de rendimiento — que es todo lo que necesita esta aritmética. Si todavía está decidiendo entre alquilar por mes o pagar por horas, ese es otro punto de equilibrio distinto, y también está resuelto.

Calcule su propio punto de equilibrio en una máquina real.

El configurador le da la estimación de rendimiento y el precio mensual de cada nodo del catálogo — los dos números que esta guía divide.

Iniciar sesión

Consola, facturas y acceso fuera de banda.

¿Aún no tiene cuenta?

No hay un registro aparte. Su cuenta se crea mientras realiza su primer pedido — elige el correo electrónico y la contraseña en el paso de pago, y la consola está abierta para cuando lo está la máquina.

Configurar un servidor

Language