Guía de Coste · 9 min de lectura

# Lo que cuesta un millón de tokens, de las dos formas.

Una API le factura por token y nada mientras está inactivo. Una máquina le factura al mes y nada por token. Cuál es más barata es una simple división: y la respuesta depende mucho más de lo ocupada que mantenga la máquina que del precio de cualquiera de las dos.

La respuesta corta

- **El punto de equilibrio es un volumen:** No es un precio. **$692 al mes** le compra tantos tokens como la máquina pueda producir realmente — la pregunta es si usted tiene tanto trabajo.
- **Frente a una API de vanguardia:** Un solo flujo sin agrupar en nuestro nodo más barato ya cuesta **$6.42** por millón. Eso está por debajo de los $15.00 que cobra un modelo cerrado de primer nivel, antes de agrupar nada.
- **Frente a los mismos pesos abiertos:** Necesita aproximadamente **7.1×** su rendimiento de flujo único para superar $0.90 por millón. Para eso sirve el procesamiento continuo por lotes, y es algo habitual.
- **Dónde sigue ganando la API:** Tráfico irregular, volumen bajo, y cualquier modelo cuyos pesos nadie le vende.

## La versión corta

Casi todas las comparaciones entre estas dos opciones que leerá se resumen en una sola cifra — «el autoalojamiento es diez veces más barato», «la API es más barata hasta que se vuelve enorme» — y ambas cometen el mismo error, que es citar un coste por token para una máquina que no se factura por token. Una GPU alquilada tiene exactamente un precio y no se mueve: tanto si genera mil millones de tokens este mes como si no genera ninguno, la factura es idéntica. Así que la pregunta honesta no es «cuánto cuesta aquí un token» sino *«cuántos tokens necesito generar antes de que el precio fijo supere al contador»*.

Ese número es una división, y se calcula más abajo con nuestros propios precios y nuestro propio modelo de rendimiento — el mismo que usa el [configurador](https://gpuserver.io/es/configure). Todo lo que sigue trata de las dos cosas que determinan si puede alcanzar ese volumen: el procesamiento por lotes y las horas que deja la máquina inactiva.

## La aritmética

Cuatro líneas. La tercera es la que merece la pena escribir en una pizarra; la cuarta es la que la gente se salta, y saltársela es lo que convierte una estimación sólida en una equivocada.

Volumen de equilibrio, y qué exige de la máquina

```
# 1. What the API charges. Linear in what you use, zero when you stop.
api_cost_per_month = output_tokens_per_month / 1e6 × api_price_per_million

# 2. What the machine charges. A constant. Tokens are free once you own the hours.
machine_cost_per_month = monthly_price

# 3. Set them equal. This is the break-even VOLUME, in output tokens per month.
break_even_tokens = monthly_price / api_price_per_million × 1e6

# 4. And the only question that matters: can the machine produce that many?
#    730 hours is the month we bill, so 2,628,000 seconds of it.
sustained_tokens_per_second = break_even_tokens / 2,628,000
```

La línea 4 es una tasa *sostenida*, no un pico. Una máquina que alcanza 600 tokens por segundo durante una hora al día y permanece inactiva las otras veintitrés tiene una tasa sostenida de 25, y a la factura le da igual de cuál de los dos hable usted.

## Lo que cuesta un flujo único

Empiece por el peor caso, porque es la única cifra que puede indicarse sin suposiciones: una solicitud a la vez, sin procesamiento por lotes, con la máquina inactiva el resto del tiempo. Cada nodo de abajo ejecuta Llama 3.3 70B a 4-bit (AWQ, GPTQ), y el rendimiento es nuestra propia estimación conservadora — la que está [limitada por el ancho de banda de memoria](https://gpuserver.io/es/guides/vram-sizing) y no medida en un buen día.

**Coste por millón de tokens de salida en un solo flujo sin agrupar, por nodo**

| Nodo | Cómo ejecuta el modelo | Al mes | Un flujo único | Coste por millón |
|---|---|---|---|---|
| [2 × NVIDIA RTX 5090](https://gpuserver.io/es/gpu/rtx-5090) 64 GB en total · PCIe 5.0 ×16 | Repartido entre las 2 tarjetas 43.1 GB necesarios, 32 GB por tarjeta | $692 | 41 tok/s | $6.42 por 1M de salida |
| [2 × NVIDIA RTX 4090](https://gpuserver.io/es/gpu/rtx-4090) 48 GB en total · PCIe 5.0 ×16 | Repartido entre las 2 tarjetas 43.1 GB necesarios, 24 GB por tarjeta | $416 | 23 tok/s | $6.88 por 1M de salida |
| [4 × NVIDIA RTX 5090](https://gpuserver.io/es/gpu/rtx-5090) 128 GB en total · PCIe 5.0 ×16 | Repartido entre las 4 tarjetas 43.1 GB necesarios, 32 GB por tarjeta | $1,345 | 68 tok/s | $7.53 por 1M de salida |
| [4 × NVIDIA RTX 4090](https://gpuserver.io/es/gpu/rtx-4090) 96 GB en total · PCIe 5.0 ×16 | Repartido entre las 4 tarjetas 43.1 GB necesarios, 24 GB por tarjeta | $814 | 38 tok/s | $8.15 por 1M de salida |
| [2 × NVIDIA A100 PCIe](https://gpuserver.io/es/gpu/a100-40gb) 80 GB en total · PCIe 5.0 ×16 | Repartido entre las 2 tarjetas 43.1 GB necesarios, 40 GB por tarjeta | $802 | 36 tok/s | $8.48 por 1M de salida |
| [8 × NVIDIA RTX 5090](https://gpuserver.io/es/gpu/rtx-5090) 256 GB en total · PCIe 5.0 ×16 | Repartido entre las 8 tarjetas 43.1 GB necesarios, 32 GB por tarjeta | $2,584 | 100 tok/s | $9.83 por 1M de salida |

Lea esto como un techo, nunca como un presupuesto. Es lo que cuesta un token si hace que la máquina responda una pregunta a la vez y la deja inactiva el resto del mes — la forma menos eficiente de tener una GPU que existe. Cualquier pila de servicio real lo hace mejor, y las dos secciones siguientes tratan de cuánto mejor.

## El punto de equilibrio, por nivel

Tome la fila más barata de arriba — [2 × NVIDIA RTX 5090](https://gpuserver.io/es/gpu/rtx-5090) a $692 al mes — y pregúntese cuánto trabajo tiene que hacer para superar a cada nivel del mercado de las API.

**Volumen mensual de equilibrio y el rendimiento sostenido que exige**

| Lo que pagaría en su lugar | Por 1M de salida | Volumen de equilibrio | Tasa sostenida | Frente a un flujo único |
|---|---|---|---|---|
| Modelo propietario de vanguardia El mejor modelo cerrado del momento. Nadie le alquila sus pesos. | $15.00 | 46Mtokens al mes | 18 tok/slas 24 horas del día | Ya más barato |
| Modelo propietario de nivel medio El nivel de referencia en el que se despliegan realmente la mayoría de los productos. | $4.00 | 173Mtokens al mes | 66 tok/slas 24 horas del día | 1.6× del flujo único |
| 70B de pesos abiertos, proveedor especializado Los mismos pesos Los mismos pesos que ejecutaría usted mismo, servidos por otra persona. | $0.90 | 769Mtokens al mes | 293 tok/slas 24 horas del día | 7.1× del flujo único |
| 70B de pesos abiertos, la opción serverless más barata Los mismos pesos El suelo del mercado, normalmente con una cola compartida detrás. | $0.40 | 1,730Mtokens al mes | 658 tok/slas 24 horas del día | 16.1× del flujo único |

La última columna es todo el artículo. Donde dice «ya más barato», un flujo sin procesamiento por lotes en una máquina $692 supera a la API y no hay nada que pensar. Donde muestra un múltiplo, la máquina aún puede ganar — pero solo si realmente la mantiene ocupada, que es la siguiente sección.

**Las dos filas de modelos propietarios no son una pelea justa, y es la pelea en la que está la mayoría.** No puede alquilar los pesos de un modelo de frontera, así que «alojarlo usted mismo en su lugar» no es una opción — la comparación real es *un modelo cerrado a $15.00 frente a uno abierto a $6.42 que usted posee por completo*, y si el abierto es lo bastante bueno para su tarea. Esa es una cuestión de calidad, no de coste, y es la que merece una tarde de dedicación antes de que importe nada de esta aritmética.

## El procesamiento por lotes lo es todo

Generar un token requiere leer los pesos activos de la memoria una vez. Generar cien tokens para cien solicitudes *distintas* también requiere leerlos una sola vez — los mismos pesos sirven a todas las solicitudes del lote. Por eso una pila de servicio con procesamiento continuo por lotes produce muchas veces más tokens por segundo que un flujo único en el mismo hardware, y por eso la proporción de la última columna de esa tabla es alcanzable.

### Lo que le da el procesamiento por lotes

El rendimiento agregado sube de forma pronunciada con la concurrencia mientras los pesos siguen siendo el cuello de botella, y luego se estabiliza a medida que la caché KV llena la tarjeta y la propia aritmética se convierte en el límite.

- Múltiplos grandes sobre un flujo único son lo habitual, no una estimación optimista
- No le cuesta nada, salvo la memoria que ocupan las cachés adicionales
- [vLLM lo hace por defecto](https://gpuserver.io/es/guides/serve-llama-70b) — no lo configura, lo alimenta

### Lo que le cuesta

El rendimiento no escala linealmente con la concurrencia, y la latencia por solicitud empeora a medida que crece el lote. Sesenta y cuatro flujos no le dan sesenta y cuatro veces los tokens.

- Cada flujo ve tokens más lentos de los que vería solo
- La caché KV es lo primero que se agota — [dimensiónela de forma deliberada](https://gpuserver.io/es/guides/vram-sizing)
- Una ranura de lote inactiva no genera nada: la concurrencia que no tiene no vale nada

La consecuencia práctica: trate el múltiplo de la tabla de punto de equilibrio como un *objetivo de rendimiento*, no como un número de usuarios. Un objetivo de diez veces el flujo único no significa «diez usuarios»; significa que el servidor debe promediar diez veces su tasa sin procesamiento por lotes, lo que normalmente requiere bastante más de diez solicitudes simultáneas y bastante menos de cien. Mídalo en la máquina antes de comprometerse con una cifra — es un solo benchmark, y zanja la discusión.

## Las horas inactivas que sigue pagando

Todo lo anterior suponía que la carga se reparte de forma uniforme a lo largo del mes. Nunca es así. Una máquina alquilada al mes se paga también el domingo a las 04:00, y los tokens que no generó entonces no se trasladan. Divida la semana que realmente sirve entre la semana que realmente paga:

**Cómo un ciclo de trabajo multiplica el rendimiento necesario mientras está ocupado**

| Cuando llega la carga | Horas a la semana | Tasa máxima necesaria | Coste efectivo por millón |
|---|---|---|---|
| Continuously, 24/7 Un endpoint que responde cada vez que se le llama | 168 h | La tasa sostenida | $6.42 en un flujo único |
| Doce horas al día Un producto con un hemisferio de usuarios | 84 h | 2.0× mientras está ocupado | $12.84 en un flujo único |
| Horario laboral, días laborables Una herramienta interna que usa su propio equipo | 40 h | 4.2× mientras está ocupado | $26.97 en un flujo único |
| Dos horas al día Un trabajo por lotes, o una demo que se abre de vez en cuando | 14 h | 12.0× mientras está ocupado | $77.07 en un flujo único |

La tercera fila es donde vive la mayoría de las herramientas internas, y multiplica en silencio su punto de equilibrio por más de cuatro. Esa es, con diferencia, la razón más común por la que una estimación de alojamiento propio resulta errónea — no el precio del token, no el hardware, sino suponer que una semana laboral es una semana entera.

## Por qué su prompt es casi gratis

Hay una asimetría que favorece claramente ser propietario de la máquina, y ninguna comparación de precio por token la muestra. Una API le cobra por los tokens de entrada — normalmente entre un cuarto y un tercio del precio de salida, por token. En su propia GPU, los tokens de entrada se procesan en la pasada de prefill, que maneja todo el prompt en paralelo y está limitada por el cómputo, no por el ancho de banda de memoria. El prefill funciona a un orden de magnitud más tokens por segundo que la generación.

**Cuanto más contexto envíe, mejor sale el alojamiento propio.** Una solicitud con recuperación aumentada, con un prompt de 20.000 tokens y una respuesta de 300 tokens, está dominada por la entrada en una factura de API y por la salida en su propia máquina. Dos cargas de trabajo con facturas mensuales idénticas en un proveedor pueden diferir dos a uno en el otro, a favor del hardware. Si sus prompts son largos — RAG, extracción de documentos, resumen de contexto largo — haga la aritmética sobre *su* proporción de entrada a salida, no solo sobre la salida.

## Lo que la aritmética deja fuera

Cuatro cosas que nunca aparecen en una tabla de coste por token, y que deciden la cuestión al menos tan a menudo como las cifras.

**Toda solicitud va a alguna parte.** Una API ve sus prompts, y sus prompts son su producto, los documentos de sus clientes o su código. En una máquina que alquila, los pesos y el tráfico se quedan en la máquina — y [nunca le preguntamos quién es](https://gpuserver.io/es/no-kyc-gpu-server), para empezar. Eso no es una partida más, pero para algunas cargas de trabajo es toda la decisión.

**Los modelos quedan obsoletos; el suyo no.** Un modelo alojado puede cambiar, recibir una nueva versión con un comportamiento distinto, o retirarse según un calendario que no es el suyo. Un conjunto de pesos en su propio NVMe se comporta igual dentro de un año, lo cual importa mucho si ha evaluado contra él.

**Un precio fijo es un tipo de cifra distinto.** La facturación por medición significa que un error, un bucle de reintentos o una ráfaga de tráfico se convierte en una factura de la que se entera después. Un plazo mensual no puede sorprenderle: el peor caso es que la máquina vaya lenta, no que sea cara.

**Alguien tiene que ejecutarlo.** El coste honesto del autoalojamiento incluye una tarde de configuración y, de vez en cuando, una noche en la que un controlador o un contenedor se comporta mal. Nuestra [documentación](https://gpuserver.io/es/docs) existe para que eso sea una tarde y no una semana, pero no es cero, y fingir lo contrario es lo que hace que estas comparaciones pierdan su credibilidad.

## En qué lado está usted

En orden, y deténgase en la primera que le describa.

1. **Necesita la calidad de un modelo cerrado de vanguardia.** Entonces este artículo no se aplica: nadie le alquila esos pesos. Use la API, y vuelva a valorarlo cuando un modelo abierto reduzca la distancia en su tarea concreta.
2. **Su volumen es bajo, o todavía no lo sabe.** Use la API. Es la forma más barata de averiguar cómo es realmente su tráfico, y el contador es un instrumento de medida perfectamente válido.
3. **Su tráfico es irregular y tolera una cola.** Use la API, o repártalo: su propia máquina para la carga base constante, un endpoint alojado para los picos. Nada obliga a que la decisión sea toda en un solo sentido.
4. **Mantiene un volumen real y por lotes contra un modelo de pesos abiertos.** Este es el caso en que gana el hardware, y gana por mucho — el precio fijo deja de moverse mientras el contador sigue corriendo. Compruebe su propia cifra en la tabla de arriba antes de creérsela.
5. **Los prompts son sensibles, el modelo no debe cambiar, o la factura debe conocerse de antemano.** Entonces la aritmética es una formalidad. Alquile la máquina que aloja su modelo, y páguela [sin decirle a nadie quién es](https://gpuserver.io/es/guides/pay-in-crypto).

Sea cual sea la línea en la que se haya detenido, la cifra que hay que comprobar es la de la tabla de punto de equilibrio para *su* modelo y *su* volumen. El [configurador](https://gpuserver.io/es/configure) indica, para cada nodo que alquilamos, si su modelo cabe en una sola tarjeta, si hay que repartirlo, y cuál es la estimación de rendimiento — que es todo lo que necesita esta aritmética. Si todavía está decidiendo entre alquilar por mes o pagar por horas, ese es [otro punto de equilibrio distinto](https://gpuserver.io/es/guides/monthly-vs-hourly), y también está resuelto.

## Calcule su propio punto de equilibrio en una máquina real.

El configurador le da la estimación de rendimiento y el precio mensual de cada nodo del catálogo — los dos números que esta guía divide.

[Abrir el configurador](https://gpuserver.io/es/configure) [Leer las guías](https://gpuserver.io/es/guides)

## Otras guías

- [Práctica · 11 min Servir Llama 3.3 70B en un nodo De una máquina entregada a un endpoint compatible con OpenAI, con los parámetros que importan y los dos que reducen a la mitad su rendimiento sin avisar. Leer la guía](https://gpuserver.io/es/guides/serve-llama-70b)
- [Práctica · 10 min Fine-tuning de un modelo de 70B en una sola tarjeta QLoRA en una sola GPU de 48 GB: qué cabe, cuánto cuesta al mes y por qué el fine-tuning completo exige otro tipo de máquina. Leer la guía](https://gpuserver.io/es/guides/lora-finetune)
- [Pago · 8 min Pagar un servidor en cripto Qué ocurre realmente entre pulsar pagar y obtener root, qué moneda elegir, y los cuatro errores que hacen perder dinero en un primer pago. Leer la guía](https://gpuserver.io/es/guides/pay-in-crypto)

---

Fuente: https://gpuserver.io/es/guides/api-vs-self-hosting/. Este archivo se genera a partir de los mismos datos que el sitio web; si una cifra aquí difiere de la de una página, prevalece la página y este archivo está desactualizado: la fuente canónica es https://gpuserver.io/.
