Lo que realmente cuesta una mezcla de expertos.
Un nombre como «235B-A22B» contiene dos cifras, y casi todo el mundo lee la que no es. Una decide qué alquila; la otra decide con qué rapidez responde. Pueden diferir en un factor de diez.
La respuesta corta
- Los parámetros totales deciden la máquina
- DeepSeek V3 671B-A37B (MoE) en 4 bits necesita 386 GB con 8k de contexto. Un modelo denso del tamaño de sus parámetros activos necesitaría 22 GB — 17.6× menos.
- Los parámetros activos deciden la velocidad
- Solo se lee una fracción de los pesos por token, así que genera más rápido que un modelo denso de la misma masa — pero el enrutamiento se lleva de vuelta buena parte de esa ventaja.
- El nodo más barato en el que cabe
- 8 × NVIDIA A100 PCIe a $7,906 al mes. Casi nunca es la que conviene alquilar.
- La que merece la pena alquilar
- 4 × NVIDIA B200 SXM6 a $11,790 — 1.5× el dinero por 2.8× el rendimiento.
La versión corta
Una mezcla de expertos divide la parte feed-forward de cada capa en muchas redes pequeñas y hace pasar cada token por solo unas pocas de ellas. El nombre publicado recoge ambos datos: el número total de parámetros, y el número que está activo para un token cualquiera. El primero debe estar entero en memoria; el segundo es lo único que se lee en cada token. Esa única frase es la guía entera, y entenderla al revés es el error más caro que le hemos visto cometer a la gente antes de hacer un pedido.
La consecuencia es un modelo con una forma de coste extraña: se alquila como un gigante y funciona como uno de tamaño medio. Que eso sea una ganga o una trampa depende por completo de cuál de los dos números sea su cuello de botella.
¿Dimensionar la máquina? Use el total. Cada experto tiene que estar residente, porque no se puede saber de antemano cuáles va a necesitar el siguiente token. El enrutamiento se decide token a token, en tiempo de ejecución.
¿Calcular la velocidad? Parta de la cifra de activos y luego aplique un descuento importante. La generación solo lee los pesos activos, que es precisamente la idea —pero el enrutador, el despacho de expertos y el tráfico entre tarjetas no son gratis, y escalan mal en todo un nodo.
¿Sirve contexto largo o a muchos usuarios? Fíjese en el diseño de la atención, no en el recuento de parámetros. Los modelos más grandes de esta página tienen la caché de clave/valor más pequeña por token, y a partir de cierta longitud eso invierte el orden por completo.
¿Solo quiere la calidad? Un modelo denso que cabe en una tarjeta es más fácil, más barato y más rápido de operar que una mezcla de expertos repartida entre ocho. Recurra a un MoE cuando ningún modelo denso le dé la respuesta que necesita, no porque el nombre suene impresionante.
La aritmética de más abajo es la misma que ejecuta el configurador, sobre el mismo catálogo. Si todavía no ha calculado cuánta memoria necesita un modelo en general, esa fórmula va primero —esta página es lo que cambia en cuanto el modelo es una mezcla de expertos.
Leer el nombre
Circulan tres convenciones de nomenclatura, y las tres codifican el mismo par de números, por eso sobrevive la confusión. En cuanto sepa leerlas, la pregunta del dimensionamiento se responde sola.
| Modelo | Parámetros totales | Activos por token | Proporción de activos |
|---|---|---|---|
| Mixtral 8×22B (MoE) | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) | 671 B | 37 B | 6 % |
| Llama 3.3 70B | 70 B | 70 B | 100 % |
La última columna es la que hay que recordar. Un modelo denso lee todo lo que almacena; una mezcla de expertos lee una porción. Todo lo que estos modelos tienen de extraño — bueno y malo — sale de esa única línea.
La memoria que realmente alquila
Aquí está la trampa entera en una sola tabla. La columna del medio es lo que el modelo necesita en la máquina; la columna siguiente es lo que habría presupuestado un lector que se tomara al pie de la letra la cifra de activos. La última columna es la factura de esa mala lectura.
| Modelo | Pesos en 4 bits | Total necesario | Si fuera su tamaño activo | Exceso |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB | 22 GB | 17.6× |
Lea la última columna como un error de compra. Quien dimensione solo con la cifra de activos se pondría a buscar una sola tarjeta y acabaría necesitando un nodo entero — no una máquina algo más grande, sino una máquina de otra categoría, y de otro precio.
Lo que compran los parámetros activos
La generación está limitada por el ancho de banda de memoria: cada token nuevo exige releer los pesos que intervienen en él. Una mezcla de expertos solo lee su porción activa, así que el techo de su velocidad lo marca un número mucho más pequeño de lo que sugiere su tamaño. Esa parte de la promesa es real, y es la razón de que estos modelos existan.
La tabla de abajo pone todos los modelos en la misma máquina — 8 × NVIDIA A100 PCIe a $7,906 al mes, el nodo más barato de nuestro catálogo en el que caben todos a la vez. Comparar cifras de rendimiento tomadas en máquinas distintas no compara nada.
| Modelo | Total | Lectura por token | Tokens/s estimados |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) | 671 B | 18.5 GB | 37 |
| Llama 3.1 405B | 405 B | 202.5 GB | 19 |
| Qwen 3 235B-A22B (MoE) | 235 B | 11.0 GB | 62 |
| Mixtral 8×22B (MoE) | 141 B | 19.5 GB | 35 |
| Llama 3.3 70B | 70 B | 35.0 GB | 25 |
Las dos filas que merece la pena comparar son la mezcla de expertos más grande y el modelo denso más grande, porque ambos están repartidos entre todo el nodo. La mezcla es el modelo más grande, por un margen amplio, y aun así genera más rápido, porque lee una fracción de sí misma por token — ese es precisamente el intercambio que justifica la arquitectura. Lea de otra manera las filas marcadas como en una tarjeta: esos modelos ocupan una sola tarjeta del nodo y dejan las otras siete libres, lo que es una máquina más barata esperando a que la elijan, no una más lenta.
Lo segundo que oculta la aritmética es que una mezcla de expertos es más difícil de repartir bien. Un modelo denso repartido entre tarjetas se sincroniza una vez por capa; una mezcla, además, tiene que enviar cada token a la tarjeta que tenga el experto elegido, lo cual es un patrón de tráfico distinto y menos predecible. Esta es una de las pocas cargas de trabajo en las que la interconexión de verdad justifica su precio, en lugar de limitarse a aparecer en la factura.
La mitad que sale más barata
Todo lo anterior han sido malas noticias para los modelos grandes. Aquí está la compensación, y es grande, y casi ninguna comparación la menciona: los modelos con más parámetros de esta página tienen la caché de clave/valor más pequeña por token. La caché la determina el diseño de la atención —capas, cabezas de clave/valor, dimensión de cabeza— y no tiene nada que ver con cuántos expertos haya detrás de la atención.
| Modelo | Caché por token | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |
Esas columnas son por solicitud concurrente. Multiplique por el número de personas que usan el endpoint a la vez, y el orden de la última columna decide su máquina mucho más que los pesos.
La lectura práctica: los pesos son una entrada fija, la caché es el coste de funcionamiento. Una mezcla de expertos cobra una entrada enorme y luego un coste de funcionamiento pequeño por usuario. Un modelo denso de capacidad comparable funciona al revés. Cuál de los dos le sale más barato lo deciden la concurrencia y la longitud de contexto, no el recuento de parámetros de la ficha del modelo.
En qué máquinas caben
En 4 bits, con el contexto de referencia, y tomando el nodo más barato de nuestro catálogo en el que cabe cada modelo — ya sea en una tarjeta o repartido entre el nodo. Son el umbral de entrada, no recomendaciones; la siguiente sección explica por qué.
| Modelo | Necesita | Nodo más barato en el que cabe | Al mes | Tokens/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | 4 × NVIDIA L4 | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | 8 × NVIDIA L4 | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | 8 × NVIDIA A100 PCIe | $7,906 | 37 |
Cada uno de estos es un nodo multitarjeta, y ese es el titular honesto de esta página: ninguno de estos modelos cabe en una sola tarjeta de nuestro catálogo, por pequeña que la cifra de activos los haga parecer. El catálogo completo tiene el resto de las configuraciones, y el configurador ejecutará esta misma comprobación con su propio modelo y contexto.
El nodo más barato es el equivocado
Caber es un umbral, no un objetivo. Una vez que un modelo está repartido entre un nodo, el rendimiento depende del ancho de banda de memoria de las tarjetas entre las que se reparte — y el ancho de banda por dólar varía en más del doble entre configuraciones que superan igualmente ese umbral de memoria. Aquí tiene a DeepSeek V3 671B-A37B (MoE) en cada nodo en el que cabe, ordenado por precio, con la única columna que importa a la derecha.
| Configuración | VRAM | Al mes | Tokens/s | $ por token/s |
|---|---|---|---|---|
| 8 × NVIDIA A100 PCIe | 640 GB | $7,906 | 37 | $213.68 |
| 8 × NVIDIA A100 SXM4 | 640 GB | $8,355 | 39 | $214.23 |
| 4 × NVIDIA H200 SXM5 | 564 GB | $8,405 | 62 | $135.56 |
| 8 × NVIDIA H100 PCIe | 640 GB | $10,568 | 38 | $278.11 |
| 8 × NVIDIA H100 SXM5 | 640 GB | $11,509 | 64 | $179.83 |
| 4 × NVIDIA B200 SXM6 | 720 GB | $11,790 | 103 | $114.47 |
| 8 × NVIDIA H200 SXM5 | 1128 GB | $15,945 | 91 | $175.22 |
| 8 × NVIDIA B200 SXM6 | 1440 GB | $22,351 | 152 | $147.05 |
La celda verde es la mejor relación calidad-precio de la lista, y no es la fila más barata. Pasar de $7,906 a $11,790 multiplica la factura por 1.5× y el rendimiento por 2.8× — paga más y cada token le sale más barato. Ordenar un catálogo por precio y quedarse con la primera máquina que encaja es la forma de gastar dos veces el presupuesto de servicio.
Una advertencia sobre esa columna, y se aplica a cualquier tabla de precio por rendimiento que lea en su vida: usa generación de flujo único. Con procesamiento continuo por lotes, el agregado sube varias veces en cada fila, y no sube en la misma proporción en todas — un nodo con más memoria libre tras los pesos aguanta más secuencias concurrentes. El orden se mantiene estable; las cifras absolutas son conservadoras. La economía de ese agregado se explica aparte.
Cuándo una mezcla de expertos es la respuesta correcta
En orden. Deténgase en la primera línea que le describa.
- Un modelo denso que cabe en una tarjeta hace el trabajo. Tómelo y no mire atrás. Una sola tarjeta significa nada de sharding, ninguna cuestión de interconexión, nada de tráfico de enrutamiento entre expertos, y una máquina que cuesta una fracción de un nodo. La mayoría de los productos que creen necesitar un modelo abierto de frontera solo necesitan un buen 32B.
- Necesita la calidad y su contexto es largo. Aquí es donde una mezcla de expertos es, de verdad, el mejor instrumento disponible: paga una vez por los pesos, y la caché pequeña permite que la máquina siga sirviendo conversaciones largas sin venirse abajo. Dimensione el nodo según los pesos, y luego consulte la tabla de caché para su contexto real.
- Necesita la calidad y sirve a mucha gente a la vez. Misma respuesta, mismo motivo, y la ventaja crece con la concurrencia. El coste fijo se amortiza entre todos los flujos, mientras que el coste por flujo se mantiene bajo.
- Necesita la calidad, pero solo de vez en cuando. Entonces está alquilando un nodo grande para mantenerlo caliente unas horas a la semana, que es el peor uso posible de un plazo mensual. O agrupe el trabajo para que se ejecute de una sola vez, o use un endpoint alojado para este caso y reserve su propia máquina para la carga constante.
- Quiere hacerle fine-tuning. Es otro problema, y una máquina más grande: el entrenamiento toca todos los expertos y necesita estado del optimizador para cada uno, así que la memoria que ya complicaba la inferencia se vuelve prohibitiva. El fine-tuning con adaptadores sobre un modelo denso es la vía realista para casi todo el mundo.
Sea cual sea la línea en la que se haya detenido, el primer número que hay que comprobar es el recuento total de parámetros, en la precisión con la que piense servir el modelo. Todo lo demás de esta página — la velocidad, la caché, el precio por token por segundo — solo importa una vez que el modelo está en memoria. El configurador hace toda esa comprobación contra cada nodo que alquilamos, y aplica a la estimación de rendimiento la misma corrección de enrutamiento que las tablas de arriba. Si prefiere ver antes la aritmética de memoria completa, es una guía propia; y si todavía no ha decidido el formato numérico, esa elección viene antes que esta.
Compare su propia mezcla de expertos con máquinas reales.
El configurador incluye cada nodo que alquilamos, aplica la misma aritmética que esta página, y le indica en cuáles cabe su modelo antes de que pague nada.
Otras guías
- Coste · 6 min
Cuándo el alquiler mensual gana al alquiler por horas
El punto de equilibrio con cifras reales, los tres costes que un precio por hora oculta hasta la factura, y la trampa del tiempo inactivo que la triplica.
Leer la guía - Coste · 9 min
Autoalojamiento frente a una API por token
El punto de equilibrio entre pagar una API por token y alquilar una GPU, con nuestros precios y rendimiento reales — y las cuatro cosas que la aritmética omite.
Leer la guía - Práctica · 11 min
Servir Llama 3.3 70B en un nodo
De una máquina entregada a un endpoint compatible con OpenAI, con los parámetros que importan y los dos que reducen a la mitad su rendimiento sin avisar.
Leer la guía