Guía de Dimensionamiento · 10 min de lectura

# Lo que realmente cuesta una mezcla de expertos.

Un nombre como «235B-A22B» contiene dos cifras, y casi todo el mundo lee la que no es. Una decide qué alquila; la otra decide con qué rapidez responde. Pueden diferir en un factor de diez.

La respuesta corta

- **Los parámetros totales deciden la máquina:** **DeepSeek V3 671B-A37B (MoE)** en 4 bits necesita **386 GB** con 8k de contexto. Un modelo denso del tamaño de sus parámetros *activos* necesitaría 22 GB — **17.6×** menos.
- **Los parámetros activos deciden la velocidad:** Solo se lee una fracción de los pesos por token, así que genera más rápido que un modelo denso de la misma masa — pero el enrutamiento se lleva de vuelta buena parte de esa ventaja.
- **El nodo más barato en el que cabe:** [8 × NVIDIA A100 PCIe](https://gpuserver.io/es/gpu/a100-80gb) a **$7,906** al mes. Casi nunca es la que conviene alquilar.
- **La que merece la pena alquilar:** [4 × NVIDIA B200 SXM6](https://gpuserver.io/es/gpu/b200) a **$11,790** — 1.5× el dinero por 2.8× el rendimiento.

## La versión corta

Una mezcla de expertos divide la parte feed-forward de cada capa en muchas redes pequeñas y hace pasar cada token por solo unas pocas de ellas. El nombre publicado recoge ambos datos: el número total de parámetros, y el número que está activo para un token cualquiera. *El primero debe estar entero en memoria; el segundo es lo único que se lee en cada token.* Esa única frase es la guía entera, y entenderla al revés es el error más caro que le hemos visto cometer a la gente antes de hacer un pedido.

La consecuencia es un modelo con una forma de coste extraña: se alquila como un gigante y funciona como uno de tamaño medio. Que eso sea una ganga o una trampa depende por completo de cuál de los dos números sea su cuello de botella.

**¿Dimensionar la máquina?** Use el total. Cada experto tiene que estar residente, porque no se puede saber de antemano cuáles va a necesitar el siguiente token. El enrutamiento se decide token a token, en tiempo de ejecución.

**¿Calcular la velocidad?** Parta de la cifra de activos y luego aplique un descuento importante. La generación solo lee los pesos activos, que es precisamente la idea —pero el enrutador, el despacho de expertos y el tráfico entre tarjetas no son gratis, y escalan mal en todo un nodo.

**¿Sirve contexto largo o a muchos usuarios?** Fíjese en el diseño de la atención, no en el recuento de parámetros. Los modelos más grandes de esta página tienen la caché de clave/valor *más pequeña* por token, y a partir de cierta longitud eso invierte el orden por completo.

**¿Solo quiere la calidad?** Un modelo denso que cabe en una tarjeta es más fácil, más barato y más rápido de operar que una mezcla de expertos repartida entre ocho. Recurra a un MoE cuando ningún modelo denso le dé la respuesta que necesita, no porque el nombre suene impresionante.

La aritmética de más abajo es la misma que ejecuta el [configurador](https://gpuserver.io/es/configure), sobre el mismo catálogo. Si todavía no ha calculado cuánta memoria necesita un modelo en general, [esa fórmula va primero](https://gpuserver.io/es/guides/vram-sizing) —esta página es lo que cambia en cuanto el modelo es una mezcla de expertos.

## Leer el nombre

Circulan tres convenciones de nomenclatura, y las tres codifican el mismo par de números, por eso sobrevive la confusión. En cuanto sepa leerlas, la pregunta del dimensionamiento se responde sola.

235B-A22B Total, luego activos El más claro de los tres. 235 000 millones de parámetros residen en memoria; de ellos se leen 22 000 millones para cualquier token dado. La letra A significa *activo*, y es el número que **no** le dice qué debe alquilar.

671B-A37B Misma convención, más grande A este tamaño la brecha se vuelve absurda a propósito: la proporción de activos es inferior al seis por ciento. De ese 37 no se deduce nada sobre la máquina que necesita.

8×22B Expertos, luego el tamaño del experto La convención más antigua, y la que más confunde. No significa 176 000 millones de parámetros, porque la atención y los embeddings se comparten en lugar de duplicarse; y tampoco significa 22 000 millones, porque hay dos expertos activos por token, no uno.

A22B, A37B Un promedio, no una garantía La cifra de activos es lo que cuesta el enrutamiento en un texto típico. No es un tope: un lote cuyos tokens se repartan entre muchos expertos toca más partes del modelo, lo que es una de las razones por las que el rendimiento medido queda por debajo de la aritmética.

**Los modelos de mezcla de expertos de nuestro catálogo de dimensionamiento, parámetros totales frente a activos**

| Modelo | Parámetros totales | Activos por token | Proporción de activos |
|---|---|---|---|
| Mixtral 8×22B (MoE) 56 capas | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) 94 capas | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) 61 capas | 671 B | 37 B | 6 % |
| Llama 3.3 70B Denso, a modo de comparación | 70 B | 70 B | 100 % |

La última columna es la que hay que recordar. Un modelo denso lee todo lo que almacena; una mezcla de expertos lee una porción. Todo lo que estos modelos tienen de extraño — bueno y malo — sale de esa única línea.

## La memoria que realmente alquila

Aquí está la trampa entera en una sola tabla. La columna del medio es lo que el modelo necesita en la máquina; la columna siguiente es lo que habría presupuestado un lector que se tomara al pie de la letra la cifra de activos. La última columna es la factura de esa mala lectura.

**VRAM necesaria en 4 bits con 8k de contexto, frente a lo que sugiere la cifra de parámetros activos**

| Modelo | Pesos en 4 bits | Total necesario | Si fuera su tamaño activo | Exceso |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB a 8k | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB a 8k | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB a 8k | 22 GB | 17.6× |

Lea la última columna como un error de compra. Quien dimensione solo con la cifra de activos se pondría a buscar una sola tarjeta y acabaría necesitando un nodo entero — no una máquina algo más grande, sino una máquina de otra categoría, y de otro precio.

**No, no puede mantener en disco los expertos que no usa.** Es la primera idea que se le ocurre a todo el mundo, y las pilas de servicio la ofrecen. El problema es que el enrutamiento se decide token a token: el conjunto de expertos que hace falta cambia varias veces por cada palabra generada, así que una tarjeta que solo tiene un subconjunto se pasa el tiempo trayendo pesos por PCIe en lugar de calcular. El resultado no es un modelo algo más lento, es uno que funciona a una fracción pequeña de su velocidad. El offloading es una forma de hacer que un modelo *funcione* en una máquina que no lo puede alojar, no una forma de *servirlo*.

## Lo que compran los parámetros activos

La generación está limitada por el ancho de banda de memoria: cada token nuevo exige releer los pesos que intervienen en él. Una mezcla de expertos solo lee su porción activa, así que el techo de su velocidad lo marca un número mucho más pequeño de lo que sugiere su tamaño. Esa parte de la promesa es real, y es la razón de que estos modelos existan.

La tabla de abajo pone todos los modelos en la *misma* máquina — [8 × NVIDIA A100 PCIe](https://gpuserver.io/es/gpu/a100-80gb) a $7,906 al mes, el nodo más barato de nuestro catálogo en el que caben todos a la vez. Comparar cifras de rendimiento tomadas en máquinas distintas no compara nada.

**Generación de flujo único en un nodo, mezclas de expertos frente a modelos densos**

| Modelo | Total | Lectura por token | Tokens/s estimados |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) Mezcla de expertos · repartido entre 8 tarjetas | 671 B | 18.5 GB | 37 un flujo |
| Llama 3.1 405B Denso · repartido entre 8 tarjetas | 405 B | 202.5 GB | 19 un flujo |
| Qwen 3 235B-A22B (MoE) Mezcla de expertos · repartido entre 8 tarjetas | 235 B | 11.0 GB | 62 un flujo |
| Mixtral 8×22B (MoE) Mezcla de expertos · repartido entre 8 tarjetas | 141 B | 19.5 GB | 35 un flujo |
| Llama 3.3 70B Denso · en una tarjeta | 70 B | 35.0 GB | 25 un flujo |

Las dos filas que merece la pena comparar son la mezcla de expertos más grande y el modelo denso más grande, porque ambos están repartidos entre todo el nodo. La mezcla es el modelo más grande, por un margen amplio, y aun así genera más rápido, porque lee una fracción de sí misma por token — ese es precisamente el intercambio que justifica la arquitectura. Lea de otra manera las filas marcadas como *en una tarjeta*: esos modelos ocupan una sola tarjeta del nodo y dejan las otras siete libres, lo que es una máquina más barata esperando a que la elijan, no una más lenta.

**Estas cifras ya llevan incorporada una penalización importante, y así debe ser.** La aritmética pura de parámetros activos sobreestima mucho una mezcla de expertos. Nuestra primera versión de este estimador hacía exactamente eso, y se equivocaba por un factor de casi cinco frente a las mediciones publicadas del modelo más grande de esta página. El enrutamiento cuesta un paso propio, los expertos tienen que intercambiar activaciones entre tarjetas en cada capa, y el lote se reparte entre más expertos de lo que sugiere el promedio. El estimador aplica ahora una corrección deliberadamente conservadora, calibrada con cifras medidas y no elegida a dedo — por eso se queda corto en vez de largo. Trate cada cifra de aquí como un suelo que debe superar la máquina, no como un objetivo para planificar.

Lo segundo que oculta la aritmética es que una mezcla de expertos es más difícil de repartir bien. Un modelo denso repartido entre tarjetas se sincroniza una vez por capa; una mezcla, además, tiene que enviar cada token a la tarjeta que tenga el experto elegido, lo cual es un patrón de tráfico distinto y menos predecible. Esta es una de las pocas cargas de trabajo en las que [la interconexión de verdad justifica su precio](https://gpuserver.io/es/guides/nvlink-vs-pcie), en lugar de limitarse a aparecer en la factura.

## La mitad que sale más barata

Todo lo anterior han sido malas noticias para los modelos grandes. Aquí está la compensación, y es grande, y casi ninguna comparación la menciona: los modelos con más parámetros de esta página tienen la caché de clave/valor *más pequeña* por token. La caché la determina el diseño de la atención —capas, cabezas de clave/valor, dimensión de cabeza— y no tiene nada que ver con cuántos expertos haya detrás de la atención.

**Caché de clave/valor por token, y lo que cuesta un flujo según la longitud de contexto**

| Modelo | Caché por token | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) 8 cabezas KV | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) 4 cabezas KV | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) Atención latente | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B 8 cabezas KV | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B 8 cabezas KV | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |

Esas columnas son por *solicitud concurrente*. Multiplique por el número de personas que usan el endpoint a la vez, y el orden de la última columna decide su máquina mucho más que los pesos.

**DeepSeek V3 671B-A37B (MoE) tiene la caché más pequeña de la lista, a 70 KiB por token.** Frente a Llama 3.3 70B a 320 KiB, eso es un factor de **4.6×** a favor del modelo más grande. Comprime la caché proyectando las claves y los valores en un vector latente compartido y pequeño, en lugar de almacenarlos por cabeza. Así que el modelo que más cuesta cargar es el que menos cuesta mantener ocupado — por eso sigue siendo utilizable con contexto largo, y por eso la aritmética se invierte en cuanto sirve a más de un puñado de personas a la vez.

La lectura práctica: los pesos son una entrada fija, la caché es el coste de funcionamiento. Una mezcla de expertos cobra una entrada enorme y luego un coste de funcionamiento pequeño por usuario. Un modelo denso de capacidad comparable funciona al revés. Cuál de los dos le sale más barato lo deciden la concurrencia y la longitud de contexto, no el recuento de parámetros de la ficha del modelo.

## En qué máquinas caben

En 4 bits, con el contexto de referencia, y tomando el nodo más barato de nuestro catálogo en el que cabe cada modelo — ya sea en una tarjeta o repartido entre el nodo. Son el umbral de entrada, no recomendaciones; la siguiente sección explica por qué.

**La configuración más barata que alquilamos en la que cabe cada modelo de mezcla de expertos**

| Modelo | Necesita | Nodo más barato en el que cabe | Al mes | Tokens/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | [4 × NVIDIA L4](https://gpuserver.io/es/gpu/nvidia-l4) 96 GB en total · 24 GB por tarjeta | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | [8 × NVIDIA L4](https://gpuserver.io/es/gpu/nvidia-l4) 192 GB en total · 24 GB por tarjeta | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | [8 × NVIDIA A100 PCIe](https://gpuserver.io/es/gpu/a100-80gb) 640 GB en total · 80 GB por tarjeta | $7,906 | 37 |

Cada uno de estos es un nodo multitarjeta, y ese es el titular honesto de esta página: ninguno de estos modelos cabe en una sola tarjeta de nuestro catálogo, por pequeña que la cifra de activos los haga parecer. [El catálogo completo](https://gpuserver.io/es/#catalog) tiene el resto de las configuraciones, y [el configurador](https://gpuserver.io/es/configure) ejecutará esta misma comprobación con su propio modelo y contexto.

## El nodo más barato es el equivocado

Caber es un umbral, no un objetivo. Una vez que un modelo está repartido entre un nodo, el rendimiento depende del ancho de banda de memoria de las tarjetas entre las que se reparte — y el ancho de banda por dólar varía en más del doble entre configuraciones que superan igualmente ese umbral de memoria. Aquí tiene a DeepSeek V3 671B-A37B (MoE) en cada nodo en el que cabe, ordenado por precio, con la única columna que importa a la derecha.

**Cada nodo en el que cabe DeepSeek V3 671B-A37B (MoE), con el precio mensual de un token por segundo**

| Configuración | VRAM | Al mes | Tokens/s | $ por token/s |
|---|---|---|---|---|
| [8 × NVIDIA A100 PCIe](https://gpuserver.io/es/gpu/a100-80gb) GN-A10080×8 | 640 GB | $7,906 | 37 | $213.68 |
| [8 × NVIDIA A100 SXM4](https://gpuserver.io/es/gpu/a100-sxm4) GN-A100SXM×8 | 640 GB | $8,355 | 39 | $214.23 |
| [4 × NVIDIA H200 SXM5](https://gpuserver.io/es/gpu/h200) GN-H200×4 | 564 GB | $8,405 | 62 | $135.56 |
| [8 × NVIDIA H100 PCIe](https://gpuserver.io/es/gpu/h100-pcie) GN-H100PCIE×8 | 640 GB | $10,568 | 38 | $278.11 |
| [8 × NVIDIA H100 SXM5](https://gpuserver.io/es/gpu/h100-sxm5) GN-H100SXM×8 | 640 GB | $11,509 | 64 | $179.83 |
| [4 × NVIDIA B200 SXM6](https://gpuserver.io/es/gpu/b200) GN-B200×4 | 720 GB | $11,790 | 103 | $114.47 |
| [8 × NVIDIA H200 SXM5](https://gpuserver.io/es/gpu/h200) GN-H200×8 | 1128 GB | $15,945 | 91 | $175.22 |
| [8 × NVIDIA B200 SXM6](https://gpuserver.io/es/gpu/b200) GN-B200×8 | 1440 GB | $22,351 | 152 | $147.05 |

La celda verde es la mejor relación calidad-precio de la lista, y no es la fila más barata. Pasar de $7,906 a $11,790 multiplica la factura por 1.5× y el rendimiento por 2.8× — paga más y cada token le sale más barato. Ordenar un catálogo por precio y quedarse con la primera máquina que encaja es la forma de gastar dos veces el presupuesto de servicio.

Una advertencia sobre esa columna, y se aplica a cualquier tabla de precio por rendimiento que lea en su vida: usa generación de flujo único. Con procesamiento continuo por lotes, el agregado sube varias veces en cada fila, y no sube en la misma proporción en todas — un nodo con más memoria libre tras los pesos aguanta más secuencias concurrentes. El orden se mantiene estable; las cifras absolutas son conservadoras. [La economía de ese agregado](https://gpuserver.io/es/guides/api-vs-self-hosting) se explica aparte.

## Cuándo una mezcla de expertos es la respuesta correcta

En orden. Deténgase en la primera línea que le describa.

1. **Un modelo denso que cabe en una tarjeta hace el trabajo.** Tómelo y no mire atrás. Una sola tarjeta significa nada de sharding, ninguna cuestión de interconexión, nada de tráfico de enrutamiento entre expertos, y una máquina que cuesta una fracción de un nodo. La mayoría de los productos que creen necesitar un modelo abierto de frontera solo necesitan un buen 32B.
2. **Necesita la calidad y su contexto es largo.** Aquí es donde una mezcla de expertos es, de verdad, el mejor instrumento disponible: paga una vez por los pesos, y la caché pequeña permite que la máquina siga sirviendo conversaciones largas sin venirse abajo. Dimensione el nodo según los pesos, y luego consulte la tabla de caché para su contexto real.
3. **Necesita la calidad y sirve a mucha gente a la vez.** Misma respuesta, mismo motivo, y la ventaja crece con la concurrencia. El coste fijo se amortiza entre todos los flujos, mientras que el coste por flujo se mantiene bajo.
4. **Necesita la calidad, pero solo de vez en cuando.** Entonces está alquilando un nodo grande para mantenerlo caliente unas horas a la semana, que es el peor uso posible de un plazo mensual. O agrupe el trabajo para que se ejecute de una sola vez, o use un endpoint alojado para este caso y reserve su propia máquina para la carga constante.
5. **Quiere hacerle fine-tuning.** Es otro problema, y una máquina más grande: el entrenamiento toca todos los expertos y necesita estado del optimizador para cada uno, así que la memoria que ya complicaba la inferencia se vuelve prohibitiva. El [fine-tuning con adaptadores](https://gpuserver.io/es/guides/lora-finetune) sobre un modelo denso es la vía realista para casi todo el mundo.

Sea cual sea la línea en la que se haya detenido, el primer número que hay que comprobar es el recuento total de parámetros, en la precisión con la que piense servir el modelo. Todo lo demás de esta página — la velocidad, la caché, el precio por token por segundo — solo importa una vez que el modelo está en memoria. El [configurador](https://gpuserver.io/es/configure) hace toda esa comprobación contra cada nodo que alquilamos, y aplica a la estimación de rendimiento la misma corrección de enrutamiento que las tablas de arriba. Si prefiere ver antes la aritmética de memoria completa, [es una guía propia](https://gpuserver.io/es/guides/vram-sizing); y si todavía no ha decidido el formato numérico, [esa elección viene antes que esta](https://gpuserver.io/es/guides/awq-vs-gptq-vs-fp8).

## Compare su propia mezcla de expertos con máquinas reales.

El configurador incluye cada nodo que alquilamos, aplica la misma aritmética que esta página, y le indica en cuáles cabe su modelo antes de que pague nada.

[Abrir el configurador](https://gpuserver.io/es/configure) [Leer las guías](https://gpuserver.io/es/guides)

## Otras guías

- [Coste · 6 min Cuándo el alquiler mensual gana al alquiler por horas El punto de equilibrio con cifras reales, los tres costes que un precio por hora oculta hasta la factura, y la trampa del tiempo inactivo que la triplica. Leer la guía](https://gpuserver.io/es/guides/monthly-vs-hourly)
- [Coste · 9 min Autoalojamiento frente a una API por token El punto de equilibrio entre pagar una API por token y alquilar una GPU, con nuestros precios y rendimiento reales — y las cuatro cosas que la aritmética omite. Leer la guía](https://gpuserver.io/es/guides/api-vs-self-hosting)
- [Práctica · 11 min Servir Llama 3.3 70B en un nodo De una máquina entregada a un endpoint compatible con OpenAI, con los parámetros que importan y los dos que reducen a la mitad su rendimiento sin avisar. Leer la guía](https://gpuserver.io/es/guides/serve-llama-70b)

---

Fuente: https://gpuserver.io/es/guides/mixture-of-experts/. Este archivo se genera a partir de los mismos datos que el sitio web; si una cifra aquí difiere de la de una página, prevalece la página y este archivo está desactualizado: la fuente canónica es https://gpuserver.io/.
