Todos los 6 centros de datos operativos

Pagado en cripto · Sin verificación de identidad · Acceso root en en menos de 5 minutos

Guía de Dimensionamiento · 10 min de lectura

Lo que realmente cuesta una mezcla de expertos.

Un nombre como «235B-A22B» contiene dos cifras, y casi todo el mundo lee la que no es. Una decide qué alquila; la otra decide con qué rapidez responde. Pueden diferir en un factor de diez.

La respuesta corta

Los parámetros totales deciden la máquina
DeepSeek V3 671B-A37B (MoE) en 4 bits necesita 386 GB con 8k de contexto. Un modelo denso del tamaño de sus parámetros activos necesitaría 22 GB — 17.6× menos.
Los parámetros activos deciden la velocidad
Solo se lee una fracción de los pesos por token, así que genera más rápido que un modelo denso de la misma masa — pero el enrutamiento se lleva de vuelta buena parte de esa ventaja.
El nodo más barato en el que cabe
8 × NVIDIA A100 PCIe a $7,906 al mes. Casi nunca es la que conviene alquilar.
La que merece la pena alquilar
4 × NVIDIA B200 SXM6 a $11,790 — 1.5× el dinero por 2.8× el rendimiento.

La versión corta

Una mezcla de expertos divide la parte feed-forward de cada capa en muchas redes pequeñas y hace pasar cada token por solo unas pocas de ellas. El nombre publicado recoge ambos datos: el número total de parámetros, y el número que está activo para un token cualquiera. El primero debe estar entero en memoria; el segundo es lo único que se lee en cada token. Esa única frase es la guía entera, y entenderla al revés es el error más caro que le hemos visto cometer a la gente antes de hacer un pedido.

La consecuencia es un modelo con una forma de coste extraña: se alquila como un gigante y funciona como uno de tamaño medio. Que eso sea una ganga o una trampa depende por completo de cuál de los dos números sea su cuello de botella.

¿Dimensionar la máquina? Use el total. Cada experto tiene que estar residente, porque no se puede saber de antemano cuáles va a necesitar el siguiente token. El enrutamiento se decide token a token, en tiempo de ejecución.

¿Calcular la velocidad? Parta de la cifra de activos y luego aplique un descuento importante. La generación solo lee los pesos activos, que es precisamente la idea —pero el enrutador, el despacho de expertos y el tráfico entre tarjetas no son gratis, y escalan mal en todo un nodo.

¿Sirve contexto largo o a muchos usuarios? Fíjese en el diseño de la atención, no en el recuento de parámetros. Los modelos más grandes de esta página tienen la caché de clave/valor más pequeña por token, y a partir de cierta longitud eso invierte el orden por completo.

¿Solo quiere la calidad? Un modelo denso que cabe en una tarjeta es más fácil, más barato y más rápido de operar que una mezcla de expertos repartida entre ocho. Recurra a un MoE cuando ningún modelo denso le dé la respuesta que necesita, no porque el nombre suene impresionante.

La aritmética de más abajo es la misma que ejecuta el configurador, sobre el mismo catálogo. Si todavía no ha calculado cuánta memoria necesita un modelo en general, esa fórmula va primero —esta página es lo que cambia en cuanto el modelo es una mezcla de expertos.

Leer el nombre

Circulan tres convenciones de nomenclatura, y las tres codifican el mismo par de números, por eso sobrevive la confusión. En cuanto sepa leerlas, la pregunta del dimensionamiento se responde sola.

235B-A22BTotal, luego activosEl más claro de los tres. 235 000 millones de parámetros residen en memoria; de ellos se leen 22 000 millones para cualquier token dado. La letra A significa activo, y es el número que no le dice qué debe alquilar.
671B-A37BMisma convención, más grandeA este tamaño la brecha se vuelve absurda a propósito: la proporción de activos es inferior al seis por ciento. De ese 37 no se deduce nada sobre la máquina que necesita.
8×22BExpertos, luego el tamaño del expertoLa convención más antigua, y la que más confunde. No significa 176 000 millones de parámetros, porque la atención y los embeddings se comparten en lugar de duplicarse; y tampoco significa 22 000 millones, porque hay dos expertos activos por token, no uno.
A22B, A37BUn promedio, no una garantíaLa cifra de activos es lo que cuesta el enrutamiento en un texto típico. No es un tope: un lote cuyos tokens se repartan entre muchos expertos toca más partes del modelo, lo que es una de las razones por las que el rendimiento medido queda por debajo de la aritmética.
Los modelos de mezcla de expertos de nuestro catálogo de dimensionamiento, parámetros totales frente a activos
Modelo Parámetros totales Activos por token Proporción de activos
Mixtral 8×22B (MoE)56 capas 141 B 39 B 28 %
Qwen 3 235B-A22B (MoE)94 capas 235 B 22 B 9 %
DeepSeek V3 671B-A37B (MoE)61 capas 671 B 37 B 6 %
Llama 3.3 70BDenso, a modo de comparación 70 B 70 B 100 %

La última columna es la que hay que recordar. Un modelo denso lee todo lo que almacena; una mezcla de expertos lee una porción. Todo lo que estos modelos tienen de extraño — bueno y malo — sale de esa única línea.

La memoria que realmente alquila

Aquí está la trampa entera en una sola tabla. La columna del medio es lo que el modelo necesita en la máquina; la columna siguiente es lo que habría presupuestado un lector que se tomara al pie de la letra la cifra de activos. La última columna es la factura de esa mala lectura.

VRAM necesaria en 4 bits con 8k de contexto, frente a lo que sugiere la cifra de parámetros activos
Modelo Pesos en 4 bits Total necesario Si fuera su tamaño activo Exceso
Mixtral 8×22B (MoE) 71 GB 83 GBa 8k 24 GB 3.4×
Qwen 3 235B-A22B (MoE) 118 GB 137 GBa 8k 14 GB 9.5×
DeepSeek V3 671B-A37B (MoE) 336 GB 386 GBa 8k 22 GB 17.6×

Lea la última columna como un error de compra. Quien dimensione solo con la cifra de activos se pondría a buscar una sola tarjeta y acabaría necesitando un nodo entero — no una máquina algo más grande, sino una máquina de otra categoría, y de otro precio.

No, no puede mantener en disco los expertos que no usa. Es la primera idea que se le ocurre a todo el mundo, y las pilas de servicio la ofrecen. El problema es que el enrutamiento se decide token a token: el conjunto de expertos que hace falta cambia varias veces por cada palabra generada, así que una tarjeta que solo tiene un subconjunto se pasa el tiempo trayendo pesos por PCIe en lugar de calcular. El resultado no es un modelo algo más lento, es uno que funciona a una fracción pequeña de su velocidad. El offloading es una forma de hacer que un modelo funcione en una máquina que no lo puede alojar, no una forma de servirlo.

Lo que compran los parámetros activos

La generación está limitada por el ancho de banda de memoria: cada token nuevo exige releer los pesos que intervienen en él. Una mezcla de expertos solo lee su porción activa, así que el techo de su velocidad lo marca un número mucho más pequeño de lo que sugiere su tamaño. Esa parte de la promesa es real, y es la razón de que estos modelos existan.

La tabla de abajo pone todos los modelos en la misma máquina — 8 × NVIDIA A100 PCIe a $7,906 al mes, el nodo más barato de nuestro catálogo en el que caben todos a la vez. Comparar cifras de rendimiento tomadas en máquinas distintas no compara nada.

Generación de flujo único en un nodo, mezclas de expertos frente a modelos densos
Modelo Total Lectura por token Tokens/s estimados
DeepSeek V3 671B-A37B (MoE)Mezcla de expertos · repartido entre 8 tarjetas 671 B 18.5 GB 37un flujo
Llama 3.1 405BDenso · repartido entre 8 tarjetas 405 B 202.5 GB 19un flujo
Qwen 3 235B-A22B (MoE)Mezcla de expertos · repartido entre 8 tarjetas 235 B 11.0 GB 62un flujo
Mixtral 8×22B (MoE)Mezcla de expertos · repartido entre 8 tarjetas 141 B 19.5 GB 35un flujo
Llama 3.3 70BDenso · en una tarjeta 70 B 35.0 GB 25un flujo

Las dos filas que merece la pena comparar son la mezcla de expertos más grande y el modelo denso más grande, porque ambos están repartidos entre todo el nodo. La mezcla es el modelo más grande, por un margen amplio, y aun así genera más rápido, porque lee una fracción de sí misma por token — ese es precisamente el intercambio que justifica la arquitectura. Lea de otra manera las filas marcadas como en una tarjeta: esos modelos ocupan una sola tarjeta del nodo y dejan las otras siete libres, lo que es una máquina más barata esperando a que la elijan, no una más lenta.

Estas cifras ya llevan incorporada una penalización importante, y así debe ser. La aritmética pura de parámetros activos sobreestima mucho una mezcla de expertos. Nuestra primera versión de este estimador hacía exactamente eso, y se equivocaba por un factor de casi cinco frente a las mediciones publicadas del modelo más grande de esta página. El enrutamiento cuesta un paso propio, los expertos tienen que intercambiar activaciones entre tarjetas en cada capa, y el lote se reparte entre más expertos de lo que sugiere el promedio. El estimador aplica ahora una corrección deliberadamente conservadora, calibrada con cifras medidas y no elegida a dedo — por eso se queda corto en vez de largo. Trate cada cifra de aquí como un suelo que debe superar la máquina, no como un objetivo para planificar.

Lo segundo que oculta la aritmética es que una mezcla de expertos es más difícil de repartir bien. Un modelo denso repartido entre tarjetas se sincroniza una vez por capa; una mezcla, además, tiene que enviar cada token a la tarjeta que tenga el experto elegido, lo cual es un patrón de tráfico distinto y menos predecible. Esta es una de las pocas cargas de trabajo en las que la interconexión de verdad justifica su precio, en lugar de limitarse a aparecer en la factura.

La mitad que sale más barata

Todo lo anterior han sido malas noticias para los modelos grandes. Aquí está la compensación, y es grande, y casi ninguna comparación la menciona: los modelos con más parámetros de esta página tienen la caché de clave/valor más pequeña por token. La caché la determina el diseño de la atención —capas, cabezas de clave/valor, dimensión de cabeza— y no tiene nada que ver con cuántos expertos haya detrás de la atención.

Caché de clave/valor por token, y lo que cuesta un flujo según la longitud de contexto
Modelo Caché por token 4k 8k 32k 128k
Mixtral 8×22B (MoE)8 cabezas KV 224 KiB 0.9 GB 1.8 GB 7.0 GB 28.0 GB
Qwen 3 235B-A22B (MoE)4 cabezas KV 188 KiB 0.7 GB 1.5 GB 5.9 GB 23.5 GB
DeepSeek V3 671B-A37B (MoE)Atención latente 70 KiB 0.3 GB 0.5 GB 2.2 GB 8.8 GB
Llama 3.3 70B8 cabezas KV 320 KiB 1.3 GB 2.5 GB 10.0 GB 40.0 GB
Llama 3.1 405B8 cabezas KV 504 KiB 2.0 GB 3.9 GB 15.8 GB 63.0 GB

Esas columnas son por solicitud concurrente. Multiplique por el número de personas que usan el endpoint a la vez, y el orden de la última columna decide su máquina mucho más que los pesos.

DeepSeek V3 671B-A37B (MoE) tiene la caché más pequeña de la lista, a 70 KiB por token. Frente a Llama 3.3 70B a 320 KiB, eso es un factor de 4.6× a favor del modelo más grande. Comprime la caché proyectando las claves y los valores en un vector latente compartido y pequeño, en lugar de almacenarlos por cabeza. Así que el modelo que más cuesta cargar es el que menos cuesta mantener ocupado — por eso sigue siendo utilizable con contexto largo, y por eso la aritmética se invierte en cuanto sirve a más de un puñado de personas a la vez.

La lectura práctica: los pesos son una entrada fija, la caché es el coste de funcionamiento. Una mezcla de expertos cobra una entrada enorme y luego un coste de funcionamiento pequeño por usuario. Un modelo denso de capacidad comparable funciona al revés. Cuál de los dos le sale más barato lo deciden la concurrencia y la longitud de contexto, no el recuento de parámetros de la ficha del modelo.

En qué máquinas caben

En 4 bits, con el contexto de referencia, y tomando el nodo más barato de nuestro catálogo en el que cabe cada modelo — ya sea en una tarjeta o repartido entre el nodo. Son el umbral de entrada, no recomendaciones; la siguiente sección explica por qué.

La configuración más barata que alquilamos en la que cabe cada modelo de mezcla de expertos
Modelo Necesita Nodo más barato en el que cabe Al mes Tokens/s
Mixtral 8×22B (MoE) 83 GB 4 × NVIDIA L496 GB en total · 24 GB por tarjeta $564 4
Qwen 3 235B-A22B (MoE) 137 GB 8 × NVIDIA L4192 GB en total · 24 GB por tarjeta $1,106 10
DeepSeek V3 671B-A37B (MoE) 386 GB 8 × NVIDIA A100 PCIe640 GB en total · 80 GB por tarjeta $7,906 37

Cada uno de estos es un nodo multitarjeta, y ese es el titular honesto de esta página: ninguno de estos modelos cabe en una sola tarjeta de nuestro catálogo, por pequeña que la cifra de activos los haga parecer. El catálogo completo tiene el resto de las configuraciones, y el configurador ejecutará esta misma comprobación con su propio modelo y contexto.

El nodo más barato es el equivocado

Caber es un umbral, no un objetivo. Una vez que un modelo está repartido entre un nodo, el rendimiento depende del ancho de banda de memoria de las tarjetas entre las que se reparte — y el ancho de banda por dólar varía en más del doble entre configuraciones que superan igualmente ese umbral de memoria. Aquí tiene a DeepSeek V3 671B-A37B (MoE) en cada nodo en el que cabe, ordenado por precio, con la única columna que importa a la derecha.

Cada nodo en el que cabe DeepSeek V3 671B-A37B (MoE), con el precio mensual de un token por segundo
Configuración VRAM Al mes Tokens/s $ por token/s
8 × NVIDIA A100 PCIeGN-A10080×8 640 GB $7,906 37 $213.68
8 × NVIDIA A100 SXM4GN-A100SXM×8 640 GB $8,355 39 $214.23
4 × NVIDIA H200 SXM5GN-H200×4 564 GB $8,405 62 $135.56
8 × NVIDIA H100 PCIeGN-H100PCIE×8 640 GB $10,568 38 $278.11
8 × NVIDIA H100 SXM5GN-H100SXM×8 640 GB $11,509 64 $179.83
4 × NVIDIA B200 SXM6GN-B200×4 720 GB $11,790 103 $114.47
8 × NVIDIA H200 SXM5GN-H200×8 1128 GB $15,945 91 $175.22
8 × NVIDIA B200 SXM6GN-B200×8 1440 GB $22,351 152 $147.05

La celda verde es la mejor relación calidad-precio de la lista, y no es la fila más barata. Pasar de $7,906 a $11,790 multiplica la factura por 1.5× y el rendimiento por 2.8× — paga más y cada token le sale más barato. Ordenar un catálogo por precio y quedarse con la primera máquina que encaja es la forma de gastar dos veces el presupuesto de servicio.

Una advertencia sobre esa columna, y se aplica a cualquier tabla de precio por rendimiento que lea en su vida: usa generación de flujo único. Con procesamiento continuo por lotes, el agregado sube varias veces en cada fila, y no sube en la misma proporción en todas — un nodo con más memoria libre tras los pesos aguanta más secuencias concurrentes. El orden se mantiene estable; las cifras absolutas son conservadoras. La economía de ese agregado se explica aparte.

Cuándo una mezcla de expertos es la respuesta correcta

En orden. Deténgase en la primera línea que le describa.

  1. Un modelo denso que cabe en una tarjeta hace el trabajo. Tómelo y no mire atrás. Una sola tarjeta significa nada de sharding, ninguna cuestión de interconexión, nada de tráfico de enrutamiento entre expertos, y una máquina que cuesta una fracción de un nodo. La mayoría de los productos que creen necesitar un modelo abierto de frontera solo necesitan un buen 32B.
  2. Necesita la calidad y su contexto es largo. Aquí es donde una mezcla de expertos es, de verdad, el mejor instrumento disponible: paga una vez por los pesos, y la caché pequeña permite que la máquina siga sirviendo conversaciones largas sin venirse abajo. Dimensione el nodo según los pesos, y luego consulte la tabla de caché para su contexto real.
  3. Necesita la calidad y sirve a mucha gente a la vez. Misma respuesta, mismo motivo, y la ventaja crece con la concurrencia. El coste fijo se amortiza entre todos los flujos, mientras que el coste por flujo se mantiene bajo.
  4. Necesita la calidad, pero solo de vez en cuando. Entonces está alquilando un nodo grande para mantenerlo caliente unas horas a la semana, que es el peor uso posible de un plazo mensual. O agrupe el trabajo para que se ejecute de una sola vez, o use un endpoint alojado para este caso y reserve su propia máquina para la carga constante.
  5. Quiere hacerle fine-tuning. Es otro problema, y una máquina más grande: el entrenamiento toca todos los expertos y necesita estado del optimizador para cada uno, así que la memoria que ya complicaba la inferencia se vuelve prohibitiva. El fine-tuning con adaptadores sobre un modelo denso es la vía realista para casi todo el mundo.

Sea cual sea la línea en la que se haya detenido, el primer número que hay que comprobar es el recuento total de parámetros, en la precisión con la que piense servir el modelo. Todo lo demás de esta página — la velocidad, la caché, el precio por token por segundo — solo importa una vez que el modelo está en memoria. El configurador hace toda esa comprobación contra cada nodo que alquilamos, y aplica a la estimación de rendimiento la misma corrección de enrutamiento que las tablas de arriba. Si prefiere ver antes la aritmética de memoria completa, es una guía propia; y si todavía no ha decidido el formato numérico, esa elección viene antes que esta.

Compare su propia mezcla de expertos con máquinas reales.

El configurador incluye cada nodo que alquilamos, aplica la misma aritmética que esta página, y le indica en cuáles cabe su modelo antes de que pague nada.

Iniciar sesión

Consola, facturas y acceso fuera de banda.

¿Aún no tiene cuenta?

No hay un registro aparte. Su cuenta se crea mientras realiza su primer pedido — elige el correo electrónico y la contraseña en el paso de pago, y la consola está abierta para cuando lo está la máquina.

Configurar un servidor

Language