L’ensemble des 6 centres de données opérationnels

Payé en crypto · Sans vérification d’identité · Accès root en moins de 5 minutes

Dimensionnement guide · 10 min de lecture

Ce que coûte vraiment un mélange d’experts.

Un nom comme « 235B-A22B » contient deux nombres, et presque tout le monde lit le mauvais. L’un décide ce que vous louez ; l’autre décide de sa vitesse de réponse. L’écart entre eux peut atteindre un facteur dix.

En bref

Le nombre total de paramètres décide de la machine
DeepSeek V3 671B-A37B (MoE) en 4 bits nécessite 386 GB avec 8k de contexte. Un modèle dense de la taille de ses paramètres actifs nécessiterait 22 GB — soit 17.6× de moins.
Les paramètres actifs décident de la vitesse
Seule une fraction des poids est lue par token, donc il génère plus vite qu’un modèle dense de même masse — mais le routage reprend aussitôt une grande partie de cet avantage.
Le nœud le moins cher qui le tient
8 × NVIDIA A100 PCIe à $7,906 par mois. Ce n’est presque jamais celui qu’il faut louer.
Celui qui vaut la peine d’être loué
4 × NVIDIA B200 SXM6 à $11,790 — 1.5× le prix pour 2.8× le débit.

La version courte

Un mélange d’experts découpe la partie feed-forward de chaque couche en de nombreux petits réseaux, et n’envoie chaque token qu’à travers quelques-uns d’entre eux. Le nom publié consigne ces deux faits : le nombre total de paramètres, et le nombre de paramètres actifs pour un token donné. Vous devez garder la totalité du premier en mémoire, et vous ne lisez que le second par token. Cette seule phrase résume tout le guide, et l’inverser est l’erreur la plus coûteuse que nous voyons les gens commettre avant de passer commande.

La conséquence est un modèle au profil de coût étrange : il se loue comme un géant et tourne comme un modèle de taille moyenne. Que ce soit une bonne affaire ou un piège dépend entièrement de celui des deux nombres qui constitue votre goulot d’étranglement.

Vous dimensionnez la machine ? Utilisez le total. Chaque expert doit être résident, car vous ne pouvez pas savoir à l’avance desquels le prochain token aura besoin. Le routage se décide par token, à l’exécution.

Vous estimez la vitesse ? Partez du nombre de paramètres actifs, puis appliquez une forte décote. La génération ne lit que les poids actifs, ce qui est précisément le but — mais le routeur, la répartition vers les experts et le trafic entre les cartes ne sont pas gratuits, et ils passent mal à l’échelle sur un nœud.

Vous servez un contexte long ou de nombreux utilisateurs ? Regardez la conception de l’attention, pas le nombre de paramètres. Les plus gros modèles de cette page ont le plus petit cache clef/valeur par token, et au-delà d’une certaine longueur, cela inverse complètement le classement.

Vous voulez seulement la qualité ? Un modèle dense qui tient sur une seule carte est plus simple, moins cher et plus rapide à exploiter qu’un mélange d’experts réparti sur huit cartes. Choisissez un MoE quand aucun modèle dense ne vous donne la réponse dont vous avez besoin, pas parce que le nom fait impression.

Le calcul ci-dessous est exactement celui qu’exécute le configurateur, sur le même catalogue. Si vous n’avez pas encore déterminé de combien de mémoire un modèle a besoin en général, cette formule vient d’abord — cette page couvre ce qui change une fois que le modèle est un mélange d’experts.

Lire le nom

Trois conventions de nommage circulent, et elles encodent toutes la même paire de nombres, ce qui explique que la confusion persiste. Une fois que vous savez les lire, la question du dimensionnement se résout d’elle-même.

235B-A22BTotal, puis actifLa plus claire des trois. 235 milliards de paramètres vivent en mémoire ; 22 milliards d’entre eux sont lus pour un token donné. La lettre A signifie active, et c’est le nombre qui ne vous indique en aucun cas quoi louer.
671B-A37BMême convention, en plus grandÀ cette taille, l’écart devient délibérément absurde : la part active est inférieure à six pour cent. Rien, dans la machine dont vous avez besoin, ne découle de ce 37.
8×22BExperts, puis tailleL’ancienne convention, et celle qui induit le plus en erreur. Elle ne signifie pas 176 milliards de paramètres, car l’attention et les embeddings sont partagés plutôt que dupliqués ; et elle ne signifie pas non plus 22 milliards, car deux experts sont actifs par token, pas un seul.
A22B, A37BUne moyenne, pas une garantieLe nombre de paramètres actifs correspond au coût du routage sur un texte typique. Ce n’est pas un plafond : un lot dont les tokens se répartissent sur de nombreux experts sollicite une plus grande partie du modèle, ce qui explique en partie pourquoi le débit mesuré reste en dessous du calcul théorique.
Les modèles à mélange d’experts de notre catalogue de dimensionnement, nombre total de paramètres contre paramètres actifs
Modèle Nombre total de paramètres Actifs par token Part active
Mixtral 8×22B (MoE)56 couches 141 B 39 B 28 %
Qwen 3 235B-A22B (MoE)94 couches 235 B 22 B 9 %
DeepSeek V3 671B-A37B (MoE)61 couches 671 B 37 B 6 %
Llama 3.3 70BDense, à titre de comparaison 70 B 70 B 100 %

La dernière colonne est celle qu’il faut retenir. Un modèle dense lit tout ce qu’il stocke ; un mélange d’experts n’en lit qu’une tranche. Tout ce que ces modèles ont d’étrange — en bien comme en mal — découle de cette seule ligne.

La mémoire que vous louez réellement

Voici tout le piège en un seul tableau. La colonne du milieu indique ce dont le modèle a besoin sur la machine ; la colonne suivante indique ce qu’aurait budgété un lecteur ayant pris le nombre de paramètres actifs au pied de la lettre. La dernière colonne est la facture de cette erreur de lecture.

VRAM nécessaire en 4 bits avec 8k de contexte, comparée à ce que suggère le nombre de paramètres actifs
Modèle Poids en 4 bits Total nécessaire Si c’était sa taille active Dépassement
Mixtral 8×22B (MoE) 71 GB 83 GBà 8k 24 GB 3.4×
Qwen 3 235B-A22B (MoE) 118 GB 137 GBà 8k 14 GB 9.5×
DeepSeek V3 671B-A37B (MoE) 336 GB 386 GBà 8k 22 GB 17.6×

Lisez la dernière colonne comme une erreur d’achat. Quelqu’un qui dimensionne uniquement sur le nombre de paramètres actifs partirait à la recherche d’une seule carte pour finalement avoir besoin d’un nœud entier — pas une machine un peu plus grande, mais une catégorie de machine différente, à un prix différent.

Non, vous ne pouvez pas garder les experts inutilisés sur disque. C’est la première idée qui vient à l’esprit, et les piles de service la proposent effectivement. Le problème est que le routage se décide par token : l’ensemble des experts dont vous avez besoin change plusieurs fois par mot généré, si bien qu’une carte qui n’en détient qu’un sous-ensemble passe son temps à rapatrier des poids via PCIe au lieu de calculer. Le résultat n’est pas un modèle un peu plus lent, c’est un modèle qui tourne à une infime fraction de sa vitesse. Le déchargement permet de faire tourner un modèle sur une machine qui ne peut pas le contenir, pas de le servir.

Ce que procurent les paramètres actifs

La génération est limitée par la bande passante mémoire : chaque nouveau token exige de relire les poids qui y participent. Un mélange d’experts ne lit que sa tranche active, si bien que le plafond de sa vitesse est fixé par un nombre bien plus petit que sa taille ne le laisse penser. Cette partie de la promesse est bien réelle, et c’est précisément la raison d’être de ces modèles.

Le tableau ci-dessous place chaque modèle sur la même machine — 8 × NVIDIA A100 PCIe à $7,906 par mois, le nœud le moins cher de notre catalogue qui les tient tous à la fois. Comparer des chiffres de débit relevés sur des machines différentes ne compare rien du tout.

Génération en flux unique sur un même nœud, mélanges d’experts contre modèles denses
Modèle Total Lu par token Tokens/s estimés
DeepSeek V3 671B-A37B (MoE)Mélange d’experts · réparti sur 8 cartes 671 B 18.5 GB 37flux unique
Llama 3.1 405BDense · réparti sur 8 cartes 405 B 202.5 GB 19flux unique
Qwen 3 235B-A22B (MoE)Mélange d’experts · réparti sur 8 cartes 235 B 11.0 GB 62flux unique
Mixtral 8×22B (MoE)Mélange d’experts · réparti sur 8 cartes 141 B 19.5 GB 35flux unique
Llama 3.3 70BDense · sur une carte 70 B 35.0 GB 25flux unique

Les deux lignes qui méritent d’être comparées sont le plus grand mélange d’experts et le plus grand modèle dense, car tous deux sont répartis sur l’ensemble du nœud. Le mélange est de loin le plus gros modèle des deux et il génère malgré tout plus vite, puisqu’il ne lit qu’une fraction de lui-même par token — c’est précisément l’arbitrage que cette architecture existe pour faire. Lisez différemment les lignes marquées sur une carte : ces modèles occupent une seule carte du nœud et en laissent sept autres libres, ce qui est une machine moins chère qui attend d’être choisie, pas une machine plus lente.

Ces chiffres intègrent déjà une forte pénalité, et c’est voulu. Un calcul purement fondé sur les paramètres actifs surestime largement un mélange d’experts. La première version de notre estimateur faisait exactement cela, et elle se trompait d’environ un facteur cinq par rapport aux mesures publiées pour le plus gros modèle de cette page. Le routage coûte une passe à lui seul, les experts doivent échanger des activations entre les cartes à chaque couche, et le lot sollicite davantage d’experts que ne le laisse penser la moyenne. L’estimateur applique désormais une correction délibérément prudente, calibrée sur des mesures réelles plutôt que choisie — ce qui explique qu’il tend à sous-estimer plutôt qu’à surestimer. Considérez chaque chiffre ici comme un plancher à dépasser sur la machine, pas comme un objectif à viser.

La deuxième chose que le calcul dissimule, c’est qu’un mélange d’experts est plus difficile à bien répartir entre cartes. Un modèle dense réparti sur plusieurs cartes se synchronise une fois par couche ; un mélange doit en plus router les tokens vers la carte qui détient l’expert choisi, ce qui donne un profil de trafic différent et moins prévisible. C’est l’un des rares usages où l’interconnexion justifie vraiment son prix plutôt que de simplement apparaître sur la facture.

La moitié qui devient moins chère

Jusqu’ici, tout était mauvais pour les gros modèles. Voici la compensation, et elle est de taille — presque aucune comparaison ne la mentionne : les modèles qui comptent le plus de paramètres sur cette page ont le plus petit cache clef/valeur par token. Le cache est déterminé par la conception de l’attention — couches, têtes clef/valeur, dimension des têtes — et n’a rien à voir avec le nombre d’experts placés derrière l’attention.

Cache clef/valeur par token, et ce que coûte un flux unique à chaque longueur de contexte
Modèle Cache par token 4k 8k 32k 128k
Mixtral 8×22B (MoE)8 têtes KV 224 KiB 0.9 GB 1.8 GB 7.0 GB 28.0 GB
Qwen 3 235B-A22B (MoE)4 têtes KV 188 KiB 0.7 GB 1.5 GB 5.9 GB 23.5 GB
DeepSeek V3 671B-A37B (MoE)Attention latente 70 KiB 0.3 GB 0.5 GB 2.2 GB 8.8 GB
Llama 3.3 70B8 têtes KV 320 KiB 1.3 GB 2.5 GB 10.0 GB 40.0 GB
Llama 3.1 405B8 têtes KV 504 KiB 2.0 GB 3.9 GB 15.8 GB 63.0 GB

Ces colonnes s’entendent par requête simultanée. Multipliez par le nombre de personnes qui utilisent le point de terminaison en même temps, et le classement de la dernière colonne détermine votre machine bien plus que les poids.

DeepSeek V3 671B-A37B (MoE) porte le plus petit cache de la liste, à 70 KiB par token. Face à Llama 3.3 70B à 320 KiB, c’est un facteur 4.6× en faveur du modèle le plus grand. Elle compresse le cache en projetant les clefs et les valeurs dans un petit vecteur latent partagé plutôt que de les stocker par tête. Le modèle le plus coûteux à charger est donc celui qui coûte le moins cher à garder occupé — ce qui explique qu’il reste utilisable en contexte long, et pourquoi le calcul s’inverse dès que vous servez plus qu’une poignée de personnes à la fois.

En pratique : les poids sont un droit d’entrée fixe, le cache est le coût d’exploitation. Un mélange d’experts facture un droit d’entrée énorme, puis un faible coût d’exploitation par utilisateur. Un modèle dense de capacité comparable fonctionne à l’inverse. Lequel des deux vous revient moins cher se décide sur la simultanéité et la longueur de contexte, pas sur le nombre de paramètres indiqué sur la fiche du modèle.

Quelles machines les tiennent

En 4 bits, avec le contexte de référence, et en retenant le nœud le moins cher de notre catalogue qui tient chaque modèle — que ce soit sur une seule carte ou réparti sur le nœud. Ce sont des tickets d’entrée, pas des recommandations ; la section suivante explique pourquoi.

La configuration la moins chère que nous louons qui tient chaque modèle à mélange d’experts
Modèle Besoins Nœud le moins cher qui le tient Par mois Tokens/s
Mixtral 8×22B (MoE) 83 GB 4 × NVIDIA L496 GB au total · 24 GB par carte $564 4
Qwen 3 235B-A22B (MoE) 137 GB 8 × NVIDIA L4192 GB au total · 24 GB par carte $1,106 10
DeepSeek V3 671B-A37B (MoE) 386 GB 8 × NVIDIA A100 PCIe640 GB au total · 80 GB par carte $7,906 37

Chacun d’entre eux est un nœud multi-cartes, et c’est le message honnête de cette page : rien dans notre catalogue ne tient l’un de ces modèles sur une seule carte, aussi petit que son nombre de paramètres actifs le fasse paraître. Le catalogue complet contient le reste des configurations, et le configurateur effectuera cette même vérification sur votre propre modèle et contexte.

Le nœud le moins cher n’est pas le bon

Tenir en mémoire est un seuil, pas un objectif. Une fois qu’un modèle est réparti sur un nœud, le débit dépend de la bande passante mémoire des cartes sur lesquelles il est réparti — et la bande passante par dollar varie de plus d’un facteur deux entre des configurations qui franchissent toutes la même barre de mémoire. Voici DeepSeek V3 671B-A37B (MoE) sur chaque nœud qui le tient, classé par prix, avec la seule colonne qui compte, à droite.

Tous les nœuds qui tiennent DeepSeek V3 671B-A37B (MoE), avec le prix mensuel d’un token par seconde
Configuration VRAM Par mois Tokens/s $ par token/s
8 × NVIDIA A100 PCIeGN-A10080×8 640 GB $7,906 37 $213.68
8 × NVIDIA A100 SXM4GN-A100SXM×8 640 GB $8,355 39 $214.23
4 × NVIDIA H200 SXM5GN-H200×4 564 GB $8,405 62 $135.56
8 × NVIDIA H100 PCIeGN-H100PCIE×8 640 GB $10,568 38 $278.11
8 × NVIDIA H100 SXM5GN-H100SXM×8 640 GB $11,509 64 $179.83
4 × NVIDIA B200 SXM6GN-B200×4 720 GB $11,790 103 $114.47
8 × NVIDIA H200 SXM5GN-H200×8 1128 GB $15,945 91 $175.22
8 × NVIDIA B200 SXM6GN-B200×8 1440 GB $22,351 152 $147.05

La cellule verte offre le meilleur rapport qualité-prix de la liste, et ce n’est pas la ligne la moins chère. Passer de $7,906 à $11,790 multiplie la facture par 1.5× et le débit par 2.8× — vous payez plus, et chaque token vous coûte moins cher. Trier un catalogue par prix et prendre la première machine qui tient, c’est le moyen de dépenser deux fois son budget de service.

Une réserve sur cette colonne, et elle s’applique à tout tableau prix/débit que vous lirez : elle utilise la génération en flux unique. Sous traitement par lots continu, l’agrégat grimpe plusieurs fois plus haut sur chaque ligne, et pas dans les mêmes proportions selon les lignes — un nœud disposant de plus de mémoire disponible après les poids tient davantage de séquences simultanées. Le classement est stable ; les chiffres absolus sont prudents. L’économie de cet agrégat est développée séparément.

Quand un mélange d’experts est la bonne réponse

Dans l’ordre. Arrêtez-vous à la première ligne qui vous correspond.

  1. Un modèle dense qui tient sur une seule carte fait l’affaire. Alors prenez-le, et n’y revenez plus. Une seule carte, c’est : aucune répartition entre cartes, aucune question d’interconnexion, aucun trafic de routage vers les experts, et une machine qui coûte une fraction d’un nœud. La plupart des produits qui pensent avoir besoin d’un modèle ouvert de pointe ont seulement besoin d’un bon 32B.
  2. Vous avez besoin de la qualité et votre contexte est long. C’est là qu’un mélange d’experts est vraiment le meilleur instrument disponible : vous payez les poids une seule fois, et le petit cache permet à la machine de continuer à servir de longues conversations sans tomber en panne. Dimensionnez le nœud sur les poids, puis vérifiez le tableau des caches pour votre contexte réel.
  3. Vous avez besoin de la qualité et vous servez beaucoup de monde à la fois. Même réponse, même raison, et l’avantage grandit avec la simultanéité. Le coût fixe est amorti sur chaque flux, tandis que le coût par flux reste faible.
  4. Vous avez besoin de la qualité, mais seulement occasionnellement. Vous louez alors un grand nœud pour le garder chaud quelques heures par semaine, ce qui est le pire usage possible d’une durée d’engagement mensuelle. Regroupez le travail pour qu’il s’exécute en une seule fois, ou utilisez un point de terminaison hébergé pour ce cas précis et gardez votre propre machine pour la charge constante.
  5. Vous voulez en affiner un. Problème différent, machine plus grande : l’entraînement sollicite chaque expert et nécessite un état d’optimiseur pour chacun d’eux, si bien que la mémoire déjà pénible pour l’inférence devient prohibitive. Le fine-tuning par adaptateur sur un modèle dense est la solution réaliste pour presque tout le monde.

Quelle que soit la ligne où vous vous êtes arrêté, le premier nombre à vérifier est le nombre total de paramètres, dans la précision que vous comptez servir. Tout le reste sur cette page — la vitesse, le cache, le prix par token par seconde — ne devient pertinent qu’une fois le modèle résident en mémoire. Le configurateur effectue toute la vérification sur chaque nœud que nous louons, et il applique à l’estimation de débit la même correction de routage que les tableaux ci-dessus. Si vous préférez d’abord voir le calcul de mémoire dans son intégralité, cela fait l’objet d’un guide à part ; si vous n’avez pas encore choisi de format numérique, ce choix vient avant celui-ci.

Comparez votre propre mélange d’experts à des machines réelles.

Le configurateur connaît tous les nœuds que nous louons, applique le même calcul que cette page, et vous indique lesquels tiennent votre modèle avant que vous ne payiez quoi que ce soit.

Se connecter

Console, factures et accès hors bande.

Pas encore de compte ?

Il n’y a pas d’inscription séparée. Votre compte est créé au moment où vous passez votre première commande — vous choisissez l’e-mail et le mot de passe à l’étape de paiement, et la console est ouverte au moment où la machine l’est.

Configurer un serveur

Language