Ce que coûte vraiment un mélange d’experts.
Un nom comme « 235B-A22B » contient deux nombres, et presque tout le monde lit le mauvais. L’un décide ce que vous louez ; l’autre décide de sa vitesse de réponse. L’écart entre eux peut atteindre un facteur dix.
En bref
- Le nombre total de paramètres décide de la machine
- DeepSeek V3 671B-A37B (MoE) en 4 bits nécessite 386 GB avec 8k de contexte. Un modèle dense de la taille de ses paramètres actifs nécessiterait 22 GB — soit 17.6× de moins.
- Les paramètres actifs décident de la vitesse
- Seule une fraction des poids est lue par token, donc il génère plus vite qu’un modèle dense de même masse — mais le routage reprend aussitôt une grande partie de cet avantage.
- Le nœud le moins cher qui le tient
- 8 × NVIDIA A100 PCIe à $7,906 par mois. Ce n’est presque jamais celui qu’il faut louer.
- Celui qui vaut la peine d’être loué
- 4 × NVIDIA B200 SXM6 à $11,790 — 1.5× le prix pour 2.8× le débit.
La version courte
Un mélange d’experts découpe la partie feed-forward de chaque couche en de nombreux petits réseaux, et n’envoie chaque token qu’à travers quelques-uns d’entre eux. Le nom publié consigne ces deux faits : le nombre total de paramètres, et le nombre de paramètres actifs pour un token donné. Vous devez garder la totalité du premier en mémoire, et vous ne lisez que le second par token. Cette seule phrase résume tout le guide, et l’inverser est l’erreur la plus coûteuse que nous voyons les gens commettre avant de passer commande.
La conséquence est un modèle au profil de coût étrange : il se loue comme un géant et tourne comme un modèle de taille moyenne. Que ce soit une bonne affaire ou un piège dépend entièrement de celui des deux nombres qui constitue votre goulot d’étranglement.
Vous dimensionnez la machine ? Utilisez le total. Chaque expert doit être résident, car vous ne pouvez pas savoir à l’avance desquels le prochain token aura besoin. Le routage se décide par token, à l’exécution.
Vous estimez la vitesse ? Partez du nombre de paramètres actifs, puis appliquez une forte décote. La génération ne lit que les poids actifs, ce qui est précisément le but — mais le routeur, la répartition vers les experts et le trafic entre les cartes ne sont pas gratuits, et ils passent mal à l’échelle sur un nœud.
Vous servez un contexte long ou de nombreux utilisateurs ? Regardez la conception de l’attention, pas le nombre de paramètres. Les plus gros modèles de cette page ont le plus petit cache clef/valeur par token, et au-delà d’une certaine longueur, cela inverse complètement le classement.
Vous voulez seulement la qualité ? Un modèle dense qui tient sur une seule carte est plus simple, moins cher et plus rapide à exploiter qu’un mélange d’experts réparti sur huit cartes. Choisissez un MoE quand aucun modèle dense ne vous donne la réponse dont vous avez besoin, pas parce que le nom fait impression.
Le calcul ci-dessous est exactement celui qu’exécute le configurateur, sur le même catalogue. Si vous n’avez pas encore déterminé de combien de mémoire un modèle a besoin en général, cette formule vient d’abord — cette page couvre ce qui change une fois que le modèle est un mélange d’experts.
Lire le nom
Trois conventions de nommage circulent, et elles encodent toutes la même paire de nombres, ce qui explique que la confusion persiste. Une fois que vous savez les lire, la question du dimensionnement se résout d’elle-même.
| Modèle | Nombre total de paramètres | Actifs par token | Part active |
|---|---|---|---|
| Mixtral 8×22B (MoE) | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) | 671 B | 37 B | 6 % |
| Llama 3.3 70B | 70 B | 70 B | 100 % |
La dernière colonne est celle qu’il faut retenir. Un modèle dense lit tout ce qu’il stocke ; un mélange d’experts n’en lit qu’une tranche. Tout ce que ces modèles ont d’étrange — en bien comme en mal — découle de cette seule ligne.
La mémoire que vous louez réellement
Voici tout le piège en un seul tableau. La colonne du milieu indique ce dont le modèle a besoin sur la machine ; la colonne suivante indique ce qu’aurait budgété un lecteur ayant pris le nombre de paramètres actifs au pied de la lettre. La dernière colonne est la facture de cette erreur de lecture.
| Modèle | Poids en 4 bits | Total nécessaire | Si c’était sa taille active | Dépassement |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB | 22 GB | 17.6× |
Lisez la dernière colonne comme une erreur d’achat. Quelqu’un qui dimensionne uniquement sur le nombre de paramètres actifs partirait à la recherche d’une seule carte pour finalement avoir besoin d’un nœud entier — pas une machine un peu plus grande, mais une catégorie de machine différente, à un prix différent.
Ce que procurent les paramètres actifs
La génération est limitée par la bande passante mémoire : chaque nouveau token exige de relire les poids qui y participent. Un mélange d’experts ne lit que sa tranche active, si bien que le plafond de sa vitesse est fixé par un nombre bien plus petit que sa taille ne le laisse penser. Cette partie de la promesse est bien réelle, et c’est précisément la raison d’être de ces modèles.
Le tableau ci-dessous place chaque modèle sur la même machine — 8 × NVIDIA A100 PCIe à $7,906 par mois, le nœud le moins cher de notre catalogue qui les tient tous à la fois. Comparer des chiffres de débit relevés sur des machines différentes ne compare rien du tout.
| Modèle | Total | Lu par token | Tokens/s estimés |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) | 671 B | 18.5 GB | 37 |
| Llama 3.1 405B | 405 B | 202.5 GB | 19 |
| Qwen 3 235B-A22B (MoE) | 235 B | 11.0 GB | 62 |
| Mixtral 8×22B (MoE) | 141 B | 19.5 GB | 35 |
| Llama 3.3 70B | 70 B | 35.0 GB | 25 |
Les deux lignes qui méritent d’être comparées sont le plus grand mélange d’experts et le plus grand modèle dense, car tous deux sont répartis sur l’ensemble du nœud. Le mélange est de loin le plus gros modèle des deux et il génère malgré tout plus vite, puisqu’il ne lit qu’une fraction de lui-même par token — c’est précisément l’arbitrage que cette architecture existe pour faire. Lisez différemment les lignes marquées sur une carte : ces modèles occupent une seule carte du nœud et en laissent sept autres libres, ce qui est une machine moins chère qui attend d’être choisie, pas une machine plus lente.
La deuxième chose que le calcul dissimule, c’est qu’un mélange d’experts est plus difficile à bien répartir entre cartes. Un modèle dense réparti sur plusieurs cartes se synchronise une fois par couche ; un mélange doit en plus router les tokens vers la carte qui détient l’expert choisi, ce qui donne un profil de trafic différent et moins prévisible. C’est l’un des rares usages où l’interconnexion justifie vraiment son prix plutôt que de simplement apparaître sur la facture.
La moitié qui devient moins chère
Jusqu’ici, tout était mauvais pour les gros modèles. Voici la compensation, et elle est de taille — presque aucune comparaison ne la mentionne : les modèles qui comptent le plus de paramètres sur cette page ont le plus petit cache clef/valeur par token. Le cache est déterminé par la conception de l’attention — couches, têtes clef/valeur, dimension des têtes — et n’a rien à voir avec le nombre d’experts placés derrière l’attention.
| Modèle | Cache par token | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |
Ces colonnes s’entendent par requête simultanée. Multipliez par le nombre de personnes qui utilisent le point de terminaison en même temps, et le classement de la dernière colonne détermine votre machine bien plus que les poids.
En pratique : les poids sont un droit d’entrée fixe, le cache est le coût d’exploitation. Un mélange d’experts facture un droit d’entrée énorme, puis un faible coût d’exploitation par utilisateur. Un modèle dense de capacité comparable fonctionne à l’inverse. Lequel des deux vous revient moins cher se décide sur la simultanéité et la longueur de contexte, pas sur le nombre de paramètres indiqué sur la fiche du modèle.
Quelles machines les tiennent
En 4 bits, avec le contexte de référence, et en retenant le nœud le moins cher de notre catalogue qui tient chaque modèle — que ce soit sur une seule carte ou réparti sur le nœud. Ce sont des tickets d’entrée, pas des recommandations ; la section suivante explique pourquoi.
| Modèle | Besoins | Nœud le moins cher qui le tient | Par mois | Tokens/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | 4 × NVIDIA L4 | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | 8 × NVIDIA L4 | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | 8 × NVIDIA A100 PCIe | $7,906 | 37 |
Chacun d’entre eux est un nœud multi-cartes, et c’est le message honnête de cette page : rien dans notre catalogue ne tient l’un de ces modèles sur une seule carte, aussi petit que son nombre de paramètres actifs le fasse paraître. Le catalogue complet contient le reste des configurations, et le configurateur effectuera cette même vérification sur votre propre modèle et contexte.
Le nœud le moins cher n’est pas le bon
Tenir en mémoire est un seuil, pas un objectif. Une fois qu’un modèle est réparti sur un nœud, le débit dépend de la bande passante mémoire des cartes sur lesquelles il est réparti — et la bande passante par dollar varie de plus d’un facteur deux entre des configurations qui franchissent toutes la même barre de mémoire. Voici DeepSeek V3 671B-A37B (MoE) sur chaque nœud qui le tient, classé par prix, avec la seule colonne qui compte, à droite.
| Configuration | VRAM | Par mois | Tokens/s | $ par token/s |
|---|---|---|---|---|
| 8 × NVIDIA A100 PCIe | 640 GB | $7,906 | 37 | $213.68 |
| 8 × NVIDIA A100 SXM4 | 640 GB | $8,355 | 39 | $214.23 |
| 4 × NVIDIA H200 SXM5 | 564 GB | $8,405 | 62 | $135.56 |
| 8 × NVIDIA H100 PCIe | 640 GB | $10,568 | 38 | $278.11 |
| 8 × NVIDIA H100 SXM5 | 640 GB | $11,509 | 64 | $179.83 |
| 4 × NVIDIA B200 SXM6 | 720 GB | $11,790 | 103 | $114.47 |
| 8 × NVIDIA H200 SXM5 | 1128 GB | $15,945 | 91 | $175.22 |
| 8 × NVIDIA B200 SXM6 | 1440 GB | $22,351 | 152 | $147.05 |
La cellule verte offre le meilleur rapport qualité-prix de la liste, et ce n’est pas la ligne la moins chère. Passer de $7,906 à $11,790 multiplie la facture par 1.5× et le débit par 2.8× — vous payez plus, et chaque token vous coûte moins cher. Trier un catalogue par prix et prendre la première machine qui tient, c’est le moyen de dépenser deux fois son budget de service.
Une réserve sur cette colonne, et elle s’applique à tout tableau prix/débit que vous lirez : elle utilise la génération en flux unique. Sous traitement par lots continu, l’agrégat grimpe plusieurs fois plus haut sur chaque ligne, et pas dans les mêmes proportions selon les lignes — un nœud disposant de plus de mémoire disponible après les poids tient davantage de séquences simultanées. Le classement est stable ; les chiffres absolus sont prudents. L’économie de cet agrégat est développée séparément.
Quand un mélange d’experts est la bonne réponse
Dans l’ordre. Arrêtez-vous à la première ligne qui vous correspond.
- Un modèle dense qui tient sur une seule carte fait l’affaire. Alors prenez-le, et n’y revenez plus. Une seule carte, c’est : aucune répartition entre cartes, aucune question d’interconnexion, aucun trafic de routage vers les experts, et une machine qui coûte une fraction d’un nœud. La plupart des produits qui pensent avoir besoin d’un modèle ouvert de pointe ont seulement besoin d’un bon 32B.
- Vous avez besoin de la qualité et votre contexte est long. C’est là qu’un mélange d’experts est vraiment le meilleur instrument disponible : vous payez les poids une seule fois, et le petit cache permet à la machine de continuer à servir de longues conversations sans tomber en panne. Dimensionnez le nœud sur les poids, puis vérifiez le tableau des caches pour votre contexte réel.
- Vous avez besoin de la qualité et vous servez beaucoup de monde à la fois. Même réponse, même raison, et l’avantage grandit avec la simultanéité. Le coût fixe est amorti sur chaque flux, tandis que le coût par flux reste faible.
- Vous avez besoin de la qualité, mais seulement occasionnellement. Vous louez alors un grand nœud pour le garder chaud quelques heures par semaine, ce qui est le pire usage possible d’une durée d’engagement mensuelle. Regroupez le travail pour qu’il s’exécute en une seule fois, ou utilisez un point de terminaison hébergé pour ce cas précis et gardez votre propre machine pour la charge constante.
- Vous voulez en affiner un. Problème différent, machine plus grande : l’entraînement sollicite chaque expert et nécessite un état d’optimiseur pour chacun d’eux, si bien que la mémoire déjà pénible pour l’inférence devient prohibitive. Le fine-tuning par adaptateur sur un modèle dense est la solution réaliste pour presque tout le monde.
Quelle que soit la ligne où vous vous êtes arrêté, le premier nombre à vérifier est le nombre total de paramètres, dans la précision que vous comptez servir. Tout le reste sur cette page — la vitesse, le cache, le prix par token par seconde — ne devient pertinent qu’une fois le modèle résident en mémoire. Le configurateur effectue toute la vérification sur chaque nœud que nous louons, et il applique à l’estimation de débit la même correction de routage que les tableaux ci-dessus. Si vous préférez d’abord voir le calcul de mémoire dans son intégralité, cela fait l’objet d’un guide à part ; si vous n’avez pas encore choisi de format numérique, ce choix vient avant celui-ci.
Comparez votre propre mélange d’experts à des machines réelles.
Le configurateur connaît tous les nœuds que nous louons, applique le même calcul que cette page, et vous indique lesquels tiennent votre modèle avant que vous ne payiez quoi que ce soit.
Autres guides
- Coût · 6 min
Quand la location mensuelle l’emporte sur l’horaire
Le seuil de rentabilité sur des chiffres réels, les trois coûts qu’un prix horaire cache jusqu’à la facture, et le piège du temps mort qui triple une estimation.
Lire le guide - Coût · 9 min
L’auto-hébergement contre une API facturée au token
Le seuil de rentabilité entre payer une API au token et louer un GPU, calculé sur nos propres prix et débit — et les quatre points que l’arithmétique laisse de côté.
Lire le guide - Pratique · 11 min
Servir Llama 3.3 70B sur un nœud
D’une machine livrée à un point de terminaison compatible OpenAI, avec les options qui comptent et les deux qui divisent silencieusement votre débit par deux.
Lire le guide