Was ein Mixture-of-Experts-Modell wirklich kostet.
Ein Name wie „235B-A22B“ enthält zwei Zahlen, und fast jeder liest die falsche. Die eine entscheidet, was Sie mieten; die andere entscheidet, wie schnell es antwortet. Sie können um den Faktor zehn auseinanderliegen.
Die kurze Antwort
- Die Gesamtzahl der Parameter entscheidet über die Maschine
- DeepSeek V3 671B-A37B (MoE) braucht bei 4-Bit 386 GB mit 8k Kontext. Ein dichtes Modell von der Größe seiner aktiven Parameter würde 22 GB brauchen — 17.6× weniger.
- Aktive Parameter entscheiden über die Geschwindigkeit
- Pro Token wird nur ein Bruchteil der Gewichte gelesen, daher generiert es schneller als ein dichtes Modell derselben Masse — aber das Routing nimmt einen großen Teil dieses Vorteils gleich wieder zurück.
- Der günstigste Knoten, der es hält
- 8 × NVIDIA A100 PCIe zu $7,906 pro Monat. Das ist fast nie die richtige Wahl.
- Der, den es sich zu mieten lohnt
- 4 × NVIDIA B200 SXM6 zu $11,790 — 1.5× des Geldes für 2.8× des Durchsatzes.
Die Kurzfassung
Ein Mixture-of-Experts-Modell teilt den Feed-Forward-Teil jedes Layers in viele kleine Netzwerke auf und schickt jedes Token nur durch wenige davon. Der veröffentlichte Name hält beide Tatsachen fest: die Gesamtzahl der Parameter, und die Zahl, die für ein einzelnes Token aktiv ist. Die erste Zahl müssen Sie vollständig im Speicher halten, die zweite lesen Sie nur pro Token. Dieser eine Satz ist der ganze Guide, und ihn zu verwechseln ist der teuerste Fehler, den wir Leute vor einer Bestellung machen sehen.
Die Folge ist ein Modell mit einer merkwürdigen Kostenform: Es mietet sich wie ein Riese und läuft wie ein mittelgroßes Modell. Ob das ein Schnäppchen oder eine Falle ist, hängt vollständig davon ab, welche der beiden Zahlen Ihr Engpass ist.
Die Maschine dimensionieren? Nehmen Sie die Gesamtzahl. Jeder Experte muss resident sein, weil Sie vorher nicht wissen können, welchen das nächste Token braucht. Routing wird pro Token entschieden, zur Laufzeit.
Die Geschwindigkeit schätzen? Gehen Sie von der aktiven Zahl aus, und ziehen Sie dann einen großen Abschlag ab. Die Generierung liest nur die aktiven Gewichte, was genau der Sinn der Sache ist – aber der Router, die Verteilung an die Experten und der Datenverkehr zwischen den Karten sind nicht kostenlos, und sie skalieren schlecht über einen Knoten hinweg.
Langer Kontext oder viele Nutzer? Schauen Sie auf das Attention-Design, nicht auf die Parameterzahlen. Die größten Modelle auf dieser Seite haben den kleinsten Key/Value-Cache pro Token, und ab einer bestimmten Länge kehrt das die Rangfolge vollständig um.
Nur die Qualität zählt? Ein dichtes Modell, das auf eine Karte passt, ist einfacher, günstiger und schneller zu betreiben als ein auf acht Karten aufgeteiltes Mixture-of-Experts-Modell. Greifen Sie zu einem MoE, wenn kein dichtes Modell die Antwort liefert, die Sie brauchen – nicht, weil der Name beeindruckend klingt.
Die Rechnung unten ist dieselbe, die der Konfigurator ausführt, auf demselben Katalog. Wenn Sie noch nicht ermittelt haben, wie viel Speicher ein Modell überhaupt braucht, kommt diese Formel zuerst – diese Seite zeigt, was sich ändert, sobald das Modell ein Mixture-of-Experts-Modell ist.
Den Namen lesen
Drei Namenskonventionen sind im Umlauf, und alle kodieren dasselbe Zahlenpaar – deshalb hält sich die Verwirrung. Sobald Sie sie lesen können, beantwortet sich die Dimensionierungsfrage von selbst.
| Modell | Parameter gesamt | Aktiv pro Token | Aktiver Anteil |
|---|---|---|---|
| Mixtral 8×22B (MoE) | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) | 671 B | 37 B | 6 % |
| Llama 3.3 70B | 70 B | 70 B | 100 % |
Die letzte Spalte ist die, die man sich merken sollte. Ein dichtes Modell liest alles, was es speichert; ein Mixture-of-Experts-Modell liest einen Ausschnitt. Alles Merkwürdige an diesen Modellen — im Guten wie im Schlechten — folgt aus genau dieser einen Zeile.
Der Speicher, den Sie tatsächlich mieten
Hier ist die ganze Falle in einer Tabelle. Die mittlere Spalte zeigt, was das Modell auf der Maschine braucht; die Spalte danach zeigt, wofür ein Leser budgetiert hätte, der die aktive Zahl für bare Münze genommen hätte. Die letzte Spalte ist die Rechnung für dieses Missverständnis.
| Modell | Gewichte bei 4-Bit | Insgesamt benötigt | Wäre es seine aktive Größe | Überschreitung |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB | 22 GB | 17.6× |
Lesen Sie die letzte Spalte als Einkaufsfehler. Wer allein anhand der aktiven Zahl dimensioniert, würde nach einer einzigen Karte suchen und am Ende einen ganzen Knoten brauchen — nicht eine etwas größere Maschine, sondern eine andere Kategorie von Maschine, zu einem anderen Preis.
Was die aktiven Parameter bringen
Generierung wird durch die Speicherbandbreite begrenzt: Jedes neue Token erfordert, die daran beteiligten Gewichte erneut zu lesen. Ein Mixture-of-Experts-Modell liest nur seinen aktiven Ausschnitt, sodass die Obergrenze seiner Geschwindigkeit durch eine viel kleinere Zahl gesetzt wird, als seine Größe vermuten lässt. Dieser Teil des Versprechens ist real, und deshalb gibt es diese Modelle überhaupt.
Die Tabelle unten stellt jedes Modell auf dieselbe Maschine — 8 × NVIDIA A100 PCIe zu $7,906 pro Monat, der günstigste Knoten in unserem Katalog, der sie alle gleichzeitig hält. Durchsatzwerte zu vergleichen, die auf unterschiedlichen Maschinen gemessen wurden, vergleicht gar nichts.
| Modell | Gesamt | Gelesen pro Token | Geschätzte Token/s |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) | 671 B | 18.5 GB | 37 |
| Llama 3.1 405B | 405 B | 202.5 GB | 19 |
| Qwen 3 235B-A22B (MoE) | 235 B | 11.0 GB | 62 |
| Mixtral 8×22B (MoE) | 141 B | 19.5 GB | 35 |
| Llama 3.3 70B | 70 B | 35.0 GB | 25 |
Die beiden Zeilen, die sich zu vergleichen lohnen, sind das größte Mixture-of-Experts-Modell und das größte dichte Modell, weil beide auf den gesamten Knoten aufgeteilt sind. Das Mixture-of-Experts-Modell ist mit weitem Abstand das größere der beiden und generiert trotzdem schneller, weil es pro Token nur einen Bruchteil seiner selbst liest — genau das ist der Tausch, für den die Architektur gemacht ist. Lesen Sie die mit auf einer Karte markierten Zeilen anders: Diese Modelle belegen nur eine einzige Karte des Knotens und lassen die anderen sieben frei – das ist eine günstigere Maschine, die darauf wartet, gewählt zu werden, keine langsamere.
Die zweite Sache, die die Rechnung verbirgt, ist, dass sich ein Mixture-of-Experts-Modell schwerer gut sharden lässt. Ein dichtes Modell, das auf mehrere Karten aufgeteilt ist, synchronisiert einmal pro Layer; ein Mixture-of-Experts-Modell muss Token außerdem an die Karte routen, die den jeweils gewählten Experten hält, was ein anderes und weniger vorhersagbares Verkehrsmuster ergibt. Das ist einer der wenigen Workloads, bei denen der Interconnect seinen Preis wirklich wert ist, statt nur auf der Rechnung aufzutauchen.
Die Hälfte, die günstiger wird
Bisher waren das alles schlechte Nachrichten für die großen Modelle. Hier ist der Ausgleich, und zwar ein großer, den fast kein Vergleich erwähnt: Die Modelle mit den meisten Parametern auf dieser Seite haben den kleinsten Key/Value-Cache pro Token. Der Cache wird vom Attention-Design festgelegt – Layer, Key/Value-Heads, Head-Dimension – und hat nichts damit zu tun, wie viele Experten hinter der Attention stecken.
| Modell | Cache pro Token | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |
Diese Spalten gelten pro gleichzeitiger Anfrage. Multiplizieren Sie mit der Zahl der Menschen, die den Endpunkt gleichzeitig nutzen, und die Rangfolge in der letzten Spalte bestimmt Ihre Maschine weit mehr als die Gewichte.
Die praktische Lesart: Gewichte sind ein fixer Eintrittspreis, der Cache sind die laufenden Kosten. Ein Mixture-of-Experts-Modell verlangt einen enormen Eintrittspreis und dann geringe laufende Kosten pro Nutzer. Ein dichtes Modell vergleichbarer Fähigkeit ist genau umgekehrt. Welches der beiden für Sie günstiger ist, entscheiden Nebenläufigkeit und Kontextlänge – nicht die Parameterzahl auf der Modellkarte.
Welche Maschinen sie halten
Bei 4-Bit, mit dem Referenzkontext, und mit dem günstigsten Knoten in unserem Katalog, der jedes Modell hält — ob auf einer Karte oder aufgeteilt auf den Knoten. Das sind die Eintrittspreise, keine Empfehlungen; der nächste Abschnitt erklärt, warum.
| Modell | Braucht | Günstigster Knoten, der es hält | Pro Monat | Token/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | 4 × NVIDIA L4 | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | 8 × NVIDIA L4 | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | 8 × NVIDIA A100 PCIe | $7,906 | 37 |
Jede einzelne davon ist ein Multi-Karten-Knoten, und das ist die ehrliche Kernaussage dieser Seite: Nichts in unserem Katalog hält eines dieser Modelle auf einer einzigen Karte, egal wie klein die aktive Zahl sie aussehen lässt. Der vollständige Katalog enthält die restlichen Konfigurationen, und der Konfigurator führt genau diese Prüfung für Ihr eigenes Modell und Ihren Kontext durch.
Der günstigste Knoten ist der falsche
Passen ist eine Schwelle, kein Ziel. Sobald ein Modell auf einen Knoten aufgeteilt ist, hängt der Durchsatz von der Speicherbandbreite der Karten ab, auf die es aufgeteilt ist — und die Bandbreite pro Dollar variiert um mehr als das Doppelte zwischen Konfigurationen, die alle dieselbe Speicherhürde nehmen. Hier ist DeepSeek V3 671B-A37B (MoE) auf jedem Knoten, der es hält, sortiert nach Preis, mit der einzig wichtigen Spalte rechts.
| Konfiguration | VRAM | Pro Monat | Token/s | $ pro Token/s |
|---|---|---|---|---|
| 8 × NVIDIA A100 PCIe | 640 GB | $7,906 | 37 | $213.68 |
| 8 × NVIDIA A100 SXM4 | 640 GB | $8,355 | 39 | $214.23 |
| 4 × NVIDIA H200 SXM5 | 564 GB | $8,405 | 62 | $135.56 |
| 8 × NVIDIA H100 PCIe | 640 GB | $10,568 | 38 | $278.11 |
| 8 × NVIDIA H100 SXM5 | 640 GB | $11,509 | 64 | $179.83 |
| 4 × NVIDIA B200 SXM6 | 720 GB | $11,790 | 103 | $114.47 |
| 8 × NVIDIA H200 SXM5 | 1128 GB | $15,945 | 91 | $175.22 |
| 8 × NVIDIA B200 SXM6 | 1440 GB | $22,351 | 152 | $147.05 |
Die grüne Zelle ist das beste Preis-Leistungs-Verhältnis auf der Liste, und sie ist nicht die günstigste Zeile. Der Wechsel von $7,906 zu $11,790 vervielfacht die Rechnung um 1.5× und den Durchsatz um 2.8× — Sie zahlen mehr, und jedes Token kostet Sie weniger. Einen Katalog nach Preis zu sortieren und die erste passende Maschine zu nehmen, ist die Art, wie ein Serving-Budget zweimal ausgegeben wird.
Ein Vorbehalt zu dieser Spalte, und er gilt für jede Preis-pro-Durchsatz-Tabelle, die Sie je lesen werden: Sie beruht auf der Generierung mit einem einzelnen Stream. Unter kontinuierlichem Batching steigt die Summe in jeder Zeile um ein Vielfaches, und sie steigt nicht in jeder Zeile um denselben Faktor — ein Knoten mit mehr freiem Speicher nach den Gewichten hält mehr gleichzeitige Sequenzen. Die Rangfolge ist stabil; die absoluten Zahlen sind konservativ. Die Wirtschaftlichkeit dieser Summe wird an anderer Stelle durchgerechnet.
Wann ein Mixture-of-Experts-Modell die richtige Antwort ist
Der Reihe nach. Halten Sie bei der ersten Zeile an, die auf Sie zutrifft.
- Ein dichtes Modell, das auf eine Karte passt, erledigt die Aufgabe. Dann nehmen Sie es, und schauen Sie nicht zurück. Eine Karte bedeutet: kein Sharding, keine Interconnect-Frage, kein Expert-Routing-Verkehr, und eine Maschine, die einen Bruchteil eines Knotens kostet. Die meisten Produkte, die glauben, ein offenes Frontier-Modell zu brauchen, brauchen ein gutes 32B-Modell.
- Sie brauchen die Qualität, und Ihr Kontext ist lang. Genau hier ist ein Mixture-of-Experts-Modell wirklich das beste verfügbare Werkzeug: Sie zahlen einmal für die Gewichte, und der kleine Cache sorgt dafür, dass die Maschine lange Gespräche weiter bedient, ohne einzuknicken. Dimensionieren Sie den Knoten anhand der Gewichte, und prüfen Sie dann die Cache-Tabelle für Ihren tatsächlichen Kontext.
- Sie brauchen die Qualität und bedienen viele Menschen gleichzeitig. Gleiche Antwort, gleicher Grund, und der Vorteil wächst mit der Nebenläufigkeit. Die Fixkosten werden über jeden Stream amortisiert, während die Kosten pro Stream niedrig bleiben.
- Sie brauchen die Qualität, aber nur gelegentlich. Dann mieten Sie einen großen Knoten, nur um ihn ein paar Stunden pro Woche warmzuhalten – das ist die denkbar schlechteste Nutzung einer monatlichen Laufzeit. Bündeln Sie die Arbeit entweder so, dass sie in einem Rutsch läuft, oder nutzen Sie dafür einen gehosteten Endpunkt und behalten Sie Ihre eigene Maschine für die gleichmäßige Last.
- Sie wollen eines fine-tunen. Anderes Problem, größere Maschine: Training berührt jeden Experten und braucht Optimizer-Zustand für alle davon, sodass der Speicherbedarf, der schon die Inferenz unhandlich machte, hier unerschwinglich wird. Adapter-Fine-Tuning auf einem dichten Modell ist für fast jeden der realistische Weg.
Bei welcher Zeile auch immer Sie hängengeblieben sind: Die Zahl, die Sie zuerst prüfen sollten, ist die Gesamtzahl der Parameter, in der Präzision, in der Sie bedienen wollen. Alles andere auf dieser Seite — die Geschwindigkeit, der Cache, der Preis pro Token pro Sekunde — wird erst relevant, sobald das Modell resident ist. Der Konfigurator führt die gesamte Prüfung für jeden Knoten durch, den wir vermieten, und wendet auf die Durchsatzschätzung dieselbe Routing-Korrektur an wie die Tabellen oben. Wenn Sie lieber zuerst die vollständige Speicherrechnung sehen möchten, dazu gibt es einen eigenen Guide; wenn Sie sich noch nicht auf ein Zahlenformat festgelegt haben, kommt diese Entscheidung vor dieser hier.
Prüfen Sie Ihr eigenes Mixture-of-Experts-Modell an echten Maschinen.
Der Konfigurator kennt jeden Knoten, den wir vermieten, wendet dieselbe Rechnung an wie diese Seite, und sagt Ihnen, welche Ihr Modell halten, bevor Sie irgendetwas bezahlen.
Weitere Guides
- Kosten · 6 Min.
Wann Monatsmiete die Stundenmiete schlägt
Der Break-even anhand realer Zahlen, die drei Kosten, die ein Stundenpreis bis zur Rechnung verbirgt, und die Leerlauf-Falle, die eine Schätzung verdreifacht.
Guide lesen - Kosten · 9 Min.
Self-Hosting gegen eine API mit Preis pro Token
Der Break-even zwischen einer API mit Preis pro Token und einer gemieteten GPU, mit unseren eigenen Zahlen — und vier Dinge, die dabei fehlen.
Guide lesen - Praxis · 11 Min.
Llama 3.3 70B auf einem Knoten betreiben
Von der gelieferten Maschine zum OpenAI-kompatiblen Endpunkt, mit den Flags, die zählen, und den zweien, die Ihren Durchsatz unbemerkt halbieren.
Guide lesen