Alle 6 Rechenzentren betriebsbereit

Bezahlung in Krypto · Keine Identitätsprüfung · Root-Zugriff in unter 5 Minuten

Dimensionierung-Guide · 10 Min. Lesezeit

Was ein Mixture-of-Experts-Modell wirklich kostet.

Ein Name wie „235B-A22B“ enthält zwei Zahlen, und fast jeder liest die falsche. Die eine entscheidet, was Sie mieten; die andere entscheidet, wie schnell es antwortet. Sie können um den Faktor zehn auseinanderliegen.

Die kurze Antwort

Die Gesamtzahl der Parameter entscheidet über die Maschine
DeepSeek V3 671B-A37B (MoE) braucht bei 4-Bit 386 GB mit 8k Kontext. Ein dichtes Modell von der Größe seiner aktiven Parameter würde 22 GB brauchen — 17.6× weniger.
Aktive Parameter entscheiden über die Geschwindigkeit
Pro Token wird nur ein Bruchteil der Gewichte gelesen, daher generiert es schneller als ein dichtes Modell derselben Masse — aber das Routing nimmt einen großen Teil dieses Vorteils gleich wieder zurück.
Der günstigste Knoten, der es hält
8 × NVIDIA A100 PCIe zu $7,906 pro Monat. Das ist fast nie die richtige Wahl.
Der, den es sich zu mieten lohnt
4 × NVIDIA B200 SXM6 zu $11,790 — 1.5× des Geldes für 2.8× des Durchsatzes.

Die Kurzfassung

Ein Mixture-of-Experts-Modell teilt den Feed-Forward-Teil jedes Layers in viele kleine Netzwerke auf und schickt jedes Token nur durch wenige davon. Der veröffentlichte Name hält beide Tatsachen fest: die Gesamtzahl der Parameter, und die Zahl, die für ein einzelnes Token aktiv ist. Die erste Zahl müssen Sie vollständig im Speicher halten, die zweite lesen Sie nur pro Token. Dieser eine Satz ist der ganze Guide, und ihn zu verwechseln ist der teuerste Fehler, den wir Leute vor einer Bestellung machen sehen.

Die Folge ist ein Modell mit einer merkwürdigen Kostenform: Es mietet sich wie ein Riese und läuft wie ein mittelgroßes Modell. Ob das ein Schnäppchen oder eine Falle ist, hängt vollständig davon ab, welche der beiden Zahlen Ihr Engpass ist.

Die Maschine dimensionieren? Nehmen Sie die Gesamtzahl. Jeder Experte muss resident sein, weil Sie vorher nicht wissen können, welchen das nächste Token braucht. Routing wird pro Token entschieden, zur Laufzeit.

Die Geschwindigkeit schätzen? Gehen Sie von der aktiven Zahl aus, und ziehen Sie dann einen großen Abschlag ab. Die Generierung liest nur die aktiven Gewichte, was genau der Sinn der Sache ist – aber der Router, die Verteilung an die Experten und der Datenverkehr zwischen den Karten sind nicht kostenlos, und sie skalieren schlecht über einen Knoten hinweg.

Langer Kontext oder viele Nutzer? Schauen Sie auf das Attention-Design, nicht auf die Parameterzahlen. Die größten Modelle auf dieser Seite haben den kleinsten Key/Value-Cache pro Token, und ab einer bestimmten Länge kehrt das die Rangfolge vollständig um.

Nur die Qualität zählt? Ein dichtes Modell, das auf eine Karte passt, ist einfacher, günstiger und schneller zu betreiben als ein auf acht Karten aufgeteiltes Mixture-of-Experts-Modell. Greifen Sie zu einem MoE, wenn kein dichtes Modell die Antwort liefert, die Sie brauchen – nicht, weil der Name beeindruckend klingt.

Die Rechnung unten ist dieselbe, die der Konfigurator ausführt, auf demselben Katalog. Wenn Sie noch nicht ermittelt haben, wie viel Speicher ein Modell überhaupt braucht, kommt diese Formel zuerst – diese Seite zeigt, was sich ändert, sobald das Modell ein Mixture-of-Experts-Modell ist.

Den Namen lesen

Drei Namenskonventionen sind im Umlauf, und alle kodieren dasselbe Zahlenpaar – deshalb hält sich die Verwirrung. Sobald Sie sie lesen können, beantwortet sich die Dimensionierungsfrage von selbst.

235B-A22BGesamt, dann aktivDie klarste der drei Konventionen. 235 Milliarden Parameter liegen im Speicher; 22 Milliarden davon werden für jedes einzelne Token gelesen. Der Buchstabe A steht für aktiv, und das ist die Zahl, die Ihnen nicht sagt, was Sie mieten sollen.
671B-A37BGleiche Konvention, größerBei dieser Größe wird die Lücke bewusst absurd: Der aktive Anteil liegt unter sechs Prozent. Für die Maschine, die Sie brauchen, sagt die 37 gar nichts aus.
8×22BExperten, dann ExpertengrößeDie ältere Konvention, und die, die am meisten in die Irre führt. Sie bedeutet nicht 176 Milliarden Parameter, weil Attention und Embeddings gemeinsam genutzt statt dupliziert werden; und sie bedeutet auch nicht 22 Milliarden, weil pro Token zwei Experten aktiv sind, nicht einer.
A22B, A37BEin Durchschnitt, keine GarantieDie aktive Zahl ist das, was Routing bei typischem Text kostet. Sie ist keine Obergrenze: Ein Batch, dessen Token sich zufällig über viele Experten verteilen, berührt mehr vom Modell – einer der Gründe, warum der gemessene Durchsatz unter der reinen Rechnung liegt.
Die Mixture-of-Experts-Modelle in unserem Dimensionierungskatalog, Gesamt- gegen aktive Parameter
Modell Parameter gesamt Aktiv pro Token Aktiver Anteil
Mixtral 8×22B (MoE)56 Layer 141 B 39 B 28 %
Qwen 3 235B-A22B (MoE)94 Layer 235 B 22 B 9 %
DeepSeek V3 671B-A37B (MoE)61 Layer 671 B 37 B 6 %
Llama 3.3 70BDicht, zum Vergleich 70 B 70 B 100 %

Die letzte Spalte ist die, die man sich merken sollte. Ein dichtes Modell liest alles, was es speichert; ein Mixture-of-Experts-Modell liest einen Ausschnitt. Alles Merkwürdige an diesen Modellen — im Guten wie im Schlechten — folgt aus genau dieser einen Zeile.

Der Speicher, den Sie tatsächlich mieten

Hier ist die ganze Falle in einer Tabelle. Die mittlere Spalte zeigt, was das Modell auf der Maschine braucht; die Spalte danach zeigt, wofür ein Leser budgetiert hätte, der die aktive Zahl für bare Münze genommen hätte. Die letzte Spalte ist die Rechnung für dieses Missverständnis.

Benötigter VRAM bei 4-Bit mit 8k Kontext, gegenüber dem, was die aktive Parameterzahl vermuten lässt
Modell Gewichte bei 4-Bit Insgesamt benötigt Wäre es seine aktive Größe Überschreitung
Mixtral 8×22B (MoE) 71 GB 83 GBbei 8k 24 GB 3.4×
Qwen 3 235B-A22B (MoE) 118 GB 137 GBbei 8k 14 GB 9.5×
DeepSeek V3 671B-A37B (MoE) 336 GB 386 GBbei 8k 22 GB 17.6×

Lesen Sie die letzte Spalte als Einkaufsfehler. Wer allein anhand der aktiven Zahl dimensioniert, würde nach einer einzigen Karte suchen und am Ende einen ganzen Knoten brauchen — nicht eine etwas größere Maschine, sondern eine andere Kategorie von Maschine, zu einem anderen Preis.

Nein, Sie können die ungenutzten Experten nicht auf der Festplatte lassen. Das ist die erste Idee, die jeder hat, und Serving-Stacks bieten sie tatsächlich an. Das Problem ist, dass Routing pro Token entschieden wird: Die Menge der benötigten Experten wechselt mehrmals pro erzeugtem Wort, sodass eine Karte, die nur eine Teilmenge hält, ihre Zeit damit verbringt, Gewichte über PCIe nachzuladen, statt zu rechnen. Das Ergebnis ist kein etwas langsameres Modell, sondern eines, das nur mit einem Bruchteil seiner Geschwindigkeit läuft. Offloading ist ein Weg, ein Modell auf einer Maschine laufen zu lassen, die es nicht halten kann, nicht ein Weg, es zu bedienen.

Was die aktiven Parameter bringen

Generierung wird durch die Speicherbandbreite begrenzt: Jedes neue Token erfordert, die daran beteiligten Gewichte erneut zu lesen. Ein Mixture-of-Experts-Modell liest nur seinen aktiven Ausschnitt, sodass die Obergrenze seiner Geschwindigkeit durch eine viel kleinere Zahl gesetzt wird, als seine Größe vermuten lässt. Dieser Teil des Versprechens ist real, und deshalb gibt es diese Modelle überhaupt.

Die Tabelle unten stellt jedes Modell auf dieselbe Maschine — 8 × NVIDIA A100 PCIe zu $7,906 pro Monat, der günstigste Knoten in unserem Katalog, der sie alle gleichzeitig hält. Durchsatzwerte zu vergleichen, die auf unterschiedlichen Maschinen gemessen wurden, vergleicht gar nichts.

Generierung mit einzelnem Stream auf einem Knoten, Mixture-of-Experts-Modelle gegen dichte Modelle
Modell Gesamt Gelesen pro Token Geschätzte Token/s
DeepSeek V3 671B-A37B (MoE)Mixture of Experts · aufgeteilt auf 8 Karten 671 B 18.5 GB 37ein Stream
Llama 3.1 405BDicht · aufgeteilt auf 8 Karten 405 B 202.5 GB 19ein Stream
Qwen 3 235B-A22B (MoE)Mixture of Experts · aufgeteilt auf 8 Karten 235 B 11.0 GB 62ein Stream
Mixtral 8×22B (MoE)Mixture of Experts · aufgeteilt auf 8 Karten 141 B 19.5 GB 35ein Stream
Llama 3.3 70BDicht · auf einer Karte 70 B 35.0 GB 25ein Stream

Die beiden Zeilen, die sich zu vergleichen lohnen, sind das größte Mixture-of-Experts-Modell und das größte dichte Modell, weil beide auf den gesamten Knoten aufgeteilt sind. Das Mixture-of-Experts-Modell ist mit weitem Abstand das größere der beiden und generiert trotzdem schneller, weil es pro Token nur einen Bruchteil seiner selbst liest — genau das ist der Tausch, für den die Architektur gemacht ist. Lesen Sie die mit auf einer Karte markierten Zeilen anders: Diese Modelle belegen nur eine einzige Karte des Knotens und lassen die anderen sieben frei – das ist eine günstigere Maschine, die darauf wartet, gewählt zu werden, keine langsamere.

Diese Zahlen enthalten bereits einen großen Abschlag, und das ist auch richtig so. Reine Rechnung mit aktiven Parametern überschätzt ein Mixture-of-Experts-Modell stark. Unsere erste Version dieses Schätzers tat genau das und lag gegenüber veröffentlichten Messungen für das größte Modell auf dieser Seite um etwa den Faktor fünf daneben. Routing kostet einen eigenen Durchlauf, Experten müssen bei jedem Layer Aktivierungen zwischen Karten austauschen, und der Batch verteilt sich auf mehr Experten, als der Durchschnitt vermuten lässt. Der Schätzer wendet jetzt eine bewusst konservative Korrektur an, kalibriert an gemessenen Werten statt frei gewählt — deshalb liegt er eher niedrig als hoch. Behandeln Sie jede Zahl hier als Untergrenze, die die Maschine schlagen sollte, nicht als Zielwert, auf den Sie hinplanen.

Die zweite Sache, die die Rechnung verbirgt, ist, dass sich ein Mixture-of-Experts-Modell schwerer gut sharden lässt. Ein dichtes Modell, das auf mehrere Karten aufgeteilt ist, synchronisiert einmal pro Layer; ein Mixture-of-Experts-Modell muss Token außerdem an die Karte routen, die den jeweils gewählten Experten hält, was ein anderes und weniger vorhersagbares Verkehrsmuster ergibt. Das ist einer der wenigen Workloads, bei denen der Interconnect seinen Preis wirklich wert ist, statt nur auf der Rechnung aufzutauchen.

Die Hälfte, die günstiger wird

Bisher waren das alles schlechte Nachrichten für die großen Modelle. Hier ist der Ausgleich, und zwar ein großer, den fast kein Vergleich erwähnt: Die Modelle mit den meisten Parametern auf dieser Seite haben den kleinsten Key/Value-Cache pro Token. Der Cache wird vom Attention-Design festgelegt – Layer, Key/Value-Heads, Head-Dimension – und hat nichts damit zu tun, wie viele Experten hinter der Attention stecken.

Key/Value-Cache pro Token, und was ein Stream bei jeder Kontextlänge kostet
Modell Cache pro Token 4k 8k 32k 128k
Mixtral 8×22B (MoE)8 KV-Heads 224 KiB 0.9 GB 1.8 GB 7.0 GB 28.0 GB
Qwen 3 235B-A22B (MoE)4 KV-Heads 188 KiB 0.7 GB 1.5 GB 5.9 GB 23.5 GB
DeepSeek V3 671B-A37B (MoE)Latent Attention 70 KiB 0.3 GB 0.5 GB 2.2 GB 8.8 GB
Llama 3.3 70B8 KV-Heads 320 KiB 1.3 GB 2.5 GB 10.0 GB 40.0 GB
Llama 3.1 405B8 KV-Heads 504 KiB 2.0 GB 3.9 GB 15.8 GB 63.0 GB

Diese Spalten gelten pro gleichzeitiger Anfrage. Multiplizieren Sie mit der Zahl der Menschen, die den Endpunkt gleichzeitig nutzen, und die Rangfolge in der letzten Spalte bestimmt Ihre Maschine weit mehr als die Gewichte.

DeepSeek V3 671B-A37B (MoE) hat den kleinsten Cache auf der Liste, mit 70 KiB pro Token. Gegenüber Llama 3.3 70B mit 320 KiB ist das ein Faktor von 4.6× zugunsten des größeren Modells. Es komprimiert den Cache, indem es Keys und Values in einen kleinen, gemeinsam genutzten latenten Vektor projiziert, statt sie pro Head zu speichern. Das Modell, das am meisten kostet zu laden, ist also das, das am wenigsten kostet, um es beschäftigt zu halten — weshalb es bei langem Kontext nutzbar bleibt, und weshalb die Rechnung kippt, sobald Sie mehr als eine Handvoll Menschen gleichzeitig bedienen.

Die praktische Lesart: Gewichte sind ein fixer Eintrittspreis, der Cache sind die laufenden Kosten. Ein Mixture-of-Experts-Modell verlangt einen enormen Eintrittspreis und dann geringe laufende Kosten pro Nutzer. Ein dichtes Modell vergleichbarer Fähigkeit ist genau umgekehrt. Welches der beiden für Sie günstiger ist, entscheiden Nebenläufigkeit und Kontextlänge – nicht die Parameterzahl auf der Modellkarte.

Welche Maschinen sie halten

Bei 4-Bit, mit dem Referenzkontext, und mit dem günstigsten Knoten in unserem Katalog, der jedes Modell hält — ob auf einer Karte oder aufgeteilt auf den Knoten. Das sind die Eintrittspreise, keine Empfehlungen; der nächste Abschnitt erklärt, warum.

Die günstigste Konfiguration, die wir vermieten und die jedes Mixture-of-Experts-Modell hält
Modell Braucht Günstigster Knoten, der es hält Pro Monat Token/s
Mixtral 8×22B (MoE) 83 GB 4 × NVIDIA L496 GB insgesamt · 24 GB pro Karte $564 4
Qwen 3 235B-A22B (MoE) 137 GB 8 × NVIDIA L4192 GB insgesamt · 24 GB pro Karte $1,106 10
DeepSeek V3 671B-A37B (MoE) 386 GB 8 × NVIDIA A100 PCIe640 GB insgesamt · 80 GB pro Karte $7,906 37

Jede einzelne davon ist ein Multi-Karten-Knoten, und das ist die ehrliche Kernaussage dieser Seite: Nichts in unserem Katalog hält eines dieser Modelle auf einer einzigen Karte, egal wie klein die aktive Zahl sie aussehen lässt. Der vollständige Katalog enthält die restlichen Konfigurationen, und der Konfigurator führt genau diese Prüfung für Ihr eigenes Modell und Ihren Kontext durch.

Der günstigste Knoten ist der falsche

Passen ist eine Schwelle, kein Ziel. Sobald ein Modell auf einen Knoten aufgeteilt ist, hängt der Durchsatz von der Speicherbandbreite der Karten ab, auf die es aufgeteilt ist — und die Bandbreite pro Dollar variiert um mehr als das Doppelte zwischen Konfigurationen, die alle dieselbe Speicherhürde nehmen. Hier ist DeepSeek V3 671B-A37B (MoE) auf jedem Knoten, der es hält, sortiert nach Preis, mit der einzig wichtigen Spalte rechts.

Jeder Knoten, der DeepSeek V3 671B-A37B (MoE) hält, mit dem Monatspreis für ein Token pro Sekunde
Konfiguration VRAM Pro Monat Token/s $ pro Token/s
8 × NVIDIA A100 PCIeGN-A10080×8 640 GB $7,906 37 $213.68
8 × NVIDIA A100 SXM4GN-A100SXM×8 640 GB $8,355 39 $214.23
4 × NVIDIA H200 SXM5GN-H200×4 564 GB $8,405 62 $135.56
8 × NVIDIA H100 PCIeGN-H100PCIE×8 640 GB $10,568 38 $278.11
8 × NVIDIA H100 SXM5GN-H100SXM×8 640 GB $11,509 64 $179.83
4 × NVIDIA B200 SXM6GN-B200×4 720 GB $11,790 103 $114.47
8 × NVIDIA H200 SXM5GN-H200×8 1128 GB $15,945 91 $175.22
8 × NVIDIA B200 SXM6GN-B200×8 1440 GB $22,351 152 $147.05

Die grüne Zelle ist das beste Preis-Leistungs-Verhältnis auf der Liste, und sie ist nicht die günstigste Zeile. Der Wechsel von $7,906 zu $11,790 vervielfacht die Rechnung um 1.5× und den Durchsatz um 2.8× — Sie zahlen mehr, und jedes Token kostet Sie weniger. Einen Katalog nach Preis zu sortieren und die erste passende Maschine zu nehmen, ist die Art, wie ein Serving-Budget zweimal ausgegeben wird.

Ein Vorbehalt zu dieser Spalte, und er gilt für jede Preis-pro-Durchsatz-Tabelle, die Sie je lesen werden: Sie beruht auf der Generierung mit einem einzelnen Stream. Unter kontinuierlichem Batching steigt die Summe in jeder Zeile um ein Vielfaches, und sie steigt nicht in jeder Zeile um denselben Faktor — ein Knoten mit mehr freiem Speicher nach den Gewichten hält mehr gleichzeitige Sequenzen. Die Rangfolge ist stabil; die absoluten Zahlen sind konservativ. Die Wirtschaftlichkeit dieser Summe wird an anderer Stelle durchgerechnet.

Wann ein Mixture-of-Experts-Modell die richtige Antwort ist

Der Reihe nach. Halten Sie bei der ersten Zeile an, die auf Sie zutrifft.

  1. Ein dichtes Modell, das auf eine Karte passt, erledigt die Aufgabe. Dann nehmen Sie es, und schauen Sie nicht zurück. Eine Karte bedeutet: kein Sharding, keine Interconnect-Frage, kein Expert-Routing-Verkehr, und eine Maschine, die einen Bruchteil eines Knotens kostet. Die meisten Produkte, die glauben, ein offenes Frontier-Modell zu brauchen, brauchen ein gutes 32B-Modell.
  2. Sie brauchen die Qualität, und Ihr Kontext ist lang. Genau hier ist ein Mixture-of-Experts-Modell wirklich das beste verfügbare Werkzeug: Sie zahlen einmal für die Gewichte, und der kleine Cache sorgt dafür, dass die Maschine lange Gespräche weiter bedient, ohne einzuknicken. Dimensionieren Sie den Knoten anhand der Gewichte, und prüfen Sie dann die Cache-Tabelle für Ihren tatsächlichen Kontext.
  3. Sie brauchen die Qualität und bedienen viele Menschen gleichzeitig. Gleiche Antwort, gleicher Grund, und der Vorteil wächst mit der Nebenläufigkeit. Die Fixkosten werden über jeden Stream amortisiert, während die Kosten pro Stream niedrig bleiben.
  4. Sie brauchen die Qualität, aber nur gelegentlich. Dann mieten Sie einen großen Knoten, nur um ihn ein paar Stunden pro Woche warmzuhalten – das ist die denkbar schlechteste Nutzung einer monatlichen Laufzeit. Bündeln Sie die Arbeit entweder so, dass sie in einem Rutsch läuft, oder nutzen Sie dafür einen gehosteten Endpunkt und behalten Sie Ihre eigene Maschine für die gleichmäßige Last.
  5. Sie wollen eines fine-tunen. Anderes Problem, größere Maschine: Training berührt jeden Experten und braucht Optimizer-Zustand für alle davon, sodass der Speicherbedarf, der schon die Inferenz unhandlich machte, hier unerschwinglich wird. Adapter-Fine-Tuning auf einem dichten Modell ist für fast jeden der realistische Weg.

Bei welcher Zeile auch immer Sie hängengeblieben sind: Die Zahl, die Sie zuerst prüfen sollten, ist die Gesamtzahl der Parameter, in der Präzision, in der Sie bedienen wollen. Alles andere auf dieser Seite — die Geschwindigkeit, der Cache, der Preis pro Token pro Sekunde — wird erst relevant, sobald das Modell resident ist. Der Konfigurator führt die gesamte Prüfung für jeden Knoten durch, den wir vermieten, und wendet auf die Durchsatzschätzung dieselbe Routing-Korrektur an wie die Tabellen oben. Wenn Sie lieber zuerst die vollständige Speicherrechnung sehen möchten, dazu gibt es einen eigenen Guide; wenn Sie sich noch nicht auf ein Zahlenformat festgelegt haben, kommt diese Entscheidung vor dieser hier.

Prüfen Sie Ihr eigenes Mixture-of-Experts-Modell an echten Maschinen.

Der Konfigurator kennt jeden Knoten, den wir vermieten, wendet dieselbe Rechnung an wie diese Seite, und sagt Ihnen, welche Ihr Modell halten, bevor Sie irgendetwas bezahlen.

Anmelden

Konsole, Rechnungen und Out-of-Band-Zugriff.

Noch kein Konto?

Es gibt keine separate Registrierung. Ihr Konto wird bei Ihrer ersten Bestellung angelegt — Sie wählen E-Mail und Passwort im Zahlungsschritt, und die Konsole ist offen, sobald die Maschine es ist.

Server konfigurieren

Language