Dimensionierung-Guide · 10 Min. Lesezeit

# Was ein Mixture-of-Experts-Modell wirklich kostet.

Ein Name wie „235B-A22B“ enthält zwei Zahlen, und fast jeder liest die falsche. Die eine entscheidet, was Sie mieten; die andere entscheidet, wie schnell es antwortet. Sie können um den Faktor zehn auseinanderliegen.

Die kurze Antwort

- **Die Gesamtzahl der Parameter entscheidet über die Maschine:** **DeepSeek V3 671B-A37B (MoE)** braucht bei 4-Bit **386 GB** mit 8k Kontext. Ein dichtes Modell von der Größe seiner *aktiven* Parameter würde 22 GB brauchen — **17.6×** weniger.
- **Aktive Parameter entscheiden über die Geschwindigkeit:** Pro Token wird nur ein Bruchteil der Gewichte gelesen, daher generiert es schneller als ein dichtes Modell derselben Masse — aber das Routing nimmt einen großen Teil dieses Vorteils gleich wieder zurück.
- **Der günstigste Knoten, der es hält:** [8 × NVIDIA A100 PCIe](https://gpuserver.io/de/gpu/a100-80gb) zu **$7,906** pro Monat. Das ist fast nie die richtige Wahl.
- **Der, den es sich zu mieten lohnt:** [4 × NVIDIA B200 SXM6](https://gpuserver.io/de/gpu/b200) zu **$11,790** — 1.5× des Geldes für 2.8× des Durchsatzes.

## Die Kurzfassung

Ein Mixture-of-Experts-Modell teilt den Feed-Forward-Teil jedes Layers in viele kleine Netzwerke auf und schickt jedes Token nur durch wenige davon. Der veröffentlichte Name hält beide Tatsachen fest: die Gesamtzahl der Parameter, und die Zahl, die für ein einzelnes Token aktiv ist. *Die erste Zahl müssen Sie vollständig im Speicher halten, die zweite lesen Sie nur pro Token.* Dieser eine Satz ist der ganze Guide, und ihn zu verwechseln ist der teuerste Fehler, den wir Leute vor einer Bestellung machen sehen.

Die Folge ist ein Modell mit einer merkwürdigen Kostenform: Es mietet sich wie ein Riese und läuft wie ein mittelgroßes Modell. Ob das ein Schnäppchen oder eine Falle ist, hängt vollständig davon ab, welche der beiden Zahlen Ihr Engpass ist.

**Die Maschine dimensionieren?** Nehmen Sie die Gesamtzahl. Jeder Experte muss resident sein, weil Sie vorher nicht wissen können, welchen das nächste Token braucht. Routing wird pro Token entschieden, zur Laufzeit.

**Die Geschwindigkeit schätzen?** Gehen Sie von der aktiven Zahl aus, und ziehen Sie dann einen großen Abschlag ab. Die Generierung liest nur die aktiven Gewichte, was genau der Sinn der Sache ist – aber der Router, die Verteilung an die Experten und der Datenverkehr zwischen den Karten sind nicht kostenlos, und sie skalieren schlecht über einen Knoten hinweg.

**Langer Kontext oder viele Nutzer?** Schauen Sie auf das Attention-Design, nicht auf die Parameterzahlen. Die größten Modelle auf dieser Seite haben den *kleinsten* Key/Value-Cache pro Token, und ab einer bestimmten Länge kehrt das die Rangfolge vollständig um.

**Nur die Qualität zählt?** Ein dichtes Modell, das auf eine Karte passt, ist einfacher, günstiger und schneller zu betreiben als ein auf acht Karten aufgeteiltes Mixture-of-Experts-Modell. Greifen Sie zu einem MoE, wenn kein dichtes Modell die Antwort liefert, die Sie brauchen – nicht, weil der Name beeindruckend klingt.

Die Rechnung unten ist dieselbe, die der [Konfigurator](https://gpuserver.io/de/configure) ausführt, auf demselben Katalog. Wenn Sie noch nicht ermittelt haben, wie viel Speicher ein Modell überhaupt braucht, kommt [diese Formel zuerst](https://gpuserver.io/de/guides/vram-sizing) – diese Seite zeigt, was sich ändert, sobald das Modell ein Mixture-of-Experts-Modell ist.

## Den Namen lesen

Drei Namenskonventionen sind im Umlauf, und alle kodieren dasselbe Zahlenpaar – deshalb hält sich die Verwirrung. Sobald Sie sie lesen können, beantwortet sich die Dimensionierungsfrage von selbst.

235B-A22B Gesamt, dann aktiv Die klarste der drei Konventionen. 235 Milliarden Parameter liegen im Speicher; 22 Milliarden davon werden für jedes einzelne Token gelesen. Der Buchstabe A steht für *aktiv*, und das ist die Zahl, die Ihnen **nicht** sagt, was Sie mieten sollen.

671B-A37B Gleiche Konvention, größer Bei dieser Größe wird die Lücke bewusst absurd: Der aktive Anteil liegt unter sechs Prozent. Für die Maschine, die Sie brauchen, sagt die 37 gar nichts aus.

8×22B Experten, dann Expertengröße Die ältere Konvention, und die, die am meisten in die Irre führt. Sie bedeutet nicht 176 Milliarden Parameter, weil Attention und Embeddings gemeinsam genutzt statt dupliziert werden; und sie bedeutet auch nicht 22 Milliarden, weil pro Token zwei Experten aktiv sind, nicht einer.

A22B, A37B Ein Durchschnitt, keine Garantie Die aktive Zahl ist das, was Routing bei typischem Text kostet. Sie ist keine Obergrenze: Ein Batch, dessen Token sich zufällig über viele Experten verteilen, berührt mehr vom Modell – einer der Gründe, warum der gemessene Durchsatz unter der reinen Rechnung liegt.

**Die Mixture-of-Experts-Modelle in unserem Dimensionierungskatalog, Gesamt- gegen aktive Parameter**

| Modell | Parameter gesamt | Aktiv pro Token | Aktiver Anteil |
|---|---|---|---|
| Mixtral 8×22B (MoE) 56 Layer | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) 94 Layer | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) 61 Layer | 671 B | 37 B | 6 % |
| Llama 3.3 70B Dicht, zum Vergleich | 70 B | 70 B | 100 % |

Die letzte Spalte ist die, die man sich merken sollte. Ein dichtes Modell liest alles, was es speichert; ein Mixture-of-Experts-Modell liest einen Ausschnitt. Alles Merkwürdige an diesen Modellen — im Guten wie im Schlechten — folgt aus genau dieser einen Zeile.

## Der Speicher, den Sie tatsächlich mieten

Hier ist die ganze Falle in einer Tabelle. Die mittlere Spalte zeigt, was das Modell auf der Maschine braucht; die Spalte danach zeigt, wofür ein Leser budgetiert hätte, der die aktive Zahl für bare Münze genommen hätte. Die letzte Spalte ist die Rechnung für dieses Missverständnis.

**Benötigter VRAM bei 4-Bit mit 8k Kontext, gegenüber dem, was die aktive Parameterzahl vermuten lässt**

| Modell | Gewichte bei 4-Bit | Insgesamt benötigt | Wäre es seine aktive Größe | Überschreitung |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB bei 8k | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB bei 8k | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB bei 8k | 22 GB | 17.6× |

Lesen Sie die letzte Spalte als Einkaufsfehler. Wer allein anhand der aktiven Zahl dimensioniert, würde nach einer einzigen Karte suchen und am Ende einen ganzen Knoten brauchen — nicht eine etwas größere Maschine, sondern eine andere Kategorie von Maschine, zu einem anderen Preis.

**Nein, Sie können die ungenutzten Experten nicht auf der Festplatte lassen.** Das ist die erste Idee, die jeder hat, und Serving-Stacks bieten sie tatsächlich an. Das Problem ist, dass Routing pro Token entschieden wird: Die Menge der benötigten Experten wechselt mehrmals pro erzeugtem Wort, sodass eine Karte, die nur eine Teilmenge hält, ihre Zeit damit verbringt, Gewichte über PCIe nachzuladen, statt zu rechnen. Das Ergebnis ist kein etwas langsameres Modell, sondern eines, das nur mit einem Bruchteil seiner Geschwindigkeit läuft. Offloading ist ein Weg, ein Modell auf einer Maschine *laufen* zu lassen, die es nicht halten kann, nicht ein Weg, es zu *bedienen*.

## Was die aktiven Parameter bringen

Generierung wird durch die Speicherbandbreite begrenzt: Jedes neue Token erfordert, die daran beteiligten Gewichte erneut zu lesen. Ein Mixture-of-Experts-Modell liest nur seinen aktiven Ausschnitt, sodass die Obergrenze seiner Geschwindigkeit durch eine viel kleinere Zahl gesetzt wird, als seine Größe vermuten lässt. Dieser Teil des Versprechens ist real, und deshalb gibt es diese Modelle überhaupt.

Die Tabelle unten stellt jedes Modell auf *dieselbe* Maschine — [8 × NVIDIA A100 PCIe](https://gpuserver.io/de/gpu/a100-80gb) zu $7,906 pro Monat, der günstigste Knoten in unserem Katalog, der sie alle gleichzeitig hält. Durchsatzwerte zu vergleichen, die auf unterschiedlichen Maschinen gemessen wurden, vergleicht gar nichts.

**Generierung mit einzelnem Stream auf einem Knoten, Mixture-of-Experts-Modelle gegen dichte Modelle**

| Modell | Gesamt | Gelesen pro Token | Geschätzte Token/s |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) Mixture of Experts · aufgeteilt auf 8 Karten | 671 B | 18.5 GB | 37 ein Stream |
| Llama 3.1 405B Dicht · aufgeteilt auf 8 Karten | 405 B | 202.5 GB | 19 ein Stream |
| Qwen 3 235B-A22B (MoE) Mixture of Experts · aufgeteilt auf 8 Karten | 235 B | 11.0 GB | 62 ein Stream |
| Mixtral 8×22B (MoE) Mixture of Experts · aufgeteilt auf 8 Karten | 141 B | 19.5 GB | 35 ein Stream |
| Llama 3.3 70B Dicht · auf einer Karte | 70 B | 35.0 GB | 25 ein Stream |

Die beiden Zeilen, die sich zu vergleichen lohnen, sind das größte Mixture-of-Experts-Modell und das größte dichte Modell, weil beide auf den gesamten Knoten aufgeteilt sind. Das Mixture-of-Experts-Modell ist mit weitem Abstand das größere der beiden und generiert trotzdem schneller, weil es pro Token nur einen Bruchteil seiner selbst liest — genau das ist der Tausch, für den die Architektur gemacht ist. Lesen Sie die mit *auf einer Karte* markierten Zeilen anders: Diese Modelle belegen nur eine einzige Karte des Knotens und lassen die anderen sieben frei – das ist eine günstigere Maschine, die darauf wartet, gewählt zu werden, keine langsamere.

**Diese Zahlen enthalten bereits einen großen Abschlag, und das ist auch richtig so.** Reine Rechnung mit aktiven Parametern überschätzt ein Mixture-of-Experts-Modell stark. Unsere erste Version dieses Schätzers tat genau das und lag gegenüber veröffentlichten Messungen für das größte Modell auf dieser Seite um etwa den Faktor fünf daneben. Routing kostet einen eigenen Durchlauf, Experten müssen bei jedem Layer Aktivierungen zwischen Karten austauschen, und der Batch verteilt sich auf mehr Experten, als der Durchschnitt vermuten lässt. Der Schätzer wendet jetzt eine bewusst konservative Korrektur an, kalibriert an gemessenen Werten statt frei gewählt — deshalb liegt er eher niedrig als hoch. Behandeln Sie jede Zahl hier als Untergrenze, die die Maschine schlagen sollte, nicht als Zielwert, auf den Sie hinplanen.

Die zweite Sache, die die Rechnung verbirgt, ist, dass sich ein Mixture-of-Experts-Modell schwerer gut sharden lässt. Ein dichtes Modell, das auf mehrere Karten aufgeteilt ist, synchronisiert einmal pro Layer; ein Mixture-of-Experts-Modell muss Token außerdem an die Karte routen, die den jeweils gewählten Experten hält, was ein anderes und weniger vorhersagbares Verkehrsmuster ergibt. Das ist einer der wenigen Workloads, bei denen [der Interconnect seinen Preis wirklich wert ist](https://gpuserver.io/de/guides/nvlink-vs-pcie), statt nur auf der Rechnung aufzutauchen.

## Die Hälfte, die günstiger wird

Bisher waren das alles schlechte Nachrichten für die großen Modelle. Hier ist der Ausgleich, und zwar ein großer, den fast kein Vergleich erwähnt: Die Modelle mit den meisten Parametern auf dieser Seite haben den *kleinsten* Key/Value-Cache pro Token. Der Cache wird vom Attention-Design festgelegt – Layer, Key/Value-Heads, Head-Dimension – und hat nichts damit zu tun, wie viele Experten hinter der Attention stecken.

**Key/Value-Cache pro Token, und was ein Stream bei jeder Kontextlänge kostet**

| Modell | Cache pro Token | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) 8 KV-Heads | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) 4 KV-Heads | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) Latent Attention | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B 8 KV-Heads | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B 8 KV-Heads | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |

Diese Spalten gelten pro *gleichzeitiger Anfrage*. Multiplizieren Sie mit der Zahl der Menschen, die den Endpunkt gleichzeitig nutzen, und die Rangfolge in der letzten Spalte bestimmt Ihre Maschine weit mehr als die Gewichte.

**DeepSeek V3 671B-A37B (MoE) hat den kleinsten Cache auf der Liste, mit 70 KiB pro Token.** Gegenüber Llama 3.3 70B mit 320 KiB ist das ein Faktor von **4.6×** zugunsten des größeren Modells. Es komprimiert den Cache, indem es Keys und Values in einen kleinen, gemeinsam genutzten latenten Vektor projiziert, statt sie pro Head zu speichern. Das Modell, das am meisten kostet zu laden, ist also das, das am wenigsten kostet, um es beschäftigt zu halten — weshalb es bei langem Kontext nutzbar bleibt, und weshalb die Rechnung kippt, sobald Sie mehr als eine Handvoll Menschen gleichzeitig bedienen.

Die praktische Lesart: Gewichte sind ein fixer Eintrittspreis, der Cache sind die laufenden Kosten. Ein Mixture-of-Experts-Modell verlangt einen enormen Eintrittspreis und dann geringe laufende Kosten pro Nutzer. Ein dichtes Modell vergleichbarer Fähigkeit ist genau umgekehrt. Welches der beiden für Sie günstiger ist, entscheiden Nebenläufigkeit und Kontextlänge – nicht die Parameterzahl auf der Modellkarte.

## Welche Maschinen sie halten

Bei 4-Bit, mit dem Referenzkontext, und mit dem günstigsten Knoten in unserem Katalog, der jedes Modell hält — ob auf einer Karte oder aufgeteilt auf den Knoten. Das sind die Eintrittspreise, keine Empfehlungen; der nächste Abschnitt erklärt, warum.

**Die günstigste Konfiguration, die wir vermieten und die jedes Mixture-of-Experts-Modell hält**

| Modell | Braucht | Günstigster Knoten, der es hält | Pro Monat | Token/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | [4 × NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) 96 GB insgesamt · 24 GB pro Karte | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | [8 × NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) 192 GB insgesamt · 24 GB pro Karte | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | [8 × NVIDIA A100 PCIe](https://gpuserver.io/de/gpu/a100-80gb) 640 GB insgesamt · 80 GB pro Karte | $7,906 | 37 |

Jede einzelne davon ist ein Multi-Karten-Knoten, und das ist die ehrliche Kernaussage dieser Seite: Nichts in unserem Katalog hält eines dieser Modelle auf einer einzigen Karte, egal wie klein die aktive Zahl sie aussehen lässt. [Der vollständige Katalog](https://gpuserver.io/de/#catalog) enthält die restlichen Konfigurationen, und [der Konfigurator](https://gpuserver.io/de/configure) führt genau diese Prüfung für Ihr eigenes Modell und Ihren Kontext durch.

## Der günstigste Knoten ist der falsche

Passen ist eine Schwelle, kein Ziel. Sobald ein Modell auf einen Knoten aufgeteilt ist, hängt der Durchsatz von der Speicherbandbreite der Karten ab, auf die es aufgeteilt ist — und die Bandbreite pro Dollar variiert um mehr als das Doppelte zwischen Konfigurationen, die alle dieselbe Speicherhürde nehmen. Hier ist DeepSeek V3 671B-A37B (MoE) auf jedem Knoten, der es hält, sortiert nach Preis, mit der einzig wichtigen Spalte rechts.

**Jeder Knoten, der DeepSeek V3 671B-A37B (MoE) hält, mit dem Monatspreis für ein Token pro Sekunde**

| Konfiguration | VRAM | Pro Monat | Token/s | $ pro Token/s |
|---|---|---|---|---|
| [8 × NVIDIA A100 PCIe](https://gpuserver.io/de/gpu/a100-80gb) GN-A10080×8 | 640 GB | $7,906 | 37 | $213.68 |
| [8 × NVIDIA A100 SXM4](https://gpuserver.io/de/gpu/a100-sxm4) GN-A100SXM×8 | 640 GB | $8,355 | 39 | $214.23 |
| [4 × NVIDIA H200 SXM5](https://gpuserver.io/de/gpu/h200) GN-H200×4 | 564 GB | $8,405 | 62 | $135.56 |
| [8 × NVIDIA H100 PCIe](https://gpuserver.io/de/gpu/h100-pcie) GN-H100PCIE×8 | 640 GB | $10,568 | 38 | $278.11 |
| [8 × NVIDIA H100 SXM5](https://gpuserver.io/de/gpu/h100-sxm5) GN-H100SXM×8 | 640 GB | $11,509 | 64 | $179.83 |
| [4 × NVIDIA B200 SXM6](https://gpuserver.io/de/gpu/b200) GN-B200×4 | 720 GB | $11,790 | 103 | $114.47 |
| [8 × NVIDIA H200 SXM5](https://gpuserver.io/de/gpu/h200) GN-H200×8 | 1128 GB | $15,945 | 91 | $175.22 |
| [8 × NVIDIA B200 SXM6](https://gpuserver.io/de/gpu/b200) GN-B200×8 | 1440 GB | $22,351 | 152 | $147.05 |

Die grüne Zelle ist das beste Preis-Leistungs-Verhältnis auf der Liste, und sie ist nicht die günstigste Zeile. Der Wechsel von $7,906 zu $11,790 vervielfacht die Rechnung um 1.5× und den Durchsatz um 2.8× — Sie zahlen mehr, und jedes Token kostet Sie weniger. Einen Katalog nach Preis zu sortieren und die erste passende Maschine zu nehmen, ist die Art, wie ein Serving-Budget zweimal ausgegeben wird.

Ein Vorbehalt zu dieser Spalte, und er gilt für jede Preis-pro-Durchsatz-Tabelle, die Sie je lesen werden: Sie beruht auf der Generierung mit einem einzelnen Stream. Unter kontinuierlichem Batching steigt die Summe in jeder Zeile um ein Vielfaches, und sie steigt nicht in jeder Zeile um denselben Faktor — ein Knoten mit mehr freiem Speicher nach den Gewichten hält mehr gleichzeitige Sequenzen. Die Rangfolge ist stabil; die absoluten Zahlen sind konservativ. [Die Wirtschaftlichkeit dieser Summe](https://gpuserver.io/de/guides/api-vs-self-hosting) wird an anderer Stelle durchgerechnet.

## Wann ein Mixture-of-Experts-Modell die richtige Antwort ist

Der Reihe nach. Halten Sie bei der ersten Zeile an, die auf Sie zutrifft.

1. **Ein dichtes Modell, das auf eine Karte passt, erledigt die Aufgabe.** Dann nehmen Sie es, und schauen Sie nicht zurück. Eine Karte bedeutet: kein Sharding, keine Interconnect-Frage, kein Expert-Routing-Verkehr, und eine Maschine, die einen Bruchteil eines Knotens kostet. Die meisten Produkte, die glauben, ein offenes Frontier-Modell zu brauchen, brauchen ein gutes 32B-Modell.
2. **Sie brauchen die Qualität, und Ihr Kontext ist lang.** Genau hier ist ein Mixture-of-Experts-Modell wirklich das beste verfügbare Werkzeug: Sie zahlen einmal für die Gewichte, und der kleine Cache sorgt dafür, dass die Maschine lange Gespräche weiter bedient, ohne einzuknicken. Dimensionieren Sie den Knoten anhand der Gewichte, und prüfen Sie dann die Cache-Tabelle für Ihren tatsächlichen Kontext.
3. **Sie brauchen die Qualität und bedienen viele Menschen gleichzeitig.** Gleiche Antwort, gleicher Grund, und der Vorteil wächst mit der Nebenläufigkeit. Die Fixkosten werden über jeden Stream amortisiert, während die Kosten pro Stream niedrig bleiben.
4. **Sie brauchen die Qualität, aber nur gelegentlich.** Dann mieten Sie einen großen Knoten, nur um ihn ein paar Stunden pro Woche warmzuhalten – das ist die denkbar schlechteste Nutzung einer monatlichen Laufzeit. Bündeln Sie die Arbeit entweder so, dass sie in einem Rutsch läuft, oder nutzen Sie dafür einen gehosteten Endpunkt und behalten Sie Ihre eigene Maschine für die gleichmäßige Last.
5. **Sie wollen eines fine-tunen.** Anderes Problem, größere Maschine: Training berührt jeden Experten und braucht Optimizer-Zustand für alle davon, sodass der Speicherbedarf, der schon die Inferenz unhandlich machte, hier unerschwinglich wird. [Adapter-Fine-Tuning](https://gpuserver.io/de/guides/lora-finetune) auf einem dichten Modell ist für fast jeden der realistische Weg.

Bei welcher Zeile auch immer Sie hängengeblieben sind: Die Zahl, die Sie zuerst prüfen sollten, ist die Gesamtzahl der Parameter, in der Präzision, in der Sie bedienen wollen. Alles andere auf dieser Seite — die Geschwindigkeit, der Cache, der Preis pro Token pro Sekunde — wird erst relevant, sobald das Modell resident ist. Der [Konfigurator](https://gpuserver.io/de/configure) führt die gesamte Prüfung für jeden Knoten durch, den wir vermieten, und wendet auf die Durchsatzschätzung dieselbe Routing-Korrektur an wie die Tabellen oben. Wenn Sie lieber zuerst die vollständige Speicherrechnung sehen möchten, [dazu gibt es einen eigenen Guide](https://gpuserver.io/de/guides/vram-sizing); wenn Sie sich noch nicht auf ein Zahlenformat festgelegt haben, [kommt diese Entscheidung vor dieser hier](https://gpuserver.io/de/guides/awq-vs-gptq-vs-fp8).

## Prüfen Sie Ihr eigenes Mixture-of-Experts-Modell an echten Maschinen.

Der Konfigurator kennt jeden Knoten, den wir vermieten, wendet dieselbe Rechnung an wie diese Seite, und sagt Ihnen, welche Ihr Modell halten, bevor Sie irgendetwas bezahlen.

[Konfigurator öffnen](https://gpuserver.io/de/configure) [Guides lesen](https://gpuserver.io/de/guides)

## Weitere Guides

- [Kosten · 6 Min. Wann Monatsmiete die Stundenmiete schlägt Der Break-even anhand realer Zahlen, die drei Kosten, die ein Stundenpreis bis zur Rechnung verbirgt, und die Leerlauf-Falle, die eine Schätzung verdreifacht. Guide lesen](https://gpuserver.io/de/guides/monthly-vs-hourly)
- [Kosten · 9 Min. Self-Hosting gegen eine API mit Preis pro Token Der Break-even zwischen einer API mit Preis pro Token und einer gemieteten GPU, mit unseren eigenen Zahlen — und vier Dinge, die dabei fehlen. Guide lesen](https://gpuserver.io/de/guides/api-vs-self-hosting)
- [Praxis · 11 Min. Llama 3.3 70B auf einem Knoten betreiben Von der gelieferten Maschine zum OpenAI-kompatiblen Endpunkt, mit den Flags, die zählen, und den zweien, die Ihren Durchsatz unbemerkt halbieren. Guide lesen](https://gpuserver.io/de/guides/serve-llama-70b)

---

Quelle: https://gpuserver.io/de/guides/mixture-of-experts/. Diese Datei wird aus denselben Daten wie die Website erzeugt; weicht eine Zahl hier von einer Seite ab, ist die Seite maßgeblich und diese Datei veraltet — die kanonische Quelle ist https://gpuserver.io/.
