Dimensionierung-Guide · 9 Min. Lesezeit

# Wie viel VRAM ein Modell tatsächlich benötigt.

Zwei Zahlen entscheiden: die Gewichte, die fest sind, und der KV-Cache, der mit dem bedienten Kontext wächst. Fast jede falsche Antwort entsteht dadurch, dass die zweite aus der ersten geschätzt wird.

Die kurze Antwort

- **Weights:** Parameter in Milliarden × Bytes pro Parameter. 70B bei 4-Bit sind **35 GB**.
- **KV-Cache:** 2 × Layer × KV-Heads × Head-Dim × Bytes, pro Token. Hat nichts mit der Parameterzahl zu tun.
- **Overhead:** Rechnen Sie etwa **15 %** für Aktivierungen, den CUDA-Kontext und Allocator-Fragmentierung hinzu.
- **Die Falle:** Gewichte auf 4-Bit zu quantisieren, quantisiert den Cache **nicht**. Er bleibt in jedem gängigen Stack FP16.

## Die Formel

Es gibt hier keine Faustregel, die den Kontakt mit einem zweiten Modell übersteht. Die gesamte Berechnung sind drei Zeilen, und es lohnt sich, sie durchzuführen, statt einem Multiplikator zu vertrauen.

Gesamter VRAM, in GB

```
# 1. Weights
weights_gb   = parameters_in_billions × bytes_per_parameter

# 2. KV cache, per token — then multiplied by the context you serve
bytes_per_tok = 2 × layers × kv_heads × head_dim × cache_bytes
cache_gb      = bytes_per_tok × context_tokens × batch / 1024³

# 3. Everything else
total_gb      = (weights_gb + cache_gb) × 1.15
```

Die `2` steht dafür, dass es zwei Tensoren pro Token gibt, K und V. `bytes_per_parameter` ist 2 für BF16, 1 für FP8, 0.5 für 4-Bit. `cache_bytes` ist eine *separate* Zahl, und diese Trennung ist die häufigste Ursache für eine falsche Antwort – siehe [unten](https://gpuserver.io/de/guides/vram-sizing#wrong).

## Gewichte

Die einfache Hälfte. Sie verläuft exakt linear zur Parameterzahl, und die einzige Entscheidung ist die Präzision.

**Gewichtsspeicher nach Präzision, für eine Auswahl an Modellgrößen**

| Modell | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|
| Llama 3.1 8B 8B Parameter | 16.0 GB | 8.0 GB | 4.0 GB |
| Qwen 3 32B 32B Parameter | 64.0 GB | 32.0 GB | 16.0 GB |
| Llama 3.3 70B 70B Parameter | 140.0 GB | 70.0 GB | 35.0 GB |
| Llama 3.1 405B 405B Parameter | 810.0 GB | 405.0 GB | 202.5 GB |

4-Bit-Quantisierung kostet Qualität, und wie viel hängt weit stärker vom Modell ab als von der Methode. Es ist der richtige Kompromiss, wenn er den Unterschied zwischen einer Karte und vier ausmacht; es ist ein schlechter Kompromiss, wenn Sie ohnehin schon genug Spielraum haben.

## Der KV-Cache

Die schwierige Hälfte, und diejenige, die entscheidet, ob eine Maschine bei 4k ausreicht und bei 128k hoffnungslos ist. Sie hängt von Layern und KV-Heads ab – *nicht* davon, wie groß das Modell ist.

**Zwei Modelle sehr unterschiedlicher Größe, nebeneinander.** Llama 3.3 70B hat 80 Layer und 8 KV-Heads, also 320 KB pro Token. Gemma 3 27B – ein Drittel der Parameter – hat 62 Layer und 16 KV-Heads, also 496 KB pro Token, das ist 1.6× *mehr*. Jede aus der Parameterzahl hochgerechnete Schätzung liegt damit genau verkehrt.

**KV-Cache-Größe nach Modell und Kontextlänge, bei FP16-Cache-Präzision, eine Anfrage**

| Modell | Pro Token | 4k Kontext | 8k Kontext | 32k Kontext | 128k Kontext |
|---|---|---|---|---|---|
| Llama 3.1 8B 32 Layer · 8 KV-Heads | 128 KB | 0.5 GB | 1.0 GB | 4.0 GB | 16.0 GB |
| Gemma 3 27B 62 Layer · 16 KV-Heads | 496 KB | 1.9 GB | 3.9 GB | 15.5 GB | 62.0 GB |
| Llama 3.3 70B 80 Layer · 8 KV-Heads | 320 KB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| DeepSeek V3 671B-A37B (MoE) Latent Attention | 70 KB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.1 405B 126 Layer · 8 KV-Heads | 504 KB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |

Lesen Sie die letzte Spalte vor der ersten. Bei 4k Kontext ist der Cache bei jedem Modell hier ein Rundungsfehler; bei 128k ist er größer als die Gewichte eines 70B-Modells in 4-Bit. DeepSeek V3 ist der Ausreißer, weil seine Latent Attention den Cache von Grund auf komprimiert – deshalb ist es trotz des größten Modells auf der Liste bei langem Kontext nutzbar.

## Wo Schätzungen danebenliegen

**Den Cache anhand der Parameterzahl hochzurechnen.** Der häufigste Fehler, und genau der, der oben gezeigt wurde. Ein 27B-Modell kann mehr Cache benötigen als ein 70B-Modell.

**Anzunehmen, 4-Bit-Gewichte bedeuten einen 4-Bit-Cache.** Das stimmt nicht. AWQ und GPTQ quantisieren nur die Gewichte; der Cache bleibt FP16, sofern Sie nicht explizit FP8-KV aktivieren. Ein 70B-Modell bei 4-Bit und 128k Kontext hat 35 GB Gewichte und 40 GB Cache.

**Für eine einzelne Anfrage zu dimensionieren.** Der Cache gilt pro gleichzeitiger Sequenz. Acht Nutzer gleichzeitig zu bedienen benötigt die achtfache Cache-Menge – siehe [unten](https://gpuserver.io/de/guides/vram-sizing#batch).

**Den Overhead zu vergessen.** Aktivierungen, der CUDA-Kontext und Allocator-Fragmentierung sind real. 15 % sind eine bewusst vorsichtige Reserve; wer sie ganz ignoriert, erlebt, wie ein Modell, das „passt“, nicht lädt.

**Den gesamten VRAM über mehrere Karten hinweg zu addieren.** Vier 24-GB-Karten sind keine einzelne 96-GB-Karte. Tensor-Parallelismus kann ein Modell darauf aufteilen, aber dann synchronisiert sich jeder Layer über die Verbindung – siehe den [NVLink-Guide](https://gpuserver.io/de/guides/nvlink-vs-pcie).

**Ein MoE anhand seiner aktiven Parameter zu dimensionieren.** DeepSeek V3 aktiviert 37B pro Token, aber Sie müssen alle 671B im Speicher halten. Aktive Parameter sagen die *Geschwindigkeit* voraus; die Gesamtzahl der Parameter entscheidet, ob es überhaupt lädt.

## Durchgerechnete Beispiele

Benötigter Gesamtspeicher, Gewichte plus Cache plus Overhead, bei 8k Kontext und einer Anfrage. Das ist dieselbe Berechnung, die der Konfigurator für jede Konfiguration im Katalog durchführt.

**Benötigter Gesamt-VRAM bei 8k Kontext, nach Modell und Präzision**

| Modell | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) | Kleinster passender Knoten |
|---|---|---|---|---|
| Llama 3.1 8B 8B Parameter | 20 GB | 10 GB | 6 GB | [NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) $125/Monat · auf einer Karte · ~34 tok/s |
| Mistral Small 24B 24B Parameter | 57 GB | 28 GB | 15 GB | [NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) $125/Monat · auf einer Karte · ~11 tok/s |
| Gemma 3 27B 27B Parameter | 67 GB | 33 GB | 20 GB | [NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) $125/Monat · auf einer Karte · ~10 tok/s |
| Qwen 3 32B 32B Parameter | 76 GB | 38 GB | 21 GB | [NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) $125/Monat · auf einer Karte · ~8 tok/s |
| Llama 3.3 70B 70B Parameter | 164 GB | 82 GB | 43 GB | [2 × NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) $285/Monat · auf den Knoten aufgeteilt · ~7 tok/s |
| Mixtral 8×22B (MoE) 39B aktiv von 141B | 326 GB | 163 GB | 83 GB | [4 × NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) $564/Monat · auf den Knoten aufgeteilt · ~4 tok/s |
| Qwen 3 235B-A22B (MoE) 22B aktiv von 235B | 542 GB | 271 GB | 137 GB | [8 × NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) $1,106/Monat · auf den Knoten aufgeteilt · ~10 tok/s |
| DeepSeek V3 671B-A37B (MoE) 37B aktiv von 671B | 1,544 GB | 772 GB | 386 GB | [8 × NVIDIA A100 PCIe](https://gpuserver.io/de/gpu/a100-80gb) $7,906/Monat · auf den Knoten aufgeteilt · ~37 tok/s |
| Llama 3.1 405B 405B Parameter | 936 GB | 468 GB | 237 GB | [10 × NVIDIA L4](https://gpuserver.io/de/gpu/nvidia-l4) $1,371/Monat · auf den Knoten aufgeteilt · ~3 tok/s |

Die letzte Spalte zeigt den günstigsten Knoten in unserem Katalog, der das Modell bei 4-Bit und 8k Kontext hält, mit der Single-Stream-Generierungsrate, die die Speicherbandbreite zulässt. Die Durchsatzwerte sind bewusst konservativ angesetzt und an veröffentlichten Messungen kalibriert – verstehen Sie sie als Untergrenze, nicht als Versprechen.

## Mehr als eine Anfrage bedienen

Genau hier wird aus einer für eine Demo dimensionierten Maschine eine, die kein Produkt bedienen kann. Gewichte werden einmal bezahlt; Cache wird pro gleichzeitiger Sequenz bezahlt.

**Gesamter VRAM für Llama 3.3 70B bei 4-Bit, nach gleichzeitigen Anfragen und Kontext**

| Gleichzeitige Anfragen | 4k Kontext | 8k Kontext | 32k Kontext |
|---|---|---|---|
| 1 Anfrage | 42 GB eine 80-GB-Karte | 43 GB eine 80-GB-Karte | 52 GB eine 80-GB-Karte |
| 4 Anfragen | 46 GB eine 80-GB-Karte | 52 GB eine 80-GB-Karte | 86 GB eine H200 |
| 16 Anfragen | 63 GB eine 80-GB-Karte | 86 GB eine H200 | 224 GB Multi-GPU-Knoten |
| 64 Anfragen | 132 GB eine H200 | 224 GB Multi-GPU-Knoten | 776 GB Multi-GPU-Knoten |

Llama 3.3 70B bei 4-Bit sind 35 GB Gewichte, egal was Sie tun. Alles über 35 GB in dieser Tabelle ist Cache. Deshalb sind „lief einwandfrei auf meinem Laptop“ und „ist in Produktion abgestürzt“ dasselbe Modell auf derselben Karte.

**Zwei Wege, um Cache-Speicher zurückzugewinnen.** Aktivieren Sie den FP8-KV-Cache, falls Ihr Stack ihn unterstützt – das halbiert die obigen Zahlen bei einem Qualitätsverlust, der meist unsichtbar ist. Und begrenzen Sie `--max-model-len` auf den Kontext, den Sie tatsächlich bedienen: vLLM reserviert Cache für das deklarierte Maximum, sodass die Deklaration von 128k bei tatsächlich 8k die sechzehnfache Menge des benötigten Speichers verschenkt.

## Welche Maschine das bedeutet

Drei praktische Regeln, die sich aus allem oben Genannten ergeben, in der Reihenfolge ihrer Wichtigkeit.

1. **Eine Karte schlägt mehrere, wann immer es möglich ist.** Kein Sharding, keine Synchronisierung zwischen Layern, kein Interconnect, um den man sich sorgen müsste. Passt Ihr Modell bei Ihrem Kontext auf eine einzige Karte, kaufen Sie diese Karte.
2. **Dimensionieren Sie für Ihren tatsächlichen Kontext und Ihre tatsächliche Nebenläufigkeit**, nicht für das beworbene Maximum des Modells. Das beworbene Maximum ist eine Fähigkeit, keine Anforderung.
3. **Müssen Sie sharden, bevorzugen Sie NVLink.** Die Aufteilung auf vier PCIe-Karten funktioniert; die Aufteilung auf vier NVLink-Karten funktioniert und ist spürbar schneller. Der [nächste Guide](https://gpuserver.io/de/guides/nvlink-vs-pcie) handelt genau davon, wann sich dieser Unterschied lohnt.

Der [Konfigurator](https://gpuserver.io/de/configure) führt diese Berechnung live für alle 41 Konfigurationen durch: Wählen Sie ein Modell, eine Präzision und eine Kontextlänge, und er zeigt Ihnen, welche Knoten es halten, welche es auf einer einzigen Karte halten, und was jeder pro Monat kostet. Er verwendet die Formel auf dieser Seite – widersprechen Sie unserer Rechnung, können Sie jetzt genau sagen, wo.

## Vergleichen Sie Ihr eigenes Modell mit jeder Maschine, die wir vermieten.

Der Konfigurator führt die obige Rechnung für alle 41 Konfigurationen durch, bevor Sie irgendetwas bezahlen.

[Konfigurator öffnen](https://gpuserver.io/de/configure) [Guides lesen](https://gpuserver.io/de/guides)

## Weitere Guides

- [Dimensionierung · 7 Min. NVLink oder PCIe: Was Ihr Workload braucht Wann die Verbindung zwischen Karten über Ihren Durchsatz entscheidet, wann sie nichts ändert, und wie Sie das vor dem falschen Knoten erkennen. Guide lesen](https://gpuserver.io/de/guides/nvlink-vs-pcie)
- [Dimensionierung · 9 Min. Die passende Karte für Bild- und Videomodelle wählen Was FLUX, SDXL, SD 3.5 und Wan 2.1 an VRAM brauchen, welche Katalogkarte jedes fasst, und warum die billigste passende selten die richtige zum Mieten ist. Guide lesen](https://gpuserver.io/de/guides/gpu-for-flux-sdxl)
- [Dimensionierung · 10 Min. Ein Quantisierungsformat wählen Was AWQ, GPTQ, GGUF und FP8 an Speicher, Geschwindigkeit und Qualität kosten — und warum das Format mit den kleinsten Gewichten selten das kleinste Modell ergibt. Guide lesen](https://gpuserver.io/de/guides/awq-vs-gptq-vs-fp8)

---

Quelle: https://gpuserver.io/de/guides/vram-sizing/. Diese Datei wird aus denselben Daten wie die Website erzeugt; weicht eine Zahl hier von einer Seite ab, ist die Seite maßgeblich und diese Datei veraltet — die kanonische Quelle ist https://gpuserver.io/.
