Wie viel VRAM ein Modell tatsächlich benötigt.
Zwei Zahlen entscheiden: die Gewichte, die fest sind, und der KV-Cache, der mit dem bedienten Kontext wächst. Fast jede falsche Antwort entsteht dadurch, dass die zweite aus der ersten geschätzt wird.
Die kurze Antwort
- Weights
- Parameter in Milliarden × Bytes pro Parameter. 70B bei 4-Bit sind 35 GB.
- KV-Cache
- 2 × Layer × KV-Heads × Head-Dim × Bytes, pro Token. Hat nichts mit der Parameterzahl zu tun.
- Overhead
- Rechnen Sie etwa 15 % für Aktivierungen, den CUDA-Kontext und Allocator-Fragmentierung hinzu.
- Die Falle
- Gewichte auf 4-Bit zu quantisieren, quantisiert den Cache nicht. Er bleibt in jedem gängigen Stack FP16.
Die Formel
Es gibt hier keine Faustregel, die den Kontakt mit einem zweiten Modell übersteht. Die gesamte Berechnung sind drei Zeilen, und es lohnt sich, sie durchzuführen, statt einem Multiplikator zu vertrauen.
# 1. Weights
weights_gb = parameters_in_billions × bytes_per_parameter
# 2. KV cache, per token — then multiplied by the context you serve
bytes_per_tok = 2 × layers × kv_heads × head_dim × cache_bytes
cache_gb = bytes_per_tok × context_tokens × batch / 1024³
# 3. Everything else
total_gb = (weights_gb + cache_gb) × 1.15
Die 2 steht dafür, dass es zwei Tensoren pro Token gibt, K und V. bytes_per_parameter ist 2 für BF16, 1 für FP8, 0.5 für 4-Bit. cache_bytes ist eine separate Zahl, und diese Trennung ist die häufigste Ursache für eine falsche Antwort – siehe unten.
Gewichte
Die einfache Hälfte. Sie verläuft exakt linear zur Parameterzahl, und die einzige Entscheidung ist die Präzision.
| Modell | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|
| Llama 3.1 8B | 16.0 GB | 8.0 GB | 4.0 GB |
| Qwen 3 32B | 64.0 GB | 32.0 GB | 16.0 GB |
| Llama 3.3 70B | 140.0 GB | 70.0 GB | 35.0 GB |
| Llama 3.1 405B | 810.0 GB | 405.0 GB | 202.5 GB |
4-Bit-Quantisierung kostet Qualität, und wie viel hängt weit stärker vom Modell ab als von der Methode. Es ist der richtige Kompromiss, wenn er den Unterschied zwischen einer Karte und vier ausmacht; es ist ein schlechter Kompromiss, wenn Sie ohnehin schon genug Spielraum haben.
Der KV-Cache
Die schwierige Hälfte, und diejenige, die entscheidet, ob eine Maschine bei 4k ausreicht und bei 128k hoffnungslos ist. Sie hängt von Layern und KV-Heads ab – nicht davon, wie groß das Modell ist.
| Modell | Pro Token | 4k Kontext | 8k Kontext | 32k Kontext | 128k Kontext |
|---|---|---|---|---|---|
| Llama 3.1 8B | 128 KB | 0.5 GB | 1.0 GB | 4.0 GB | 16.0 GB |
| Gemma 3 27B | 496 KB | 1.9 GB | 3.9 GB | 15.5 GB | 62.0 GB |
| Llama 3.3 70B | 320 KB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| DeepSeek V3 671B-A37B (MoE) | 70 KB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.1 405B | 504 KB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |
Lesen Sie die letzte Spalte vor der ersten. Bei 4k Kontext ist der Cache bei jedem Modell hier ein Rundungsfehler; bei 128k ist er größer als die Gewichte eines 70B-Modells in 4-Bit. DeepSeek V3 ist der Ausreißer, weil seine Latent Attention den Cache von Grund auf komprimiert – deshalb ist es trotz des größten Modells auf der Liste bei langem Kontext nutzbar.
Wo Schätzungen danebenliegen
Den Cache anhand der Parameterzahl hochzurechnen. Der häufigste Fehler, und genau der, der oben gezeigt wurde. Ein 27B-Modell kann mehr Cache benötigen als ein 70B-Modell.
Anzunehmen, 4-Bit-Gewichte bedeuten einen 4-Bit-Cache. Das stimmt nicht. AWQ und GPTQ quantisieren nur die Gewichte; der Cache bleibt FP16, sofern Sie nicht explizit FP8-KV aktivieren. Ein 70B-Modell bei 4-Bit und 128k Kontext hat 35 GB Gewichte und 40 GB Cache.
Für eine einzelne Anfrage zu dimensionieren. Der Cache gilt pro gleichzeitiger Sequenz. Acht Nutzer gleichzeitig zu bedienen benötigt die achtfache Cache-Menge – siehe unten.
Den Overhead zu vergessen. Aktivierungen, der CUDA-Kontext und Allocator-Fragmentierung sind real. 15 % sind eine bewusst vorsichtige Reserve; wer sie ganz ignoriert, erlebt, wie ein Modell, das „passt“, nicht lädt.
Den gesamten VRAM über mehrere Karten hinweg zu addieren. Vier 24-GB-Karten sind keine einzelne 96-GB-Karte. Tensor-Parallelismus kann ein Modell darauf aufteilen, aber dann synchronisiert sich jeder Layer über die Verbindung – siehe den NVLink-Guide.
Ein MoE anhand seiner aktiven Parameter zu dimensionieren. DeepSeek V3 aktiviert 37B pro Token, aber Sie müssen alle 671B im Speicher halten. Aktive Parameter sagen die Geschwindigkeit voraus; die Gesamtzahl der Parameter entscheidet, ob es überhaupt lädt.
Durchgerechnete Beispiele
Benötigter Gesamtspeicher, Gewichte plus Cache plus Overhead, bei 8k Kontext und einer Anfrage. Das ist dieselbe Berechnung, die der Konfigurator für jede Konfiguration im Katalog durchführt.
| Modell | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) | Kleinster passender Knoten |
|---|---|---|---|---|
| Llama 3.1 8B | 20 GB | 10 GB | 6 GB | NVIDIA L4 |
| Mistral Small 24B | 57 GB | 28 GB | 15 GB | NVIDIA L4 |
| Gemma 3 27B | 67 GB | 33 GB | 20 GB | NVIDIA L4 |
| Qwen 3 32B | 76 GB | 38 GB | 21 GB | NVIDIA L4 |
| Llama 3.3 70B | 164 GB | 82 GB | 43 GB | 2 × NVIDIA L4 |
| Mixtral 8×22B (MoE) | 326 GB | 163 GB | 83 GB | 4 × NVIDIA L4 |
| Qwen 3 235B-A22B (MoE) | 542 GB | 271 GB | 137 GB | 8 × NVIDIA L4 |
| DeepSeek V3 671B-A37B (MoE) | 1,544 GB | 772 GB | 386 GB | 8 × NVIDIA A100 PCIe |
| Llama 3.1 405B | 936 GB | 468 GB | 237 GB | 10 × NVIDIA L4 |
Die letzte Spalte zeigt den günstigsten Knoten in unserem Katalog, der das Modell bei 4-Bit und 8k Kontext hält, mit der Single-Stream-Generierungsrate, die die Speicherbandbreite zulässt. Die Durchsatzwerte sind bewusst konservativ angesetzt und an veröffentlichten Messungen kalibriert – verstehen Sie sie als Untergrenze, nicht als Versprechen.
Mehr als eine Anfrage bedienen
Genau hier wird aus einer für eine Demo dimensionierten Maschine eine, die kein Produkt bedienen kann. Gewichte werden einmal bezahlt; Cache wird pro gleichzeitiger Sequenz bezahlt.
| Gleichzeitige Anfragen | 4k Kontext | 8k Kontext | 32k Kontext |
|---|---|---|---|
| 1 Anfrage | 42 GB | 43 GB | 52 GB |
| 4 Anfragen | 46 GB | 52 GB | 86 GB |
| 16 Anfragen | 63 GB | 86 GB | 224 GB |
| 64 Anfragen | 132 GB | 224 GB | 776 GB |
Llama 3.3 70B bei 4-Bit sind 35 GB Gewichte, egal was Sie tun. Alles über 35 GB in dieser Tabelle ist Cache. Deshalb sind „lief einwandfrei auf meinem Laptop“ und „ist in Produktion abgestürzt“ dasselbe Modell auf derselben Karte.
--max-model-len auf den Kontext, den Sie tatsächlich bedienen: vLLM reserviert Cache für das deklarierte Maximum, sodass die Deklaration von 128k bei tatsächlich 8k die sechzehnfache Menge des benötigten Speichers verschenkt.
Welche Maschine das bedeutet
Drei praktische Regeln, die sich aus allem oben Genannten ergeben, in der Reihenfolge ihrer Wichtigkeit.
- Eine Karte schlägt mehrere, wann immer es möglich ist. Kein Sharding, keine Synchronisierung zwischen Layern, kein Interconnect, um den man sich sorgen müsste. Passt Ihr Modell bei Ihrem Kontext auf eine einzige Karte, kaufen Sie diese Karte.
- Dimensionieren Sie für Ihren tatsächlichen Kontext und Ihre tatsächliche Nebenläufigkeit, nicht für das beworbene Maximum des Modells. Das beworbene Maximum ist eine Fähigkeit, keine Anforderung.
- Müssen Sie sharden, bevorzugen Sie NVLink. Die Aufteilung auf vier PCIe-Karten funktioniert; die Aufteilung auf vier NVLink-Karten funktioniert und ist spürbar schneller. Der nächste Guide handelt genau davon, wann sich dieser Unterschied lohnt.
Der Konfigurator führt diese Berechnung live für alle 41 Konfigurationen durch: Wählen Sie ein Modell, eine Präzision und eine Kontextlänge, und er zeigt Ihnen, welche Knoten es halten, welche es auf einer einzigen Karte halten, und was jeder pro Monat kostet. Er verwendet die Formel auf dieser Seite – widersprechen Sie unserer Rechnung, können Sie jetzt genau sagen, wo.
Vergleichen Sie Ihr eigenes Modell mit jeder Maschine, die wir vermieten.
Der Konfigurator führt die obige Rechnung für alle 41 Konfigurationen durch, bevor Sie irgendetwas bezahlen.
Weitere Guides
- Dimensionierung · 7 Min.
NVLink oder PCIe: Was Ihr Workload braucht
Wann die Verbindung zwischen Karten über Ihren Durchsatz entscheidet, wann sie nichts ändert, und wie Sie das vor dem falschen Knoten erkennen.
Guide lesen - Dimensionierung · 9 Min.
Die passende Karte für Bild- und Videomodelle wählen
Was FLUX, SDXL, SD 3.5 und Wan 2.1 an VRAM brauchen, welche Katalogkarte jedes fasst, und warum die billigste passende selten die richtige zum Mieten ist.
Guide lesen - Dimensionierung · 10 Min.
Ein Quantisierungsformat wählen
Was AWQ, GPTQ, GGUF und FP8 an Speicher, Geschwindigkeit und Qualität kosten — und warum das Format mit den kleinsten Gewichten selten das kleinste Modell ergibt.
Guide lesen