NVLink oder PCIe: Was Ihr Job braucht.
Die Verbindung zwischen den Karten ist für eine Art von Workload enorm wichtig und für drei andere völlig unwichtig. Zu wissen, welche davon Sie betreiben, ist mehrere hundert Dollar im Monat wert.
Die kurze Antwort
- Ein Modell pro Karte betreiben
- Die Verbindung ist irrelevant. Kaufen Sie PCIe und stecken Sie die Differenz in mehr Karten.
- Ein Modell über mehrere Karten aufteilen
- Tensor-Parallelismus synchronisiert bei jedem Layer. NVLink lohnt sich.
- Pipeline-Parallelismus
- Eine Übertragung pro Mikro-Batch, nicht pro Layer. PCIe reicht meist aus.
- Multi-Knoten-Training
- Das bieten wir nicht an — NVLink verbindet Karten innerhalb eines Knotens, nichts verbindet Knoten.
Die Kurzfassung
Passt ein Modell auf eine Karte, hören Sie auf zu lesen — nichts davon betrifft Sie, und die günstigste Karte, die Ihr Modell fasst, ist der richtige Kauf. Dieser Guide handelt davon, was passiert, wenn es nicht passt und Sie es aufteilen müssen.
Was jede Verbindung ist
| Verbindung | Wo Sie es bekommen | Pro Karte, je Richtung | Topologie |
|---|---|---|---|
| NVLink 4 über NVSwitch | SXM-Karten auf einem HGX-Board — 4- und 8-GPU-Knoten | 900 GB/s | All-to-all. Jede Karte spricht gleichzeitig mit jeder anderen bei voller Rate. |
| NVLink 5 über NVSwitch | B200-SXM6-Knoten | 1.800 GB/s | All-to-all, doppelt so schnell wie die vorherige Generation. |
| PCIe Gen5 ×16 | Alle PCIe-Karten | 64 GB/s | Über den CPU-Root-Complex. Karten auf unterschiedlichen Sockeln sind weiter voneinander entfernt als Karten auf demselben. |
| PCIe Gen4 ×16 | Manche 1- und 2-GPU-Gehäuse | 32 GB/s | Wie oben, mit halber Rate. |
Das Verhältnis in der Überschrift liegt bei etwa 14× zwischen NVLink 4 und PCIe Gen5. Diese Zahl stimmt, aber sie ist nicht die Zahl, auf die es ankommt — entscheidend ist, wie oft Ihr Job die Verbindung überquert.
Wann es Ihre Geschwindigkeit bestimmt
Ein Fall, und es ist der Fall, in dem sich die meisten wiederfinden, ohne ihn eingeplant zu haben.
Tensor-Parallelismus
Jeder Layer wird über die Karten hinweg zerschnitten, sodass jede Karte einen Ausschnitt jeder Gewichtsmatrix hält. Nach jedem Layer müssen die Teilergebnisse über alle Karten summiert werden — ein All-Reduce.
- Bei einem 70B-Modell sind das 80 Synchronisationen pro Token
- Jede von ihnen wartet auf die langsamste Karte
- Hier wird das 14× der Verbindung zu realen Sekunden
Large-Batch-Training
Gradient-All-Reduce am Ende jedes Schritts, bemessen an der Parameterzahl, nicht am Batch. Ein 70B-Modell in BF16 bewegt 140 GB pro Schritt über die Verbindung.
- Über PCIe Gen5 rund zwei Sekunden reine Übertragung
- Über NVLink eher ein Zehntel davon
- Multipliziert mit jedem Schritt eines mehrtägigen Laufs
Wann es nichts ändert
Drei häufige Workloads, bei denen sich NVLink messbar nicht auszahlt. Treffen Sie auf einen davon zu, geben Ihnen PCIe-Karten mehr VRAM pro Dollar.
Ein Modell pro Karte. Vier unabhängige Kopien eines 24B-Modells auf vier Karten berühren die Verbindung überhaupt nicht. Vierfacher Durchsatz, keine Synchronisation, kein Fehlermodus.
Pipeline-Parallelismus. Das Modell wird nach Layer-Gruppen aufgeteilt, sodass eine Karte einmal pro Mikro-Batch an die nächste übergibt statt einmal pro Layer. Übertragungen sind selten genug, dass PCIe mithält.
Diffusion und Rendering. Bild- und Videogenerierung, Blender, Octane: Jede Karte arbeitet an ihrem eigenen Frame oder Bild. Es gibt nichts, das per All-Reduce synchronisiert werden müsste.
--tensor-parallel-size 4 bedient wird, weil der Knoten vier Karten hat, ist langsamer als dasselbe Modell auf nur einer davon. Die Synchronisationskosten sind real, der Nutzen ist null. Sharding nur, wenn das Modell nicht passt.
Derselbe Job, auf beide Arten
Zwei Knoten, die wir vermieten, beide mit vier 80-GB-Karten — derselbe Gesamtspeicher, dieselbe Kartenklasse, unterschiedlich nur in der Verbindung zwischen ihnen. Die Preise sind unsere, pro Monat.
| 4 × NVIDIA A100 PCIe | 4 × NVIDIA A100 SXM4 | |
|---|---|---|
| Verbindung zwischen den Karten | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| VRAM gesamt | 320 GB | 320 GB |
| Speicherbandbreite pro Karte | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B in BF16, aufgeteilt | ~18 Token/s | ~19 Token/s |
| Preis | $4,157/Monat | $4,395/Monat |
Unser Durchsatzmodell ist durch die Speicherbandbreite begrenzt und bewusst konservativ — es bildet das All-Reduce nicht direkt ab, sodass der reale Abstand bei einem Tensor-Parallel-Job größer ist, als die Tabelle nahelegt, nicht kleiner. Betrachten Sie diese Werte als Untergrenze für beide Maschinen — entscheidend ist die Reihenfolge.
Es selbst messen
Machen Sie das am ersten Tag. Es dauert zwei Minuten und zeigt Ihnen, ob die Maschine, die Sie gekauft haben, die Topologie hat, für die Sie bezahlt haben.
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m
# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status
# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
nvcr.io/nvidia/pytorch:25.02-py3 \
all_reduce_perf -b 8 -e 4G -f 2 -g 4
Zeigt topo -m zwischen zwei Karten auf einem Knoten, den Sie für Tensor-Parallelismus gekauft haben, SYS an, sprechen diese beiden Karten über die CPU und über Sockel hinweg — der schlechteste Fall auf der Maschine. Auf unseren SXM-Knoten meldet jedes Paar NV18; alles andere ist ein Defekt, und genau davon wollen wir am ersten Tag erfahren.
Was Sie kaufen sollten
- Modell passt auf eine Karte? Kaufen Sie eine Karte. Nichts auf dieser Seite trifft dann zu, und der Interconnect-Aufpreis ist verbranntes Geld.
- Mehrere unabhängige Modelle oder viele unabhängige Jobs? Kaufen Sie PCIe-Karten, so viele Sie brauchen. Sie bekommen mehr VRAM pro Dollar und überqueren nie die Verbindung.
- Ein Modell, zu groß für eine einzelne Karte, bei geringer Nebenläufigkeit im Serving? PCIe funktioniert. Erwarten Sie, dass Sharding eher kostet als bringt, und dimensionieren Sie den Knoten für Speicher statt für Geschwindigkeit.
- Ein Modell, zu groß für eine einzelne Karte, im Serving für echten Traffic oder im Training? Genau dafür gibt es NVLink. Kaufen Sie SXM.
- Ein einzelner Job, der mehr als acht Karten braucht? Dafür braucht es ein Fabric zwischen Knoten, das wir nicht anbieten. Das sagen wir Ihnen lieber hier als nach der Rechnung — siehe was wir nicht anbieten.
Der Konfigurator sagt Ihnen, welcher Fall bei Ihnen zutrifft: Wählen Sie ein Modell, und er zeigt für jeden Knoten im Katalog, ob es auf eine einzelne Karte passt, aufgeteilt werden muss oder gar nicht passt. Beim Wort „aufteilen“ wird dieser Guide relevant.
Sehen Sie, welche Knoten Ihr Modell auf einer einzelnen Karte fassen.
Der Konfigurator beantwortet das für alle 41 Konfigurationen und zeigt Ihnen den Preis für jede.
Weitere Guides
- Dimensionierung · 9 Min.
Die passende Karte für Bild- und Videomodelle wählen
Was FLUX, SDXL, SD 3.5 und Wan 2.1 an VRAM brauchen, welche Katalogkarte jedes fasst, und warum die billigste passende selten die richtige zum Mieten ist.
Guide lesen - Dimensionierung · 10 Min.
Ein Quantisierungsformat wählen
Was AWQ, GPTQ, GGUF und FP8 an Speicher, Geschwindigkeit und Qualität kosten — und warum das Format mit den kleinsten Gewichten selten das kleinste Modell ergibt.
Guide lesen - Dimensionierung · 10 Min.
Ein Mixture-of-Experts-Modell betreiben
Gesamtparameter entscheiden über die Maschine, aktive Parameter über die Geschwindigkeit: der VRAM-Bedarf von DeepSeek V3 und Qwen 3 235B, und welcher Knoten passt.
Guide lesen