Alle 6 Rechenzentren betriebsbereit

Bezahlung in Krypto · Keine Identitätsprüfung · Root-Zugriff in unter 5 Minuten

Dimensionierung-Guide · 7 Min. Lesezeit

NVLink oder PCIe: Was Ihr Job braucht.

Die Verbindung zwischen den Karten ist für eine Art von Workload enorm wichtig und für drei andere völlig unwichtig. Zu wissen, welche davon Sie betreiben, ist mehrere hundert Dollar im Monat wert.

Die kurze Antwort

Ein Modell pro Karte betreiben
Die Verbindung ist irrelevant. Kaufen Sie PCIe und stecken Sie die Differenz in mehr Karten.
Ein Modell über mehrere Karten aufteilen
Tensor-Parallelismus synchronisiert bei jedem Layer. NVLink lohnt sich.
Pipeline-Parallelismus
Eine Übertragung pro Mikro-Batch, nicht pro Layer. PCIe reicht meist aus.
Multi-Knoten-Training
Das bieten wir nicht an — NVLink verbindet Karten innerhalb eines Knotens, nichts verbindet Knoten.

Die Kurzfassung

Passt ein Modell auf eine Karte, hören Sie auf zu lesen — nichts davon betrifft Sie, und die günstigste Karte, die Ihr Modell fasst, ist der richtige Kauf. Dieser Guide handelt davon, was passiert, wenn es nicht passt und Sie es aufteilen müssen.

Was jede Verbindung ist

Interconnect-Typen, Bandbreite und Topologie
VerbindungWo Sie es bekommenPro Karte, je RichtungTopologie
NVLink 4 über NVSwitchHopper-Generation SXM-Karten auf einem HGX-Board — 4- und 8-GPU-KnotenA100 SXM4, H100 SXM5, H200 900 GB/s All-to-all. Jede Karte spricht gleichzeitig mit jeder anderen bei voller Rate.
NVLink 5 über NVSwitchBlackwell-Generation B200-SXM6-Knoten4- und 8-GPU 1.800 GB/s All-to-all, doppelt so schnell wie die vorherige Generation.
PCIe Gen5 ×16Aktuelle PCIe-Knoten Alle PCIe-KartenL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe 64 GB/s Über den CPU-Root-Complex. Karten auf unterschiedlichen Sockeln sind weiter voneinander entfernt als Karten auf demselben.
PCIe Gen4 ×16Ältere Plattformen Manche 1- und 2-GPU-Gehäuse 32 GB/s Wie oben, mit halber Rate.

Das Verhältnis in der Überschrift liegt bei etwa 14× zwischen NVLink 4 und PCIe Gen5. Diese Zahl stimmt, aber sie ist nicht die Zahl, auf die es ankommt — entscheidend ist, wie oft Ihr Job die Verbindung überquert.

Wann es Ihre Geschwindigkeit bestimmt

Ein Fall, und es ist der Fall, in dem sich die meisten wiederfinden, ohne ihn eingeplant zu haben.

Tensor-Parallelismus

Jeder Layer wird über die Karten hinweg zerschnitten, sodass jede Karte einen Ausschnitt jeder Gewichtsmatrix hält. Nach jedem Layer müssen die Teilergebnisse über alle Karten summiert werden — ein All-Reduce.

  • Bei einem 70B-Modell sind das 80 Synchronisationen pro Token
  • Jede von ihnen wartet auf die langsamste Karte
  • Hier wird das 14× der Verbindung zu realen Sekunden

Large-Batch-Training

Gradient-All-Reduce am Ende jedes Schritts, bemessen an der Parameterzahl, nicht am Batch. Ein 70B-Modell in BF16 bewegt 140 GB pro Schritt über die Verbindung.

  • Über PCIe Gen5 rund zwei Sekunden reine Übertragung
  • Über NVLink eher ein Zehntel davon
  • Multipliziert mit jedem Schritt eines mehrtägigen Laufs

Wann es nichts ändert

Drei häufige Workloads, bei denen sich NVLink messbar nicht auszahlt. Treffen Sie auf einen davon zu, geben Ihnen PCIe-Karten mehr VRAM pro Dollar.

Ein Modell pro Karte. Vier unabhängige Kopien eines 24B-Modells auf vier Karten berühren die Verbindung überhaupt nicht. Vierfacher Durchsatz, keine Synchronisation, kein Fehlermodus.

Pipeline-Parallelismus. Das Modell wird nach Layer-Gruppen aufgeteilt, sodass eine Karte einmal pro Mikro-Batch an die nächste übergibt statt einmal pro Layer. Übertragungen sind selten genug, dass PCIe mithält.

Diffusion und Rendering. Bild- und Videogenerierung, Blender, Octane: Jede Karte arbeitet an ihrem eigenen Frame oder Bild. Es gibt nichts, das per All-Reduce synchronisiert werden müsste.

Der teuerste Fehler ist, Tensor-Parallelismus zu kaufen, den Sie nicht brauchten. Ein Modell, das auf eine einzelne 80-GB-Karte passt, aber mit --tensor-parallel-size 4 bedient wird, weil der Knoten vier Karten hat, ist langsamer als dasselbe Modell auf nur einer davon. Die Synchronisationskosten sind real, der Nutzen ist null. Sharding nur, wenn das Modell nicht passt.

Derselbe Job, auf beide Arten

Zwei Knoten, die wir vermieten, beide mit vier 80-GB-Karten — derselbe Gesamtspeicher, dieselbe Kartenklasse, unterschiedlich nur in der Verbindung zwischen ihnen. Die Preise sind unsere, pro Monat.

Ein SXM-Knoten mit vier Karten im Vergleich zu einem PCIe-Knoten mit vier Karten
4 × NVIDIA A100 PCIe4 × NVIDIA A100 SXM4
Verbindung zwischen den KartenPCIe 5.0 ×16NVLink 3 · 600 GB/s
VRAM gesamt320 GB320 GB
Speicherbandbreite pro Karte1,935 GB/s2,039 GB/s
Llama 3.3 70B in BF16, aufgeteiltGenerierung mit einzelnem Stream, unsere konservative Schätzung ~18 Token/s~19 Token/s
Preis $4,157/Monat $4,395/Monat

Unser Durchsatzmodell ist durch die Speicherbandbreite begrenzt und bewusst konservativ — es bildet das All-Reduce nicht direkt ab, sodass der reale Abstand bei einem Tensor-Parallel-Job größer ist, als die Tabelle nahelegt, nicht kleiner. Betrachten Sie diese Werte als Untergrenze für beide Maschinen — entscheidend ist die Reihenfolge.

Es selbst messen

Machen Sie das am ersten Tag. Es dauert zwei Minuten und zeigt Ihnen, ob die Maschine, die Sie gekauft haben, die Topologie hat, für die Sie bezahlt haben.

Topologie, dann tatsächliche Bandbreite
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4

Zeigt topo -m zwischen zwei Karten auf einem Knoten, den Sie für Tensor-Parallelismus gekauft haben, SYS an, sprechen diese beiden Karten über die CPU und über Sockel hinweg — der schlechteste Fall auf der Maschine. Auf unseren SXM-Knoten meldet jedes Paar NV18; alles andere ist ein Defekt, und genau davon wollen wir am ersten Tag erfahren.

Was Sie kaufen sollten

  1. Modell passt auf eine Karte? Kaufen Sie eine Karte. Nichts auf dieser Seite trifft dann zu, und der Interconnect-Aufpreis ist verbranntes Geld.
  2. Mehrere unabhängige Modelle oder viele unabhängige Jobs? Kaufen Sie PCIe-Karten, so viele Sie brauchen. Sie bekommen mehr VRAM pro Dollar und überqueren nie die Verbindung.
  3. Ein Modell, zu groß für eine einzelne Karte, bei geringer Nebenläufigkeit im Serving? PCIe funktioniert. Erwarten Sie, dass Sharding eher kostet als bringt, und dimensionieren Sie den Knoten für Speicher statt für Geschwindigkeit.
  4. Ein Modell, zu groß für eine einzelne Karte, im Serving für echten Traffic oder im Training? Genau dafür gibt es NVLink. Kaufen Sie SXM.
  5. Ein einzelner Job, der mehr als acht Karten braucht? Dafür braucht es ein Fabric zwischen Knoten, das wir nicht anbieten. Das sagen wir Ihnen lieber hier als nach der Rechnung — siehe was wir nicht anbieten.

Der Konfigurator sagt Ihnen, welcher Fall bei Ihnen zutrifft: Wählen Sie ein Modell, und er zeigt für jeden Knoten im Katalog, ob es auf eine einzelne Karte passt, aufgeteilt werden muss oder gar nicht passt. Beim Wort „aufteilen“ wird dieser Guide relevant.

Sehen Sie, welche Knoten Ihr Modell auf einer einzelnen Karte fassen.

Der Konfigurator beantwortet das für alle 41 Konfigurationen und zeigt Ihnen den Preis für jede.

Anmelden

Konsole, Rechnungen und Out-of-Band-Zugriff.

Noch kein Konto?

Es gibt keine separate Registrierung. Ihr Konto wird bei Ihrer ersten Bestellung angelegt — Sie wählen E-Mail und Passwort im Zahlungsschritt, und die Konsole ist offen, sobald die Maschine es ist.

Server konfigurieren

Language