Dimensionierung-Guide · 7 Min. Lesezeit

# NVLink oder PCIe: Was Ihr Job braucht.

Die Verbindung zwischen den Karten ist für eine Art von Workload enorm wichtig und für drei andere völlig unwichtig. Zu wissen, welche davon Sie betreiben, ist mehrere hundert Dollar im Monat wert.

Die kurze Antwort

- **Ein Modell pro Karte betreiben:** Die Verbindung ist irrelevant. Kaufen Sie PCIe und stecken Sie die Differenz in mehr Karten.
- **Ein Modell über mehrere Karten aufteilen:** Tensor-Parallelismus synchronisiert bei **jedem Layer**. NVLink lohnt sich.
- **Pipeline-Parallelismus:** Eine Übertragung pro Mikro-Batch, nicht pro Layer. PCIe reicht meist aus.
- **Multi-Knoten-Training:** Das bieten wir nicht an — NVLink verbindet Karten *innerhalb* eines Knotens, nichts verbindet Knoten.

## Die Kurzfassung

Passt ein Modell auf eine Karte, hören Sie auf zu lesen — nichts davon betrifft Sie, und die günstigste Karte, die Ihr Modell fasst, ist der richtige Kauf. Dieser Guide handelt davon, was passiert, wenn es nicht passt und Sie es aufteilen müssen.

## Was jede Verbindung ist

**Interconnect-Typen, Bandbreite und Topologie**

| Verbindung | Wo Sie es bekommen | Pro Karte, je Richtung | Topologie |
|---|---|---|---|
| NVLink 4 über NVSwitch Hopper-Generation | SXM-Karten auf einem HGX-Board — 4- und 8-GPU-KnotenA100 SXM4, H100 SXM5, H200 | 900 GB/s | All-to-all. Jede Karte spricht gleichzeitig mit jeder anderen bei voller Rate. |
| NVLink 5 über NVSwitch Blackwell-Generation | B200-SXM6-Knoten4- und 8-GPU | 1.800 GB/s | All-to-all, doppelt so schnell wie die vorherige Generation. |
| PCIe Gen5 ×16 Aktuelle PCIe-Knoten | Alle PCIe-KartenL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe | 64 GB/s | Über den CPU-Root-Complex. Karten auf unterschiedlichen Sockeln sind weiter voneinander entfernt als Karten auf demselben. |
| PCIe Gen4 ×16 Ältere Plattformen | Manche 1- und 2-GPU-Gehäuse | 32 GB/s | Wie oben, mit halber Rate. |

Das Verhältnis in der Überschrift liegt bei etwa **14×** zwischen NVLink 4 und PCIe Gen5. Diese Zahl stimmt, aber sie ist nicht die Zahl, auf die es ankommt — entscheidend ist, wie oft Ihr Job die Verbindung überquert.

## Wann es Ihre Geschwindigkeit bestimmt

Ein Fall, und es ist der Fall, in dem sich die meisten wiederfinden, ohne ihn eingeplant zu haben.

### Tensor-Parallelismus

Jeder Layer wird über die Karten hinweg zerschnitten, sodass jede Karte einen Ausschnitt jeder Gewichtsmatrix hält. Nach jedem Layer müssen die Teilergebnisse über alle Karten summiert werden — ein All-Reduce.

- Bei einem 70B-Modell sind das 80 Synchronisationen pro Token
- Jede von ihnen wartet auf die langsamste Karte
- Hier wird das 14× der Verbindung zu realen Sekunden

### Large-Batch-Training

Gradient-All-Reduce am Ende jedes Schritts, bemessen an der Parameterzahl, nicht am Batch. Ein 70B-Modell in BF16 bewegt 140 GB pro Schritt über die Verbindung.

- Über PCIe Gen5 rund zwei Sekunden reine Übertragung
- Über NVLink eher ein Zehntel davon
- Multipliziert mit jedem Schritt eines mehrtägigen Laufs

## Wann es nichts ändert

Drei häufige Workloads, bei denen sich NVLink messbar nicht auszahlt. Treffen Sie auf einen davon zu, geben Ihnen PCIe-Karten mehr VRAM pro Dollar.

**Ein Modell pro Karte.** Vier unabhängige Kopien eines 24B-Modells auf vier Karten berühren die Verbindung überhaupt nicht. Vierfacher Durchsatz, keine Synchronisation, kein Fehlermodus.

**Pipeline-Parallelismus.** Das Modell wird nach Layer-*Gruppen* aufgeteilt, sodass eine Karte einmal pro Mikro-Batch an die nächste übergibt statt einmal pro Layer. Übertragungen sind selten genug, dass PCIe mithält.

**Diffusion und Rendering.** Bild- und Videogenerierung, Blender, Octane: Jede Karte arbeitet an ihrem eigenen Frame oder Bild. Es gibt nichts, das per All-Reduce synchronisiert werden müsste.

**Der teuerste Fehler ist, Tensor-Parallelismus zu kaufen, den Sie nicht brauchten.** Ein Modell, das auf eine einzelne 80-GB-Karte passt, aber mit `--tensor-parallel-size 4` bedient wird, weil der Knoten vier Karten hat, ist *langsamer* als dasselbe Modell auf nur einer davon. Die Synchronisationskosten sind real, der Nutzen ist null. Sharding nur, wenn das Modell nicht passt.

## Derselbe Job, auf beide Arten

Zwei Knoten, die wir vermieten, beide mit vier 80-GB-Karten — derselbe Gesamtspeicher, dieselbe Kartenklasse, unterschiedlich nur in der Verbindung zwischen ihnen. Die Preise sind unsere, pro Monat.

**Ein SXM-Knoten mit vier Karten im Vergleich zu einem PCIe-Knoten mit vier Karten**

|  | [4 × NVIDIA A100 PCIe](https://gpuserver.io/de/gpu/a100-80gb) | [4 × NVIDIA A100 SXM4](https://gpuserver.io/de/gpu/a100-sxm4) |
|---|---|---|
| Verbindung zwischen den Karten | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| VRAM gesamt | 320 GB | 320 GB |
| Speicherbandbreite pro Karte | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B in BF16, aufgeteilt Generierung mit einzelnem Stream, unsere konservative Schätzung | ~18 Token/s | ~19 Token/s |
| Preis | $4,157/Monat | $4,395/Monat |

Unser Durchsatzmodell ist durch die Speicherbandbreite begrenzt und bewusst konservativ — es bildet das All-Reduce nicht direkt ab, sodass der reale Abstand bei einem Tensor-Parallel-Job *größer* ist, als die Tabelle nahelegt, nicht kleiner. Betrachten Sie diese Werte als Untergrenze für beide Maschinen — entscheidend ist die Reihenfolge.

## Es selbst messen

Machen Sie das am ersten Tag. Es dauert zwei Minuten und zeigt Ihnen, ob die Maschine, die Sie gekauft haben, die Topologie hat, für die Sie bezahlt haben.

Topologie, dann tatsächliche Bandbreite

```
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4
```

Zeigt `topo -m` zwischen zwei Karten auf einem Knoten, den Sie für Tensor-Parallelismus gekauft haben, `SYS` an, sprechen diese beiden Karten über die CPU und über Sockel hinweg — der schlechteste Fall auf der Maschine. Auf unseren SXM-Knoten meldet jedes Paar `NV18`; alles andere ist ein Defekt, und genau davon wollen wir am ersten Tag erfahren.

## Was Sie kaufen sollten

1. **Modell passt auf eine Karte?** Kaufen Sie eine Karte. Nichts auf dieser Seite trifft dann zu, und der Interconnect-Aufpreis ist verbranntes Geld.
2. **Mehrere unabhängige Modelle oder viele unabhängige Jobs?** Kaufen Sie PCIe-Karten, so viele Sie brauchen. Sie bekommen mehr VRAM pro Dollar und überqueren nie die Verbindung.
3. **Ein Modell, zu groß für eine einzelne Karte, bei geringer Nebenläufigkeit im Serving?** PCIe funktioniert. Erwarten Sie, dass Sharding eher kostet als bringt, und dimensionieren Sie den Knoten für Speicher statt für Geschwindigkeit.
4. **Ein Modell, zu groß für eine einzelne Karte, im Serving für echten Traffic oder im Training?** Genau dafür gibt es NVLink. Kaufen Sie SXM.
5. **Ein einzelner Job, der mehr als acht Karten braucht?** Dafür braucht es ein Fabric zwischen Knoten, das wir nicht anbieten. Das sagen wir Ihnen lieber hier als nach der Rechnung — siehe [was wir nicht anbieten](https://gpuserver.io/de/network#limits).

Der [Konfigurator](https://gpuserver.io/de/configure) sagt Ihnen, welcher Fall bei Ihnen zutrifft: Wählen Sie ein Modell, und er zeigt für jeden Knoten im Katalog, ob es auf eine einzelne Karte passt, aufgeteilt werden muss oder gar nicht passt. Beim Wort „aufteilen“ wird dieser Guide relevant.

## Sehen Sie, welche Knoten Ihr Modell auf einer einzelnen Karte fassen.

Der Konfigurator beantwortet das für alle 41 Konfigurationen und zeigt Ihnen den Preis für jede.

[Konfigurator öffnen](https://gpuserver.io/de/configure) [Guides lesen](https://gpuserver.io/de/guides)

## Weitere Guides

- [Dimensionierung · 9 Min. Die passende Karte für Bild- und Videomodelle wählen Was FLUX, SDXL, SD 3.5 und Wan 2.1 an VRAM brauchen, welche Katalogkarte jedes fasst, und warum die billigste passende selten die richtige zum Mieten ist. Guide lesen](https://gpuserver.io/de/guides/gpu-for-flux-sdxl)
- [Dimensionierung · 10 Min. Ein Quantisierungsformat wählen Was AWQ, GPTQ, GGUF und FP8 an Speicher, Geschwindigkeit und Qualität kosten — und warum das Format mit den kleinsten Gewichten selten das kleinste Modell ergibt. Guide lesen](https://gpuserver.io/de/guides/awq-vs-gptq-vs-fp8)
- [Dimensionierung · 10 Min. Ein Mixture-of-Experts-Modell betreiben Gesamtparameter entscheiden über die Maschine, aktive Parameter über die Geschwindigkeit: der VRAM-Bedarf von DeepSeek V3 und Qwen 3 235B, und welcher Knoten passt. Guide lesen](https://gpuserver.io/de/guides/mixture-of-experts)

---

Quelle: https://gpuserver.io/de/guides/nvlink-vs-pcie/. Diese Datei wird aus denselben Daten wie die Website erzeugt; weicht eine Zahl hier von einer Seite ab, ist die Seite maßgeblich und diese Datei veraltet — die kanonische Quelle ist https://gpuserver.io/.
