Guida Dimensionamento · 7 min di lettura

# NVLink o PCIe: di quale ha bisogno il suo lavoro.

Il link tra le schede conta enormemente per un tipo di carico di lavoro e per niente per altri tre. Sapere quale sta eseguendo vale diverse centinaia di dollari al mese.

La risposta breve

- **Eseguire un modello per scheda:** Il link è irrilevante. Compri PCIe e spenda la differenza in altre schede.
- **Suddividere un modello tra più schede:** Il parallelismo tensoriale sincronizza a **ogni livello**. Vale la pena pagare per NVLink.
- **Parallelismo a pipeline:** Un trasferimento per micro-batch, non per livello. Il PCIe di solito va bene.
- **Addestramento multi-nodo:** Non lo offriamo — NVLink collega le schede *all’interno* di un nodo, nulla collega i nodi tra loro.

## La versione breve

Se un modello ci sta su una scheda sola, smetta di leggere — niente di tutto questo la riguarda, e la scheda più economica che contiene il suo modello è l’acquisto giusto. Questa guida riguarda cosa succede quando non ci sta e deve essere suddiviso.

## Cos’è ciascun link

**Tipi di interconnessione, larghezza di banda e topologia**

| Link | Dove lo si ottiene | Per scheda, per direzione | Topologia |
|---|---|---|---|
| NVLink 4 via NVSwitch Generazione Hopper | Schede SXM su una scheda HGX — nodi a 4 e 8 GPUA100 SXM4, H100 SXM5, H200 | 900 GB/s | All-to-all. Ogni scheda comunica con tutte le altre a piena velocità, simultaneamente. |
| NVLink 5 via NVSwitch Generazione Blackwell | Nodi B200 SXM6a 4 e 8 GPU | 1.800 GB/s | All-to-all, il doppio della generazione precedente. |
| PCIe Gen5 ×16 Nodi PCIe attuali | Tutte le schede PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe | 64 GB/s | Attraverso il root complex della CPU. Le schede su socket diversi sono più distanti tra loro rispetto a quelle sullo stesso socket. |
| PCIe Gen4 ×16 Piattaforme precedenti | Alcuni chassis a 1 e 2 GPU | 32 GB/s | Come sopra, a metà velocità. |

Il rapporto principale è di circa **14×** tra NVLink 4 e PCIe Gen5. Quel numero è reale, ma non è quello che conta — quello che conta è quante volte il suo lavoro attraversa il link.

## Quando determina la sua velocità

Un caso, ed è quello in cui le persone si ritrovano più spesso senza averlo pianificato.

### Parallelismo tensoriale

Ogni livello viene suddiviso tra le schede, così ogni scheda contiene una porzione di ogni matrice dei pesi. Dopo ogni livello, i risultati parziali devono essere sommati tra tutte le schede — un all-reduce.

- Su un modello da 70B, sono 80 sincronizzazioni per token
- Ognuna di esse attende la scheda più lenta
- È qui che il 14× sul link diventa secondi reali

### Addestramento a batch grandi

All-reduce del gradiente alla fine di ogni step, dimensionato in base al numero di parametri, non al batch. Un modello da 70B in BF16 sposta 140 GB attraverso il link per ogni step.

- Su PCIe Gen5, circa due secondi di puro trasferimento
- Su NVLink, più vicino a un decimo di quel valore
- Moltiplicato per ogni step di un’esecuzione di più giorni

## Quando non cambia nulla

Tre carichi di lavoro comuni in cui pagare per NVLink non porta nulla di misurabile. Se il suo caso è uno di questi, le schede PCIe le danno più VRAM per dollaro.

**Un modello per scheda.** Quattro copie indipendenti di un modello da 24B su quattro schede non toccano mai il link. Quattro volte il throughput, nessuna sincronizzazione, nessuna modalità di guasto.

**Parallelismo a pipeline.** Il modello viene suddiviso per *gruppi* di livelli, così una scheda passa il testimone alla successiva una volta per micro-batch invece che una volta per livello. I trasferimenti sono abbastanza rari da permettere al PCIe di tenere il passo.

**Diffusione e rendering.** Generazione di immagini e video, Blender, Octane: ogni scheda lavora sul proprio fotogramma o sulla propria immagine. Non c’è nulla su cui eseguire un all-reduce.

**L’errore più costoso è comprare parallelismo tensoriale di cui non aveva bisogno.** Un modello che ci sta su una singola scheda da 80 GB, servito con `--tensor-parallel-size 4` solo perché il nodo ha quattro schede, è *più lento* dello stesso modello su una sola di esse. Il costo di sincronizzazione è reale e il beneficio è nullo. Effettui lo sharding solo quando il modello non ci sta.

## Lo stesso lavoro, in entrambi i modi

Due nodi che noleggiamo, entrambi con quattro schede da 80 GB — la stessa memoria totale, la stessa classe di scheda, che differiscono solo per il link tra di esse. I prezzi sono i nostri, al mese.

**Un nodo SXM a quattro schede a confronto con un nodo PCIe a quattro schede**

|  | [4 × NVIDIA A100 PCIe](https://gpuserver.io/it/gpu/a100-80gb) | [4 × NVIDIA A100 SXM4](https://gpuserver.io/it/gpu/a100-sxm4) |
|---|---|---|
| Link tra le schede | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| VRAM totale | 320 GB | 320 GB |
| Larghezza di banda della memoria per scheda | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B in BF16, suddiviso Generazione a flusso singolo, la nostra stima conservativa | ~18 tok/s | ~19 tok/s |
| Prezzo | $4,157/mese | $4,395/mese |

Il nostro modello di throughput è limitato dalla larghezza di banda della memoria ed è deliberatamente conservativo — non modella direttamente l’all-reduce, quindi il divario reale su un lavoro a parallelismo tensoriale è *più ampio* di quanto suggerisca la tabella, non più stretto. Consideri questi valori come un limite minimo per entrambe le macchine, e l’ordine come il punto che conta.

## Misurarlo da sé

Lo faccia il primo giorno. Richiede due minuti e le dice se la macchina che le è stata venduta ha la topologia per cui ha pagato.

Topologia, poi larghezza di banda effettiva

```
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4
```

Se `topo -m` mostra `SYS` tra due schede su un nodo acquistato per il parallelismo tensoriale, quelle due schede comunicano attraverso la CPU e tra socket diversi — il caso peggiore sulla macchina. Sui nostri nodi SXM ogni coppia riporta `NV18`; qualsiasi altro valore è un guasto, ed è uno di quelli su cui vogliamo essere avvisati fin dal primo giorno.

## Cosa comprare

1. **Il modello ci sta su una scheda sola?** Compri una scheda sola. Niente in questa pagina si applica, e il sovrapprezzo per l’interconnessione è denaro bruciato.
2. **Diversi modelli indipendenti o molti lavori indipendenti?** Compri schede PCIe, quante ne servono. Ottiene più VRAM per dollaro e non attraversa mai il link.
3. **Un modello troppo grande per una singola scheda, servito a bassa concorrenza?** Il PCIe va bene. Si aspetti che lo sharding le costi anziché avvantaggiarla, e dimensioni il nodo in base alla memoria piuttosto che alla velocità.
4. **Un modello troppo grande per una singola scheda, che serve traffico reale o è in fase di addestramento?** È il caso per cui esiste NVLink. Compri SXM.
5. **Un singolo lavoro che richiede più di otto schede?** Serve un fabric tra i nodi, che non vendiamo. Preferiamo dirglielo qui piuttosto che dopo la ricevuta — veda [cosa non offriamo](https://gpuserver.io/it/network#limits).

Il [configuratore](https://gpuserver.io/it/configure) le dice in quale di questi casi si trova: scelga un modello e riporta, per ogni nodo del catalogo, se ci sta su una singola scheda, deve essere suddiviso, o non ci sta affatto. La parola «suddiviso» è il momento in cui questa guida inizia a contare.

## Veda quali nodi contengono il suo modello su una singola scheda.

Il configuratore risponde per tutte le 41 configurazioni, e le mostra il prezzo di ciascuna.

[Apri il configuratore](https://gpuserver.io/it/configure) [Leggi le guide](https://gpuserver.io/it/guides)

## Altre guide

- [Dimensionamento · 9 min Scegliere una scheda per modelli di immagine e video Quanta VRAM richiedono FLUX, SDXL, SD 3.5 e Wan 2.1, quale scheda del catalogo li ospita, e perché la più economica che ci sta è raramente quella da noleggiare. Leggi la guida](https://gpuserver.io/it/guides/gpu-for-flux-sdxl)
- [Dimensionamento · 10 min Scegliere un formato di quantizzazione Quanto costano AWQ, GPTQ, GGUF e FP8 in memoria, velocità e qualità — e perché il formato con i pesi più piccoli raramente dà il modello più piccolo. Leggi la guida](https://gpuserver.io/it/guides/awq-vs-gptq-vs-fp8)
- [Dimensionamento · 10 min Eseguire un modello mixture-of-experts I parametri totali decidono la macchina, i parametri attivi decidono la velocità. Quanta VRAM serve a DeepSeek V3 e Qwen 3 235B, e quale nodo noleggiare per loro. Leggi la guida](https://gpuserver.io/it/guides/mixture-of-experts)

---

Fonte: https://gpuserver.io/it/guides/nvlink-vs-pcie/. Questo file è generato dagli stessi dati del sito web; se una cifra qui differisce da una pagina, la pagina è quella autorevole e questo file è obsoleto — la fonte canonica è https://gpuserver.io/.
