Tutti i 6 data center operativi

Pagamento in cripto · Nessuna verifica d’identità · Accesso root in in meno di 5 minuti

Guida Dimensionamento · 7 min di lettura

NVLink o PCIe: di quale ha bisogno il suo lavoro.

Il link tra le schede conta enormemente per un tipo di carico di lavoro e per niente per altri tre. Sapere quale sta eseguendo vale diverse centinaia di dollari al mese.

La risposta breve

Eseguire un modello per scheda
Il link è irrilevante. Compri PCIe e spenda la differenza in altre schede.
Suddividere un modello tra più schede
Il parallelismo tensoriale sincronizza a ogni livello. Vale la pena pagare per NVLink.
Parallelismo a pipeline
Un trasferimento per micro-batch, non per livello. Il PCIe di solito va bene.
Addestramento multi-nodo
Non lo offriamo — NVLink collega le schede all’interno di un nodo, nulla collega i nodi tra loro.

La versione breve

Se un modello ci sta su una scheda sola, smetta di leggere — niente di tutto questo la riguarda, e la scheda più economica che contiene il suo modello è l’acquisto giusto. Questa guida riguarda cosa succede quando non ci sta e deve essere suddiviso.

Cos’è ciascun link

Tipi di interconnessione, larghezza di banda e topologia
LinkDove lo si ottienePer scheda, per direzioneTopologia
NVLink 4 via NVSwitchGenerazione Hopper Schede SXM su una scheda HGX — nodi a 4 e 8 GPUA100 SXM4, H100 SXM5, H200 900 GB/s All-to-all. Ogni scheda comunica con tutte le altre a piena velocità, simultaneamente.
NVLink 5 via NVSwitchGenerazione Blackwell Nodi B200 SXM6a 4 e 8 GPU 1.800 GB/s All-to-all, il doppio della generazione precedente.
PCIe Gen5 ×16Nodi PCIe attuali Tutte le schede PCIeL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe 64 GB/s Attraverso il root complex della CPU. Le schede su socket diversi sono più distanti tra loro rispetto a quelle sullo stesso socket.
PCIe Gen4 ×16Piattaforme precedenti Alcuni chassis a 1 e 2 GPU 32 GB/s Come sopra, a metà velocità.

Il rapporto principale è di circa 14× tra NVLink 4 e PCIe Gen5. Quel numero è reale, ma non è quello che conta — quello che conta è quante volte il suo lavoro attraversa il link.

Quando determina la sua velocità

Un caso, ed è quello in cui le persone si ritrovano più spesso senza averlo pianificato.

Parallelismo tensoriale

Ogni livello viene suddiviso tra le schede, così ogni scheda contiene una porzione di ogni matrice dei pesi. Dopo ogni livello, i risultati parziali devono essere sommati tra tutte le schede — un all-reduce.

  • Su un modello da 70B, sono 80 sincronizzazioni per token
  • Ognuna di esse attende la scheda più lenta
  • È qui che il 14× sul link diventa secondi reali

Addestramento a batch grandi

All-reduce del gradiente alla fine di ogni step, dimensionato in base al numero di parametri, non al batch. Un modello da 70B in BF16 sposta 140 GB attraverso il link per ogni step.

  • Su PCIe Gen5, circa due secondi di puro trasferimento
  • Su NVLink, più vicino a un decimo di quel valore
  • Moltiplicato per ogni step di un’esecuzione di più giorni

Quando non cambia nulla

Tre carichi di lavoro comuni in cui pagare per NVLink non porta nulla di misurabile. Se il suo caso è uno di questi, le schede PCIe le danno più VRAM per dollaro.

Un modello per scheda. Quattro copie indipendenti di un modello da 24B su quattro schede non toccano mai il link. Quattro volte il throughput, nessuna sincronizzazione, nessuna modalità di guasto.

Parallelismo a pipeline. Il modello viene suddiviso per gruppi di livelli, così una scheda passa il testimone alla successiva una volta per micro-batch invece che una volta per livello. I trasferimenti sono abbastanza rari da permettere al PCIe di tenere il passo.

Diffusione e rendering. Generazione di immagini e video, Blender, Octane: ogni scheda lavora sul proprio fotogramma o sulla propria immagine. Non c’è nulla su cui eseguire un all-reduce.

L’errore più costoso è comprare parallelismo tensoriale di cui non aveva bisogno. Un modello che ci sta su una singola scheda da 80 GB, servito con --tensor-parallel-size 4 solo perché il nodo ha quattro schede, è più lento dello stesso modello su una sola di esse. Il costo di sincronizzazione è reale e il beneficio è nullo. Effettui lo sharding solo quando il modello non ci sta.

Lo stesso lavoro, in entrambi i modi

Due nodi che noleggiamo, entrambi con quattro schede da 80 GB — la stessa memoria totale, la stessa classe di scheda, che differiscono solo per il link tra di esse. I prezzi sono i nostri, al mese.

Un nodo SXM a quattro schede a confronto con un nodo PCIe a quattro schede
4 × NVIDIA A100 PCIe4 × NVIDIA A100 SXM4
Link tra le schedePCIe 5.0 ×16NVLink 3 · 600 GB/s
VRAM totale320 GB320 GB
Larghezza di banda della memoria per scheda1,935 GB/s2,039 GB/s
Llama 3.3 70B in BF16, suddivisoGenerazione a flusso singolo, la nostra stima conservativa ~18 tok/s~19 tok/s
Prezzo $4,157/mese $4,395/mese

Il nostro modello di throughput è limitato dalla larghezza di banda della memoria ed è deliberatamente conservativo — non modella direttamente l’all-reduce, quindi il divario reale su un lavoro a parallelismo tensoriale è più ampio di quanto suggerisca la tabella, non più stretto. Consideri questi valori come un limite minimo per entrambe le macchine, e l’ordine come il punto che conta.

Misurarlo da sé

Lo faccia il primo giorno. Richiede due minuti e le dice se la macchina che le è stata venduta ha la topologia per cui ha pagato.

Topologia, poi larghezza di banda effettiva
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4

Se topo -m mostra SYS tra due schede su un nodo acquistato per il parallelismo tensoriale, quelle due schede comunicano attraverso la CPU e tra socket diversi — il caso peggiore sulla macchina. Sui nostri nodi SXM ogni coppia riporta NV18; qualsiasi altro valore è un guasto, ed è uno di quelli su cui vogliamo essere avvisati fin dal primo giorno.

Cosa comprare

  1. Il modello ci sta su una scheda sola? Compri una scheda sola. Niente in questa pagina si applica, e il sovrapprezzo per l’interconnessione è denaro bruciato.
  2. Diversi modelli indipendenti o molti lavori indipendenti? Compri schede PCIe, quante ne servono. Ottiene più VRAM per dollaro e non attraversa mai il link.
  3. Un modello troppo grande per una singola scheda, servito a bassa concorrenza? Il PCIe va bene. Si aspetti che lo sharding le costi anziché avvantaggiarla, e dimensioni il nodo in base alla memoria piuttosto che alla velocità.
  4. Un modello troppo grande per una singola scheda, che serve traffico reale o è in fase di addestramento? È il caso per cui esiste NVLink. Compri SXM.
  5. Un singolo lavoro che richiede più di otto schede? Serve un fabric tra i nodi, che non vendiamo. Preferiamo dirglielo qui piuttosto che dopo la ricevuta — veda cosa non offriamo.

Il configuratore le dice in quale di questi casi si trova: scelga un modello e riporta, per ogni nodo del catalogo, se ci sta su una singola scheda, deve essere suddiviso, o non ci sta affatto. La parola «suddiviso» è il momento in cui questa guida inizia a contare.

Veda quali nodi contengono il suo modello su una singola scheda.

Il configuratore risponde per tutte le 41 configurazioni, e le mostra il prezzo di ciascuna.

Accedi

Console, ricevute e accesso fuori banda.

Non ha ancora un account?

Non esiste una registrazione separata. Il suo account viene creato mentre effettua il suo primo ordine — sceglie l’email e la password nella fase di pagamento, e la console è già aperta quando lo è la macchina.

Configura un server

Language