NVLink mi PCIe mi: işiniz hangisine ihtiyaç duyuyor.
Kartlar arasındaki bağlantı, bir tür iş yükü için son derece önemlidir, diğer üç tür için ise hiç önemli değildir. Hangisini çalıştırdığınızı bilmek, ayda birkaç yüz dolar değerindedir.
Kısa cevap
- Kart başına bir model çalıştırma
- Bağlantı önemsizdir. PCIe alın ve farkı daha fazla kart için harcayın.
- Tek bir modeli kartlar arasında bölme
- Tensor paralelliği her katmanda senkronize olur. NVLink'in parasını vermeye değer.
- Pipeline paralelliği
- Katman başına değil, mikro-batch başına bir aktarım. PCIe genellikle yeterlidir.
- Çok düğümlü eğitim
- Bunu sunmuyoruz — NVLink, bir düğümün içindeki kartları birleştirir, düğümleri birleştiren hiçbir şey yoktur.
Kısa özet
Bir model tek bir karta sığıyorsa okumayı bırakın — bunların hiçbiri sizin için geçerli değil, modelinizi barındıran en ucuz kart doğru satın alımdır. Bu rehber, model sığmadığında ve onu bölmeniz gerektiğinde ne olduğuyla ilgilidir.
Her bağlantının ne olduğu
| Bağlantı | Nereden elde edersiniz | Kart başına, her yönde | Topoloji |
|---|---|---|---|
| NVSwitch üzerinden NVLink 4 | Bir HGX kartı üzerinde SXM kartları — 4 ve 8 GPU'lu düğümler | 900 GB/s | All-to-all. Her kart, diğer her kartla aynı anda tam hızda konuşur. |
| NVSwitch üzerinden NVLink 5 | B200 SXM6 düğümleri | 1.800 GB/s | All-to-all, önceki neslin iki katı. |
| PCIe Gen5 ×16 | Tüm PCIe kartlar | 64 GB/s | CPU kök kompleksi üzerinden. Farklı soketlerdeki kartlar, aynı soketteki kartlardan daha uzaktır. |
| PCIe Gen4 ×16 | Bazı 1 ve 2 GPU'lu kasalar | 32 GB/s | Yukarıdaki gibi, ama yarı hızda. |
Öne çıkan oran, NVLink 4 ile PCIe Gen5 arasında kabaca 14× düzeyindedir. Bu sayı gerçektir ama önemli olan sayı bu değildir — önemli olan, işinizin bağlantıyı ne sıklıkla kullandığıdır.
Hızınızı belirlediğinde
Tek bir durum, ve insanların planlamadan en sık içinde bulduğu durum da bu.
Tensor paralelliği
Her katman kartlar arasında kesilir, böylece her kart her ağırlık matrisinin bir dilimini tutar. Her katmandan sonra, kısmi sonuçların tüm kartlar üzerinde toplanması gerekir — bir all-reduce.
- 70B'lik bir modelde bu, token başına 80 senkronizasyon demektir
- Hepsi en yavaş kartı bekler
- Bağlantıdaki 14× oranının gerçek saniyelere dönüştüğü yer burasıdır
Büyük batch'li eğitim
Her adımın sonunda, boyutu batch'e değil parametre sayısına göre belirlenen bir gradient all-reduce. BF16'daki 70B'lik bir model, adım başına bağlantı üzerinden 140 GB taşır.
- PCIe Gen5 üzerinden, yaklaşık iki saniyelik saf aktarım
- NVLink üzerinden, bunun onda birine yakın
- Çok günlük bir çalıştırmanın her adımıyla çarpılır
Hiçbir şeyi değiştirmediğinde
NVLink için ödeme yapmanın size ölçülebilir hiçbir şey kazandırmadığı üç yaygın iş yükü. Bunlardan birindeyseniz, PCIe kartlar size dolar başına daha fazla VRAM verir.
Kart başına bir model. Dört kart üzerindeki 24B modelin dört bağımsız kopyası, bağlantıya hiç dokunmaz. Dört kat işlem hacmi, senkronizasyon yok, hata modu yok.
Pipeline paralelliği. Model, katman grupları halinde bölünür; böylece bir kart, katman başına değil mikro-batch başına bir kez diğerine devreder. Aktarımlar, PCIe'nin yetişebileceği kadar seyrektir.
Diffusion ve render. Görüntü ve video üretimi, Blender, Octane: her kart kendi karesi veya kendi görüntüsü üzerinde çalışır. All-reduce yapılacak hiçbir şey yoktur.
--tensor-parallel-size 4 ile sunulan bir model, aynı modelin kartlardan yalnızca birinde çalıştırılmasından daha yavaştır. Senkronizasyon maliyeti gerçektir ve kazanç sıfırdır. Yalnızca model sığmadığında paylaştırın.
Aynı iş, iki yolla da
Kiraladığımız iki düğüm, ikisi de dört adet 80 GB'lik karta sahip — aynı toplam bellek, aynı sınıf kart, yalnızca aralarındaki bağlantı farklı. Fiyatlar bize ait, aylıktır.
| 4 × NVIDIA A100 PCIe | 4 × NVIDIA A100 SXM4 | |
|---|---|---|
| Kartlar arası bağlantı | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| Toplam VRAM | 320 GB | 320 GB |
| Kart başına bellek bant genişliği | 1,935 GB/s | 2,039 GB/s |
| BF16'da Llama 3.3 70B, paylaştırılmış | ~18 tok/s | ~19 tok/s |
| Fiyat | $4,157/ay | $4,395/ay |
İşlem hacmi modelimiz bellek bant genişliğiyle sınırlıdır ve kasıtlı olarak temkinlidir — all-reduce'u doğrudan modellemez, bu nedenle bir tensor-paralel işteki gerçek fark, tablonun ima ettiğinden daha dar değil, daha geniştir. Bunları her iki makine için de bir taban, sıralamayı ise asıl mesele olarak değerlendirin.
Kendiniz ölçmek
Bunu ilk gün yapın. İki dakika sürer ve size satılan makinenin, parasını ödediğiniz topolojiye sahip olup olmadığını gösterir.
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m
# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status
# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
nvcr.io/nvidia/pytorch:25.02-py3 \
all_reduce_perf -b 8 -e 4G -f 2 -g 4
Tensor paralelliği için satın aldığınız bir düğümde topo -m iki kart arasında SYS gösteriyorsa, bu iki kart CPU üzerinden ve soketler arasında konuşuyor demektir — makinedeki en kötü durum budur. SXM düğümlerimizde her çift NV18 raporlar; başka herhangi bir şey bir arızadır ve bunu ilk günden duymak isteriz.
Ne satın almalı
- Model tek bir karta sığıyor mu? Tek bir kart alın. Bu sayfadaki hiçbir şey sizin için geçerli değildir ve ara bağlantı için ödediğiniz fark, yakılmış paradır.
- Birkaç bağımsız model ya da çok sayıda bağımsız iş mi? İhtiyacınız kadar PCIe kart alın. Dolar başına daha fazla VRAM elde edersiniz ve bağlantıyı hiç kullanmazsınız.
- Tek bir karta sığmayacak kadar büyük, düşük eşzamanlılıkta sunulan bir model mi? PCIe işe yarar. Paylaştırmanın size kazandırmak yerine maliyet çıkaracağını bekleyin ve düğümü hız için değil bellek için boyutlandırın.
- Tek bir karta sığmayacak kadar büyük, gerçek trafiği sunan veya eğitilen bir model mi? NVLink'in var olma sebebi tam olarak budur. SXM alın.
- Sekizden fazla kart gerektiren tek bir iş mi? Bu, düğümler arasında bir fabric gerektirir ve biz bunu satmıyoruz. Bunu size makbuzdan sonra değil, burada söylemeyi tercih ederiz — bkz. sunmadığımız şeyler.
Yapılandırıcı bunlardan hangisinde olduğunuzu söyler: bir model seçin, katalogdaki her düğüm için tek bir karta sığıp sığmadığını, bölünmesi gerekip gerekmediğini ya da hiç sığmadığını bildirir. “Bölünmeli” kelimesi, bu rehberin önem kazanmaya başladığı andır.
Modelinizi tek bir kartta hangi düğümlerin barındırdığını görün.
Yapılandırıcı, tüm 41 yapılandırma için bu soruyu yanıtlar ve her birinin fiyatını gösterir.
Diğer rehberler
- Boyutlandırma · 9 dk
Görsel ve video modelleri için kart seçimi
FLUX, SDXL, SD 3.5 ve Wan 2.1'in VRAM ihtiyacı, kataloğumuzdaki hangi kartın karşıladığı ve sığan en ucuz seçeneğin neden nadiren kiralanacak model olduğu.
Rehberi okuyun - Boyutlandırma · 10 dk
Nicemleme biçimi seçimi
AWQ, GPTQ, GGUF ve FP8'in bellek, hız ve kalitede birer birer maliyeti — ve en küçük ağırlıklara sahip formatın neden nadiren en küçük modeli verdiği.
Rehberi okuyun - Boyutlandırma · 10 dk
Bir uzman karışımı modelini çalıştırmak
Toplam parametreler makineyi, etkin parametreler hızı belirler. DeepSeek V3 ve Qwen 3 235B için gereken VRAM ve hangi düğümün kiralanacağı.
Rehberi okuyun