Boyutlandırma rehberi · 7 dakikalık okuma

# NVLink mi PCIe mi: işiniz hangisine ihtiyaç duyuyor.

Kartlar arasındaki bağlantı, bir tür iş yükü için son derece önemlidir, diğer üç tür için ise hiç önemli değildir. Hangisini çalıştırdığınızı bilmek, ayda birkaç yüz dolar değerindedir.

Kısa cevap

- **Kart başına bir model çalıştırma:** Bağlantı önemsizdir. PCIe alın ve farkı daha fazla kart için harcayın.
- **Tek bir modeli kartlar arasında bölme:** Tensor paralelliği **her katmanda** senkronize olur. NVLink'in parasını vermeye değer.
- **Pipeline paralelliği:** Katman başına değil, mikro-batch başına bir aktarım. PCIe genellikle yeterlidir.
- **Çok düğümlü eğitim:** Bunu sunmuyoruz — NVLink, bir düğümün *içindeki* kartları birleştirir, düğümleri birleştiren hiçbir şey yoktur.

## Kısa özet

Bir model tek bir karta sığıyorsa okumayı bırakın — bunların hiçbiri sizin için geçerli değil, modelinizi barındıran en ucuz kart doğru satın alımdır. Bu rehber, model sığmadığında ve onu bölmeniz gerektiğinde ne olduğuyla ilgilidir.

## Her bağlantının ne olduğu

**Ara bağlantı türleri, bant genişliği ve topoloji**

| Bağlantı | Nereden elde edersiniz | Kart başına, her yönde | Topoloji |
|---|---|---|---|
| NVSwitch üzerinden NVLink 4 Hopper nesli | Bir HGX kartı üzerinde SXM kartları — 4 ve 8 GPU'lu düğümlerA100 SXM4, H100 SXM5, H200 | 900 GB/s | All-to-all. Her kart, diğer her kartla aynı anda tam hızda konuşur. |
| NVSwitch üzerinden NVLink 5 Blackwell nesli | B200 SXM6 düğümleri4 ve 8 GPU'lu | 1.800 GB/s | All-to-all, önceki neslin iki katı. |
| PCIe Gen5 ×16 Güncel PCIe düğümleri | Tüm PCIe kartlarL4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe | 64 GB/s | CPU kök kompleksi üzerinden. Farklı soketlerdeki kartlar, aynı soketteki kartlardan daha uzaktır. |
| PCIe Gen4 ×16 Daha eski platformlar | Bazı 1 ve 2 GPU'lu kasalar | 32 GB/s | Yukarıdaki gibi, ama yarı hızda. |

Öne çıkan oran, NVLink 4 ile PCIe Gen5 arasında kabaca **14×** düzeyindedir. Bu sayı gerçektir ama önemli olan sayı bu değildir — önemli olan, işinizin bağlantıyı ne sıklıkla kullandığıdır.

## Hızınızı belirlediğinde

Tek bir durum, ve insanların planlamadan en sık içinde bulduğu durum da bu.

### Tensor paralelliği

Her katman kartlar arasında kesilir, böylece her kart her ağırlık matrisinin bir dilimini tutar. Her katmandan sonra, kısmi sonuçların tüm kartlar üzerinde toplanması gerekir — bir all-reduce.

- 70B'lik bir modelde bu, token başına 80 senkronizasyon demektir
- Hepsi en yavaş kartı bekler
- Bağlantıdaki 14× oranının gerçek saniyelere dönüştüğü yer burasıdır

### Büyük batch'li eğitim

Her adımın sonunda, boyutu batch'e değil parametre sayısına göre belirlenen bir gradient all-reduce. BF16'daki 70B'lik bir model, adım başına bağlantı üzerinden 140 GB taşır.

- PCIe Gen5 üzerinden, yaklaşık iki saniyelik saf aktarım
- NVLink üzerinden, bunun onda birine yakın
- Çok günlük bir çalıştırmanın her adımıyla çarpılır

## Hiçbir şeyi değiştirmediğinde

NVLink için ödeme yapmanın size ölçülebilir hiçbir şey kazandırmadığı üç yaygın iş yükü. Bunlardan birindeyseniz, PCIe kartlar size dolar başına daha fazla VRAM verir.

**Kart başına bir model.** Dört kart üzerindeki 24B modelin dört bağımsız kopyası, bağlantıya hiç dokunmaz. Dört kat işlem hacmi, senkronizasyon yok, hata modu yok.

**Pipeline paralelliği.** Model, katman *grupları* halinde bölünür; böylece bir kart, katman başına değil mikro-batch başına bir kez diğerine devreder. Aktarımlar, PCIe'nin yetişebileceği kadar seyrektir.

**Diffusion ve render.** Görüntü ve video üretimi, Blender, Octane: her kart kendi karesi veya kendi görüntüsü üzerinde çalışır. All-reduce yapılacak hiçbir şey yoktur.

**En pahalı hata, ihtiyacınız olmayan tensor paralelliğini satın almaktır.** Tek bir 80 GB karta sığan, ancak düğümde dört kart olduğu için `--tensor-parallel-size 4` ile sunulan bir model, aynı modelin kartlardan yalnızca birinde çalıştırılmasından *daha yavaştır*. Senkronizasyon maliyeti gerçektir ve kazanç sıfırdır. Yalnızca model sığmadığında paylaştırın.

## Aynı iş, iki yolla da

Kiraladığımız iki düğüm, ikisi de dört adet 80 GB'lik karta sahip — aynı toplam bellek, aynı sınıf kart, yalnızca aralarındaki bağlantı farklı. Fiyatlar bize ait, aylıktır.

**Dört kartlı bir SXM düğümünün dört kartlı bir PCIe düğümüyle karşılaştırılması**

|  | [4 × NVIDIA A100 PCIe](https://gpuserver.io/tr/gpu/a100-80gb) | [4 × NVIDIA A100 SXM4](https://gpuserver.io/tr/gpu/a100-sxm4) |
|---|---|---|
| Kartlar arası bağlantı | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| Toplam VRAM | 320 GB | 320 GB |
| Kart başına bellek bant genişliği | 1,935 GB/s | 2,039 GB/s |
| BF16'da Llama 3.3 70B, paylaştırılmış Tek akışlı üretim, temkinli tahminimiz | ~18 tok/s | ~19 tok/s |
| Fiyat | $4,157/ay | $4,395/ay |

İşlem hacmi modelimiz bellek bant genişliğiyle sınırlıdır ve kasıtlı olarak temkinlidir — all-reduce'u doğrudan modellemez, bu nedenle bir tensor-paralel işteki gerçek fark, tablonun ima ettiğinden daha dar değil, daha *geniştir*. Bunları her iki makine için de bir taban, sıralamayı ise asıl mesele olarak değerlendirin.

## Kendiniz ölçmek

Bunu ilk gün yapın. İki dakika sürer ve size satılan makinenin, parasını ödediğiniz topolojiye sahip olup olmadığını gösterir.

Önce topoloji, sonra gerçek bant genişliği

```
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4
```

Tensor paralelliği için satın aldığınız bir düğümde `topo -m` iki kart arasında `SYS` gösteriyorsa, bu iki kart CPU üzerinden ve soketler arasında konuşuyor demektir — makinedeki en kötü durum budur. SXM düğümlerimizde her çift `NV18` raporlar; başka herhangi bir şey bir arızadır ve bunu ilk günden duymak isteriz.

## Ne satın almalı

1. **Model tek bir karta sığıyor mu?** Tek bir kart alın. Bu sayfadaki hiçbir şey sizin için geçerli değildir ve ara bağlantı için ödediğiniz fark, yakılmış paradır.
2. **Birkaç bağımsız model ya da çok sayıda bağımsız iş mi?** İhtiyacınız kadar PCIe kart alın. Dolar başına daha fazla VRAM elde edersiniz ve bağlantıyı hiç kullanmazsınız.
3. **Tek bir karta sığmayacak kadar büyük, düşük eşzamanlılıkta sunulan bir model mi?** PCIe işe yarar. Paylaştırmanın size kazandırmak yerine maliyet çıkaracağını bekleyin ve düğümü hız için değil bellek için boyutlandırın.
4. **Tek bir karta sığmayacak kadar büyük, gerçek trafiği sunan veya eğitilen bir model mi?** NVLink'in var olma sebebi tam olarak budur. SXM alın.
5. **Sekizden fazla kart gerektiren tek bir iş mi?** Bu, düğümler arasında bir fabric gerektirir ve biz bunu satmıyoruz. Bunu size makbuzdan sonra değil, burada söylemeyi tercih ederiz — bkz. [sunmadığımız şeyler](https://gpuserver.io/tr/network#limits).

[Yapılandırıcı](https://gpuserver.io/tr/configure) bunlardan hangisinde olduğunuzu söyler: bir model seçin, katalogdaki her düğüm için tek bir karta sığıp sığmadığını, bölünmesi gerekip gerekmediğini ya da hiç sığmadığını bildirir. “Bölünmeli” kelimesi, bu rehberin önem kazanmaya başladığı andır.

## Modelinizi tek bir kartta hangi düğümlerin barındırdığını görün.

Yapılandırıcı, tüm 41 yapılandırma için bu soruyu yanıtlar ve her birinin fiyatını gösterir.

[Yapılandırıcıyı açın](https://gpuserver.io/tr/configure) [Rehberleri okuyun](https://gpuserver.io/tr/guides)

## Diğer rehberler

- [Boyutlandırma · 9 dk Görsel ve video modelleri için kart seçimi FLUX, SDXL, SD 3.5 ve Wan 2.1'in VRAM ihtiyacı, kataloğumuzdaki hangi kartın karşıladığı ve sığan en ucuz seçeneğin neden nadiren kiralanacak model olduğu. Rehberi okuyun](https://gpuserver.io/tr/guides/gpu-for-flux-sdxl)
- [Boyutlandırma · 10 dk Nicemleme biçimi seçimi AWQ, GPTQ, GGUF ve FP8'in bellek, hız ve kalitede birer birer maliyeti — ve en küçük ağırlıklara sahip formatın neden nadiren en küçük modeli verdiği. Rehberi okuyun](https://gpuserver.io/tr/guides/awq-vs-gptq-vs-fp8)
- [Boyutlandırma · 10 dk Bir uzman karışımı modelini çalıştırmak Toplam parametreler makineyi, etkin parametreler hızı belirler. DeepSeek V3 ve Qwen 3 235B için gereken VRAM ve hangi düğümün kiralanacağı. Rehberi okuyun](https://gpuserver.io/tr/guides/mixture-of-experts)

---

Kaynak: https://gpuserver.io/tr/guides/nvlink-vs-pcie/. Bu dosya, web sitesiyle aynı verilerden üretilir; buradaki bir rakam bir sayfadan farklıysa, o sayfa esas alınır ve bu dosya güncel değildir — asıl kaynak https://gpuserver.io/ adresidir.
