사이징 가이드 · 7분 분량

# NVLink 또는 PCIe: 작업에 맞는 선택.

카드 간 링크는 워크로드 1종에서는 대단히 중요하고, 다른 3종에서는 전혀 중요하지 않습니다. 어느 쪽을 돌리고 있는지 아는 것은 한 달에 수백 달러의 가치가 있습니다.

짧은 답

- **카드당 모델 1개 실행:** 링크는 상관없습니다. PCIe를 구매하고 차액은 카드를 더 사는 데 쓰십시오.
- **모델 하나를 카드 간에 분할:** 텐서 병렬화는 **레이어마다** 동기화합니다. NVLink는 값을 치를 만합니다.
- **파이프라인 병렬화:** 레이어마다가 아니라 마이크로배치마다 한 번씩 전송합니다. PCIe로 대개 충분합니다.
- **멀티 노드 학습:** 당사는 제공하지 않습니다 — NVLink는 노드 *안에서* 카드를 잇고, 노드끼리 잇는 것은 없습니다.

## 요약

모델이 카드 1장에 들어간다면 여기서 읽기를 멈추십시오 — 이 내용은 하나도 해당하지 않고, 모델을 담을 수 있는 가장 저렴한 카드가 올바른 선택입니다. 이 가이드는 모델이 들어가지 않아 분할해야 할 때 무슨 일이 일어나는지를 다룹니다.

## 각 링크가 무엇인지

**인터커넥트 종류, 대역폭, 토폴로지**

| 링크 | 제공되는 곳 | 카드당, 방향당 | 토폴로지 |
|---|---|---|---|
| NVSwitch 경유 NVLink 4 Hopper 세대 | HGX 보드의 SXM 카드 — GPU 4장 및 8장 노드A100 SXM4, H100 SXM5, H200 | 900 GB/s | 올투올. 모든 카드가 다른 모든 카드와 최대 속도로 동시에 통신합니다. |
| NVSwitch 경유 NVLink 5 Blackwell 세대 | B200 SXM6 노드GPU 4장 및 8장 | 1,800 GB/s | 올투올, 이전 세대의 2배. |
| PCIe Gen5 ×16 현재 PCIe 노드 | 모든 PCIe 카드L4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe | 64 GB/s | CPU root complex를 거칩니다. 서로 다른 소켓에 꽂힌 카드는 같은 소켓의 카드보다 더 멀리 떨어져 있습니다. |
| PCIe Gen4 ×16 구형 플랫폼 | 일부 GPU 1장 및 2장 섀시 | 32 GB/s | 위와 같고, 속도는 절반입니다. |

NVLink 4와 PCIe Gen5 사이의 대표 비율은 대략 **14×**입니다. 실제 수치이지만 중요한 수치는 아닙니다 — 중요한 것은 작업이 링크를 얼마나 자주 건너느냐입니다.

## 속도를 좌우하는 경우

1가지 경우이고, 계획하지 않은 채 가장 자주 마주치게 되는 경우입니다.

### 텐서 병렬화

레이어마다 카드 간에 잘리므로, 모든 카드가 모든 가중치 행렬의 조각을 하나씩 가집니다. 레이어를 지날 때마다 부분 결과를 모든 카드에 걸쳐 합산해야 합니다 — 올리듀스입니다.

- 70B 모델에서는 토큰당 동기화 80회
- 모두가 가장 느린 카드를 기다림
- 링크의 14× 차이가 실제 초 단위로 나타나는 지점

### 대규모 배치 학습

매 스텝 종료 시 그래디언트 올리듀스가 일어나고, 크기는 배치가 아니라 파라미터 수로 정해집니다. BF16으로 돌리는 70B 모델은 스텝마다 링크로 140 GB를 옮깁니다.

- PCIe Gen5에서는 순수 전송만 약 2초
- NVLink에서는 그 10분의 1 수준
- 며칠짜리 실행의 매 스텝마다 곱해짐

## 아무것도 바꾸지 않는 경우

NVLink에 돈을 써도 측정 가능한 이득이 없는 흔한 워크로드 3가지입니다. 이 중 하나에 해당한다면 PCIe 카드가 달러당 VRAM을 더 많이 줍니다.

**카드당 모델 1개.** 24B 모델의 독립된 사본 4개를 카드 4장에 올리면 링크를 전혀 건드리지 않습니다. 처리량 4배, 동기화 없음, 장애 요인 없음.

**파이프라인 병렬화.** 모델을 레이어 *그룹* 단위로 나누므로, 카드는 레이어마다가 아니라 마이크로배치마다 다음 카드로 넘깁니다. 전송이 드물어서 PCIe로도 따라갑니다.

**디퓨전과 렌더링.** 이미지·영상 생성, Blender, Octane: 각 카드가 자기 프레임이나 자기 이미지를 처리합니다. 올리듀스할 것이 없습니다.

**가장 비싼 실수는 필요 없는 텐서 병렬화를 구매하는 것입니다.** 80 GB 카드 1장에 들어가는 모델을, 노드에 카드가 4장 있다는 이유로 `--tensor-parallel-size 4`로 서빙하면, 같은 모델을 카드 1장에서 돌릴 때보다 *느립니다*. 동기화 비용은 실제로 발생하고 이득은 0입니다. 모델이 들어가지 않을 때만 샤딩하십시오.

## 같은 작업, 두 가지 방식

당사가 임대하는 노드 2대, 둘 다 80 GB 카드 4장 — 총 메모리가 같고, 카드 등급이 같고, 카드 간 링크만 다릅니다. 가격은 당사 기준, 월 단위입니다.

**카드 4장 SXM 노드와 카드 4장 PCIe 노드 비교**

|  | [4 × NVIDIA A100 PCIe](https://gpuserver.io/ko/gpu/a100-80gb) | [4 × NVIDIA A100 SXM4](https://gpuserver.io/ko/gpu/a100-sxm4) |
|---|---|---|
| 카드 간 링크 | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| 총 VRAM | 320 GB | 320 GB |
| 카드당 메모리 대역폭 | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B 모델을 BF16으로 카드 간 분할 단일 스트림 생성, 당사의 보수적 추정치 | 약 18 tok/s | 약 19 tok/s |
| 가격 | $4,157/월 | $4,395/월 |

당사의 처리량 모델은 메모리 대역폭에 묶여 있고 의도적으로 보수적입니다 — 올리듀스를 직접 모델링하지 않으므로, 텐서 병렬 작업에서 실제 격차는 표가 시사하는 것보다 좁은 것이 아니라 *더 큽니다*. 두 머신 모두 이 값을 하한으로 보시고, 요점은 순서라고 보십시오.

## 직접 측정하기

첫날에 해 두십시오. 2분이면 되고, 받으신 머신이 결제하신 토폴로지를 갖추었는지 알려 줍니다.

토폴로지, 그다음 실제 대역폭

```
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4
```

텐서 병렬화를 위해 구매하신 노드에서 `topo -m`이 두 카드 사이에 `SYS`를 표시한다면, 그 두 카드는 CPU를 거쳐 소켓을 넘어 통신하고 있는 것입니다 — 이 머신에서 최악의 경우입니다. 당사 SXM 노드에서는 모든 쌍이 `NV18`을 보고합니다. 그 밖의 값은 결함이고, 첫날에 알려 주시기 바라는 종류의 결함입니다.

## 무엇을 살 것인가

1. **모델이 카드 1장에 들어갑니까?** 카드 1장을 구매하십시오. 이 페이지의 내용은 하나도 해당하지 않고, 인터커넥트 프리미엄은 돈을 태우는 셈입니다.
2. **독립된 모델이 여럿이거나 독립된 작업이 많습니까?** 필요한 만큼 PCIe 카드를 구매하십시오. 달러당 VRAM이 더 많고, 링크를 건널 일이 없습니다.
3. **카드 1장에 담기에는 큰 모델 하나를 낮은 동시성으로 서빙합니까?** PCIe로 됩니다. 샤딩은 이득이 아니라 비용이라고 보시고, 노드는 속도가 아니라 메모리 기준으로 사이징하십시오.
4. **카드 1장에 담기에는 큰 모델 하나로 실제 트래픽을 서빙하거나 학습합니까?** NVLink가 존재하는 이유가 바로 이 경우입니다. SXM을 구매하십시오.
5. **카드 8장을 넘게 쓰는 단일 작업입니까?** 그것은 노드 간 패브릭이 필요하고, 당사는 판매하지 않습니다. 청구서를 받은 뒤보다 여기서 말씀드리는 편이 낫습니다 — [제공하지 않는 것](https://gpuserver.io/ko/network#limits)을 보십시오.

[구성 도구](https://gpuserver.io/ko/configure)가 어느 경우에 해당하는지 알려 줍니다: 모델을 고르면 카탈로그의 모든 노드에 대해 카드 1장에 들어가는지, 분할해야 하는지, 아예 들어가지 않는지 표시합니다. “분할”이라는 말이 나오는 순간부터 이 가이드가 의미를 갖습니다.

## 어느 노드가 모델을 카드 1장에 담는지 확인하십시오.

구성 도구는 41개 구성 전부에 답하고, 각각의 가격을 보여 줍니다.

[구성 도구 열기](https://gpuserver.io/ko/configure) [가이드 둘러보기](https://gpuserver.io/ko/guides)

## 다른 가이드

- [사이징 · 9분 이미지·영상 모델용 카드 선택 FLUX, SDXL, SD 3.5, Wan 2.1 모델이 VRAM을 얼마나 요구하는지, 카탈로그의 어떤 카드가 각각을 담는지, 그리고 들어가는 가장 싼 카드가 왜 임대할 카드가 아닌지. 가이드 읽기](https://gpuserver.io/ko/guides/gpu-for-flux-sdxl)
- [사이징 · 10분 양자화 형식 선택 AWQ, GPTQ, GGUF, FP8 포맷이 각각 메모리, 속도, 품질에서 치르는 대가 — 그리고 가중치가 가장 작은 포맷이 왜 가장 작은 모델로 이어지지 않는지. 가이드 읽기](https://gpuserver.io/ko/guides/awq-vs-gptq-vs-fp8)
- [사이징 · 10분 전문가 혼합 모델 실행하기 총 파라미터가 머신을 결정하고, 활성 파라미터가 속도를 결정합니다. DeepSeek V3와 Qwen 3 235B에 필요한 VRAM, 그리고 이들을 위해 임대할 노드를 알아보십시오. 가이드 읽기](https://gpuserver.io/ko/guides/mixture-of-experts)

---

출처: https://gpuserver.io/ko/guides/nvlink-vs-pcie/. 이 파일은 웹사이트와 동일한 데이터에서 생성됩니다. 여기의 수치가 페이지와 다르다면 페이지가 정본이고 이 파일이 오래된 것입니다 — 정식 출처는 https://gpuserver.io/입니다.
