NVLink 또는 PCIe: 작업에 맞는 선택.
카드 간 링크는 워크로드 1종에서는 대단히 중요하고, 다른 3종에서는 전혀 중요하지 않습니다. 어느 쪽을 돌리고 있는지 아는 것은 한 달에 수백 달러의 가치가 있습니다.
짧은 답
- 카드당 모델 1개 실행
- 링크는 상관없습니다. PCIe를 구매하고 차액은 카드를 더 사는 데 쓰십시오.
- 모델 하나를 카드 간에 분할
- 텐서 병렬화는 레이어마다 동기화합니다. NVLink는 값을 치를 만합니다.
- 파이프라인 병렬화
- 레이어마다가 아니라 마이크로배치마다 한 번씩 전송합니다. PCIe로 대개 충분합니다.
- 멀티 노드 학습
- 당사는 제공하지 않습니다 — NVLink는 노드 안에서 카드를 잇고, 노드끼리 잇는 것은 없습니다.
요약
모델이 카드 1장에 들어간다면 여기서 읽기를 멈추십시오 — 이 내용은 하나도 해당하지 않고, 모델을 담을 수 있는 가장 저렴한 카드가 올바른 선택입니다. 이 가이드는 모델이 들어가지 않아 분할해야 할 때 무슨 일이 일어나는지를 다룹니다.
각 링크가 무엇인지
| 링크 | 제공되는 곳 | 카드당, 방향당 | 토폴로지 |
|---|---|---|---|
| NVSwitch 경유 NVLink 4 | HGX 보드의 SXM 카드 — GPU 4장 및 8장 노드 | 900 GB/s | 올투올. 모든 카드가 다른 모든 카드와 최대 속도로 동시에 통신합니다. |
| NVSwitch 경유 NVLink 5 | B200 SXM6 노드 | 1,800 GB/s | 올투올, 이전 세대의 2배. |
| PCIe Gen5 ×16 | 모든 PCIe 카드 | 64 GB/s | CPU root complex를 거칩니다. 서로 다른 소켓에 꽂힌 카드는 같은 소켓의 카드보다 더 멀리 떨어져 있습니다. |
| PCIe Gen4 ×16 | 일부 GPU 1장 및 2장 섀시 | 32 GB/s | 위와 같고, 속도는 절반입니다. |
NVLink 4와 PCIe Gen5 사이의 대표 비율은 대략 14×입니다. 실제 수치이지만 중요한 수치는 아닙니다 — 중요한 것은 작업이 링크를 얼마나 자주 건너느냐입니다.
속도를 좌우하는 경우
1가지 경우이고, 계획하지 않은 채 가장 자주 마주치게 되는 경우입니다.
텐서 병렬화
레이어마다 카드 간에 잘리므로, 모든 카드가 모든 가중치 행렬의 조각을 하나씩 가집니다. 레이어를 지날 때마다 부분 결과를 모든 카드에 걸쳐 합산해야 합니다 — 올리듀스입니다.
- 70B 모델에서는 토큰당 동기화 80회
- 모두가 가장 느린 카드를 기다림
- 링크의 14× 차이가 실제 초 단위로 나타나는 지점
대규모 배치 학습
매 스텝 종료 시 그래디언트 올리듀스가 일어나고, 크기는 배치가 아니라 파라미터 수로 정해집니다. BF16으로 돌리는 70B 모델은 스텝마다 링크로 140 GB를 옮깁니다.
- PCIe Gen5에서는 순수 전송만 약 2초
- NVLink에서는 그 10분의 1 수준
- 며칠짜리 실행의 매 스텝마다 곱해짐
아무것도 바꾸지 않는 경우
NVLink에 돈을 써도 측정 가능한 이득이 없는 흔한 워크로드 3가지입니다. 이 중 하나에 해당한다면 PCIe 카드가 달러당 VRAM을 더 많이 줍니다.
카드당 모델 1개. 24B 모델의 독립된 사본 4개를 카드 4장에 올리면 링크를 전혀 건드리지 않습니다. 처리량 4배, 동기화 없음, 장애 요인 없음.
파이프라인 병렬화. 모델을 레이어 그룹 단위로 나누므로, 카드는 레이어마다가 아니라 마이크로배치마다 다음 카드로 넘깁니다. 전송이 드물어서 PCIe로도 따라갑니다.
디퓨전과 렌더링. 이미지·영상 생성, Blender, Octane: 각 카드가 자기 프레임이나 자기 이미지를 처리합니다. 올리듀스할 것이 없습니다.
--tensor-parallel-size 4로 서빙하면, 같은 모델을 카드 1장에서 돌릴 때보다 느립니다. 동기화 비용은 실제로 발생하고 이득은 0입니다. 모델이 들어가지 않을 때만 샤딩하십시오.
같은 작업, 두 가지 방식
당사가 임대하는 노드 2대, 둘 다 80 GB 카드 4장 — 총 메모리가 같고, 카드 등급이 같고, 카드 간 링크만 다릅니다. 가격은 당사 기준, 월 단위입니다.
| 4 × NVIDIA A100 PCIe | 4 × NVIDIA A100 SXM4 | |
|---|---|---|
| 카드 간 링크 | PCIe 5.0 ×16 | NVLink 3 · 600 GB/s |
| 총 VRAM | 320 GB | 320 GB |
| 카드당 메모리 대역폭 | 1,935 GB/s | 2,039 GB/s |
| Llama 3.3 70B 모델을 BF16으로 카드 간 분할 | 약 18 tok/s | 약 19 tok/s |
| 가격 | $4,157/월 | $4,395/월 |
당사의 처리량 모델은 메모리 대역폭에 묶여 있고 의도적으로 보수적입니다 — 올리듀스를 직접 모델링하지 않으므로, 텐서 병렬 작업에서 실제 격차는 표가 시사하는 것보다 좁은 것이 아니라 더 큽니다. 두 머신 모두 이 값을 하한으로 보시고, 요점은 순서라고 보십시오.
직접 측정하기
첫날에 해 두십시오. 2분이면 되고, 받으신 머신이 결제하신 토폴로지를 갖추었는지 알려 줍니다.
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m
# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status
# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
nvcr.io/nvidia/pytorch:25.02-py3 \
all_reduce_perf -b 8 -e 4G -f 2 -g 4
텐서 병렬화를 위해 구매하신 노드에서 topo -m이 두 카드 사이에 SYS를 표시한다면, 그 두 카드는 CPU를 거쳐 소켓을 넘어 통신하고 있는 것입니다 — 이 머신에서 최악의 경우입니다. 당사 SXM 노드에서는 모든 쌍이 NV18을 보고합니다. 그 밖의 값은 결함이고, 첫날에 알려 주시기 바라는 종류의 결함입니다.
무엇을 살 것인가
- 모델이 카드 1장에 들어갑니까? 카드 1장을 구매하십시오. 이 페이지의 내용은 하나도 해당하지 않고, 인터커넥트 프리미엄은 돈을 태우는 셈입니다.
- 독립된 모델이 여럿이거나 독립된 작업이 많습니까? 필요한 만큼 PCIe 카드를 구매하십시오. 달러당 VRAM이 더 많고, 링크를 건널 일이 없습니다.
- 카드 1장에 담기에는 큰 모델 하나를 낮은 동시성으로 서빙합니까? PCIe로 됩니다. 샤딩은 이득이 아니라 비용이라고 보시고, 노드는 속도가 아니라 메모리 기준으로 사이징하십시오.
- 카드 1장에 담기에는 큰 모델 하나로 실제 트래픽을 서빙하거나 학습합니까? NVLink가 존재하는 이유가 바로 이 경우입니다. SXM을 구매하십시오.
- 카드 8장을 넘게 쓰는 단일 작업입니까? 그것은 노드 간 패브릭이 필요하고, 당사는 판매하지 않습니다. 청구서를 받은 뒤보다 여기서 말씀드리는 편이 낫습니다 — 제공하지 않는 것을 보십시오.
구성 도구가 어느 경우에 해당하는지 알려 줍니다: 모델을 고르면 카탈로그의 모든 노드에 대해 카드 1장에 들어가는지, 분할해야 하는지, 아예 들어가지 않는지 표시합니다. “분할”이라는 말이 나오는 순간부터 이 가이드가 의미를 갖습니다.
다른 가이드
- 사이징 · 9분
이미지·영상 모델용 카드 선택
FLUX, SDXL, SD 3.5, Wan 2.1 모델이 VRAM을 얼마나 요구하는지, 카탈로그의 어떤 카드가 각각을 담는지, 그리고 들어가는 가장 싼 카드가 왜 임대할 카드가 아닌지.
가이드 읽기 - 사이징 · 10분
양자화 형식 선택
AWQ, GPTQ, GGUF, FP8 포맷이 각각 메모리, 속도, 품질에서 치르는 대가 — 그리고 가중치가 가장 작은 포맷이 왜 가장 작은 모델로 이어지지 않는지.
가이드 읽기 - 사이징 · 10분
전문가 혼합 모델 실행하기
총 파라미터가 머신을 결정하고, 활성 파라미터가 속도를 결정합니다. DeepSeek V3와 Qwen 3 235B에 필요한 VRAM, 그리고 이들을 위해 임대할 노드를 알아보십시오.
가이드 읽기