데이터센터 6곳 전체 정상

암호화폐 결제 · 신원 확인 없음 · 5분 미만 안에 root 권한

사이징 가이드 · 7분 분량

NVLink 또는 PCIe: 작업에 맞는 선택.

카드 간 링크는 워크로드 1종에서는 대단히 중요하고, 다른 3종에서는 전혀 중요하지 않습니다. 어느 쪽을 돌리고 있는지 아는 것은 한 달에 수백 달러의 가치가 있습니다.

짧은 답

카드당 모델 1개 실행
링크는 상관없습니다. PCIe를 구매하고 차액은 카드를 더 사는 데 쓰십시오.
모델 하나를 카드 간에 분할
텐서 병렬화는 레이어마다 동기화합니다. NVLink는 값을 치를 만합니다.
파이프라인 병렬화
레이어마다가 아니라 마이크로배치마다 한 번씩 전송합니다. PCIe로 대개 충분합니다.
멀티 노드 학습
당사는 제공하지 않습니다 — NVLink는 노드 안에서 카드를 잇고, 노드끼리 잇는 것은 없습니다.

요약

모델이 카드 1장에 들어간다면 여기서 읽기를 멈추십시오 — 이 내용은 하나도 해당하지 않고, 모델을 담을 수 있는 가장 저렴한 카드가 올바른 선택입니다. 이 가이드는 모델이 들어가지 않아 분할해야 할 때 무슨 일이 일어나는지를 다룹니다.

각 링크가 무엇인지

인터커넥트 종류, 대역폭, 토폴로지
링크제공되는 곳카드당, 방향당토폴로지
NVSwitch 경유 NVLink 4Hopper 세대 HGX 보드의 SXM 카드 — GPU 4장 및 8장 노드A100 SXM4, H100 SXM5, H200 900 GB/s 올투올. 모든 카드가 다른 모든 카드와 최대 속도로 동시에 통신합니다.
NVSwitch 경유 NVLink 5Blackwell 세대 B200 SXM6 노드GPU 4장 및 8장 1,800 GB/s 올투올, 이전 세대의 2배.
PCIe Gen5 ×16현재 PCIe 노드 모든 PCIe 카드L4, L40S, RTX 4090/5090, A6000, A100 PCIe, H100 PCIe 64 GB/s CPU root complex를 거칩니다. 서로 다른 소켓에 꽂힌 카드는 같은 소켓의 카드보다 더 멀리 떨어져 있습니다.
PCIe Gen4 ×16구형 플랫폼 일부 GPU 1장 및 2장 섀시 32 GB/s 위와 같고, 속도는 절반입니다.

NVLink 4와 PCIe Gen5 사이의 대표 비율은 대략 14×입니다. 실제 수치이지만 중요한 수치는 아닙니다 — 중요한 것은 작업이 링크를 얼마나 자주 건너느냐입니다.

속도를 좌우하는 경우

1가지 경우이고, 계획하지 않은 채 가장 자주 마주치게 되는 경우입니다.

텐서 병렬화

레이어마다 카드 간에 잘리므로, 모든 카드가 모든 가중치 행렬의 조각을 하나씩 가집니다. 레이어를 지날 때마다 부분 결과를 모든 카드에 걸쳐 합산해야 합니다 — 올리듀스입니다.

  • 70B 모델에서는 토큰당 동기화 80회
  • 모두가 가장 느린 카드를 기다림
  • 링크의 14× 차이가 실제 초 단위로 나타나는 지점

대규모 배치 학습

매 스텝 종료 시 그래디언트 올리듀스가 일어나고, 크기는 배치가 아니라 파라미터 수로 정해집니다. BF16으로 돌리는 70B 모델은 스텝마다 링크로 140 GB를 옮깁니다.

  • PCIe Gen5에서는 순수 전송만 약 2초
  • NVLink에서는 그 10분의 1 수준
  • 며칠짜리 실행의 매 스텝마다 곱해짐

아무것도 바꾸지 않는 경우

NVLink에 돈을 써도 측정 가능한 이득이 없는 흔한 워크로드 3가지입니다. 이 중 하나에 해당한다면 PCIe 카드가 달러당 VRAM을 더 많이 줍니다.

카드당 모델 1개. 24B 모델의 독립된 사본 4개를 카드 4장에 올리면 링크를 전혀 건드리지 않습니다. 처리량 4배, 동기화 없음, 장애 요인 없음.

파이프라인 병렬화. 모델을 레이어 그룹 단위로 나누므로, 카드는 레이어마다가 아니라 마이크로배치마다 다음 카드로 넘깁니다. 전송이 드물어서 PCIe로도 따라갑니다.

디퓨전과 렌더링. 이미지·영상 생성, Blender, Octane: 각 카드가 자기 프레임이나 자기 이미지를 처리합니다. 올리듀스할 것이 없습니다.

가장 비싼 실수는 필요 없는 텐서 병렬화를 구매하는 것입니다. 80 GB 카드 1장에 들어가는 모델을, 노드에 카드가 4장 있다는 이유로 --tensor-parallel-size 4로 서빙하면, 같은 모델을 카드 1장에서 돌릴 때보다 느립니다. 동기화 비용은 실제로 발생하고 이득은 0입니다. 모델이 들어가지 않을 때만 샤딩하십시오.

같은 작업, 두 가지 방식

당사가 임대하는 노드 2대, 둘 다 80 GB 카드 4장 — 총 메모리가 같고, 카드 등급이 같고, 카드 간 링크만 다릅니다. 가격은 당사 기준, 월 단위입니다.

카드 4장 SXM 노드와 카드 4장 PCIe 노드 비교
4 × NVIDIA A100 PCIe4 × NVIDIA A100 SXM4
카드 간 링크PCIe 5.0 ×16NVLink 3 · 600 GB/s
총 VRAM320 GB320 GB
카드당 메모리 대역폭1,935 GB/s2,039 GB/s
Llama 3.3 70B 모델을 BF16으로 카드 간 분할단일 스트림 생성, 당사의 보수적 추정치 약 18 tok/s약 19 tok/s
가격 $4,157/월 $4,395/월

당사의 처리량 모델은 메모리 대역폭에 묶여 있고 의도적으로 보수적입니다 — 올리듀스를 직접 모델링하지 않으므로, 텐서 병렬 작업에서 실제 격차는 표가 시사하는 것보다 좁은 것이 아니라 더 큽니다. 두 머신 모두 이 값을 하한으로 보시고, 요점은 순서라고 보십시오.

직접 측정하기

첫날에 해 두십시오. 2분이면 되고, 받으신 머신이 결제하신 토폴로지를 갖추었는지 알려 줍니다.

토폴로지, 그다음 실제 대역폭
# NV# means NVLink. PIX, PHB or SYS mean the traffic goes over PCIe.
$ nvidia-smi topo -m

# NVLink state and per-link throughput counters
$ nvidia-smi nvlink --status

# The honest test: an actual all-reduce across every card in the box.
# Compare busbw to the link's rated figure, not to the headline number.
$ docker run --rm --gpus all --ipc=host --shm-size=8g \
    nvcr.io/nvidia/pytorch:25.02-py3 \
    all_reduce_perf -b 8 -e 4G -f 2 -g 4

텐서 병렬화를 위해 구매하신 노드에서 topo -m이 두 카드 사이에 SYS를 표시한다면, 그 두 카드는 CPU를 거쳐 소켓을 넘어 통신하고 있는 것입니다 — 이 머신에서 최악의 경우입니다. 당사 SXM 노드에서는 모든 쌍이 NV18을 보고합니다. 그 밖의 값은 결함이고, 첫날에 알려 주시기 바라는 종류의 결함입니다.

무엇을 살 것인가

  1. 모델이 카드 1장에 들어갑니까? 카드 1장을 구매하십시오. 이 페이지의 내용은 하나도 해당하지 않고, 인터커넥트 프리미엄은 돈을 태우는 셈입니다.
  2. 독립된 모델이 여럿이거나 독립된 작업이 많습니까? 필요한 만큼 PCIe 카드를 구매하십시오. 달러당 VRAM이 더 많고, 링크를 건널 일이 없습니다.
  3. 카드 1장에 담기에는 큰 모델 하나를 낮은 동시성으로 서빙합니까? PCIe로 됩니다. 샤딩은 이득이 아니라 비용이라고 보시고, 노드는 속도가 아니라 메모리 기준으로 사이징하십시오.
  4. 카드 1장에 담기에는 큰 모델 하나로 실제 트래픽을 서빙하거나 학습합니까? NVLink가 존재하는 이유가 바로 이 경우입니다. SXM을 구매하십시오.
  5. 카드 8장을 넘게 쓰는 단일 작업입니까? 그것은 노드 간 패브릭이 필요하고, 당사는 판매하지 않습니다. 청구서를 받은 뒤보다 여기서 말씀드리는 편이 낫습니다 — 제공하지 않는 것을 보십시오.

구성 도구가 어느 경우에 해당하는지 알려 줍니다: 모델을 고르면 카탈로그의 모든 노드에 대해 카드 1장에 들어가는지, 분할해야 하는지, 아예 들어가지 않는지 표시합니다. “분할”이라는 말이 나오는 순간부터 이 가이드가 의미를 갖습니다.

어느 노드가 모델을 카드 1장에 담는지 확인하십시오.

구성 도구는 41개 구성 전부에 답하고, 각각의 가격을 보여 줍니다.

로그인

콘솔, 청구서, 대역 외 접근.

계정이 없으십니까?

별도의 회원가입은 없습니다. 첫 주문을 진행하는 동안 계정이 만들어집니다 — 결제 단계에서 이메일과 비밀번호를 직접 정하시고, 머신이 준비될 때쯤이면 콘솔도 이미 열려 있습니다.

서버 구성하기

Language