데이터센터 6곳 전체 정상

암호화폐 결제 · 신원 확인 없음 · 5분 미만 안에 root 권한

사이징 가이드 · 10분 분량

전문가 혼합에 실제로 드는 비용.

“235B-A22B”와 같은 이름에는 숫자가 두 개 들어 있으며, 대다수는 엉뚱한 쪽을 읽습니다. 하나는 무엇을 임대해야 하는지를 결정하고, 다른 하나는 응답 속도를 결정합니다. 둘의 차이가 10배에 달할 수도 있습니다.

짧은 답

머신을 결정하는 총 파라미터
DeepSeek V3 671B-A37B (MoE) 모델은 4비트에서 8k 컨텍스트 기준으로 386 GB가 필요합니다. 활성 파라미터 크기만 한 덴스 모델이라면 22 GB가 필요합니다 — 17.6× 더 적습니다.
속도를 결정하는 활성 파라미터
토큰마다 가중치의 일부만 읽으므로 같은 질량의 덴스 모델보다 빠르게 생성합니다 — 다만 라우팅이 그 이점의 상당 부분을 다시 가져가 버립니다.
모델을 담는 최저가 노드
8 × NVIDIA A100 PCIe, 월 $7,906. 임대할 대상으로 고를 일은 거의 없습니다.
임대할 가치가 있는 모델
4 × NVIDIA B200 SXM6, $11,790 — 비용은 1.5×, 처리량은 2.8×.

요약

전문가 혼합은 각 레이어의 피드포워드 부분을 작은 네트워크 여러 개로 나누고, 토큰마다 그중 몇 개만 거치게 합니다. 공개된 이름에는 두 숫자가 모두 담겨 있습니다: 총 파라미터 수와, 토큰 하나당 활성 파라미터 수입니다. 앞의 숫자는 전부 메모리에 올려야 하고, 뒤의 숫자만 토큰마다 읽으면 됩니다. 이 한 문장이 이 가이드의 전부이며, 이를 거꾸로 이해하는 것이 주문 전에 사람들이 저지르는 가장 값비싼 실수입니다.

그 결과 비용 구조가 기묘한 모델이 탄생합니다: 임대할 때는 거인처럼 굴지만, 돌아갈 때는 중간 크기 모델처럼 움직입니다. 이것이 이득인지 함정인지는 두 숫자 중 어느 쪽이 병목인지에 전적으로 달려 있습니다.

머신 사이징을 하십니까? 총 파라미터를 기준으로 삼으십시오. 다음 토큰에 어떤 전문가가 필요할지 미리 알 수 없으므로, 모든 전문가가 메모리에 상주해야 합니다. 라우팅은 토큰마다, 실행 시점에 결정됩니다.

속도를 추정하시겠습니까? 활성 파라미터 수에서 시작한 다음 큰 폭으로 할인해서 잡으십시오. 생성은 활성 가중치만 읽는다는 것이 핵심이지만 — 라우터, 전문가 디스패치, 카드 간 트래픽은 공짜가 아니고, 노드 규모가 커질수록 확장성이 나빠집니다.

긴 컨텍스트나 많은 사용자를 서빙하십니까? 파라미터 수가 아니라 어텐션 설계를 보십시오. 이 페이지에서 가장 큰 모델들이 토큰당 가장 작은 키/값 캐시를 가지며, 일정 길이를 넘으면 순위가 완전히 뒤집힙니다.

품질만 필요하십니까? 카드 1장에 들어가는 덴스 모델은 카드 8장에 분할된 전문가 혼합보다 운영하기 쉽고 저렴하고 빠릅니다. 이름이 그럴듯해 보인다는 이유가 아니라, 덴스 모델로는 필요한 답이 나오지 않을 때 MoE를 선택하십시오.

아래 계산은 구성 도구가 같은 카탈로그를 대상으로 실행하는 것과 동일합니다. 모델에 필요한 메모리 자체를 아직 계산해 보지 않으셨다면, 그 공식이 먼저입니다 — 이 페이지는 모델이 전문가 혼합일 때 무엇이 달라지는지를 다룹니다.

이름 읽는 법

표기 방식 3가지가 함께 쓰이고 있으며, 셋 다 같은 숫자 2개를 인코딩하고 있다는 점이 이 혼란이 사라지지 않는 이유입니다. 일단 이를 읽을 줄 알게 되면 사이징 문제는 저절로 풀립니다.

235B-A22B총량, 그다음 활성셋 중 가장 명확한 표기. 2350억 파라미터가 메모리에 상주합니다. 그중 220억 파라미터가 토큰마다 읽힙니다. 여기서 A는 활성(active)을 뜻하며, 이 숫자는 무엇을 임대해야 하는지 알려 주지 않는 숫자입니다.
671B-A37B같은 표기법, 더 큰 모델이 크기에서는 격차가 일부러 터무니없는 수준까지 벌어집니다: 활성 비중이 6%가 채 안 됩니다. 37이라는 숫자로는 필요한 머신에 대해 아무것도 알 수 없습니다.
8×22B전문가 수, 그다음 전문가 크기더 오래된 표기 방식이며, 가장 오해를 많이 부르는 방식이기도 합니다. 1760억 파라미터를 뜻하지 않습니다. 어텐션과 임베딩은 전문가마다 복제되지 않고 공유되기 때문입니다. 그렇다고 220억을 뜻하지도 않습니다. 토큰당 활성 전문가가 1개가 아니라 2개이기 때문입니다.
A22B, A37B평균일 뿐, 보장은 아님.활성 파라미터 수는 일반적인 텍스트에서 라우팅에 드는 비용을 나타낼 뿐입니다. 상한이 아닙니다: 토큰이 우연히 많은 전문가에 걸쳐 퍼지는 배치는 모델을 더 많이 건드리게 되고, 이는 실측 처리량이 계산값보다 낮게 나오는 이유 중 하나입니다.
당사 사이징 카탈로그에 있는 전문가 혼합 모델들, 총 파라미터 대 활성 파라미터
모델 총 파라미터 토큰당 활성 활성 비중
Mixtral 8×22B (MoE)56 레이어 141 B 39 B 28 %
Qwen 3 235B-A22B (MoE)94 레이어 235 B 22 B 9 %
DeepSeek V3 671B-A37B (MoE)61 레이어 671 B 37 B 6 %
Llama 3.3 70B덴스, 비교용 70 B 70 B 100 %

기억해야 할 것은 마지막 열입니다. 덴스 모델은 저장한 것을 전부 읽지만, 전문가 혼합은 그중 일부만 읽습니다. 이 모델들의 기이한 특성은 — 좋든 나쁘든 — 전부 이 한 줄에서 나옵니다.

실제로 임대하는 메모리

함정 전체를 표 하나에 담았습니다. 가운데 열은 모델이 머신에서 실제로 필요로 하는 값이고, 그다음 열은 활성 파라미터 숫자를 액면 그대로 받아들인 독자가 예산으로 잡았을 값입니다. 마지막 열은 그 오독에 대한 청구서입니다.

8k 컨텍스트 기준 4비트에서 필요한 VRAM 대 활성 파라미터 수가 암시하는 값
모델 4비트 가중치 필요한 총량 활성 크기 기준이라면 초과분
Mixtral 8×22B (MoE) 71 GB 83 GB8k에서 24 GB 3.4×
Qwen 3 235B-A22B (MoE) 118 GB 137 GB8k에서 14 GB 9.5×
DeepSeek V3 671B-A37B (MoE) 336 GB 386 GB8k에서 22 GB 17.6×

마지막 열은 쇼핑 실수로 읽으십시오. 활성 파라미터 수만 보고 사이징한 사람은 카드 1장을 찾아 나섰다가 결국 노드 전체가 필요하다는 것을 알게 됩니다 — 조금 더 큰 머신이 아니라, 아예 다른 등급의 머신이, 아예 다른 가격에 필요해집니다.

아니요, 사용하지 않는 전문가를 디스크에 남겨 둘 수는 없습니다. 누구나 처음 떠올리는 방법이고, 서빙 스택도 실제로 이를 지원합니다. 문제는 라우팅이 토큰마다 결정된다는 점입니다: 필요한 전문가 집합이 생성되는 단어 하나마다 여러 번 바뀌므로, 일부만 들고 있는 카드는 연산 대신 PCIe로 가중치를 가져오는 데 시간을 씁니다. 그 결과는 조금 느려진 모델이 아니라, 원래 속도의 일부밖에 내지 못하는 모델입니다. 오프로딩은 모델을 담을 수 없는 머신에서 돌아가게 만드는 방법이지, 그것을 서빙하는 방법이 아닙니다.

활성 파라미터로 얻는 것

생성 속도는 메모리 대역폭이 제한합니다: 새 토큰마다 거기에 관여하는 가중치를 다시 읽어야 하기 때문입니다. 전문가 혼합은 활성 슬라이스만 읽으므로, 속도의 상한은 모델 크기가 암시하는 것보다 훨씬 작은 숫자로 정해집니다. 이 부분의 약속만큼은 진짜이며, 이런 모델이 애초에 존재하는 이유이기도 합니다.

아래 표는 모든 모델을 동일한 머신에 올려놓습니다 — 이들 전부를 한꺼번에 담는 카탈로그 내 최저가 노드인 8 × NVIDIA A100 PCIe, 월 $7,906. 서로 다른 머신에서 측정한 처리량 수치를 비교하는 것은 아무 의미가 없습니다.

단일 노드에서 단일 스트림 생성 기준, 전문가 혼합 대 덴스 모델
모델 합계 토큰당 읽기량 예상 초당 토큰
DeepSeek V3 671B-A37B (MoE)전문가 혼합 · 카드 8장에 걸쳐 분할됨 671 B 18.5 GB 37단일 스트림
Llama 3.1 405B덴스 · 카드 8장에 걸쳐 분할됨 405 B 202.5 GB 19단일 스트림
Qwen 3 235B-A22B (MoE)전문가 혼합 · 카드 8장에 걸쳐 분할됨 235 B 11.0 GB 62단일 스트림
Mixtral 8×22B (MoE)전문가 혼합 · 카드 8장에 걸쳐 분할됨 141 B 19.5 GB 35단일 스트림
Llama 3.3 70B덴스 · 카드 1장에 70 B 35.0 GB 25단일 스트림

비교할 가치가 있는 행 2개는 가장 큰 전문가 혼합 모델과 가장 큰 덴스 모델입니다. 둘 다 노드 전체에 분할되기 때문입니다. 전문가 혼합 쪽이 훨씬 더 큰 모델이면서도 여전히 더 빠르게 생성합니다. 토큰마다 자신의 일부만 읽기 때문입니다 — 이것이 바로 이 아키텍처가 존재하는 이유인 절충입니다. 카드 1장에서라고 표시된 행은 다르게 읽으십시오: 그 모델들은 노드에서 카드 1장만 차지하고 나머지 7장은 비워 두므로, 더 느린 머신이 아니라 더 저렴한 머신을 선택할 수 있다는 뜻입니다.

이 수치에는 이미 큰 폭의 페널티가 반영되어 있으며, 그래야 마땅합니다. 활성 파라미터만으로 계산하면 전문가 혼합의 속도를 크게 과대예측합니다. 이 추정기의 첫 버전이 정확히 그런 실수를 저질렀고, 이 페이지에서 가장 큰 모델을 기준으로 공개된 실측치와 약 5배나 어긋났습니다. 라우팅 자체에도 별도의 연산 패스가 들고, 전문가들은 레이어마다 카드 간에 활성화 값을 주고받아야 하며, 배치는 평균이 암시하는 것보다 더 많은 전문가에 걸쳐 퍼집니다. 이제 이 추정기는 선택이 아니라 실측치로 보정한, 의도적으로 보수적인 보정값을 적용합니다 — 그래서 수치가 높게가 아니라 낮게 나옵니다. 여기 나온 모든 숫자는 목표로 삼을 값이 아니라 머신에서 반드시 넘어서야 할 최저선으로 받아들이십시오.

계산이 감추는 두 번째 사실은, 전문가 혼합은 잘 샤딩하기가 더 어렵다는 것입니다. 덴스 모델은 카드 간에 분할되어도 레이어마다 한 번만 동기화하면 되지만, 전문가 혼합은 선택된 전문가를 담은 카드로 토큰을 라우팅까지 해야 하므로, 트래픽 패턴이 다르고 예측하기도 더 어렵습니다. 이런 작업은 몇 안 되는 사례 중 하나로, 인터커넥트가 청구서에 이름만 올리는 것이 아니라 실제로 제값을 하는 경우입니다.

더 저렴해지는 절반

지금까지는 큰 모델에 불리한 이야기만 있었습니다. 이제 보상이 등장할 차례이며, 그것도 다른 비교 자료는 거의 언급하지 않는 큰 보상입니다: 이 페이지에서 파라미터가 가장 많은 모델들이 토큰당 키/값 캐시는 가장 작습니다. 캐시 크기는 어텐션 설계에 따라 정해집니다 — 레이어 수, 키/값 헤드 수, 헤드 차원 — 그리고 어텐션 뒤에 전문가가 몇 개 있는지와는 무관합니다.

토큰당 키/값 캐시, 그리고 각 컨텍스트 길이에서 단일 스트림의 비용
모델 토큰당 캐시 4k 8k 32k 128k
Mixtral 8×22B (MoE)8 KV 헤드 224 KiB 0.9 GB 1.8 GB 7.0 GB 28.0 GB
Qwen 3 235B-A22B (MoE)4 KV 헤드 188 KiB 0.7 GB 1.5 GB 5.9 GB 23.5 GB
DeepSeek V3 671B-A37B (MoE)잠재 어텐션 70 KiB 0.3 GB 0.5 GB 2.2 GB 8.8 GB
Llama 3.3 70B8 KV 헤드 320 KiB 1.3 GB 2.5 GB 10.0 GB 40.0 GB
Llama 3.1 405B8 KV 헤드 504 KiB 2.0 GB 3.9 GB 15.8 GB 63.0 GB

그 열들은 동시 요청 1건당 값입니다. 엔드포인트를 동시에 이용하는 인원수를 곱하면, 머신을 결정하는 것은 가중치보다 마지막 열의 순위 쪽이 훨씬 큽니다.

DeepSeek V3 671B-A37B (MoE) 모델은 목록에서 가장 작은 캐시를 가지며, 토큰당 70 KiB입니다. Llama 3.3 70B 모델의 320 KiB 대비 4.6×배 차이이며, 방향은 더 큰 모델 쪽입니다. 키와 값을 헤드별로 저장하는 대신 작은 공유 잠재 벡터로 투영해 캐시를 압축하는 방식입니다. 그 결과, 불러오는 데 비용이 가장 많이 드는 모델이 계속 가동하는 데는 비용이 가장 적게 드는 모델이 됩니다 — 그래서 긴 컨텍스트에서도 계속 쓸 수 있고, 동시에 서빙하는 사람이 몇 명을 넘어서면 셈법이 뒤집히는 이유이기도 합니다.

실용적으로 풀면 이렇습니다: 가중치는 고정 입장료이고, 캐시는 이용 요금입니다. 전문가 혼합은 어마어마한 입장료를 받은 다음 사용자당 이용 요금은 적게 받습니다. 비슷한 성능의 덴스 모델은 그 반대입니다. 둘 중 어느 쪽이 더 저렴한지는 모델 카드에 적힌 파라미터 수가 아니라 동시성과 컨텍스트 길이로 결정됩니다.

이 모델들을 담는 머신

4비트, 기준 컨텍스트로, 각 모델을 담는 카탈로그 내 최저가 노드를 기준으로 합니다 — 카드 1장이든 노드 전체에 분할되든 상관없습니다. 이는 입장권일 뿐 추천이 아니며, 그 이유는 다음 섹션에서 설명합니다.

각 전문가 혼합 모델을 담는 최저가 임대 구성
모델 실제 필요량 모델을 담는 최저가 노드 월 요금 Tokens/s
Mixtral 8×22B (MoE) 83 GB 4 × NVIDIA L4총 96 GB · 카드당 24 GB $564 4
Qwen 3 235B-A22B (MoE) 137 GB 8 × NVIDIA L4총 192 GB · 카드당 24 GB $1,106 10
DeepSeek V3 671B-A37B (MoE) 386 GB 8 × NVIDIA A100 PCIe총 640 GB · 카드당 80 GB $7,906 37

이들은 모두 예외 없이 멀티 카드 노드이며, 이것이 이 페이지의 정직한 결론입니다: 활성 파라미터 수 때문에 아무리 작아 보이는 모델이라도, 당사 카탈로그에는 이 모델들을 카드 1장에 담는 구성이 하나도 없습니다. 나머지 구성들은 전체 카탈로그에서 확인하실 수 있고, 구성 도구가 직접 보유한 모델과 컨텍스트를 기준으로 똑같은 검사를 해 드립니다.

정답이 아닌 최저가 노드

들어가느냐는 문턱값일 뿐, 목표가 아닙니다. 모델이 노드 전체에 분할되고 나면 처리량은 분할 대상 카드들의 메모리 대역폭에 좌우됩니다 — 그리고 같은 메모리 기준을 통과한 구성이라도 달러당 대역폭은 2배 넘게 차이가 납니다. 아래는 DeepSeek V3 671B-A37B (MoE) 모델을 담는 모든 노드를 가격순으로 나열한 것이며, 정말 중요한 열은 오른쪽에 있습니다.

DeepSeek V3 671B-A37B (MoE) 모델을 담는 모든 노드, 그리고 초당 토큰 1개당 월 요금
구성 VRAM 월 요금 Tokens/s $/token/s
8 × NVIDIA A100 PCIeGN-A10080×8 640 GB $7,906 37 $213.68
8 × NVIDIA A100 SXM4GN-A100SXM×8 640 GB $8,355 39 $214.23
4 × NVIDIA H200 SXM5GN-H200×4 564 GB $8,405 62 $135.56
8 × NVIDIA H100 PCIeGN-H100PCIE×8 640 GB $10,568 38 $278.11
8 × NVIDIA H100 SXM5GN-H100SXM×8 640 GB $11,509 64 $179.83
4 × NVIDIA B200 SXM6GN-B200×4 720 GB $11,790 103 $114.47
8 × NVIDIA H200 SXM5GN-H200×8 1128 GB $15,945 91 $175.22
8 × NVIDIA B200 SXM6GN-B200×8 1440 GB $22,351 152 $147.05

녹색 셀이 목록에서 가장 가성비가 좋은 항목이며, 가장 저렴한 행은 아닙니다. $7,906 노드에서 $11,790 노드로 옮기면 청구액은 1.5×배, 처리량은 2.8×배가 됩니다 — 더 많이 내지만 토큰 하나당 비용은 오히려 줄어듭니다. 카탈로그를 가격순으로 정렬해 맨 처음 들어가는 머신을 고르면, 서빙 예산을 두 번 쓰게 됩니다.

그 열에는 유의할 점이 하나 있고, 이는 앞으로 보게 될 모든 처리량 대비 가격 표에 똑같이 적용됩니다: 단일 스트림 생성 기준이라는 점입니다. 연속 배칭을 적용하면 합산 처리량은 모든 행에서 몇 배씩 뛰어오르며, 그 배수는 행마다 다릅니다 — 가중치를 올리고 남는 메모리가 많은 노드일수록 동시 시퀀스를 더 많이 담을 수 있기 때문입니다. 순위는 안정적이지만 절대 수치는 보수적으로 잡은 값입니다. 그 합산치의 경제성은 별도로 다룹니다.

전문가 혼합이 정답인 경우

순서대로 읽으십시오. 자신에게 해당하는 첫 줄에서 멈추십시오.

  1. 카드 1장에 들어가는 덴스 모델로 충분합니다. 그렇다면 그것을 선택하고 뒤돌아보지 마십시오. 카드 1장이면 샤딩도, 인터커넥트 문제도, 전문가 라우팅 트래픽도 없고, 머신 비용은 노드의 일부에 불과합니다. 프런티어급 오픈 모델이 필요하다고 생각하는 제품 대부분은 실제로는 우수한 32B 모델이면 충분합니다.
  2. 품질이 필요하고 컨텍스트가 깁니다. 이런 경우에는 전문가 혼합이 실제로 가장 좋은 도구입니다: 가중치 비용은 한 번만 지불하면 되고, 캐시가 작으므로 머신이 긴 대화를 서빙하다가 멈추는 일이 없습니다. 노드는 가중치를 기준으로 사이징한 다음, 실제 컨텍스트에 맞춰 캐시 표를 확인하십시오.
  3. 품질이 필요하고 동시에 많은 사람을 서빙합니다. 답도 같고 이유도 같으며, 동시성이 커질수록 이점도 커집니다. 고정 비용은 모든 스트림에 분산되는 반면 스트림당 비용은 낮게 유지됩니다.
  4. 품질은 필요하지만 가끔만 씁니다. 이 경우에는 일주일에 몇 시간 가동 상태를 유지하려고 대형 노드를 임대하는 셈이 되며, 월 단위 계약을 가장 나쁘게 쓰는 방법입니다. 작업을 배치로 묶어서 한 번에 처리하거나, 이 작업만큼은 호스팅 엔드포인트를 쓰고 자체 머신은 꾸준한 부하를 위해 남겨 두십시오.
  5. 파인튜닝이 목표입니다. 문제 자체가 다르고 머신도 더 커집니다: 학습은 모든 전문가를 건드리고 그 전부에 대한 옵티마이저 상태가 필요하므로, 추론을 까다롭게 만들었던 메모리 문제가 이번에는 감당할 수 없는 수준이 됩니다. 거의 모든 사람에게 현실적인 경로는 덴스 모델에 어댑터 파인튜닝을 적용하는 것입니다.

어느 줄에서 멈추셨든, 가장 먼저 확인할 숫자는 서빙하려는 정밀도 기준의 총 파라미터 수입니다. 이 페이지의 나머지 전부 — 속도, 캐시, 초당 토큰당 가격 — 는 모델이 메모리에 상주한 뒤에야 의미가 생깁니다. 구성 도구는 당사가 임대하는 모든 노드를 대상으로 전체 검사를 수행하며, 위의 표들과 똑같은 라우팅 보정을 처리량 추정치에 적용합니다. 메모리 계산을 먼저 전체적으로 보고 싶으시다면 별도의 가이드가 있고, 아직 숫자 형식을 정하지 못하셨다면 그 선택이 이보다 먼저입니다.

사용 중인 전문가 혼합 모델이 실제 머신에 맞는지 확인해 보십시오.

구성 도구는 당사가 임대하는 모든 노드 정보를 담고 있고, 이 페이지와 같은 계산을 적용하며, 결제하기 전에 어느 노드가 해당 모델을 담는지 알려 줍니다.

로그인

콘솔, 청구서, 대역 외 접근.

계정이 없으십니까?

별도의 회원가입은 없습니다. 첫 주문을 진행하는 동안 계정이 만들어집니다 — 결제 단계에서 이메일과 비밀번호를 직접 정하시고, 머신이 준비될 때쯤이면 콘솔도 이미 열려 있습니다.

서버 구성하기

Language