전문가 혼합에 실제로 드는 비용.
“235B-A22B”와 같은 이름에는 숫자가 두 개 들어 있으며, 대다수는 엉뚱한 쪽을 읽습니다. 하나는 무엇을 임대해야 하는지를 결정하고, 다른 하나는 응답 속도를 결정합니다. 둘의 차이가 10배에 달할 수도 있습니다.
짧은 답
- 머신을 결정하는 총 파라미터
- DeepSeek V3 671B-A37B (MoE) 모델은 4비트에서 8k 컨텍스트 기준으로 386 GB가 필요합니다. 활성 파라미터 크기만 한 덴스 모델이라면 22 GB가 필요합니다 — 17.6× 더 적습니다.
- 속도를 결정하는 활성 파라미터
- 토큰마다 가중치의 일부만 읽으므로 같은 질량의 덴스 모델보다 빠르게 생성합니다 — 다만 라우팅이 그 이점의 상당 부분을 다시 가져가 버립니다.
- 모델을 담는 최저가 노드
- 8 × NVIDIA A100 PCIe, 월 $7,906. 임대할 대상으로 고를 일은 거의 없습니다.
- 임대할 가치가 있는 모델
- 4 × NVIDIA B200 SXM6, $11,790 — 비용은 1.5×, 처리량은 2.8×.
요약
전문가 혼합은 각 레이어의 피드포워드 부분을 작은 네트워크 여러 개로 나누고, 토큰마다 그중 몇 개만 거치게 합니다. 공개된 이름에는 두 숫자가 모두 담겨 있습니다: 총 파라미터 수와, 토큰 하나당 활성 파라미터 수입니다. 앞의 숫자는 전부 메모리에 올려야 하고, 뒤의 숫자만 토큰마다 읽으면 됩니다. 이 한 문장이 이 가이드의 전부이며, 이를 거꾸로 이해하는 것이 주문 전에 사람들이 저지르는 가장 값비싼 실수입니다.
그 결과 비용 구조가 기묘한 모델이 탄생합니다: 임대할 때는 거인처럼 굴지만, 돌아갈 때는 중간 크기 모델처럼 움직입니다. 이것이 이득인지 함정인지는 두 숫자 중 어느 쪽이 병목인지에 전적으로 달려 있습니다.
머신 사이징을 하십니까? 총 파라미터를 기준으로 삼으십시오. 다음 토큰에 어떤 전문가가 필요할지 미리 알 수 없으므로, 모든 전문가가 메모리에 상주해야 합니다. 라우팅은 토큰마다, 실행 시점에 결정됩니다.
속도를 추정하시겠습니까? 활성 파라미터 수에서 시작한 다음 큰 폭으로 할인해서 잡으십시오. 생성은 활성 가중치만 읽는다는 것이 핵심이지만 — 라우터, 전문가 디스패치, 카드 간 트래픽은 공짜가 아니고, 노드 규모가 커질수록 확장성이 나빠집니다.
긴 컨텍스트나 많은 사용자를 서빙하십니까? 파라미터 수가 아니라 어텐션 설계를 보십시오. 이 페이지에서 가장 큰 모델들이 토큰당 가장 작은 키/값 캐시를 가지며, 일정 길이를 넘으면 순위가 완전히 뒤집힙니다.
품질만 필요하십니까? 카드 1장에 들어가는 덴스 모델은 카드 8장에 분할된 전문가 혼합보다 운영하기 쉽고 저렴하고 빠릅니다. 이름이 그럴듯해 보인다는 이유가 아니라, 덴스 모델로는 필요한 답이 나오지 않을 때 MoE를 선택하십시오.
아래 계산은 구성 도구가 같은 카탈로그를 대상으로 실행하는 것과 동일합니다. 모델에 필요한 메모리 자체를 아직 계산해 보지 않으셨다면, 그 공식이 먼저입니다 — 이 페이지는 모델이 전문가 혼합일 때 무엇이 달라지는지를 다룹니다.
이름 읽는 법
표기 방식 3가지가 함께 쓰이고 있으며, 셋 다 같은 숫자 2개를 인코딩하고 있다는 점이 이 혼란이 사라지지 않는 이유입니다. 일단 이를 읽을 줄 알게 되면 사이징 문제는 저절로 풀립니다.
| 모델 | 총 파라미터 | 토큰당 활성 | 활성 비중 |
|---|---|---|---|
| Mixtral 8×22B (MoE) | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) | 671 B | 37 B | 6 % |
| Llama 3.3 70B | 70 B | 70 B | 100 % |
기억해야 할 것은 마지막 열입니다. 덴스 모델은 저장한 것을 전부 읽지만, 전문가 혼합은 그중 일부만 읽습니다. 이 모델들의 기이한 특성은 — 좋든 나쁘든 — 전부 이 한 줄에서 나옵니다.
실제로 임대하는 메모리
함정 전체를 표 하나에 담았습니다. 가운데 열은 모델이 머신에서 실제로 필요로 하는 값이고, 그다음 열은 활성 파라미터 숫자를 액면 그대로 받아들인 독자가 예산으로 잡았을 값입니다. 마지막 열은 그 오독에 대한 청구서입니다.
| 모델 | 4비트 가중치 | 필요한 총량 | 활성 크기 기준이라면 | 초과분 |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB | 22 GB | 17.6× |
마지막 열은 쇼핑 실수로 읽으십시오. 활성 파라미터 수만 보고 사이징한 사람은 카드 1장을 찾아 나섰다가 결국 노드 전체가 필요하다는 것을 알게 됩니다 — 조금 더 큰 머신이 아니라, 아예 다른 등급의 머신이, 아예 다른 가격에 필요해집니다.
활성 파라미터로 얻는 것
생성 속도는 메모리 대역폭이 제한합니다: 새 토큰마다 거기에 관여하는 가중치를 다시 읽어야 하기 때문입니다. 전문가 혼합은 활성 슬라이스만 읽으므로, 속도의 상한은 모델 크기가 암시하는 것보다 훨씬 작은 숫자로 정해집니다. 이 부분의 약속만큼은 진짜이며, 이런 모델이 애초에 존재하는 이유이기도 합니다.
아래 표는 모든 모델을 동일한 머신에 올려놓습니다 — 이들 전부를 한꺼번에 담는 카탈로그 내 최저가 노드인 8 × NVIDIA A100 PCIe, 월 $7,906. 서로 다른 머신에서 측정한 처리량 수치를 비교하는 것은 아무 의미가 없습니다.
| 모델 | 합계 | 토큰당 읽기량 | 예상 초당 토큰 |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) | 671 B | 18.5 GB | 37 |
| Llama 3.1 405B | 405 B | 202.5 GB | 19 |
| Qwen 3 235B-A22B (MoE) | 235 B | 11.0 GB | 62 |
| Mixtral 8×22B (MoE) | 141 B | 19.5 GB | 35 |
| Llama 3.3 70B | 70 B | 35.0 GB | 25 |
비교할 가치가 있는 행 2개는 가장 큰 전문가 혼합 모델과 가장 큰 덴스 모델입니다. 둘 다 노드 전체에 분할되기 때문입니다. 전문가 혼합 쪽이 훨씬 더 큰 모델이면서도 여전히 더 빠르게 생성합니다. 토큰마다 자신의 일부만 읽기 때문입니다 — 이것이 바로 이 아키텍처가 존재하는 이유인 절충입니다. 카드 1장에서라고 표시된 행은 다르게 읽으십시오: 그 모델들은 노드에서 카드 1장만 차지하고 나머지 7장은 비워 두므로, 더 느린 머신이 아니라 더 저렴한 머신을 선택할 수 있다는 뜻입니다.
계산이 감추는 두 번째 사실은, 전문가 혼합은 잘 샤딩하기가 더 어렵다는 것입니다. 덴스 모델은 카드 간에 분할되어도 레이어마다 한 번만 동기화하면 되지만, 전문가 혼합은 선택된 전문가를 담은 카드로 토큰을 라우팅까지 해야 하므로, 트래픽 패턴이 다르고 예측하기도 더 어렵습니다. 이런 작업은 몇 안 되는 사례 중 하나로, 인터커넥트가 청구서에 이름만 올리는 것이 아니라 실제로 제값을 하는 경우입니다.
더 저렴해지는 절반
지금까지는 큰 모델에 불리한 이야기만 있었습니다. 이제 보상이 등장할 차례이며, 그것도 다른 비교 자료는 거의 언급하지 않는 큰 보상입니다: 이 페이지에서 파라미터가 가장 많은 모델들이 토큰당 키/값 캐시는 가장 작습니다. 캐시 크기는 어텐션 설계에 따라 정해집니다 — 레이어 수, 키/값 헤드 수, 헤드 차원 — 그리고 어텐션 뒤에 전문가가 몇 개 있는지와는 무관합니다.
| 모델 | 토큰당 캐시 | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |
그 열들은 동시 요청 1건당 값입니다. 엔드포인트를 동시에 이용하는 인원수를 곱하면, 머신을 결정하는 것은 가중치보다 마지막 열의 순위 쪽이 훨씬 큽니다.
실용적으로 풀면 이렇습니다: 가중치는 고정 입장료이고, 캐시는 이용 요금입니다. 전문가 혼합은 어마어마한 입장료를 받은 다음 사용자당 이용 요금은 적게 받습니다. 비슷한 성능의 덴스 모델은 그 반대입니다. 둘 중 어느 쪽이 더 저렴한지는 모델 카드에 적힌 파라미터 수가 아니라 동시성과 컨텍스트 길이로 결정됩니다.
이 모델들을 담는 머신
4비트, 기준 컨텍스트로, 각 모델을 담는 카탈로그 내 최저가 노드를 기준으로 합니다 — 카드 1장이든 노드 전체에 분할되든 상관없습니다. 이는 입장권일 뿐 추천이 아니며, 그 이유는 다음 섹션에서 설명합니다.
| 모델 | 실제 필요량 | 모델을 담는 최저가 노드 | 월 요금 | Tokens/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | 4 × NVIDIA L4 | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | 8 × NVIDIA L4 | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | 8 × NVIDIA A100 PCIe | $7,906 | 37 |
이들은 모두 예외 없이 멀티 카드 노드이며, 이것이 이 페이지의 정직한 결론입니다: 활성 파라미터 수 때문에 아무리 작아 보이는 모델이라도, 당사 카탈로그에는 이 모델들을 카드 1장에 담는 구성이 하나도 없습니다. 나머지 구성들은 전체 카탈로그에서 확인하실 수 있고, 구성 도구가 직접 보유한 모델과 컨텍스트를 기준으로 똑같은 검사를 해 드립니다.
정답이 아닌 최저가 노드
들어가느냐는 문턱값일 뿐, 목표가 아닙니다. 모델이 노드 전체에 분할되고 나면 처리량은 분할 대상 카드들의 메모리 대역폭에 좌우됩니다 — 그리고 같은 메모리 기준을 통과한 구성이라도 달러당 대역폭은 2배 넘게 차이가 납니다. 아래는 DeepSeek V3 671B-A37B (MoE) 모델을 담는 모든 노드를 가격순으로 나열한 것이며, 정말 중요한 열은 오른쪽에 있습니다.
| 구성 | VRAM | 월 요금 | Tokens/s | $/token/s |
|---|---|---|---|---|
| 8 × NVIDIA A100 PCIe | 640 GB | $7,906 | 37 | $213.68 |
| 8 × NVIDIA A100 SXM4 | 640 GB | $8,355 | 39 | $214.23 |
| 4 × NVIDIA H200 SXM5 | 564 GB | $8,405 | 62 | $135.56 |
| 8 × NVIDIA H100 PCIe | 640 GB | $10,568 | 38 | $278.11 |
| 8 × NVIDIA H100 SXM5 | 640 GB | $11,509 | 64 | $179.83 |
| 4 × NVIDIA B200 SXM6 | 720 GB | $11,790 | 103 | $114.47 |
| 8 × NVIDIA H200 SXM5 | 1128 GB | $15,945 | 91 | $175.22 |
| 8 × NVIDIA B200 SXM6 | 1440 GB | $22,351 | 152 | $147.05 |
녹색 셀이 목록에서 가장 가성비가 좋은 항목이며, 가장 저렴한 행은 아닙니다. $7,906 노드에서 $11,790 노드로 옮기면 청구액은 1.5×배, 처리량은 2.8×배가 됩니다 — 더 많이 내지만 토큰 하나당 비용은 오히려 줄어듭니다. 카탈로그를 가격순으로 정렬해 맨 처음 들어가는 머신을 고르면, 서빙 예산을 두 번 쓰게 됩니다.
그 열에는 유의할 점이 하나 있고, 이는 앞으로 보게 될 모든 처리량 대비 가격 표에 똑같이 적용됩니다: 단일 스트림 생성 기준이라는 점입니다. 연속 배칭을 적용하면 합산 처리량은 모든 행에서 몇 배씩 뛰어오르며, 그 배수는 행마다 다릅니다 — 가중치를 올리고 남는 메모리가 많은 노드일수록 동시 시퀀스를 더 많이 담을 수 있기 때문입니다. 순위는 안정적이지만 절대 수치는 보수적으로 잡은 값입니다. 그 합산치의 경제성은 별도로 다룹니다.
전문가 혼합이 정답인 경우
순서대로 읽으십시오. 자신에게 해당하는 첫 줄에서 멈추십시오.
- 카드 1장에 들어가는 덴스 모델로 충분합니다. 그렇다면 그것을 선택하고 뒤돌아보지 마십시오. 카드 1장이면 샤딩도, 인터커넥트 문제도, 전문가 라우팅 트래픽도 없고, 머신 비용은 노드의 일부에 불과합니다. 프런티어급 오픈 모델이 필요하다고 생각하는 제품 대부분은 실제로는 우수한 32B 모델이면 충분합니다.
- 품질이 필요하고 컨텍스트가 깁니다. 이런 경우에는 전문가 혼합이 실제로 가장 좋은 도구입니다: 가중치 비용은 한 번만 지불하면 되고, 캐시가 작으므로 머신이 긴 대화를 서빙하다가 멈추는 일이 없습니다. 노드는 가중치를 기준으로 사이징한 다음, 실제 컨텍스트에 맞춰 캐시 표를 확인하십시오.
- 품질이 필요하고 동시에 많은 사람을 서빙합니다. 답도 같고 이유도 같으며, 동시성이 커질수록 이점도 커집니다. 고정 비용은 모든 스트림에 분산되는 반면 스트림당 비용은 낮게 유지됩니다.
- 품질은 필요하지만 가끔만 씁니다. 이 경우에는 일주일에 몇 시간 가동 상태를 유지하려고 대형 노드를 임대하는 셈이 되며, 월 단위 계약을 가장 나쁘게 쓰는 방법입니다. 작업을 배치로 묶어서 한 번에 처리하거나, 이 작업만큼은 호스팅 엔드포인트를 쓰고 자체 머신은 꾸준한 부하를 위해 남겨 두십시오.
- 파인튜닝이 목표입니다. 문제 자체가 다르고 머신도 더 커집니다: 학습은 모든 전문가를 건드리고 그 전부에 대한 옵티마이저 상태가 필요하므로, 추론을 까다롭게 만들었던 메모리 문제가 이번에는 감당할 수 없는 수준이 됩니다. 거의 모든 사람에게 현실적인 경로는 덴스 모델에 어댑터 파인튜닝을 적용하는 것입니다.
어느 줄에서 멈추셨든, 가장 먼저 확인할 숫자는 서빙하려는 정밀도 기준의 총 파라미터 수입니다. 이 페이지의 나머지 전부 — 속도, 캐시, 초당 토큰당 가격 — 는 모델이 메모리에 상주한 뒤에야 의미가 생깁니다. 구성 도구는 당사가 임대하는 모든 노드를 대상으로 전체 검사를 수행하며, 위의 표들과 똑같은 라우팅 보정을 처리량 추정치에 적용합니다. 메모리 계산을 먼저 전체적으로 보고 싶으시다면 별도의 가이드가 있고, 아직 숫자 형식을 정하지 못하셨다면 그 선택이 이보다 먼저입니다.
다른 가이드
- 비용 · 6분
월 단위 임대가 시간 단위보다 유리한 경우
실제 숫자로 계산한 손익분기점, 시간 단위 가격이 청구서 전까지 감추는 비용 3가지, 그리고 추정치를 3배로 부풀리는 유휴 시간의 함정.
가이드 읽기 - 비용 · 9분
자체 호스팅 대 토큰당 과금 API
토큰당 과금 API와 GPU 임대 사이의 손익분기점을 당사의 실제 가격과 처리량으로 계산했습니다 — 그리고 그 계산이 빠뜨리는 4가지.
가이드 읽기 - 실전 · 11분
노드 1개로 Llama 3.3 70B 서빙
제공받은 머신에서 OpenAI 호환 엔드포인트까지, 중요한 플래그와 처리량을 조용히 절반으로 떨어뜨리는 두 가지 플래그.
가이드 읽기