사이징 가이드 · 10분 분량

# 실제로 실행할 양자화 포맷.

서빙 스택은 무엇보다 먼저 숫자 포맷을 묻고, 그 답에 따라 월 청구액이 8배까지 달라집니다. 가중치가 가장 작은 포맷이 언제나 가장 작은 모델을 주는 것은 아닙니다.

짧은 답

- **경험칙:** 가중치는 이름에 적힌 비율만큼 정확히 줄어듭니다 — BF16 / FP16 **2 B/param** · FP8 **1 B/param** · 4-bit (AWQ, GPTQ) **0.5 B/param**. 그 밖의 것은 줄지 않습니다.
- **그 값어치:** Qwen 3 32B 모델은 전체 정밀도에서 월 **$1,091**의 [NVIDIA A100 PCIe](https://gpuserver.io/ko/gpu/a100-80gb) 머신이 필요하고, 4비트에서는 월 **$125**의 [NVIDIA L4](https://gpuserver.io/ko/gpu/nvidia-l4) 머신이 필요합니다. 같은 모델, 같은 컨텍스트.
- **함정:** 키/값 캐시는 가중치를 따라 줄어들지 않습니다. 128k 컨텍스트에서 4비트 Llama 3.3 70B 모델은 **53 %**가 캐시이고 가중치는 47 %에 불과합니다.
- **4비트가 완전히 지는 지점:** Llama 3.1 8B 모델은 128k에서 4비트로 **23.0 GB**, FP8로 **18.4 GB** — 메모리는 더 쓰고 품질은 더 낮음

## 여기서 시작

이 페이지의 대부분은 계산이므로 결론을 먼저 적습니다. 질문 4가지가 포맷을 정하며, 각 질문이 단독으로 논의를 끝낼 수 있기 때문에 이 순서로 묻습니다.

**모델이 이미 전체 정밀도로 들어가고 컨텍스트를 넣을 여유도 있습니까?** BF16으로 구동하시고 여기서 읽기를 멈추십시오. 양자화는 더 작은 머신을 사기 위한 수단인데, 이미 제대로 도는 머신을 확보하신 것입니다. 들어가는 모델을 압축한다고 상이 주어지지는 않습니다.

**컨텍스트가 짧고 모델이 큽니까?** 4비트가 명성을 얻는 지점이 바로 여기입니다. 메모리는 가중치가 지배하므로, 가중치를 4분의 1로 줄이는 것은 머신을 4분의 1로 줄이는 것에 가깝습니다.

**컨텍스트가 길고 모델이 작습니까?** FP8 지원 카드에서 FP8 포맷을 쓰십시오. FP8 포맷은 가중치뿐 아니라 캐시도 절반으로 줄이고, 일정 길이를 넘어서면 중요한 것은 그 두 번째 절감입니다 — 아래 표는 FP8 포맷이 4비트를 앞지르는 정확한 지점을 보여 줍니다.

**머신 1대에서 한 사람에게만 서빙합니까?** Ollama를 통한 GGUF가 압도적으로 손이 덜 가며, 포기하는 처리량은 혼자 쓰는 사용자라면 애초에 쓸 일이 없던 처리량입니다.

이후의 내용은 그 답 4가지가 왜 그렇게 나오는지 설명하고, 당사 모델이 아니라 고객의 모델에 대고 확인할 수 있는 수치를 제공합니다. 모델에 메모리가 얼마나 필요한지 아직 계산하지 않으셨다면 그 계산은 [별도의 가이드](https://gpuserver.io/ko/guides/vram-sizing)이고, 그것이 먼저입니다.

## 포맷 3가지, 이름 4가지

서빙에 흔히 쓰이는 숫자 포맷은 3가지뿐이며, 이들은 한 가지 점에서만 다릅니다: 파라미터 하나가 몇 바이트를 차지하는가입니다. 그 밖의 것은 — AWQ, GPTQ, GGUF, bitsandbytes — 모두 이 3가지 중 하나를 만들어 내는 방법이지, 네 번째 포맷이 아닙니다.

**숫자 포맷 3가지와 각 바이트 수치가 적용되는 대상**

| 포맷 | 가중치당 바이트 | 캐시 요소당 바이트 | 용도 |
|---|---|---|---|
| BF16 / FP16 공개된 그대로의 가중치 | 2 | 2 | 레퍼런스 품질 |
| FP8 서빙 스택이 직접 생성 | 1 | 1 | 레퍼런스급, Hopper와 Blackwell |
| 4-bit (AWQ, GPTQ) 미리 준비된 체크포인트 | 0.5 | 2 | 가장 작은 가중치, 캐시는 FP16 유지 |

숫자 열 2개를 한 쌍으로 읽으십시오. 앞의 행 2개에서는 값이 같지만 세 번째 행에서는 같지 *않으며*, 이 비대칭 하나가 이 페이지 아래쪽에서 나오는 의외의 결과 대부분을 만들어 냅니다.

모델 저장소에서 실제로 마주치는 이름 4개는 그 표에 다음과 같이 대응합니다.

### AWQ와 GPTQ

같은 4비트 목적지로 가는 두 갈래 길입니다. AWQ는 활성화 값을 관찰해 어떤 가중치가 중요한지 정하고 그 가중치를 보호합니다. GPTQ는 레이어 단위로 압축하면서 그때그때 오차를 보정합니다. 둘 다 vLLM과 SGLang이 그대로 불러들이는 체크포인트를 만들며, 어떤 모델에서든 둘 사이의 차이는 둘 중 어느 하나와 16비트 사이의 차이보다 작습니다.

### GGUF

llama.cpp 계열이며, Ollama가 내부에서 쓰는 것이기도 합니다. 단일 방식이라기보다 컨테이너입니다: 파일 하나가 12가지 정밀도 중 어느 것으로든 가중치를 담고, 카드가 너무 작으면 레이어를 시스템 RAM으로 흘려보냅니다. 머신 1대에서 사용자 1명이 쓰기에는 따라올 상대가 없고, 실제 동시 요청 환경에서는 3가지 중 가장 약합니다.

### FP8

체크포인트 포맷이라기보다 모드에 가깝습니다. 서빙 스택에 16비트 가중치를 주면 불러오면서 FP8로 캐스팅하며, 별도 다운로드도 캘리브레이션 과정도 없습니다. 4개 중 캐시까지 압축할 수 있는 유일한 포맷이고, 그래서 아래에서 예상 밖의 자리에 등장합니다.

### BF16과 FP16

제작자가 공개한 그대로의 가중치이며, 다른 모든 행을 재는 기준입니다. 파라미터당 2바이트, 캘리브레이션 세트 없음, 확인할 커널 지원 없음, 다툴 품질 문제 없음. 들어가기만 한다면 이것이 정답이고, 이 페이지의 나머지는 곁가지입니다.

각각을 요청하는 데는 플래그 하나면 됩니다. [vLLM 가이드](https://gpuserver.io/ko/guides/serve-llama-70b)가 길게 다루는 것과 같은 옵션입니다. 여기서 말하려는 것은 그 차이가 얼마나 짧은가 하는 점뿐입니다.

같은 서버, 4가지 방식

```
# 1. Reference. The weights as published, nothing to prepare.
$ vllm serve meta-llama/Llama-3.3-70B-Instruct --dtype bfloat16

# 2. FP8, quantised while it loads. No second download, no calibration.
#    --kv-cache-dtype is the half everyone forgets: it is what
#    halves the CACHE as well as the weights.
$ vllm serve meta-llama/Llama-3.3-70B-Instruct \
    --quantization fp8 --kv-cache-dtype fp8

# 3. Four-bit AWQ. A DIFFERENT checkpoint, prepared by someone else.
$ vllm serve casperhansen/llama-3.3-70b-instruct-awq \
    --quantization awq_marlin

# 4. Four-bit GPTQ. Same idea, different repository and flag.
$ vllm serve TechxGenus/Llama-3.3-70B-Instruct-GPTQ \
    --quantization gptq_marlin
```

## 줄어들지 않는 절반

가중치를 4 비트로 양자화해도 키/값 캐시는 양자화되지 않습니다. AWQ와 GPTQ는 가중치만, 오직 가중치만 압축합니다. FP8 캐시를 따로 요청하지 않는 한 캐시는 16 비트로 남고, 4비트 체크포인트에서 그렇게 요청하는 사람은 사실상 없습니다. 위 표의 세 번째 열이 그것이며, 아래 계산이 누구의 예상과도 다르게 흘러가는 이유이기도 합니다.

그 결과는 모델 하나로 보면 가장 잘 드러납니다. 아래는 [구성 도구](https://gpuserver.io/ko/configure)가 제공하는 각 컨텍스트 길이에서 4비트로 돌린 Llama 3.3 70B 모델입니다 — 가중치 대 캐시.

**컨텍스트 길이별 4비트 70B 모델의 가중치와 캐시**

| 컨텍스트 | 가중치 | KV 캐시 | 캐시 비중 |
|---|---|---|---|
| 4k 토큰 | 35.0 GB | 1.3 GB | 3 % |
| 8k 토큰 | 35.0 GB | 2.5 GB | 7 % |
| 32k 토큰 | 35.0 GB | 10.0 GB | 22 % |
| 128k 토큰 | 35.0 GB | 40.0 GB | 53 % |

가중치 열은 전혀 움직이지 않습니다 — 양자화하는 목적이 바로 그것입니다. 캐시 열은 컨텍스트에 따라 선형으로 늘어나, 마지막 행에서는 그 캐시가 속한 모델보다 커집니다.

**128k에서 4비트 Llama 3.3 70B 모델은 53 %가 캐시입니다.** 가중치를 4분의 1 크기로 양자화했는데도 필요한 머신은 거의 달라지지 않았습니다. 이미 문제가 아니게 된 쪽을 압축했기 때문입니다. 가중치 수치만 보고 긴 컨텍스트 배포를 사이징하면 필요량보다 절반 이상 적게 주문하게 됩니다.

이를 충분히 밀어붙이면 4비트는 아예 우위를 잃습니다. FP8 포맷은 양쪽 절반을 모두 반으로 줄입니다. 4비트는 한쪽 절반만 4분의 1로 줄이고 나머지 절반은 그대로 둡니다. 그래서 모델마다 둘이 교차하는 컨텍스트 길이가 있고, 모델이 작을수록 그 지점이 일찍 옵니다 — 작은 모델은 아낄 가중치가 적은 반면 토큰당 캐시 증가량은 같기 때문입니다.

**모델별·컨텍스트 길이별 FP8 대 4비트 총 메모리**

| 모델 | 4k | 8k | 32k | 128k |
|---|---|---|---|---|
| Llama 3.1 8B 8 B 파라미터 · 32 레이어 · 8 KV 헤드 | 5.24비트 우세, 4.3 GB 차 | 5.84비트 우세, 4.0 GB 차 | 9.24비트 우세, 2.3 GB 차 | 23.0FP8 우세 — 18.4 GB |
| Qwen 3 32B 32 B 파라미터 · 64 레이어 · 8 KV 헤드 | 19.54비트 우세, 17.8 GB 차 | 20.74비트 우세, 17.2 GB 차 | 27.64비트 우세, 13.8 GB 차 | 55.2동률 |
| Llama 3.3 70B 70 B 파라미터 · 80 레이어 · 8 KV 헤드 | 41.74비트 우세, 39.5 GB 차 | 43.14비트 우세, 38.8 GB 차 | 51.74비트 우세, 34.5 GB 차 | 86.34비트 우세, 17.2 GB 차 |

단위: GB. 포맷 2가지 중 더 작은 쪽의 값이고, 아래에 진 쪽의 이름을 적었습니다. 왼쪽에서 오른쪽으로 읽으면서, 컨텍스트가 길어질수록 4비트 열의 우위가 빠져나가는 것을 확인하십시오.

마지막 행은 어디서나 우위를 지킵니다. 700억 파라미터쯤 되면 아낄 가중치가 대단히 많기 때문입니다. 가운데 행은 무승부로 끝납니다: 128k에서 Qwen 3 32B 모델은 어느 포맷에서도 비용이 정확히 같고, 품질을 생각하면 FP8 포맷을 고르게 됩니다. 그리고 첫 행은 완전히 역전되며 at 128k, 그 지점에서 4비트는 FP8보다 *더* 많은 메모리를 요구하면서 충실도는 둘 중 더 낮습니다. 이 조합은 — 메모리는 더 쓰고 출력은 더 나쁩니다 — 당사가 목격하는 가장 흔한 양자화 실수이며, 가중치 파일 크기만 들여다보고 있으면 보이지 않습니다.

## 카드가 실제로 할 수 있는 것

FP8 포맷은 소프트웨어 기능이기에 앞서 하드웨어 기능입니다. 텐서 코어가 이 포맷을 알아듣지 못하는 카드도 FP8 체크포인트를 불러오기는 합니다 — 스택이 곱셈으로 넘어가는 길에 가중치를 16 비트로 풀어 놓습니다 — 그러나 다운로드 용량 절감만 남고 속도 이득은 전혀 없으며, FP8 캐시는 아예 쓸 수 없습니다. 4비트는 그 반대입니다: 어차피 계산 전에 가중치를 16 비트로 풀기 때문에 어디서나 돌아갑니다.

**세대별 카탈로그 카드와 FP8 지원 여부**

| 생성 | 당사가 임대하는 카드 | FP8 |
|---|---|---|
| Ampere | NVIDIA RTX A6000 48GB, NVIDIA A100 PCIe 40GB, NVIDIA A100 PCIe 80GB, NVIDIA A100 SXM4 80GB | 하드웨어 지원 없음 — 16비트로 풀어서 처리 |
| Ada Lovelace | NVIDIA L4 24GB, NVIDIA RTX 4090 24GB, NVIDIA L40S 48GB | 텐서 코어에서 지원 — 가중치와 캐시 |
| Hopper | NVIDIA H100 PCIe 80GB, NVIDIA H100 SXM5 80GB, NVIDIA H200 SXM5 141GB | 텐서 코어에서 지원 — 가중치와 캐시 |
| Blackwell | NVIDIA RTX 5090 32GB, NVIDIA B200 SXM6 180GB | 텐서 코어에서 지원 — 가중치와 캐시 |

그 열은 실리콘을 설명하는 것이고, FP8 포맷을 쓰기에 좋은 곳이 어디인가 하는 질문과는 조금 다릅니다. 카탈로그가 이 포맷에 붙인 설명은 Hopper and Blackwell 세대를 지목하는데, 이는 텐서 코어보다 서빙 스택에 관한 이야기입니다: FP8 커널과 FP8 캐시가 가장 많이 쓰였고 의외의 문제가 가장 적었던 세대라는 뜻입니다. Ada Lovelace에서도 구동은 됩니다. 다만 FP8에 의존하는 배포라면 당사는 Hopper와 Blackwell에 올립니다.

**Ampere 카드에서 FP8 포맷은 다운로드 용량 절감일 뿐, 그 이상이 아닙니다.** NVIDIA RTX A6000, NVIDIA A100 PCIe 및 NVIDIA A100 SXM4 카드는 텐서 코어에 FP8 경로가 없습니다. 그중 하나에서 캐시를 절반으로 줄일 계획이셨다면 그렇게 되지 않습니다 — 그리고 위 FP8 열의 메모리 수치는 그 하드웨어에서는 도달할 수 없는 값입니다. 카드와 포맷은 함께, 그 순서로 고르십시오.

카드를 고르기 전에 알아 둘 것이 하나 더 있습니다. Llama 3.3 70B 모델은 FP8, 8k에서 81.9 GB가 필요한데, 80 GB 카드는 — NVIDIA A100 PCIe 카드 등이 여기에 해당합니다 — 여기서 1.9 GB가 모자랍니다. 스프레드시트에서는 눈에 띄지 않을 만큼 작고, 머신에서 실패하기에는 충분히 큰 차이입니다. 이를 단독으로 감당하는 카드는 한 단계 위 제품이며, 어느 카드인지는 [구성 도구](https://gpuserver.io/ko/configure)가 결제 뒤가 아니라 결제 전에 알려 줍니다.

## 속도로 얻는 것

토큰 하나를 생성한다는 것은 활성 가중치를 메모리에서 한 번 읽는다는 뜻입니다. 가중치당 바이트가 줄면 읽을 바이트도 줄고, 그만큼 초당 토큰이 늘어납니다 — 배칭 없는 단일 스트림에서는 카드가 달리 기다릴 것이 없으므로 이 관계가 거의 선형입니다. [토큰 단가 가이드](https://gpuserver.io/ko/guides/api-vs-self-hosting)가 나눗셈의 기준으로 삼는 것과 같은 메모리 대역폭 상한이며, 의도적으로 보수적으로 잡았습니다. 아래에서는 당사가 임대하는 모든 단일 카드 머신에서 돌아갈 만큼 작은 모델에 이 상한을 적용해, 포맷과 카드를 같은 표에서 읽을 수 있게 했습니다.

**카드별·포맷별 8B 모델의 단일 스트림 생성 속도**

| 카드 | 대역폭 | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|---|
| NVIDIA L4 24 GB · 월 $125 | 300 GB/s | 약 8 tok/s | 약 17 tok/s | 약 34 tok/s |
| NVIDIA RTX A6000 48 GB · 월 $286 | 768 GB/s | 약 22 tok/s | 약 43 tok/s | 약 86 tok/s |
| NVIDIA L40S 48 GB · 월 $714 | 864 GB/s | 약 24 tok/s | 약 49 tok/s | 약 97 tok/s |
| NVIDIA RTX 4090 24 GB · 월 $193 | 1008 GB/s | 약 28 tok/s | 약 57 tok/s | 약 113 tok/s |
| NVIDIA A100 PCIe 40 GB · 월 $392 | 1555 GB/s | 약 44 tok/s | 약 87 tok/s | 약 175 tok/s |
| NVIDIA RTX 5090 32 GB · 월 $335 | 1792 GB/s | 약 50 tok/s | 약 101 tok/s | 약 202 tok/s |
| NVIDIA A100 PCIe 80 GB · 월 $1,091 | 1935 GB/s | 약 54 tok/s | 약 109 tok/s | 약 218 tok/s |
| NVIDIA H100 PCIe 80 GB · 월 $1,469 | 2000 GB/s | 약 56 tok/s | 약 113 tok/s | 약 225 tok/s |

카드 1장의 Llama 3.1 8B 모델, 한 번에 단일 스트림. 표에 실린 모든 머신이 세 포맷 모두에서 이 모델을 수용하므로 행은 세로로도 가로로도 비교할 수 있습니다 — 그리고 세 열 사이의 비율은 모든 줄에서 같습니다. 가중치당 바이트 수가 정할 뿐 다른 요인은 없기 때문입니다.

그 표를 읽을 때 주의할 점이 2가지 있습니다. 첫째, 이 표는 한 번에 요청 1건을 처리하는 경우를 설명하는데, 한 번에 요청 1건만 처리하는 곳은 거의 없습니다: 연속 배칭에서는 배치 전체에 대해 가중치를 한 번만 읽으므로 메모리가 아니라 계산이 한계가 되고 열 사이의 비율은 좁아집니다. 둘째, 역양자화에도 비용이 듭니다. 4비트 가중치는 곱셈 전에 풀어야 하고, 작은 모델에서 배치 크기가 작으면 그 푸는 과정이 읽기가 줄어 얻은 이득 중 눈에 띄는 몫을 잡아먹을 수 있습니다. 이 표의 방향은 신뢰할 수 있습니다. 다만 정확한 배수는 약속이 아닙니다.

## 치르는 대가

이 주제에서 자신 있게 제시되는 수치는 당사의 것을 포함해 믿지 않는 편이 좋습니다. 양자화 오차는 방식보다 모델에 훨씬 더 크게 좌우되고, 공개된 비교들은 서로 다른 모델을 서로 다른 과제에서 측정하기 때문에 결과가 서로 어긋납니다. 정직하게 말할 수 있는 것은 그 대략적인 윤곽뿐입니다.

**FP8 포맷은 논란의 여지가 없을 만큼 원본에 가깝습니다.** 여전히 부동소수점 포맷이며 — 지수부와 가수부의 비트 수가 각각 줄어든 것뿐입니다 — 4비트 체크포인트처럼 그룹별 스케일을 써서 정수 격자에 대응시켜야 하는 형태가 아닙니다. 품질 저하가 그토록 완만한 이유, 그리고 캘리브레이션 과정이 필요 없는 이유가 여기에 있습니다. 대부분의 팀은 평가를 돌리지 않고 채택하며, 대부분은 그래도 문제없이 넘어갑니다.

**4비트는 실제로 대가를 치르는 선택이고, 그 대가는 고르게 나타나지 않습니다.** 평균 벤치마크 점수는 대개 거의 움직이지 않습니다. 움직이는 것은 꼬리 쪽입니다: 긴 추론 사슬, 정확한 계산, 희귀 언어, 엄격한 출력 포맷. 객관식 문제 모음에서는 여전히 좋은 점수를 내는 모델이 JSON을 잘못 닫기 시작할 수 있습니다.

**모델이 클수록 손실을 더 잘 흡수합니다.** 70B에 4비트를 적용하는 것은 일상적인 배포입니다. 파라미터 하나하나가 더 많은 것을 담고 있는 8B에 4비트를 적용하면 품질 저하가 눈에 띕니다 — 그리고 위 표에 따르면 그때 얻는 것도 가장 적습니다.

**알파벳 이름보다 캘리브레이션 데이터가 더 중요합니다.** AWQ와 GPTQ는 둘 다 표본 말뭉치를 기준으로 압축합니다. 영어 산문으로 캘리브레이션한 체크포인트를 코드에 쓰면 그 방식이 받아야 할 평가보다 나쁜 결과가 나오고, 어떤 벤치마크 표도 그 사실을 알려 주지 않습니다.

그래서 이 페이지에서 계산이 아닌 유일한 권고가 나옵니다: 둘 다 돌려 보십시오. root 권한이 있고 사용량 과금이 전혀 없는 머신을 임대하고 계시므로, 같은 모델을 두 포트에 두 번 서빙하고 각 포트로 직접 준비한 프롬프트 100개를 흘려보내는 데 드는 것은 저녁 한 나절뿐이며, 그것으로 다른 사람의 워크로드가 아니라 고객의 워크로드에 맞는 답이 정해집니다. 그것이 이 표를 포함한 어떤 표보다도 실질적으로 나은 답입니다 — 그리고 그것이 당사가 점수보다 계산식을 보여 드리려는 이유입니다.

**비용이 가장 적게 드는 순서로 시험하십시오.** 조금이라도 들어간다면 BF16에서 시작하십시오. 다른 실행들이 기준으로 삼아야 할 값이기 때문입니다. 다음은 FP8입니다 — 같은 체크포인트, 플래그 하나, 내려받을 것 없음. 4비트 체크포인트는 위 2가지가 메모리 때문에 배제된 뒤에만 손대시고, 그때는 기대치가 아니라 FP8 실행 결과와 비교하십시오.

## 그에 해당하는 머신

이 모든 것이 중요한 이유는 청구서입니다. 아래는 포맷 3가지 각각에 대해 8k 컨텍스트에서 각 모델을 *통째로* 담는 [당사 카탈로그](https://gpuserver.io/ko/#catalog) 내 가장 싼 머신입니다 — 통째로란 분할 없이 카드 1장에 담는다는 뜻인데, 카드에 걸쳐 분할한 모델은 [인터커넥트](https://gpuserver.io/ko/guides/nvlink-vs-pcie) 문제를 끌어들이고 그것은 다른 가이드의 주제이기 때문입니다.

**포맷별, 각 모델을 통째로 담는 가장 싼 머신**

| 모델 | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|
| Llama 3.1 8B | [NVIDIA L4](https://gpuserver.io/ko/gpu/nvidia-l4) 월 $125 · 19.5 GB 필요 | [NVIDIA L4](https://gpuserver.io/ko/gpu/nvidia-l4) 월 $125 · 9.8 GB 필요 | [NVIDIA L4](https://gpuserver.io/ko/gpu/nvidia-l4) 월 $125 · 5.8 GB 필요 |
| Qwen 3 32B | [NVIDIA A100 PCIe](https://gpuserver.io/ko/gpu/a100-80gb) 월 $1,091 · 75.9 GB 필요 | [NVIDIA RTX A6000](https://gpuserver.io/ko/gpu/rtx-a6000) 월 $286 · 37.9 GB 필요 | [NVIDIA L4](https://gpuserver.io/ko/gpu/nvidia-l4) 월 $125 · 20.7 GB 필요 |
| Llama 3.3 70B | [4 × NVIDIA B200 SXM6](https://gpuserver.io/ko/gpu/b200) 월 $11,790 · 163.9 GB 필요 | [4 × NVIDIA H200 SXM5](https://gpuserver.io/ko/gpu/h200) 월 $8,405 · 81.9 GB 필요 | [NVIDIA RTX A6000](https://gpuserver.io/ko/gpu/rtx-a6000) 월 $286 · 43.1 GB 필요 |

8k 컨텍스트, 당사가 실제로 임대하는 머신 기준입니다. 한 칸에 카드가 여러 장 적혀 있으면 모델을 분할했다는 뜻이 아니라 그 카드가 들어가는 가장 작은 노드라는 뜻입니다: 가장 큰 카드는 4장, 8장 단위로 판매되므로 전체 정밀도의 70B를 분할하지 않는 가장 싼 방법은 4장을 사서 1장만 쓰는 것입니다. 양자화는 바로 그런 청구액을 피하려고 존재합니다.

**가운데 행을 가로로 읽으십시오: $1,091 대 $125, 약 9×.** 같은 Qwen 3 32B 모델, 같은 8k 컨텍스트, 같은 카드 1장, 같은 root 권한 — 그리고 그 사이에 놓인 것은 숫자 포맷 하나뿐입니다. 그것이 양자화의 상업적 근거 전부이며, 읽는 데 반나절을 쓰기보다 재는 데 하룻저녁을 쓸 만한 이유이기도 합니다.

그 표를 잘 쓰는 것과 그 표에 당하는 것을 가르는 습관이 두 가지 있습니다. 모델의 최대치가 아니라 실제로 돌릴 컨텍스트에 맞춰 사이징하십시오 — 이 페이지의 두 번째 표가 그 둘을 혼동한 경우에 벌어지는 일입니다. 그리고 포맷이 카드에 맞는지는 주문한 뒤가 아니라 주문하기 전에 확인하십시오: NVIDIA RTX A6000, NVIDIA A100 PCIe 및 NVIDIA A100 SXM4 카드에서는 어떤 플래그를 넘겨도 FP8 수치가 나오지 않습니다. [구성 도구](https://gpuserver.io/ko/configure)는 모든 노드와 모든 포맷에 대해 필요한 메모리와 카드 1장에 들어가는지 여부를 결제 전에 알려 드립니다. 임대할 것인지 토큰 단위로 API 요금을 낼 것인지를 저울질하고 계시다면, [그 손익분기점](https://gpuserver.io/ko/guides/api-vs-self-hosting)은 따로 계산해 두었으며, 양자화는 그 지점을 하드웨어에 훨씬 유리한 쪽으로 옮깁니다.

## 포맷과 머신을 함께 확인하십시오.

구성 도구는 결제 전에 각 정밀도에서 모델에 무엇이 필요한지, 어느 노드가 카드 1장에 담을 수 있는지 알려 줍니다.

[구성 도구 열기](https://gpuserver.io/ko/configure) [가이드 둘러보기](https://gpuserver.io/ko/guides)

## 다른 가이드

- [사이징 · 10분 전문가 혼합 모델 실행하기 총 파라미터가 머신을 결정하고, 활성 파라미터가 속도를 결정합니다. DeepSeek V3와 Qwen 3 235B에 필요한 VRAM, 그리고 이들을 위해 임대할 노드를 알아보십시오. 가이드 읽기](https://gpuserver.io/ko/guides/mixture-of-experts)
- [비용 · 6분 월 단위 임대가 시간 단위보다 유리한 경우 실제 숫자로 계산한 손익분기점, 시간 단위 가격이 청구서 전까지 감추는 비용 3가지, 그리고 추정치를 3배로 부풀리는 유휴 시간의 함정. 가이드 읽기](https://gpuserver.io/ko/guides/monthly-vs-hourly)
- [비용 · 9분 자체 호스팅 대 토큰당 과금 API 토큰당 과금 API와 GPU 임대 사이의 손익분기점을 당사의 실제 가격과 처리량으로 계산했습니다 — 그리고 그 계산이 빠뜨리는 4가지. 가이드 읽기](https://gpuserver.io/ko/guides/api-vs-self-hosting)

---

출처: https://gpuserver.io/ko/guides/awq-vs-gptq-vs-fp8/. 이 파일은 웹사이트와 동일한 데이터에서 생성됩니다. 여기의 수치가 페이지와 다르다면 페이지가 정본이고 이 파일이 오래된 것입니다 — 정식 출처는 https://gpuserver.io/입니다.
