사이징 가이드 · 9분 분량

# 이미지·영상 모델용 카드 선택.

이미지 모델은 기억해 둘 대화가 없으므로 언어 모델과는 완전히 다른 기준으로 사이징합니다 — 그리고 이를 수용하는 가장 저렴한 카드가 실제로 임대해야 할 카드인 경우는 거의 없습니다.

짧은 답

- **전체 정밀도 기준:** SDXL 1.0 **8.0 GB** · Stable Diffusion 3.5 Large **18.4 GB** · FLUX.1 dev **27.6 GB** · Wan 2.1 video 14B **32.2 GB** — 런타임 여유분 포함
- **애매한 한 줄:** 카탈로그의 24 GB 카드는 모두 BF16에서 FLUX.1 dev 모델에 근소하게 못 미침. FP8로 절반이 되면 모두 기준을 통과함
- **이를 수용하는 최저가 머신:** 월 $125의 [NVIDIA L4](https://gpuserver.io/ko/gpu/nvidia-l4), FP8로 FLUX.1 dev 모델
- **두 번째 카드로 얻는 것:** 시간당 이미지는 2배, 이미지 1장의 시간은 1초도 줄지 않음

## 각 모델에 필요한 것

나머지 전부를 결정하는 차이부터 짚겠습니다. 언어 모델은 컨텍스트의 토큰마다 커지는 [키/값 캐시](https://gpuserver.io/ko/guides/vram-sizing)를 들고 있으며, 그래서 같은 70B 모델이 대화를 얼마나 유지하느냐에 따라 40 GB를 요구하기도 하고 140 GB를 요구하기도 합니다. 디퓨전 모델에는 캐시가 아예 없습니다. 프롬프트를 읽고, 정해진 스텝 수만큼 잠재 텐서의 노이즈를 제거한 뒤 잊어버립니다. 따라서 가중치가 사실상 메모리 문제의 전부이며, 프롬프트가 길어져도 답은 달라지지 않습니다.

**정밀도별 각 이미지·영상 모델의 필요 메모리**

| 모델 | 파라미터 | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|---|
| SDXL 1.0 정지 이미지 | 3.5 B | 8.0 GB | 4.0 GB | 2.0 GB |
| Stable Diffusion 3.5 Large 정지 이미지 | 8 B | 18.4 GB | 9.2 GB | 4.6 GB |
| FLUX.1 dev 정지 이미지 | 12 B | 27.6 GB | 13.8 GB | 6.9 GB |
| Wan 2.1 video 14B 영상, 프레임 블록 단위로 생성 | 14 B | 32.2 GB | 16.1 GB | 8.0 GB |

가중치에 활성화 값, CUDA 컨텍스트, 할당자 단편화를 위한 15% 런타임 여유분을 더한 값입니다 — [구성 도구](https://gpuserver.io/ko/configure)가 적용하는 것과 같은 여유분이므로, 이 표를 구성 도구와 대조해 보실 수 있습니다. 컨텍스트 열은 넣을 것이 없어서 없습니다.

그 표에서 두 줄은 짚고 넘어갈 만합니다. 구매가 어긋나는 지점이 바로 거기이기 때문입니다.

**FLUX.1 dev 모델은 BF16에서 27.6 GB를 요구합니다.** 당사가 임대하는 모든 24 GB 카드를 넘어서는 수치이고, 그 초과폭은 납득하기 어려울 만큼 작습니다. 이미지 작업에서 가장 흔한 의외의 사실입니다: 인터넷 어디서나 “4090에서 돌아간다”고 하는 그 모델은 양자화된 상태로 돌아가고 있으며, 아무도 그 사실을 말하지 않습니다.

**Wan 2.1 video 14B 모델은 BF16에서 32.2 GB를 요구합니다.** 1GB 미만 차이로 32 GB 카드를 넘어섭니다. 당사의 여유분은 의도적으로 보수적이며, 텍스트 인코더를 카드 밖에 두면 대개 그만큼을 되찾을 수 있습니다 — 그러나 반올림 오차를 놓고 구매 계획을 세워야 해서는 안 되므로, 정직한 답은 영상에는 40 GB 이상이 필요하다는 것입니다.

## 각 카드가 수용하는 것

당사가 임대하는 모든 단일 카드 머신과, 각 머신이 요구가 큰 두 모델에 대해 수용하는 최선의 정밀도입니다. 대역폭 열은 다음 장을 위한 것입니다. 그 장을 읽은 뒤에 보십시오.

**단일 카드 노드와 각 노드가 수용하는 정밀도**

| 노드 | 카드 메모리 | 대역폭 | FLUX.1 dev | Wan 2.1 video 14B | 월 요금 |
|---|---|---|---|---|---|
| [NVIDIA L4](https://gpuserver.io/ko/gpu/nvidia-l4) Ada Lovelace · PCIe 5.0 | 24 GB | 300 GB/s달러당 2.4 GB/s | FP8 | FP8 | $125/월 |
| [NVIDIA RTX 4090](https://gpuserver.io/ko/gpu/rtx-4090) Ada Lovelace · PCIe 5.0 | 24 GB | 1,008 GB/s달러당 5.2 GB/s | FP8 | FP8 | $193/월 |
| [NVIDIA RTX A6000](https://gpuserver.io/ko/gpu/rtx-a6000) Ampere · PCIe 5.0 | 48 GB | 768 GB/s달러당 2.7 GB/s | BF16 / FP16 | BF16 / FP16 | $286/월 |
| [NVIDIA RTX 5090](https://gpuserver.io/ko/gpu/rtx-5090) Blackwell · PCIe 5.0 | 32 GB | 1,792 GB/s달러당 5.3 GB/s | BF16 / FP16 | FP8 | $335/월 |
| [NVIDIA A100 PCIe](https://gpuserver.io/ko/gpu/a100-40gb) Ampere · PCIe 5.0 | 40 GB | 1,555 GB/s달러당 4.0 GB/s | BF16 / FP16 | BF16 / FP16 | $392/월 |
| [NVIDIA L40S](https://gpuserver.io/ko/gpu/l40s) Ada Lovelace · PCIe 5.0 | 48 GB | 864 GB/s달러당 1.2 GB/s | BF16 / FP16 | BF16 / FP16 | $714/월 |
| [NVIDIA A100 PCIe](https://gpuserver.io/ko/gpu/a100-80gb) Ampere · PCIe 5.0 | 80 GB | 1,935 GB/s달러당 1.8 GB/s | BF16 / FP16 | BF16 / FP16 | $1,091/월 |
| [NVIDIA H100 PCIe](https://gpuserver.io/ko/gpu/h100-pcie) Hopper · PCIe 5.0 | 80 GB | 2,000 GB/s달러당 1.4 GB/s | BF16 / FP16 | BF16 / FP16 | $1,469/월 |

초록은 기준 가중치, 주황은 양자화된 가중치입니다. 디퓨전 모델의 양자화는 언어 모델에서만큼 공짜가 아닙니다: 같은 프롬프트와 같은 시드에서 눈에 띄게 다른 이미지가 나오고, 대개 약간 더 부드러운 쪽입니다. FP8에서는 괜찮은 거래이고, 4 비트에서는 판단이 필요한 문제입니다.

가격 열을 아래에서부터 읽으면 그림이 분명합니다. 월 $125의 [NVIDIA L4](https://gpuserver.io/ko/gpu/nvidia-l4) 머신이 당사가 임대하는 머신 중 FLUX.1 dev 모델을 그나마 수용하는 가장 싼 머신입니다 — FP8로 말입니다. 온전한 BF16으로 수용하는 가장 싼 머신은 월 $286의 [NVIDIA RTX A6000](https://gpuserver.io/ko/gpu/rtx-a6000)입니다. 전체 정밀도 영상은 같은 카드에서 시작합니다.

## 모두가 잘못 읽는 열

여기서부터가 이미지 작업을 이 사이트의 다른 모든 내용과 갈라놓는 부분이고, 그 표에서 가장 싼 카드가 함정인 이유입니다.

언어 모델이 토큰 하나를 생성할 때는 활성 가중치를 메모리에서 한 번씩 모두 읽고, 각각에 대해 적은 양의 계산을 한 뒤, 토큰 하나를 써냅니다. 다음 토큰에도, 그다음 토큰에도 같은 일을 되풀이합니다. 카드는 메모리 버스를 기다리며 시간을 보내고, 그래서 당사의 언어 모델 처리량 추정치는 사실상 대역폭을 읽어 들이는 가중치로 나눈 값이며, [서빙 가이드](https://gpuserver.io/ko/guides/serve-llama-70b)에서 중요한 열이 대역폭 열인 것도 그 때문입니다.

디퓨전 스텝은 그렇지 않습니다. 같은 가중치가 하나의 잠재 텐서에 20~50회 되풀이해 적용되고, 매 패스마다 가져온 바이트당 상당한 양의 계산을 수행합니다. 가중치는 메모리에 계속 상주하며, 실제 작업은 작은 텐서에 대한 합성곱과 어텐션입니다. 그래서 제약이 뒤집힙니다: 이미지 모델은 메모리 버스가 아니라 텐서 처리량에 묶입니다. 여기서 세 가지 결과가 따라 나오고, 셋 다 잘못 판단하면 돈이 듭니다.

### “들어감”과 “빠름”은 다른 문제

위 표의 입문용 카드는 월 $125에 FLUX.1 dev 모델을 FP8로 수용하지만, 픽셀을 밀어내기 위해서가 아니라 작은 모델을 조밀하게 서빙하기 위해 만들어진 저전력 부품입니다. 메모리는 첫 번째 필터일 뿐, 마지막 필터가 아닙니다.

### 두 번째 카드가 대기 시간을 절반으로 줄이지는 않음

ComfyUI와 diffusers 파이프라인은 vLLM이 트랜스포머를 나누는 방식으로 하나의 디노이징 루프를 여러 GPU에 나누지 않습니다. 카드 2장은 워커 2개를 돌립니다: 시간당 이미지는 2배, 이미지 1장당 시간은 그대로입니다. [여기서 NVLink는 아무 도움이 되지 않습니다](https://gpuserver.io/ko/guides/nvlink-vs-pcie).

### 데이터센터용 카드가 자동으로 정답인 것은 아님

언어 모델 서빙에서는 작업을 좌우하는 수치에서 HBM 카드가 앞섭니다. 이미지 작업에서는 텐서 처리량과 메모리를 사는 것이며, 그래픽용으로 설계된 카드가 당사 가격표에서의 위치가 시사하는 것보다 달러당 두 가지 모두를 더 많이 제공합니다.

달러당 대역폭은 — 거칠기는 하지만 — 지금 보고 있는 카드가 어느 등급인지 가늠하게 해 주는 대리 지표이고, 당사 카탈로그에서는 [NVIDIA RTX 5090](https://gpuserver.io/ko/gpu/rtx-5090) 및 [NVIDIA RTX 4090](https://gpuserver.io/ko/gpu/rtx-4090) 두 카드가 큰 차이로 1위와 2위를 차지합니다. 우연이 아니고, 당사가 부추기는 특가도 아닙니다: 바로 이런 종류의 계산을 위해 설계된 부품이며, 시장이 이 카드의 가격을 학습 클러스터가 아니라 게이밍을 기준으로 매기기 때문에 당사 가격표에서 아래쪽에 있습니다.

**분당 이미지 열이 없는 이유.** 언어 모델에 대해서는 초당 토큰 추정치를 공개합니다. 그 뒤에 있는 계산식을 방어할 수 있고, 그 계산식을 공개하기 때문입니다. 디퓨전에는 당사가 책임질 수 있는 등가물이 없습니다: 이미지 1장당 시간은 카드가 개입하기도 전에 샘플러, 스텝 수, 해상도, 모델을 컴파일했는지 여부에 따라 5배까지 달라집니다. 이 표를 위해 지어낸 숫자는 이 페이지에서 가장 인용하기 좋고 가장 사실과 먼 숫자가 될 것입니다. 한 달 임대해서 직접 파이프라인을 측정해 보십시오. 그 답이 어떤 벤치마크보다 값집니다.

## 해상도, 배치, 영상

가중치는 고정되어 있습니다. 움직이는 것은 작업 집합이고, 파라미터가 아니라 픽셀에 따라 움직입니다. 잠재 텐서 자체는 무시할 수 있는 수준입니다 — 카드를 채우는 것은 그 해상도로 네트워크를 통과하는 활성화 값입니다.

메모리가 실제로 쓰이는 곳

```
latent_elements = (H / 8) * (W / 8) * C * batch
# C = 4 latent channels on SDXL, 16 on SD 3.5 and FLUX.

# 1024x1024, batch 1, SDXL:
128 * 128 * 4 * 1     = 65,536 elements   = 128 KB in FP16

# 2048x2048, batch 4, SDXL:
256 * 256 * 4 * 4     = 1,048,576         = 2 MB in FP16

# The latent is never the problem. The activations that pass through the
# network at that resolution are, and they scale by the SAME factor:
# doubling the edge quadruples the pixel count, and roughly quadruples
# the working set. Batch multiplies it linearly on top.
```

실무적인 결과 세 가지, 마주치게 될 순서대로:

1. **정점은 대개 샘플링 루프가 아니라 VAE 디코드입니다.** 디코딩은 잠재 텐서를 한 번에 원래 해상도로 되돌리며, 1분 동안 잘 돌아가던 작업이 맨 마지막에 메모리 부족 오류를 내는 것이 바로 그 순간 때문입니다. 타일 디코딩으로 해결되며, 시간이 조금 더 듭니다.
2. **큰 카드를 제대로 쓰는 방법은 배칭입니다.** 모델을 올리고 20 GB가 남는다면, 여유를 둔 채 이미지 1장을 만드는 것보다 한 번에 4장을 만드는 편이 훨씬 낫습니다 — 가중치는 배치 전체에 대해 한 번만 읽히며, 디퓨전 파이프라인이 대역폭에 묶인 작업처럼 동작하는 유일한 지점이 바로 여기입니다.
3. **영상은 비율이 아니라 차원을 하나 더합니다.** Wan 2.1 video 14B 모델은 프레임을 블록 단위로 한꺼번에 생성하므로, 높이와 너비가 이미 곱해 놓은 작업 집합에 프레임 수가 다시 곱해집니다. 140억 파라미터 영상 모델이 120억 파라미터 이미지 모델보다 훨씬 큰 카드를 요구하는 이유이자, 위의 가중치 표가 다른 어떤 행보다 이 행을 크게 과소평가하는 이유입니다.

**실무에서 쓰는 기준.** 첫 번째 표의 수치를 가져온 다음, 한 번에 100만 화소 이미지 1장을 만드는 데 대비해 그 위로 카드의 약 3분의 1을 비워 두십시오. 배칭할 계획이라면 배치를 줄이지 말고 메모리 등급을 한 단계 올리십시오 — 월 단위 이용 기간에서 등급 인상은 정해진 달러 금액이 들 뿐이지만, 배치 1은 매일 매시간 처리량을 깎아먹습니다.

## ComfyUI 띄우기

ComfyUI는 제공 전에 머신에 미리 설치해 드릴 수 있는 이미지 중 하나이므로, 이 절은 선택 사항입니다. 직접 구성하고 싶으시다면, 컨테이너 하나와 터널 하나면 됩니다.

갓 제공된 머신에서

```
$ ssh root@203.0.113.42
$ nvidia-smi --query-gpu=name,memory.total --format=csv

# Checkpoints, LoRAs, ControlNets and VAEs on the fast local NVMe.
# This directory is the reason you are renting by the month.
$ mkdir -p /scratch/comfy/models
$ df -h /scratch
```

루프백에 바인딩한 서버

```
$ docker run -d --name comfy --restart unless-stopped \
    --gpus all --ipc=host \
    -v /scratch/comfy:/data \
    -p 127.0.0.1:8188:8188 \
    your-comfyui-image --listen 0.0.0.0 --port 8188

# From YOUR machine, not the server: a tunnel, then a local browser tab.
$ ssh -N -L 8188:127.0.0.1:8188 root@203.0.113.42
# http://127.0.0.1:8188
```

**포트 앞의 `127.0.0.1:` 부분에 주의하십시오.** ComfyUI에는 로그인도, 비밀번호도, 사용자라는 개념도 없습니다. 공개 주소에 올리면 GPU와 모델 라이브러리, 그 아래의 파일 시스템에 접근하는 그래픽 인터페이스를 포트를 훑는 누구에게나 내주는 셈이고 — 포트는 몇 분 안에 훑힙니다. 루프백에 바인딩하고 SSH로 접속하십시오. 방화벽과 첫 한 시간은 [문서](https://gpuserver.io/ko/docs)에서 더 자세히 다룹니다.

## 한 달로 얻는 것

이미지 작업이 월 단위 머신에 맞는 이유는 GPU 가격이 아닙니다. 라이브러리입니다. 제대로 갖춘 ComfyUI 설치본은 직접 골라 모았고 다시 내려받고 싶지 않은 체크포인트, LoRA, ControlNet, 업스케일러, VAE 수백 GB입니다.

**모든 단일 카드 머신에서 디스크는 가격에 포함됩니다.** 2 × 2 TB NVMe 및 1 Gbit/s, 양방향 무제한 — 월 $125 노드에서나 월 $1,469 노드에서나 동일합니다. 여기서 GB당 청구되는 것은 없고, 카드가 유휴 상태일 때 계속 청구되는 것도 없으며, 재설치 뒤 라이브러리를 다시 내려받는 날 또 청구되는 것도 없습니다.

비교해야 할 열이 바로 그것이고, 시간 단위 플랫폼이 헤드라인에서 빼놓는 열이기도 합니다. 그런 곳에서는 디스크가 별도 항목이라 월 GB당 요금이 매겨지고, 인스턴스를 멈춰 둔 동안에도 계속 과금됩니다 — 아니면 디스크를 지우고, 다음에 작업하러 앉을 때 수백 GB를 다시 내려받게 됩니다.

[시간 단위 손익분기점](https://gpuserver.io/ko/guides/monthly-vs-hourly)이 설명하는 것과 같은 함정이, 이미지 작업에서 취하는 형태입니다. 초당 과금은 인스턴스를 멈출 수 있으니 안전해 보이지만, 아무도 멈추지 않습니다. 멈춘다는 것은 라이브러리를 잃는다는 뜻이기 때문입니다. 정직한 질문은 “몇 시간이나 생성할 것인가”가 아니라 “이 머신이 몇 시간이나 존재해야 하는가”이고 — 모델 디렉터리를 골라 모아 둔 사람에게 그 답은 내내입니다. 결제는 [암호화폐 전송 1회](https://gpuserver.io/ko/guides/pay-in-crypto)이고, 설치비는 없으며, [당사는 고객이 누구인지 묻지 않았습니다](https://gpuserver.io/ko/no-kyc-gpu-server): 프롬프트, 직접 학습한 LoRA, 아직 납품하지 않은 클라이언트 작업은 고객만 root 권한을 가진 머신에 남습니다.

## 카드를 임대하지 않는 편이 나은 경우

이 카드를 임대하고 후회하시는 것은 당사도 바라지 않으므로, 임대하지 않는 편이 나은 경우를 적어 둡니다.

**일주일에 이미지 수십 장을 생성하는 경우.** 호스팅형 엔드포인트를 쓰면 월 몇 달러가 들 뿐이고 오후 시간을 쓸 일도 없습니다. 대기열이나 해상도 제한, 콘텐츠 규정이 작업 내용을 대신 결정하기 시작하면 그때 다시 찾아 주십시오.

**가장 최신의 비공개 모델을 원하는 경우.** 가장 널리 알려진 이미지 서비스는 가중치를 공개하지 않습니다. 이 페이지의 어떤 머신도 그 모델을 돌릴 수 없으며, 메모리를 아무리 늘려도 달라지지 않습니다.

**이미지 한 장을 더 빨리 얻으려고 멀티 GPU 노드를 보고 있는 경우.** 대신 더 빠른 단일 카드를 고르십시오. 카드를 늘리면 병렬 워커가 늘어나고, 병렬 워커는 큰 가치가 있습니다 — 다만 진행 표시줄 하나를 지켜보는 사람에게는 아닙니다.

**아직 모델을 정하지 않은 경우.** 1024 px에서 SDXL 1.0 모델을 돌릴지, 클립당 5초로 Wan 2.1 video 14B 모델을 돌릴지 확실해지기 전까지는 다른 곳에서 시간 단위로 임대하십시오. 두 답 사이에는 월 $161의 차이가 있으니, 추측할 이유가 없습니다.

그 밖의 모든 경우에는 — 직접 쌓아 온 라이브러리, 계속 바꾸는 파이프라인, 밤새 돌리는 배치 작업, 자기 디스크를 벗어나서는 안 되는 작업 — 월 단위 전용 카드가 더 싸고 더 조용한 방식입니다. [구성 도구](https://gpuserver.io/ko/configure)는 [카탈로그](https://gpuserver.io/ko/#catalog)의 모든 노드에 대해, 염두에 두신 모델이 카드 1장에 들어가는지를 결제 전에 알려 드립니다.

## 결제 전에 모델이 들어가는지 확인하십시오.

구성 도구는 카탈로그의 모든 머신에 대해 모델에 필요한 메모리와 단일 카드에 들어가는지 여부를 알려 드립니다.

[구성 도구 열기](https://gpuserver.io/ko/configure) [가이드 둘러보기](https://gpuserver.io/ko/guides)

## 다른 가이드

- [사이징 · 10분 양자화 형식 선택 AWQ, GPTQ, GGUF, FP8 포맷이 각각 메모리, 속도, 품질에서 치르는 대가 — 그리고 가중치가 가장 작은 포맷이 왜 가장 작은 모델로 이어지지 않는지. 가이드 읽기](https://gpuserver.io/ko/guides/awq-vs-gptq-vs-fp8)
- [사이징 · 10분 전문가 혼합 모델 실행하기 총 파라미터가 머신을 결정하고, 활성 파라미터가 속도를 결정합니다. DeepSeek V3와 Qwen 3 235B에 필요한 VRAM, 그리고 이들을 위해 임대할 노드를 알아보십시오. 가이드 읽기](https://gpuserver.io/ko/guides/mixture-of-experts)
- [비용 · 6분 월 단위 임대가 시간 단위보다 유리한 경우 실제 숫자로 계산한 손익분기점, 시간 단위 가격이 청구서 전까지 감추는 비용 3가지, 그리고 추정치를 3배로 부풀리는 유휴 시간의 함정. 가이드 읽기](https://gpuserver.io/ko/guides/monthly-vs-hourly)

---

출처: https://gpuserver.io/ko/guides/gpu-for-flux-sdxl/. 이 파일은 웹사이트와 동일한 데이터에서 생성됩니다. 여기의 수치가 페이지와 다르다면 페이지가 정본이고 이 파일이 오래된 것입니다 — 정식 출처는 https://gpuserver.io/입니다.
