가이드.
어떤 머신을 임대해야 하는지 결정하는 질문을 깊이 다룬 글 — 당사가 실제로 운영하는 하드웨어를 기준으로 썼고, 계산 과정을 그대로 보여 줍니다.
- 당사가 운영하는 하드웨어를 기준으로 작성
- 의사 코드가 아니라 붙여 넣을 수 있는 명령
- 계산 과정 공개, 직접 확인 가능
가이드 10편 전체
5 on 사이징 · 2 on 비용 · 2 on 실전 · 1 on 결제
-
사이징 · 9분
모델에 실제로 필요한 VRAM
“모델이 들어갈까”라는 질문 뒤에 있는 계산: 가중치, KV 캐시, 그리고 경험칙이 3배나 어긋나는 지점 2곳을 그대로 짚습니다.
가이드 읽기 -
사이징 · 7분
NVLink 또는 PCIe: 작업에 필요한 쪽
카드 사이의 연결이 처리량을 좌우하는 경우, 아무것도 바꾸지 않는 경우, 그리고 잘못된 노드에 돈을 쓰기 전에 어느 쪽인지 판단하는 방법.
가이드 읽기 -
사이징 · 9분
이미지·영상 모델용 카드 선택
FLUX, SDXL, SD 3.5, Wan 2.1 모델이 VRAM을 얼마나 요구하는지, 카탈로그의 어떤 카드가 각각을 담는지, 그리고 들어가는 가장 싼 카드가 왜 임대할 카드가 아닌지.
가이드 읽기 -
사이징 · 10분
양자화 형식 선택
AWQ, GPTQ, GGUF, FP8 포맷이 각각 메모리, 속도, 품질에서 치르는 대가 — 그리고 가중치가 가장 작은 포맷이 왜 가장 작은 모델로 이어지지 않는지.
가이드 읽기 -
사이징 · 10분
전문가 혼합 모델 실행하기
총 파라미터가 머신을 결정하고, 활성 파라미터가 속도를 결정합니다. DeepSeek V3와 Qwen 3 235B에 필요한 VRAM, 그리고 이들을 위해 임대할 노드를 알아보십시오.
가이드 읽기 -
비용 · 6분
월 단위 임대가 시간 단위보다 유리한 경우
실제 숫자로 계산한 손익분기점, 시간 단위 가격이 청구서 전까지 감추는 비용 3가지, 그리고 추정치를 3배로 부풀리는 유휴 시간의 함정.
가이드 읽기 -
비용 · 9분
자체 호스팅 대 토큰당 과금 API
토큰당 과금 API와 GPU 임대 사이의 손익분기점을 당사의 실제 가격과 처리량으로 계산했습니다 — 그리고 그 계산이 빠뜨리는 4가지.
가이드 읽기 -
실전 · 11분
노드 1개로 Llama 3.3 70B 서빙
제공받은 머신에서 OpenAI 호환 엔드포인트까지, 중요한 플래그와 처리량을 조용히 절반으로 떨어뜨리는 두 가지 플래그.
가이드 읽기 -
실전 · 10분
카드 1장에서 70B 모델 파인튜닝
48 GB GPU 1장으로 QLoRA를 돌릴 때 무엇이 들어가고, 한 달 비용이 얼마이며, 전체 파인튜닝이 왜 완전히 다른 급의 머신을 요구하는지 설명합니다.
가이드 읽기 -
결제 · 8분
암호화폐로 서버 결제하기
결제 버튼을 누르고 root를 받기까지 실제로 무슨 일이 일어나는지, 어떤 코인을 고를지, 그리고 첫 결제에서 돈을 잃는 실수 4가지.
가이드 읽기
Ten가지 질문으로 임대할 머신이 정해집니다.
검색어 순위를 노린 60편보다, 실제 질문에 답하는 ten편의 글을 쓰는 편을 택했습니다. 위 가이드는 모두 주문 전에 실제로 받는 질문이기에 존재하며, 각각 당사 카탈로그의 카드를 기준으로 작성했습니다 — 그 안의 수치는 당사가 운영하는 머신에서 나온 수치입니다.
가이드에 계산식이 나오면, 그것은 구성 도구가 모델이 들어가는지 판단할 때 쓰는 것과 같은 계산식입니다. 의도한 것입니다: 초록색 체크 표시를 그대로 믿는 대신 당사의 계산을 직접 확인하실 수 있어야 하기 때문입니다.