결제 승인부터 첫 토큰까지.
제공 안내에 무엇이 담겨 오는지, 무엇이 이미 설치되어 있는지, 그리고 첫 1시간 동안 쓸 정확한 명령입니다. 아래 내용은 모두 갓 제공된 머신에서 root로 실행합니다.
- 5분 미만결제부터 아래 안내까지
- 10요청하시면 대신 기록해 드리는 이미지
- rootsudo 없음, 점프 호스트 없음, 콘솔 없음
- 22제공 시점에 유일하게 열려 있는 포트
제공되는 것
안내 한 통, 결제가 승인된 뒤 5분 미만. 필요한 내용은 모두 담겨 있고, 눌러서 넘겨야 할 것은 없습니다.
첫 접속
수락할 것도, 설치할 에이전트도 없습니다. 구성 도구에서 공개 키를 등록하셨다면 이미 /root/.ssh/authorized_keys에 들어 있습니다.
$ ssh root@203.0.113.42
# 그다음, 무엇보다 먼저 — 제공 안내에 담긴 지문
# 여기에 표시된 값과 일치해야 합니다:
$ ssh-keygen -lf /etc/ssh/ssh_host_ed25519_key.pub
키를 보내셨다면 비밀번호 인증을 끄십시오. 명령 1개면 되고, 추측이 가능한 유일한 접속 정보가 사라집니다.
# 먼저 두 번째 터미널에서 키가 동작하는지 확인하십시오. 이 창은 열어 두십시오.
$ sed -i 's/^#\?PasswordAuthentication.*/PasswordAuthentication no/' /etc/ssh/sshd_config
$ systemctl reload ssh
하드웨어 검증
첫 10분 안에 하십시오. 아직 보지 못한 머신을 받으신 것이고, 하드웨어 장애에 대한 SLA 시계는 알려 주신 시점부터 돌아갑니다.
$ nvidia-smi --query-gpu=index,name,serial,memory.total,pcie.link.gen.current --format=csv
index, name, serial, memory.total [MiB], pcie.link.gen.current
0, NVIDIA H100 80GB HBM3, 1650123456789, 81559 MiB, 5
1, NVIDIA H100 80GB HBM3, 1650123456790, 81559 MiB, 5
# 멀티 GPU 노드에서는 토폴로지가 결제하신 구성과 일치하는지 확인하십시오.
# NV# 표기는 NVLink를 뜻하고, PIX/PHB/SYS 표기는 트래픽이 PCIe로 오간다는 뜻입니다.
$ nvidia-smi topo -m
# 모든 카드를 2분간 부하 상태로 유지하고, 안정되는 클럭을 확인하십시오.
$ nvidia-smi -q -d PERFORMANCE,TEMPERATURE,CLOCK | grep -E 'Slowdown|SW Power|Graphics *:'
# 디스크: 개수와 모델을 제공 안내와 대조해 확인하십시오.
$ lsblk -d -o NAME,MODEL,SIZE,ROTA
$ nvme list
사전 설치 항목
구성 도구에서 운영체제를 선택하고, 원하시면 그 위에 스택 하나를 추가하십시오. 아래 항목은 모두 제공 전에 기록되며, 첫 부팅 때 내려받지 않습니다.
| 이미지 | 용도 | 최소 VRAM | OS |
|---|---|---|---|
| vLLM 0.11 | 대형 언어 모델 서빙 | 24 GB | Linux |
| SGLang 0.5 | 대형 언어 모델 서빙 | 24 GB | Linux |
| Text Generation Inference | 대형 언어 모델 서빙 | 24 GB | Linux |
| Ollama 0.12 | 대형 언어 모델 서빙 | 8 GB | Linux |
| Axolotl 0.8 | 학습과 파인튜닝 | 24 GB | Linux |
| PyTorch 2.9 · CUDA 12.8 | 학습과 파인튜닝 | 8 GB | Linux |
| ComfyUI | 이미지·영상 생성 | 12 GB | Linux |
| JupyterLab · CUDA | 학습과 파인튜닝 | 8 GB | Linux |
| Blender 4.5 | 3D 렌더링 | 8 GB | Linux 또는 Windows |
| 직접 준비한 Docker 이미지 | 직접 가져오는 모든 것 | 전체 | Linux |
어떤 스택을 선택하시든 모든 Linux 이미지에는 동작하는 NVIDIA 드라이버, CUDA, cuDNN, NCCL이 이미 들어 있습니다. 전부 교체하셔도 됩니다 — root 권한은 고객의 것이고, 재설치는 비용도 없고 횟수 제한도 없습니다.
컨테이너와 CUDA
Docker와 NVIDIA 컨테이너 툴킷은 설치와 설정이 끝나 있습니다. 아래 점검은 30초를 들일 값어치가 있습니다. 카드를 보지 못하는 컨테이너는 한참 뒤에 알아보기 어려운 방식으로 실패하기 때문입니다.
$ docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi
# 멀티 GPU 작업에는 공유 메모리와 IPC가 추가로 필요한데, 기본 제한값이 이를 막습니다.
# NCCL이 조용히 멈추는 원인은 대개 이 플래그 3개입니다:
$ docker run --rm --gpus all --ipc=host --shm-size=16g --ulimit memlock=-1 …
모델 서빙
제공된 머신에서 OpenAI 호환 엔드포인트까지 가는 가장 짧고 쓸 만한 경로입니다. 모델은 직접 쓰시는 것으로 바꾸십시오. 중요한 것은 플래그입니다.
$ docker run -d --name vllm --gpus all --ipc=host -p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--max-model-len 8192 \
--gpu-memory-utilization 0.92
# 멀티 GPU 노드에서는 머신 안의 모든 카드에 걸쳐 샤딩하십시오:
$ … --tensor-parallel-size 4
# 그다음, 직접 쓰시는 머신에서:
$ curl http://203.0.113.42:8000/v1/models
특정 모델이 특정 머신에 들어가는지는 의견이 아니라 계산입니다 — 가중치, 그리고 컨텍스트 길이에 따라 커지는 KV 캐시. 구성 도구는 결제 전에 모든 구성에 대해 그 계산을 수행하며, VRAM 사이징 가이드에 계산식이 실려 있어 당사의 계산을 직접 확인하실 수 있습니다.
디스크와 스토리지
시스템 볼륨을 제외한 디스크는 그대로 인계됩니다. 당사는 RAID 수준을 강제하지 않습니다. 잃어서는 안 되는 체크포인트를 두는지, 한 시간이면 다시 내려받을 수 있는 데이터셋을 두는지에 따라 적절한 수준이 달라지기 때문입니다.
# 먼저 사용하지 않는 장치를 확인하십시오 — 지정한 장치의 데이터가 파괴됩니다.
$ lsblk
$ mdadm --create /dev/md0 --level=0 --raid-devices=2 /dev/nvme1n1 /dev/nvme2n1
$ mkfs.ext4 -E lazy_itable_init=0,lazy_journal_init=0 /dev/md0
$ mkdir -p /scratch && mount /dev/md0 /scratch
$ echo '/dev/md0 /scratch ext4 defaults,noatime 0 2' >> /etc/fstab
추가 NVMe, 아카이브 HDD, 머신 외부 스냅샷은 월 단위 옵션이며, 구성 도구에서 또는 나중에 추가할 수 있습니다. 로컬 디스크는 당사가 백업하지 않으며 앞으로도 하지 않습니다 — 아래 스냅샷 항목을 참조하십시오.
방화벽과 포트
인바운드는 고객 머신이 차단하는 것을 제외하고 모두 개방되어 있습니다: 앞단에 네트워크 필터가 없으며, 이는 의도적인 선택이자 책임을 당사에 두는 방식입니다. 아웃바운드 포트 25 하나만 예외로, 요청하시기 전까지 상단에서 차단되어 있습니다.
$ ufw default deny incoming
$ ufw default allow outgoing
$ ufw allow 22/tcp
$ ufw allow from 198.51.100.7 to any port 8000 proto tcp
$ ufw --force enable
# 포트를 여는 것보다 안전한 방법: 서비스를 localhost에 두기
# 그리고 직접 쓰시는 머신에서 터널로 접속하십시오.
$ ssh -N -L 8000:127.0.0.1:8000 root@203.0.113.42
IPMI와 재설치
대역 외 접근은 모든 머신에 별도 주소로 제공됩니다. 새벽 3시에 스스로 잠겨 버린 머신을 아무에게도 요청하지 않고 복구하는 수단입니다.
전원
강제 전원 재투입, 정상 종료, 섀시 전원 상태 — 운영체제의 응답 여부와 무관합니다.
시리얼·KVM 콘솔
머신이 모니터에 표시할 화면으로, 부트로더와 커널 패닉까지 포함합니다. 망가진 fstab을 고치는 곳이 여기입니다.
가상 미디어
네트워크로 임의의 ISO를 마운트해 부팅할 수 있습니다. 복구 이미지도 포함되고, 당사가 제공하지 않는 운영체제도 포함됩니다.
당사가 제공하는 어떤 이미지로든 깨끗하게 재설치할 수 있으며, 당사에 요청하시면 최초 제공과 비슷한 시간이 걸립니다. 비용은 없고, 횟수 제한도 없으며, 머신은 기존 주소를 그대로 유지합니다. 디스크의 모든 내용은 이 과정에서 파괴됩니다 — 그것이 재설치의 목적이며, 되돌릴 수 없습니다.
스냅샷
선택 사항, 월 단위, 머신 외부 보관. 구매하지 않으시면 고객 디스크 외에는 데이터 사본이 어디에도 없습니다 — GPU에서 돌아가는 작업 대부분에는 이것이 올바른 기본값이고, 나머지에는 재앙입니다.
이용 기간 종료
월 단위 이용 기간은 결제한 달의 마지막 날에 종료되며, 통지 기간도 해지 수수료도 없습니다. 그 이후에 벌어지는 일은 되돌릴 수 없으므로, 각주가 아니라 여기에 명시합니다.
- 자동으로 갱신되는 것은 없습니다. 등록 카드도, 자동 이체도 없습니다 — 이용 기간은 다음 기간 요금을 결제하셔야만 이어집니다.
- 공용 포트는 이용 기간이 끝나는 순간 차단됩니다. 유예 하루가 끝날 때가 아니라 즉시 머신에 접근할 수 없게 됩니다.
- 디스크는 1시간 이내에 소거됩니다. 암호학적 소거 후 전체 덮어쓰기를 수행합니다. 데이터가 어딘가에 남아 있는 구간은 없습니다.
- 스냅샷도 함께 사라집니다. 구매하셨다면 같은 작업에서 삭제됩니다.
- 주소는 풀로 돌아갑니다. 일정 기간 보류한 뒤, 깨끗해진 경우에만 반환합니다.
관련 페이지
- 가이드실무 가이드 8편: VRAM 사이징, NVLink와 PCIe 비교, 이미지·영상 모델, 월 단위와 시간 단위 비교, 셀프 호스팅과 API 비교, Llama 70B 서빙, 그리고 QLoRA.
- 하드웨어 정책당사가 운영하는 NVIDIA GPU 12종, 노드를 판매하기 전 72시간 번인, 4시간 교체 목표, 그리고 테넌트 간에 디스크를 소거하는 방식까지.
- 네트워크최대 25 Gbit/s 무제한 포트, 거점마다 회선 사업자 2곳과 IX 1곳, 상시 DDoS 방어, 라우팅된 IPv6 — 그리고 당사가 제공하지 않는 4가지를 먼저 밝힙니다.
- 회사 소개gpuserver.io를 누가 운영하는지, 왜 재판매 대신 하드웨어를 직접 사들이는지, 그리고 굽히지 않는 규칙 4가지 — 판매를 잃게 만드는 규칙까지.