당사가 랙에 장착하는 것, 그리고 고장 났을 때 벌어지는 일.
전용 서버는 물리적 실체에 대한 약속입니다. 이 페이지는 그 실체를 설명합니다: 어떤 카드를 구매하는지, 테넌트를 받기 전에 노드를 어떻게 시험하는지, 그리고 카드 하나가 고장 난 날 무엇을 하는지.
- 12당사가 운영하는 GPU 모델
- 72 h노드가 테넌트를 받기 전 번인
- 4 h고장 난 하드웨어 교체 목표
- 0다른 사업자에게서 재판매된 카드
당사가 운영하는 모든 카드
이것이 전체 목록입니다 — 목록에 없는 등급도, 큰 계정을 위해 따로 두는 카드도 없습니다. 메모리 대역폭을 표에 넣은 이유는, 추론에서는 그 값이 어떤 테라플롭 수치보다 처리량을 훨씬 잘 예측하기 때문입니다.
| 카드 | 아키텍처 | 메모리 | 대역폭 | 노드 크기 | 시작가 |
|---|---|---|---|---|---|
| L4 | Ada Lovelace | 24 GB | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/월 |
| RTX 4090 | Ada Lovelace | 24 GB | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/월 |
| RTX 5090 | Blackwell | 32 GB | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/월 |
| RTX A6000 | Ampere | 48 GB | 768 GB/s | 1×, 2×, 4×, 8× | $286/월 |
| L40S | Ada Lovelace | 48 GB | 864 GB/s | 1×, 2×, 4×, 8× | $714/월 |
| A100 PCIe | Ampere | 40 GB | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/월 |
| A100 PCIe | Ampere | 80 GB | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/월 |
| H100 PCIe | Hopper | 80 GB | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/월 |
| A100 SXM4 | Ampere | 80 GB | 2,039 GB/s | 4×, 8× | $4,395/월 |
| H100 SXM5 | Hopper | 80 GB | 3,350 GB/s | 4×, 8× | $6,061/월 |
| H200 SXM5 | Hopper | 141 GB | 4,800 GB/s | 4×, 8× | $8,405/월 |
| B200 SXM6 | Blackwell | 180 GB | 8,000 GB/s | 4×, 8× | $11,790/월 |
모든 카드는 새로 구매한 리테일 또는 OEM 부품이며, 보증은 당사 명의로 되어 있습니다. 채굴에 쓰인 중고 물량은 구매하지 않고, 이력을 확인할 수 없는 카드도 구매하지 않습니다 — 중고 RTX 4090이 싼 데에는 이유가 있고, 그 이유는 4개월째에 찾아옵니다.
카드를 둘러싼 구성
CPU나 RAM, 디스크 처리량이 부족한 GPU는 비싼 값을 치르며 기다리는 방법일 뿐입니다. 섀시는 카드 수에 맞추어 선택하며, 업그레이드 경로로 판매하지 않습니다.
| 노드 | CPU | 시스템 RAM | 로컬 스토리지 | 포트 |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X | 128 GB | 2 × 2 TB NVMe | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X | 256 GB | 2 × 3.84 TB NVMe | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X | 512 GB | 4 × 3.84 TB NVMe | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ | 1 TB | 8 × 3.84 TB NVMe | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMe | 25 Gbit/s |
CPU가 두 가지로 표기된 경우 둘 중 어느 쪽이든 제공될 수 있습니다 — 두 제품은 코어 수와 메모리 채널이 같으며, 결제 전에 구성 도구가 노드에 어떤 것이 들어가는지 표시합니다. 디스크는 설정 없이 그대로 제공합니다: 당사는 RAID 레벨을 강제하지 않습니다. 적절한 레벨은 체크포인트를 저장하는지 다시 내려받을 수 있는 데이터셋을 저장하는지에 따라 달라지기 때문입니다.
노드를 판매하기 전
머신은 3일 동안 고장 나지 않고 버틴 뒤에야 카탈로그에 오릅니다. 일찍 고장 날 카드는 거의 모두 여기, 당사의 손에서 고장 나며 고객의 손에서 고장 나지 않습니다.
1단계 · 2시간
조립과 재고 관리
모든 카드와 모듈, 디스크의 일련번호를 섀시에 대응해 기록합니다. 나중에 고객의 머신에 어떤 물리 부품이 들어 있는지 정확히 알려 드릴 수 있는 것은 이 기록 덕분입니다.
2단계 · 24시간
메모리·연산 부하 시험
모든 카드에 대해 VRAM 전체 ECC 패턴 시험을 수행한 뒤, 사용률 100%로 행렬 곱셈을 지속합니다. 정정 불가 오류가 1건이라도 나오면 그 카드는 상자로 되돌아갑니다.
3단계 · 24시간
발열·전력 부하 시험
전용실 최악의 조건까지 흡기 온도를 올린 상태에서 노드 전체를 최대 부하로 유지합니다. 당사는 카드가 실제로 유지하는 클럭을 기록하고 — 상자에 적힌 부스트 수치가 아닙니다 — 사양 이하로 스로틀링되는 노드는 재장착하거나 서멀 그리스를 다시 도포한 뒤 다시 시험합니다.
4단계 · 24시간
인터커넥트와 스토리지
NVLink 또는 PCIe 피어 투 피어 대역폭을 카드 대 카드로 측정하고, NVMe 쓰기 내구성을 표본 검사하며, 포트를 회선 속도로 유지합니다. 이 수치는 같은 모델의 다른 노드와 비교하는데, 15% 느린 노드는 문제가 있는 노드이기 때문입니다.
이후 · 랙 장착 완료 후 대기
사용 가능, 기록할 이미지 준비 완료
제공까지 영업일이 아니라 5분 미만 걸리는 이유는 이렇습니다: 주문 시점에 조립하는 것이 없습니다. 머신은 이미 전원이 켜지고 시험을 마친 상태로 존재하며, 결제는 제작이 아니라 이미지 쓰기를 시작시킵니다.
펌웨어와 드라이버
nvidia-smi로 이를 올리거나 내릴 수 있습니다. 그에 따른 보증 문제는 고객이 아니라 당사가 감당합니다.
장애가 발생했을 때
하드웨어는 고장 납니다. 사업자를 가르는 것은 고장이 나느냐가 아니라, 그다음 4시간이 어떠한가입니다.
예비 부품은 현장에 상비
전용실마다 예비 카드와 PSU, 디스크, 그리고 모델별 완제품 섀시 1대를 보관합니다. 교체는 통로를 걸어가는 일이지, 택배를 예약하는 일이 아닙니다.
4시간 목표
고객의 신고부터 하드웨어가 다시 정상 동작할 때까지, 24시간 내내 대응합니다. 목표를 지키지 못하면 SLA가 이용 기간을 자동으로 연장합니다 — 고객이 별도로 신청하실 필요가 없습니다.
디스크는 그대로 고객의 것
고장 난 GPU나 PSU는 디스크를 건드리지 않고 제자리에 둔 채로 교체합니다. 스토리지를 건드리기 전에만 문의드리며, 고장 난 것이 스토리지일 때에만 그렇습니다.
테넌트 교체 시
같은 머신은 고객이 사용한 뒤 다시 임대됩니다. 아래의 모든 절차는 그 머신이 카탈로그에 다시 오르기 전에, 요청 여부와 관계없이 수행됩니다.
| 단계 | 수행 내용 | 검증 방법 |
|---|---|---|
| 1. 네트워크 | 이용 기간이 끝나는 순간 머신은 공용 포트에서 분리됩니다. 대기하는 동안 접근 가능한 것은 아무것도 남지 않습니다. | 포트 상태, 기록됨 |
| 2. 스토리지 | 모든 NVMe 장치에 대해 전체 암호학적 소거를 수행한 뒤, 전체 주소 공간을 1회 덮어씁니다. | 각 장치에서 표본 되읽기 확인 |
| 3. GPU 메모리 | 카드를 초기화하고 메모리를 비웁니다. ECC 카운터를 읽어 번인 때 기록한 값과 비교합니다. | nvidia-smi 초기화 로그 |
| 4. 펌웨어 | BMC와 BIOS 설정은 당사 기준값으로 다시 플래싱되며, 이용 기간 중에 이루어진 변경은 모두 폐기됩니다. | 기준값과 체크섬 대조 |
| 5. 식별 정보 | IPMI 접속 정보를 교체하고, IP 주소를 풀에 반환하며, rDNS를 삭제합니다. | 깨끗해질 때까지 주소 보류 |
이 점은 이용 기간이 끝난 뒤 당사가 아무것도 복구할 수 없는 이유이기도 합니다. 고객의 데이터가 어딘가에 남아 있는 유예 기간은 없습니다 — 2단계는 이미 실행되었습니다. 필요한 데이터는 이용 기간이 끝나기 전에 머신에서 옮겨 두십시오.
당사가 하지 않는 것
카드 분할. MIG 없음, vGPU 없음, 타임슬라이싱 없음. 물리 GPU당 테넌트 1개이며, 이 덕분에 목록에 표시된 처리량이 재현 가능합니다.
노드 초과 할당. 머신에는 두 번째 계정이 없고, 고객과 실물 장비 사이에 하이퍼바이저도 없습니다.
타인의 용량 재판매. 이 페이지의 모든 카드는 당사가 직접 구매해 랙에 장착한 카드입니다. 여기에 다른 클라우드에 얹은 재판매 마진은 없습니다.
다른 카드로 대체. 주문하신 모델을 제공할 수 없으면, 당사는 비슷한 제품을 조용히 보내지 않습니다 — 그 사실을 알려 드리고 해당 이용 기간을 환불합니다.
고객의 운영체제 진입. root는 고객만의 것입니다. 당사에는 전원을 껐다 켜고 미디어를 마운트할 수 있는 IPMI가 있지만, 머신 내부의 로그인 계정은 보유하지 않습니다.
무엇이든 사본 보관. 당사는 고객 디스크를 백업하지 않습니다. 스냅샷은 구매하신 경우에만 존재하며, 이용 기간과 함께 삭제됩니다.
관련 페이지
- 네트워크최대 25 Gbit/s 무제한 포트, 거점마다 회선 사업자 2곳과 IX 1곳, 상시 DDoS 방어, 라우팅된 IPv6 — 그리고 당사가 제공하지 않는 4가지를 먼저 밝힙니다.
- 문서첫 SSH 접속, 하드웨어 검증, CUDA 컨테이너, vLLM으로 모델 서빙, RAID, 방화벽 설정, IPMI, 재설치 — 실제 머신에서 쓰는 명령어.
- 서비스 수준 협약99.9% 약정: 무엇이 다운타임인지, 외부에서 어떻게 측정하는지, 손실 1분당 이용 기간 5분을 어떻게 돌려주는지, 그리고 면책 사항 전체.
- 회사 소개gpuserver.io를 누가 운영하는지, 왜 재판매 대신 하드웨어를 직접 사들이는지, 그리고 굽히지 않는 규칙 4가지 — 판매를 잃게 만드는 규칙까지.