데이터센터 6곳 전체 정상

암호화폐 결제 · 신원 확인 없음 · 5분 미만 안에 root 권한

인프라

당사가 랙에 장착하는 것, 그리고 고장 났을 때 벌어지는 일.

전용 서버는 물리적 실체에 대한 약속입니다. 이 페이지는 그 실체를 설명합니다: 어떤 카드를 구매하는지, 테넌트를 받기 전에 노드를 어떻게 시험하는지, 그리고 카드 하나가 고장 난 날 무엇을 하는지.

  • 12당사가 운영하는 GPU 모델
  • 72 h노드가 테넌트를 받기 전 번인
  • 4 h고장 난 하드웨어 교체 목표
  • 0다른 사업자에게서 재판매된 카드

당사가 운영하는 모든 카드

이것이 전체 목록입니다 — 목록에 없는 등급도, 큰 계정을 위해 따로 두는 카드도 없습니다. 메모리 대역폭을 표에 넣은 이유는, 추론에서는 그 값이 어떤 테라플롭 수치보다 처리량을 훨씬 잘 예측하기 때문입니다.

GPU 모델, 아키텍처, 메모리, 대역폭, 노드 크기와 시작 가격
카드 아키텍처 메모리 대역폭 노드 크기 시작가
L4 PCIe 애드인 카드 Ada Lovelace 24 GB GDDR6 300 GB/s 1×, 2×, 4×, 8×, 10× $125/월
RTX 4090 PCIe 애드인 카드 Ada Lovelace 24 GB GDDR6X 1,008 GB/s 1×, 2×, 4×, 8× $193/월
RTX 5090 PCIe 애드인 카드 Blackwell 32 GB GDDR7 1,792 GB/s 1×, 2×, 4×, 8× $335/월
RTX A6000 PCIe 애드인 카드 Ampere 48 GB GDDR6 ECC 768 GB/s 1×, 2×, 4×, 8× $286/월
L40S PCIe 애드인 카드 Ada Lovelace 48 GB GDDR6 ECC 864 GB/s 1×, 2×, 4×, 8× $714/월
A100 PCIe PCIe 애드인 카드 Ampere 40 GB HBM2 1,555 GB/s 1×, 2×, 4×, 8× $392/월
A100 PCIe PCIe 애드인 카드 Ampere 80 GB HBM2e 1,935 GB/s 1×, 2×, 4×, 8× $1,091/월
H100 PCIe PCIe 애드인 카드 Hopper 80 GB HBM3 2,000 GB/s 1×, 2×, 4×, 8× $1,469/월
A100 SXM4 SXM 모듈, HGX 보드 Ampere 80 GB HBM2e 2,039 GB/s 4×, 8× $4,395/월
H100 SXM5 SXM 모듈, HGX 보드 Hopper 80 GB HBM3 3,350 GB/s 4×, 8× $6,061/월
H200 SXM5 SXM 모듈, HGX 보드 Hopper 141 GB HBM3e 4,800 GB/s 4×, 8× $8,405/월
B200 SXM6 SXM 모듈, HGX 보드 Blackwell 180 GB HBM3e 8,000 GB/s 4×, 8× $11,790/월

모든 카드는 새로 구매한 리테일 또는 OEM 부품이며, 보증은 당사 명의로 되어 있습니다. 채굴에 쓰인 중고 물량은 구매하지 않고, 이력을 확인할 수 없는 카드도 구매하지 않습니다 — 중고 RTX 4090이 싼 데에는 이유가 있고, 그 이유는 4개월째에 찾아옵니다.

카드를 둘러싼 구성

CPU나 RAM, 디스크 처리량이 부족한 GPU는 비싼 값을 치르며 기다리는 방법일 뿐입니다. 섀시는 카드 수에 맞추어 선택하며, 업그레이드 경로로 판매하지 않습니다.

GPU 수별 섀시 사양
노드 CPU 시스템 RAM 로컬 스토리지 포트
1 × GPU AMD Ryzen 9 7950X 16코어 / 32스레드 · 또는 Intel Xeon Silver 4410Y 128 GB 2 × 2 TB NVMeGen4 U.2, RAID 강제 없음 1 Gbit/s
2 × GPU AMD Threadripper 7960X 24코어 / 48스레드 · 또는 Intel Xeon Gold 5416S 256 GB 2 × 3.84 TB NVMeGen4 U.2, RAID 강제 없음 2 Gbit/s
4 × GPU AMD Threadripper 7970X 32코어 / 64스레드 · 또는 2 × Intel Xeon Gold 6438Y+ 512 GB 4 × 3.84 TB NVMeGen4 U.2, RAID 강제 없음 10 Gbit/s
8 × GPU 2 × Intel Xeon Gold 6438Y+ 64코어 · 또는 2 × Intel Xeon Platinum 8462Y+ 1 TB 8 × 3.84 TB NVMeGen4 U.2, RAID 강제 없음 25 Gbit/s
10 × GPU 2 × Intel Xeon Platinum 8462Y+ 64코어 · 또는 2 × Intel Xeon Platinum 8462Y+ 1 TB 8 × 7.68 TB NVMeGen4 U.2, RAID 강제 없음 25 Gbit/s

CPU가 두 가지로 표기된 경우 둘 중 어느 쪽이든 제공될 수 있습니다 — 두 제품은 코어 수와 메모리 채널이 같으며, 결제 전에 구성 도구가 노드에 어떤 것이 들어가는지 표시합니다. 디스크는 설정 없이 그대로 제공합니다: 당사는 RAID 레벨을 강제하지 않습니다. 적절한 레벨은 체크포인트를 저장하는지 다시 내려받을 수 있는 데이터셋을 저장하는지에 따라 달라지기 때문입니다.

노드를 판매하기 전

머신은 3일 동안 고장 나지 않고 버틴 뒤에야 카탈로그에 오릅니다. 일찍 고장 날 카드는 거의 모두 여기, 당사의 손에서 고장 나며 고객의 손에서 고장 나지 않습니다.

1단계 · 2시간

조립과 재고 관리

모든 카드와 모듈, 디스크의 일련번호를 섀시에 대응해 기록합니다. 나중에 고객의 머신에 어떤 물리 부품이 들어 있는지 정확히 알려 드릴 수 있는 것은 이 기록 덕분입니다.

2단계 · 24시간

메모리·연산 부하 시험

모든 카드에 대해 VRAM 전체 ECC 패턴 시험을 수행한 뒤, 사용률 100%로 행렬 곱셈을 지속합니다. 정정 불가 오류가 1건이라도 나오면 그 카드는 상자로 되돌아갑니다.

3단계 · 24시간

발열·전력 부하 시험

전용실 최악의 조건까지 흡기 온도를 올린 상태에서 노드 전체를 최대 부하로 유지합니다. 당사는 카드가 실제로 유지하는 클럭을 기록하고 — 상자에 적힌 부스트 수치가 아닙니다 — 사양 이하로 스로틀링되는 노드는 재장착하거나 서멀 그리스를 다시 도포한 뒤 다시 시험합니다.

4단계 · 24시간

인터커넥트와 스토리지

NVLink 또는 PCIe 피어 투 피어 대역폭을 카드 대 카드로 측정하고, NVMe 쓰기 내구성을 표본 검사하며, 포트를 회선 속도로 유지합니다. 이 수치는 같은 모델의 다른 노드와 비교하는데, 15% 느린 노드는 문제가 있는 노드이기 때문입니다.

이후 · 랙 장착 완료 후 대기

사용 가능, 기록할 이미지 준비 완료

제공까지 영업일이 아니라 5분 미만 걸리는 이유는 이렇습니다: 주문 시점에 조립하는 것이 없습니다. 머신은 이미 전원이 켜지고 시험을 마친 상태로 존재하며, 결제는 제작이 아니라 이미지 쓰기를 시작시킵니다.

펌웨어와 드라이버

드라이버 스택 설치 완료, 버전 고정, 변경은 자유 모든 Linux 이미지에는 최신 NVIDIA 드라이버와 CUDA, cuDNN, NCCL이 이미 동작하는 상태로 포함됩니다. 이 전부를 교체하는 것을 막는 것은 없습니다 — root는 고객의 것이기 때문입니다.
펌웨어 업데이트 이용 기간 중에는 절대 없음 BIOS와 BMC, VBIOS는 노드가 카탈로그에 오르기 전에 설정합니다. 임대 중인 머신에는 펌웨어를 배포하지 않으며, 테넌트 교체 시에 적용합니다.
클럭 순정 상태, 고객에게 잠금 해제됨 당사는 모든 카드를 레퍼런스 클럭과 전력 제한 설정 그대로 제공합니다. nvidia-smi로 이를 올리거나 내릴 수 있습니다. 그에 따른 보증 문제는 고객이 아니라 당사가 감당합니다.
대역 외 접속 IPMI, 별도 네트워크 운영체제에 접속할 수 없을 때에도 사용할 수 있는 원격 전원 제어, 시리얼 콘솔, 가상 미디어입니다. 고객의 공용 포트에 절대 닿지 않는 관리 VLAN에 있습니다.

장애가 발생했을 때

하드웨어는 고장 납니다. 사업자를 가르는 것은 고장이 나느냐가 아니라, 그다음 4시간이 어떠한가입니다.

예비 부품은 현장에 상비

전용실마다 예비 카드와 PSU, 디스크, 그리고 모델별 완제품 섀시 1대를 보관합니다. 교체는 통로를 걸어가는 일이지, 택배를 예약하는 일이 아닙니다.

4시간 목표

고객의 신고부터 하드웨어가 다시 정상 동작할 때까지, 24시간 내내 대응합니다. 목표를 지키지 못하면 SLA가 이용 기간을 자동으로 연장합니다 — 고객이 별도로 신청하실 필요가 없습니다.

디스크는 그대로 고객의 것

고장 난 GPU나 PSU는 디스크를 건드리지 않고 제자리에 둔 채로 교체합니다. 스토리지를 건드리기 전에만 문의드리며, 고장 난 것이 스토리지일 때에만 그렇습니다.

고장 난 디스크는 다음 테넌트가 읽을 수 없습니다. 서비스에서 제외한 드라이브는 아직 응답하면 소거하고, 응답하지 않으면 물리적으로 파기합니다. 고장 난 디스크는 소거할 수 없으므로, 보증을 이유로 제조사에 반환하지 않습니다 — 고객의 데이터를 한때 담았던 드라이브가 온전한 상태로 건물을 떠나게 하느니, 당사가 그 비용을 부담합니다.

테넌트 교체 시

같은 머신은 고객이 사용한 뒤 다시 임대됩니다. 아래의 모든 절차는 그 머신이 카탈로그에 다시 오르기 전에, 요청 여부와 관계없이 수행됩니다.

테넌트 교체 시 회수 절차
단계수행 내용검증 방법
1. 네트워크이용 기간이 끝나는 순간 머신은 공용 포트에서 분리됩니다. 대기하는 동안 접근 가능한 것은 아무것도 남지 않습니다.포트 상태, 기록됨
2. 스토리지모든 NVMe 장치에 대해 전체 암호학적 소거를 수행한 뒤, 전체 주소 공간을 1회 덮어씁니다.각 장치에서 표본 되읽기 확인
3. GPU 메모리카드를 초기화하고 메모리를 비웁니다. ECC 카운터를 읽어 번인 때 기록한 값과 비교합니다.nvidia-smi 초기화 로그
4. 펌웨어BMC와 BIOS 설정은 당사 기준값으로 다시 플래싱되며, 이용 기간 중에 이루어진 변경은 모두 폐기됩니다.기준값과 체크섬 대조
5. 식별 정보IPMI 접속 정보를 교체하고, IP 주소를 풀에 반환하며, rDNS를 삭제합니다.깨끗해질 때까지 주소 보류

이 점은 이용 기간이 끝난 뒤 당사가 아무것도 복구할 수 없는 이유이기도 합니다. 고객의 데이터가 어딘가에 남아 있는 유예 기간은 없습니다 — 2단계는 이미 실행되었습니다. 필요한 데이터는 이용 기간이 끝나기 전에 머신에서 옮겨 두십시오.

당사가 하지 않는 것

카드 분할. MIG 없음, vGPU 없음, 타임슬라이싱 없음. 물리 GPU당 테넌트 1개이며, 이 덕분에 목록에 표시된 처리량이 재현 가능합니다.

노드 초과 할당. 머신에는 두 번째 계정이 없고, 고객과 실물 장비 사이에 하이퍼바이저도 없습니다.

타인의 용량 재판매. 이 페이지의 모든 카드는 당사가 직접 구매해 랙에 장착한 카드입니다. 여기에 다른 클라우드에 얹은 재판매 마진은 없습니다.

다른 카드로 대체. 주문하신 모델을 제공할 수 없으면, 당사는 비슷한 제품을 조용히 보내지 않습니다 — 그 사실을 알려 드리고 해당 이용 기간을 환불합니다.

고객의 운영체제 진입. root는 고객만의 것입니다. 당사에는 전원을 껐다 켜고 미디어를 마운트할 수 있는 IPMI가 있지만, 머신 내부의 로그인 계정은 보유하지 않습니다.

무엇이든 사본 보관. 당사는 고객 디스크를 백업하지 않습니다. 스냅샷은 구매하신 경우에만 존재하며, 이용 기간과 함께 삭제됩니다.

행에 표시된 사양이 실제로 제공되는 사양입니다.

위의 모든 카드는 데이터센터 6곳 전체에서 랙 장착과 번인을 마친 상태로, 기록할 이미지가 준비된 채 제공됩니다.

로그인

콘솔, 청구서, 대역 외 접근.

계정이 없으십니까?

별도의 회원가입은 없습니다. 첫 주문을 진행하는 동안 계정이 만들어집니다 — 결제 단계에서 이메일과 비밀번호를 직접 정하시고, 머신이 준비될 때쯤이면 콘솔도 이미 열려 있습니다.

서버 구성하기

Language