何をラックに搭載しているか、そして故障した場合に何が起こるか。
専有サーバーとは、物理的な実体についての約束です。このページでは、その実体そのものについて説明します。当社がどのカードを購入するか、ノードがテナントを受け入れる前にどのように検証されるか、そして故障した当日に何を行うかです。
- 12当社が運用するGPUモデル
- 72 hノードがテナントを迎える前のバーンイン
- 4 h故障したハードウェアの交換目標
- 0他社から転売されたカード
当社が運用するすべてのカード
これがラインナップのすべてです。非公開のプランや、大口アカウント向けに温存しているカードはありません。メモリ帯域幅を掲載しているのは、推論においてはどんなテラフロップス値よりもスループットを的確に予測できるからです。
| カード | アーキテクチャ | メモリ | 帯域幅 | ノードサイズ | から |
|---|---|---|---|---|---|
| L4 | Ada Lovelace | 24 GB | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/月 |
| RTX 4090 | Ada Lovelace | 24 GB | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/月 |
| RTX 5090 | Blackwell | 32 GB | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/月 |
| RTX A6000 | Ampere | 48 GB | 768 GB/s | 1×, 2×, 4×, 8× | $286/月 |
| L40S | Ada Lovelace | 48 GB | 864 GB/s | 1×, 2×, 4×, 8× | $714/月 |
| A100 PCIe | Ampere | 40 GB | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/月 |
| A100 PCIe | Ampere | 80 GB | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/月 |
| H100 PCIe | Hopper | 80 GB | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/月 |
| A100 SXM4 | Ampere | 80 GB | 2,039 GB/s | 4×, 8× | $4,395/月 |
| H100 SXM5 | Hopper | 80 GB | 3,350 GB/s | 4×, 8× | $6,061/月 |
| H200 SXM5 | Hopper | 141 GB | 4,800 GB/s | 4×, 8× | $8,405/月 |
| B200 SXM6 | Blackwell | 180 GB | 8,000 GB/s | 4×, 8× | $11,790/月 |
すべてのカードは、当社名義の保証付きで新品購入したリテール品またはOEM品です。マイニング上がりの在庫は購入せず、来歴が説明できないカードも購入しません。中古のRTX 4090が安いのには理由があり、その理由は4か月目にやって来ます。
カードを取り巻くもの
CPU、RAM、ディスクのスループットが不足したGPUは、高くつく「待ち時間」でしかありません。シャーシはカードの枚数に合わせて選定されており、アップグレード手段として販売されているわけではありません。
| ノード | CPU | システムRAM | ローカルストレージ | ポート |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X | 128 GB | 2 × 2 TB NVMe | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X | 256 GB | 2 × 3.84 TB NVMe | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X | 512 GB | 4 × 3.84 TB NVMe | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ | 1 TB | 8 × 3.84 TB NVMe | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMe | 25 Gbit/s |
CPUが2種類記載されている構成では、いずれか一方が届きます。コア数とメモリチャネル数を揃えてあるため、支払い前に設定画面でお使いのノードにどちらが搭載されているかをご確認いただけます。ディスクは未加工のまま提供します。チェックポイントを保存するのか、再ダウンロード可能なデータセットを保存するのかによって最適なRAIDレベルは変わるため、当社側では指定しません。
ノードが提供される前に
マシンがカタログに掲載されるのは、3日間壊れずに耐え抜いた後だけです。早期に故障するカードのほとんどは、お客様の手元ではなく、この段階で当社の手元で故障します。
STEP 1 · 2時間
組み立てと在庫管理
すべてのカード、モジュール、ディスクのシリアル番号はシャーシに紐づけて記録されます。この記録があるからこそ、後になっても、お客様のマシンに搭載されている物理部品を正確にお伝えできます。
STEP 2 · 24時間
メモリと演算のソークテスト
すべてのカードに対してVRAM全域のECCパターンテストを行い、続けて使用率100%での連続した行列乗算を実施します。訂正不能なエラーが1件でも発生すれば、そのカードは箱に戻されます。
STEP 3 · 24時間
熱・電力負荷試験
ノード全体を、吸気温度をハウジングスペースの最悪条件まで上げた状態でフルロードにかけます。記録するのは化粧箱記載のブースト値ではなく、カードが実際に維持するクロックです。仕様を下回ってスロットリングするノードは、再度テストする前に再装着またはサーマルグリスの再塗布を行います。
STEP 4 · 24時間
インターコネクトとストレージ
NVLinkまたはPCIeのピアツーピア帯域幅をカード間で測定し、NVMeの書き込み耐久性をサンプリングし、ポートを線速度で維持します。数値は同一モデルの他のノードと比較されます。15%遅いノードは、何か問題を抱えているノードだからです。
THEN · ラック搭載・待機中
利用可能。書き込み可能なイメージも用意済みです
納品が営業日単位ではなく5分未満なのはこのためです。ご注文時に組み立てられるものは何もありません。マシンはすでに存在し、電源を入れてテスト済みの状態にあり、お支払いによって行われるのはイメージの書き込みであって、組み立てではありません。
ファームウェアとドライバー
nvidia-smiで引き上げも引き下げも可能ですが、その際の保証への影響は、お客様ではなく当社が負います。
故障が起きたとき
ハードウェアは故障します。プロバイダーの違いを分けるのは、故障が起きるかどうかではなく、その後の4時間がどうなるかです。
予備部品は現地に常備
各ハウジングスペースには、予備のカード、PSU、ディスク、そしてモデルごとに完全な予備シャーシ一式が用意されています。交換は通路を歩いて行くだけで済み、配送業者への手配は不要です。
4時間の目標
ご報告から正常なハードウェアへの復旧まで、24時間365日対応します。目標を達成できなかった場合、SLAにより契約期間が自動的に延長されます。お客様からの申請は不要です。
ディスクは常にお客様のもの
故障したGPUやPSUは、ディスクに手を付けずそのままの状態で交換されます。ストレージに触れる場合、そしてストレージ自体が故障の原因である場合に限り、事前にお客様に確認します。
テナントの入れ替え時
このマシンは、次はまた別の方に貸し出されます。以下の内容はすべて、求められるかどうかにかかわらず、カタログに再登録される前に行われます。
| ステップ | 起こること | 検証担当 |
|---|---|---|
| 1. ネットワーク | 契約期間が終了した瞬間に、マシンはパブリックポートから切断されます。待機中は何にもアクセスできない状態になります。 | ポート状態(記録あり) |
| 2. ストレージ | すべてのNVMeデバイスには、完全な暗号消去に加え、アドレス空間全体への1回のオーバーライトが実施されます。 | 各デバイスでの読み取りサンプル検証 |
| 3. GPUメモリ | カードはリセットされ、メモリは消去されます。ECCカウンターを読み取り、バーンイン時に記録された値と比較します。 | nvidia-smiのリセットログ |
| 4. ファームウェア | BMCとBIOSの設定は当社の基準値に書き戻され、契約期間中に加えられた変更はすべて破棄されます。 | 基準値とのチェックサム照合 |
| 5. 識別情報 | IPMI認証情報のローテーション、IPアドレスのプールへの返却、rDNSの消去。 | クリーンになるまで保留されるアドレス |
契約期間終了後に何も復元できないのも、このためです。データがどこかにまだ残っている猶予期間はありません。手順 2はすでに実行されています。必要なものがあれば、契約期間が終わる前にマシンから取り出してください。
行わないこと
カードを分割すること。MIGも、vGPUも、タイムスライシングもありません。物理GPU1枚につき1テナントであることが、掲載しているスループットの再現性を支えています。
ノードをオーバーサブスクライブすること。マシン上に第2のアカウントは存在せず、お客様と実機の間にハイパーバイザーもありません。
他社のキャパシティを転売すること。このページに掲載されているカードは、すべて当社が購入しラック搭載したものです。他のクラウドに乗せた転売マージンは一切ありません。
別のカードにすり替えること。ご注文のモデルを納品できない場合、当社は黙って近い代替品を出荷することはありません。その旨をお伝えし、契約期間分を返金します。
お客様のOSに入り込むこと。root権限はお客様だけのものです。当社が保有するのはIPMIであり、電源の入れ直しやメディアのマウントはできますが、マシン内部へのログインは持っていません。
何かのコピーを保持すること。当社はお客様のディスクのバックアップを取りません。スナップショットは購入した場合のみ存在し、契約期間の終了とともに削除されます。
関連ページ
- ネットワーク最大25Gbit/sの無制限ポート、拠点ごとに2つのキャリアと1つのIX、常時稼働のDDoSフィルタリング、ルーテッドIPv6。そして、提供しない4つのことを最初に明示します。
- ドキュメント最初のSSH接続、ハードウェアの検証、CUDAコンテナ、vLLMでのモデル提供、RAID、ファイアウォール設定、IPMI、再インストールまで。実際に使うコマンドで解説します。
- サービスレベル契約稼働率99.9%の約束:何がダウンタイムとみなされるか、外部からどう測定するか、失った1分につき契約期間を5分延長する仕組み、そして適用除外の全内容。
- 会社概要gpuserver.ioを運営しているのは誰か、なぜ転売ではなくハードウェアを自ら購入するのか、そして曲げない4つのルール。売上を失うことになるルールも含めて。