インフラ

# 何をラックに搭載しているか、そして故障した場合に何が起こるか。

専有サーバーとは、物理的な実体についての約束です。このページでは、その実体そのものについて説明します。当社がどのカードを購入するか、ノードがテナントを受け入れる前にどのように検証されるか、そして故障した当日に何を行うかです。

- 12 当社が運用するGPUモデル
- 72 h ノードがテナントを迎える前のバーンイン
- 4 h 故障したハードウェアの交換目標
- 0 他社から転売されたカード

## 当社が運用するすべてのカード

これがラインナップのすべてです。非公開のプランや、大口アカウント向けに温存しているカードはありません。メモリ帯域幅を掲載しているのは、推論においてはどんなテラフロップス値よりもスループットを的確に予測できるからです。

**GPUモデル、アーキテクチャ、メモリ、帯域幅、ノードサイズ、最低価格**

| カード | アーキテクチャ | メモリ | 帯域幅 | ノードサイズ | から |
|---|---|---|---|---|---|
| L4 PCIeアドインカード | Ada Lovelace | 24 GB GDDR6 | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/月 |
| RTX 4090 PCIeアドインカード | Ada Lovelace | 24 GB GDDR6X | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/月 |
| RTX 5090 PCIeアドインカード | Blackwell | 32 GB GDDR7 | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/月 |
| RTX A6000 PCIeアドインカード | Ampere | 48 GB GDDR6 ECC | 768 GB/s | 1×, 2×, 4×, 8× | $286/月 |
| L40S PCIeアドインカード | Ada Lovelace | 48 GB GDDR6 ECC | 864 GB/s | 1×, 2×, 4×, 8× | $714/月 |
| A100 PCIe PCIeアドインカード | Ampere | 40 GB HBM2 | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/月 |
| A100 PCIe PCIeアドインカード | Ampere | 80 GB HBM2e | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/月 |
| H100 PCIe PCIeアドインカード | Hopper | 80 GB HBM3 | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/月 |
| A100 SXM4 SXMモジュール、HGXボード | Ampere | 80 GB HBM2e | 2,039 GB/s | 4×, 8× | $4,395/月 |
| H100 SXM5 SXMモジュール、HGXボード | Hopper | 80 GB HBM3 | 3,350 GB/s | 4×, 8× | $6,061/月 |
| H200 SXM5 SXMモジュール、HGXボード | Hopper | 141 GB HBM3e | 4,800 GB/s | 4×, 8× | $8,405/月 |
| B200 SXM6 SXMモジュール、HGXボード | Blackwell | 180 GB HBM3e | 8,000 GB/s | 4×, 8× | $11,790/月 |

すべてのカードは、当社名義の保証付きで新品購入したリテール品またはOEM品です。マイニング上がりの在庫は購入せず、来歴が説明できないカードも購入しません。中古のRTX 4090が安いのには理由があり、その理由は4か月目にやって来ます。

## カードを取り巻くもの

CPU、RAM、ディスクのスループットが不足したGPUは、高くつく「待ち時間」でしかありません。シャーシはカードの枚数に合わせて選定されており、アップグレード手段として販売されているわけではありません。

**シャーシ仕様（GPU数別）**

| ノード | CPU | システムRAM | ローカルストレージ | ポート |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X 16コア/32スレッド · またはIntel Xeon Silver 4410Y | 128 GB | 2 × 2 TB NVMeGen4 U.2、RAID強制なし | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X 24コア/48スレッド · またはIntel Xeon Gold 5416S | 256 GB | 2 × 3.84 TB NVMeGen4 U.2、RAID強制なし | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X 32コア/64スレッド · または2 × Intel Xeon Gold 6438Y+ | 512 GB | 4 × 3.84 TB NVMeGen4 U.2、RAID強制なし | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ 64コア · または2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 3.84 TB NVMeGen4 U.2、RAID強制なし | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ 64コア · または2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMeGen4 U.2、RAID強制なし | 25 Gbit/s |

CPUが2種類記載されている構成では、いずれか一方が届きます。コア数とメモリチャネル数を揃えてあるため、支払い前に設定画面でお使いのノードにどちらが搭載されているかをご確認いただけます。ディスクは未加工のまま提供します。チェックポイントを保存するのか、再ダウンロード可能なデータセットを保存するのかによって最適なRAIDレベルは変わるため、当社側では指定しません。

## ノードが提供される前に

マシンがカタログに掲載されるのは、3日間壊れずに耐え抜いた後だけです。早期に故障するカードのほとんどは、お客様の手元ではなく、この段階で当社の手元で故障します。

STEP 1 · 2時間

### 組み立てと在庫管理

すべてのカード、モジュール、ディスクのシリアル番号はシャーシに紐づけて記録されます。この記録があるからこそ、後になっても、お客様のマシンに搭載されている物理部品を正確にお伝えできます。

STEP 2 · 24時間

### メモリと演算のソークテスト

すべてのカードに対してVRAM全域のECCパターンテストを行い、続けて使用率100%での連続した行列乗算を実施します。訂正不能なエラーが1件でも発生すれば、そのカードは箱に戻されます。

STEP 3 · 24時間

### 熱・電力負荷試験

ノード全体を、吸気温度をハウジングスペースの最悪条件まで上げた状態でフルロードにかけます。記録するのは化粧箱記載のブースト値ではなく、カードが実際に維持するクロックです。仕様を下回ってスロットリングするノードは、再度テストする前に再装着またはサーマルグリスの再塗布を行います。

STEP 4 · 24時間

### インターコネクトとストレージ

NVLinkまたはPCIeのピアツーピア帯域幅をカード間で測定し、NVMeの書き込み耐久性をサンプリングし、ポートを線速度で維持します。数値は同一モデルの他のノードと比較されます。15%遅いノードは、何か問題を抱えているノードだからです。

THEN · ラック搭載・待機中

### 利用可能。書き込み可能なイメージも用意済みです

納品が営業日単位ではなく5分未満なのはこのためです。ご注文時に組み立てられるものは何もありません。マシンはすでに存在し、電源を入れてテスト済みの状態にあり、お支払いによって行われるのはイメージの書き込みであって、組み立てではありません。

## ファームウェアとドライバー

ドライバースタック インストール済み、バージョン固定済み。変更はお客様の自由です すべてのLinuxイメージには、最新のNVIDIAドライバー、CUDA、cuDNN、NCCLがあらかじめ動作する状態で含まれています。そのすべてを入れ替えることも自由です。root権限はお客様のものです。

ファームウェアの更新 契約期間中には一切行いません BIOS、BMC、VBIOSは、ノードがカタログに掲載される前に設定されます。稼働中のマシンにファームウェアを適用することはなく、テナントの入れ替え時にのみ行います。

クロック 在庫あり。お客様にすぐ開放されます すべてのカードは、リファレンスクロックおよび電力制限値の状態で出荷します。`nvidia-smi`で引き上げも引き下げも可能ですが、その際の保証への影響は、お客様ではなく当社が負います。

アウトオブバンドアクセス 独立したネットワーク上のIPMI リモート電源操作、シリアルコンソール、仮想メディアに、OSが応答しない状態でもアクセスできます。これらはお客様のパブリックポートに一切触れない、管理用VLAN上にあります。

## 故障が起きたとき

ハードウェアは故障します。プロバイダーの違いを分けるのは、故障が起きるかどうかではなく、その後の4時間がどうなるかです。

### 予備部品は現地に常備

各ハウジングスペースには、予備のカード、PSU、ディスク、そしてモデルごとに完全な予備シャーシ一式が用意されています。交換は通路を歩いて行くだけで済み、配送業者への手配は不要です。

### 4時間の目標

ご報告から正常なハードウェアへの復旧まで、24時間365日対応します。目標を達成できなかった場合、SLAにより契約期間が自動的に延長されます。お客様からの申請は不要です。

### ディスクは常にお客様のもの

故障したGPUやPSUは、ディスクに手を付けずそのままの状態で交換されます。ストレージに触れる場合、そしてストレージ自体が故障の原因である場合に限り、事前にお客様に確認します。

**故障したディスクは、次のテナントに読み取られることはありません。** 運用を外れたドライブは、応答する場合は消去され、応答しない場合は物理的に破壊されます。故障したディスクは消去できないため、保証を使ってメーカーに返送することは一切ありません。お客様のデータを保持していたドライブを、そのままの状態で建物の外に出すよりも、当社がそのコストを負担する道を選んでいます。

## テナントの入れ替え時

このマシンは、次はまた別の方に貸し出されます。以下の内容はすべて、求められるかどうかにかかわらず、カタログに再登録される前に行われます。

**テナント入れ替え時の廃棄・初期化手順**

| ステップ | 起こること | 検証担当 |
|---|---|---|
| 1. ネットワーク | 契約期間が終了した瞬間に、マシンはパブリックポートから切断されます。待機中は何にもアクセスできない状態になります。 | ポート状態（記録あり） |
| 2. ストレージ | すべてのNVMeデバイスには、完全な暗号消去に加え、アドレス空間全体への1回のオーバーライトが実施されます。 | 各デバイスでの読み取りサンプル検証 |
| 3. GPUメモリ | カードはリセットされ、メモリは消去されます。ECCカウンターを読み取り、バーンイン時に記録された値と比較します。 | `nvidia-smi`のリセットログ |
| 4. ファームウェア | BMCとBIOSの設定は当社の基準値に書き戻され、契約期間中に加えられた変更はすべて破棄されます。 | 基準値とのチェックサム照合 |
| 5. 識別情報 | IPMI認証情報のローテーション、IPアドレスのプールへの返却、rDNSの消去。 | クリーンになるまで保留されるアドレス |

契約期間終了後に何も復元できないのも、このためです。データがどこかにまだ残っている猶予期間はありません。手順 2はすでに実行されています。必要なものがあれば、契約期間が終わる前にマシンから取り出してください。

## 行わないこと

**カードを分割すること。**MIGも、vGPUも、タイムスライシングもありません。物理GPU1枚につき1テナントであることが、掲載しているスループットの再現性を支えています。

**ノードをオーバーサブスクライブすること。**マシン上に第2のアカウントは存在せず、お客様と実機の間にハイパーバイザーもありません。

**他社のキャパシティを転売すること。**このページに掲載されているカードは、すべて当社が購入しラック搭載したものです。他のクラウドに乗せた転売マージンは一切ありません。

**別のカードにすり替えること。**ご注文のモデルを納品できない場合、当社は黙って近い代替品を出荷することはありません。その旨をお伝えし、契約期間分を返金します。

**お客様のOSに入り込むこと。**root権限はお客様だけのものです。当社が保有するのはIPMIであり、電源の入れ直しやメディアのマウントはできますが、マシン内部へのログインは持っていません。

**何かのコピーを保持すること。**当社はお客様のディスクのバックアップを取りません。スナップショットは購入した場合のみ存在し、契約期間の終了とともに削除されます。

## 行に記載された仕様が、そのままお渡しする仕様です。

上記のすべてのカードは、全6か所のデータセンターで、ラック搭載済み・バーンイン済みの状態で、書き込み可能なイメージとともに利用できます。

[カタログを見る](https://gpuserver.io/ja/#catalog) [ガイドを読む](https://gpuserver.io/ja/guides)

## 関連ページ

- [ネットワーク 最大25Gbit/sの無制限ポート、拠点ごとに2つのキャリアと1つのIX、常時稼働のDDoSフィルタリング、ルーテッドIPv6。そして、提供しない4つのことを最初に明示します。](https://gpuserver.io/ja/network)
- [ドキュメント 最初のSSH接続、ハードウェアの検証、CUDAコンテナ、vLLMでのモデル提供、RAID、ファイアウォール設定、IPMI、再インストールまで。実際に使うコマンドで解説します。](https://gpuserver.io/ja/docs)
- [サービスレベル契約 稼働率99.9%の約束：何がダウンタイムとみなされるか、外部からどう測定するか、失った1分につき契約期間を5分延長する仕組み、そして適用除外の全内容。](https://gpuserver.io/ja/legal/sla)
- [会社概要 gpuserver.ioを運営しているのは誰か、なぜ転売ではなくハードウェアを自ら購入するのか、そして曲げない4つのルール。売上を失うことになるルールも含めて。](https://gpuserver.io/ja/about)

---

出典: https://gpuserver.io/ja/hardware/。このファイルはウェブサイトと同じデータから生成されています。ここに記載された数値がページの内容と異なる場合、ページの内容が正となり、このファイルは古い情報です。正式な出典はhttps://gpuserver.io/です。
