基础设施

# 我们上架什么，以及它出故障时会怎样。

独享服务器是对一个物理实体的承诺。本页描述的正是这个实体：我们采购哪些显卡、一个节点在接入租户之前如何测试，以及其中一块显卡损坏那天我们会怎么做。

- 12 我们运营的 GPU 型号
- 72 h 节点交付租户前的烤机测试
- 4 h 更换故障硬件的目标时限
- 0 从其他服务商转售而来的显卡

## 我们运营的每一张显卡

这就是全部列表——不存在未公开的等级，也没有为大客户保留的显卡。显存带宽之所以出现在表格中，是因为对推理而言，它比任何 TFLOPS 数字都更能预测吞吐量。

**GPU 型号、架构、显存、带宽、节点规格与起售价**

| 显卡 | 架构 | 显存 | 带宽 | 节点规格 | 起 |
|---|---|---|---|---|---|
| L4 PCIe 插卡 | Ada Lovelace | 24 GB GDDR6 | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/月 |
| RTX 4090 PCIe 插卡 | Ada Lovelace | 24 GB GDDR6X | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/月 |
| RTX 5090 PCIe 插卡 | Blackwell | 32 GB GDDR7 | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/月 |
| RTX A6000 PCIe 插卡 | Ampere | 48 GB GDDR6 ECC | 768 GB/s | 1×, 2×, 4×, 8× | $286/月 |
| L40S PCIe 插卡 | Ada Lovelace | 48 GB GDDR6 ECC | 864 GB/s | 1×, 2×, 4×, 8× | $714/月 |
| A100 PCIe PCIe 插卡 | Ampere | 40 GB HBM2 | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/月 |
| A100 PCIe PCIe 插卡 | Ampere | 80 GB HBM2e | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/月 |
| H100 PCIe PCIe 插卡 | Hopper | 80 GB HBM3 | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/月 |
| A100 SXM4 SXM 模组，HGX 主板 | Ampere | 80 GB HBM2e | 2,039 GB/s | 4×, 8× | $4,395/月 |
| H100 SXM5 SXM 模组，HGX 主板 | Hopper | 80 GB HBM3 | 3,350 GB/s | 4×, 8× | $6,061/月 |
| H200 SXM5 SXM 模组，HGX 主板 | Hopper | 141 GB HBM3e | 4,800 GB/s | 4×, 8× | $8,405/月 |
| B200 SXM6 SXM 模组，HGX 主板 | Blackwell | 180 GB HBM3e | 8,000 GB/s | 4×, 8× | $11,790/月 |

每一张显卡，都是我们以自己的名义购入的全新零售或 OEM 产品，享有原厂保修。我们不采购矿卡库存，也不采购来源不明的显卡——二手 RTX 4090 便宜是有原因的，而这个原因会在第四个月出现。

## 围绕显卡的一切

一块因 CPU、内存或磁盘吞吐量不足而被拖慢的 GPU，只是一种昂贵的等待方式。机箱的选型是根据显卡数量决定的，而不是作为可升级的路线出售。

**机箱规格，按 GPU 数量划分**

| 节点 | CPU | 系统内存 | 本地存储 | 端口 |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X 16 c / 32 t · 或 Intel Xeon Silver 4410Y | 128 GB | 2 × 2 TB NVMeGen4 U.2，不强制使用 RAID | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X 24 c / 48 t · 或 Intel Xeon Gold 5416S | 256 GB | 2 × 3.84 TB NVMeGen4 U.2，不强制使用 RAID | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X 32 c / 64 t · 或 2 × Intel Xeon Gold 6438Y+ | 512 GB | 4 × 3.84 TB NVMeGen4 U.2，不强制使用 RAID | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ 64 c · 或 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 3.84 TB NVMeGen4 U.2，不强制使用 RAID | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ 64 c · 或 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMeGen4 U.2，不强制使用 RAID | 25 Gbit/s |

如果列出了两款 CPU，两者都可能被交付——它们在核心数和内存通道上是匹配的，配置器会在您付款前显示您的节点实际配备的是哪一款。硬盘以裸盘形式交付：我们不强制设定 RAID 级别，因为合适的级别取决于您存储的是模型检查点，还是可以重新下载的数据集。

## 节点出租之前

一台服务器只有在连续三天未能被压垮之后，才会进入产品目录。几乎所有会提早损坏的显卡，都会在我们手上损坏，而不是在您手上。

步骤 1 · 2 小时

### 组装与库存

每一张显卡、每一个模组和每一块硬盘的序列号，都会与机箱记录关联。正是这份记录，让我们日后能准确告诉您，您的服务器里装的到底是哪个具体部件。

步骤 2 · 24 小时

### 显存与算力压力测试

对每一张显卡的全部显存进行 ECC 图案测试，随后以 100% 利用率进行持续的矩阵乘法运算。只要出现一次不可纠正的错误，这张显卡就会被退回箱子里。

步骤 3 · 24 小时

### 温度与功耗烤机测试

整个节点在满载状态下运行，同时将进气温度提高到机房环境的最差情况。我们记录的是显卡实际能够维持的频率——而不是包装盒上标注的加速频率——如果某个节点的频率降到规格以下，会先重新安装或更换导热膏，然后再次测试。

步骤 4 · 24 小时

### 互联与存储

逐卡测量 NVLink 或 PCIe 点对点带宽，抽样测试 NVMe 写入寿命，端口保持线速运行。这些数据会与同型号的其他节点进行比对，因为比正常慢 15% 的节点，就是有问题的节点。

此后 · 已上架待命

### 可用，并已准备好可写入的镜像

这就是为什么交付时间是 5 分钟以内，而不是一个工作日：下单时无需组装任何东西。这台服务器已经存在，处于通电并测试完毕的状态，您的付款触发的是镜像写入，而不是组装。

## 固件与驱动

驱动程序栈 已安装，已锁定版本，您可自行更改 每个 Linux 镜像都自带可正常使用的最新 NVIDIA 驱动、CUDA、cuDNN 和 NCCL。您完全可以把它们全部替换掉——这是您的 root 权限。

固件更新 绝不会在您的租期内发生 BIOS、BMC 和 VBIOS 会在节点进入产品目录之前设置完成。我们不会给正在被租用的服务器推送固件；固件更新只在两位租户之间进行。

频率 有现货，并已为您解锁 我们出厂时的每张显卡都保持参考频率和功耗限制。您可以使用 `nvidia-smi` 进行调高或调低；由此产生的保修后果由我们承担，而不是您。

带外访问 IPMI，位于独立网络 远程电源控制、串口控制台和虚拟介质，即使操作系统无响应也能访问。它位于一个管理 VLAN 上，绝不会触及您的公网端口。

## 出现故障时

硬件总会出故障。区分服务商优劣的，不是故障是否发生，而是接下来的四个小时里发生了什么。

### 备件就在现场

每个机房都备有备用显卡、电源、硬盘，以及每种型号的一整套完整机箱。更换设备只需走到过道另一头，而不必等快递。

### 四小时目标

从您报修到硬件恢复正常运行，全天候不间断。如果我们未能达标，SLA 会自动为您延长租期——您无需主动申请。

### 您的硬盘始终属于您

出现故障的 GPU 或电源会被更换，硬盘保持原位不动。只有在需要动硬盘、且确实是硬盘出故障时，我们才会事先征询您的意见。

**出现故障的硬盘，下一位租户无法读取其中的数据。** 下线的硬盘，只要仍能响应就会被清除数据；如果无法响应，就会被物理销毁。无法响应的硬盘无法被擦除，因此绝不会以保修名义寄回厂商——我们宁可自己承担这笔损失，也不会让一块曾经存有您数据的硬盘完好无损地离开机房。

## 两位租户之间

这台服务器在您之后还会被再次出租。无论是否有人问起，下面的一切都会在它重新进入产品目录之前完成。

**两位租户之间的下架流程**

| 步骤 | 会发生什么 | 验证人 |
|---|---|---|
| 1. 网络 | 租期一结束，服务器就会立即从公网端口断开。等待期间，不会留下任何可访问的入口。 | 端口状态，已记录 |
| 2. 存储 | 每个 NVMe 设备都会先进行一次完整的加密擦除，再对整个地址空间做一遍覆写。 | 对每个设备进行读回抽样 |
| 3. GPU 显存 | 显卡会被重置，显存会被清除；系统会读取 ECC 计数器，并与烤机时记录的数值进行比对。 | `nvidia-smi` 重置日志 |
| 4. 固件 | BMC 和 BIOS 设置会被重新刷写为我们的参考配置，租期内所做的任何更改都会被丢弃。 | 与参考值进行校验和比对 |
| 5. 身份 | IPMI 凭据轮换，IP 地址归还到地址池，rDNS 记录清除。 | 地址保留，直至清白 |

这也是为什么租期结束后，我们无法恢复任何数据。不存在所谓的宽限期让您的数据仍然留存在某处——第 2步已经执行完毕。如果您需要这些数据，请在租期结束前将其取出。

## 我们不会做什么

**对一张显卡进行分区。**没有 MIG，没有 vGPU，没有时间片轮转。每张物理 GPU 只对应一个租户，这正是产品页面上的吞吐量数据可复现的原因。

**超额出租一个节点。**服务器上没有第二个账户，您和硬件之间也没有虚拟化层。

**转售别人的算力。**本页面上的每一张显卡，都是我们自己采购并上架的。这里没有任何一项是转售其他云服务商产品所赚取的差价。

**用别的型号替换。**如果您订购的型号无法交付，我们不会悄悄给您一个近似型号——我们会告知您，并为该租期退款。

**进入您的操作系统。**root 权限完全属于您。我们有 IPMI，可以进行电源循环和挂载介质；但我们不持有您服务器内部的登录权限。

**保留任何东西的副本。**我们不会备份您的硬盘。快照仅在您购买后才存在，并会随租期一同删除。

## 表格中列出的规格，就是您实际获得的规格。

以上每一款显卡，在全部 6 个数据中心均可选用，均已上架并完成烤机，并已准备好可写入的镜像。

[浏览产品目录](https://gpuserver.io/zh/#catalog) [阅读指南](https://gpuserver.io/zh/guides)

## 相关页面

- [网络 每个站点提供最高 25 Gbit/s 不限流量端口、两家运营商与一个 IX、全天候 DDoS 过滤、可路由 IPv6——以及我们明确不提供的四件事。](https://gpuserver.io/zh/network)
- [文档 首次通过 SSH 连接、硬件验证、CUDA 容器、用 vLLM 部署模型、RAID、防火墙配置、IPMI 与系统重装——都是在真实服务器上执行的实际命令。](https://gpuserver.io/zh/docs)
- [服务等级协议 99.9% 的正常运行承诺：什么算作停机、如何从外部进行测量、每损失一分钟便延长五分钟租期，以及完整的例外情形说明。](https://gpuserver.io/zh/legal/sla)
- [关于我们 谁在运营 gpuserver.io、我们为何选择购买硬件而不是转售他人的硬件，以及我们始终坚持、绝不妥协的四条规则——包括那些让我们因此失去订单的规则。](https://gpuserver.io/zh/about)

---

来源：https://gpuserver.io/zh/hardware/。本文件由与网站相同的数据生成；如果此处的数字与页面不一致，以页面为准，本文件视为过期——权威来源是 https://gpuserver.io/。
