我们上架什么,以及它出故障时会怎样。
独享服务器是对一个物理实体的承诺。本页描述的正是这个实体:我们采购哪些显卡、一个节点在接入租户之前如何测试,以及其中一块显卡损坏那天我们会怎么做。
- 12我们运营的 GPU 型号
- 72 h节点交付租户前的烤机测试
- 4 h更换故障硬件的目标时限
- 0从其他服务商转售而来的显卡
我们运营的每一张显卡
这就是全部列表——不存在未公开的等级,也没有为大客户保留的显卡。显存带宽之所以出现在表格中,是因为对推理而言,它比任何 TFLOPS 数字都更能预测吞吐量。
| 显卡 | 架构 | 显存 | 带宽 | 节点规格 | 起 |
|---|---|---|---|---|---|
| L4 | Ada Lovelace | 24 GB | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/月 |
| RTX 4090 | Ada Lovelace | 24 GB | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/月 |
| RTX 5090 | Blackwell | 32 GB | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/月 |
| RTX A6000 | Ampere | 48 GB | 768 GB/s | 1×, 2×, 4×, 8× | $286/月 |
| L40S | Ada Lovelace | 48 GB | 864 GB/s | 1×, 2×, 4×, 8× | $714/月 |
| A100 PCIe | Ampere | 40 GB | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/月 |
| A100 PCIe | Ampere | 80 GB | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/月 |
| H100 PCIe | Hopper | 80 GB | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/月 |
| A100 SXM4 | Ampere | 80 GB | 2,039 GB/s | 4×, 8× | $4,395/月 |
| H100 SXM5 | Hopper | 80 GB | 3,350 GB/s | 4×, 8× | $6,061/月 |
| H200 SXM5 | Hopper | 141 GB | 4,800 GB/s | 4×, 8× | $8,405/月 |
| B200 SXM6 | Blackwell | 180 GB | 8,000 GB/s | 4×, 8× | $11,790/月 |
每一张显卡,都是我们以自己的名义购入的全新零售或 OEM 产品,享有原厂保修。我们不采购矿卡库存,也不采购来源不明的显卡——二手 RTX 4090 便宜是有原因的,而这个原因会在第四个月出现。
围绕显卡的一切
一块因 CPU、内存或磁盘吞吐量不足而被拖慢的 GPU,只是一种昂贵的等待方式。机箱的选型是根据显卡数量决定的,而不是作为可升级的路线出售。
| 节点 | CPU | 系统内存 | 本地存储 | 端口 |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X | 128 GB | 2 × 2 TB NVMe | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X | 256 GB | 2 × 3.84 TB NVMe | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X | 512 GB | 4 × 3.84 TB NVMe | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ | 1 TB | 8 × 3.84 TB NVMe | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMe | 25 Gbit/s |
如果列出了两款 CPU,两者都可能被交付——它们在核心数和内存通道上是匹配的,配置器会在您付款前显示您的节点实际配备的是哪一款。硬盘以裸盘形式交付:我们不强制设定 RAID 级别,因为合适的级别取决于您存储的是模型检查点,还是可以重新下载的数据集。
节点出租之前
一台服务器只有在连续三天未能被压垮之后,才会进入产品目录。几乎所有会提早损坏的显卡,都会在我们手上损坏,而不是在您手上。
步骤 1 · 2 小时
组装与库存
每一张显卡、每一个模组和每一块硬盘的序列号,都会与机箱记录关联。正是这份记录,让我们日后能准确告诉您,您的服务器里装的到底是哪个具体部件。
步骤 2 · 24 小时
显存与算力压力测试
对每一张显卡的全部显存进行 ECC 图案测试,随后以 100% 利用率进行持续的矩阵乘法运算。只要出现一次不可纠正的错误,这张显卡就会被退回箱子里。
步骤 3 · 24 小时
温度与功耗烤机测试
整个节点在满载状态下运行,同时将进气温度提高到机房环境的最差情况。我们记录的是显卡实际能够维持的频率——而不是包装盒上标注的加速频率——如果某个节点的频率降到规格以下,会先重新安装或更换导热膏,然后再次测试。
步骤 4 · 24 小时
互联与存储
逐卡测量 NVLink 或 PCIe 点对点带宽,抽样测试 NVMe 写入寿命,端口保持线速运行。这些数据会与同型号的其他节点进行比对,因为比正常慢 15% 的节点,就是有问题的节点。
此后 · 已上架待命
可用,并已准备好可写入的镜像
这就是为什么交付时间是 5 分钟以内,而不是一个工作日:下单时无需组装任何东西。这台服务器已经存在,处于通电并测试完毕的状态,您的付款触发的是镜像写入,而不是组装。
固件与驱动
nvidia-smi 进行调高或调低;由此产生的保修后果由我们承担,而不是您。
出现故障时
硬件总会出故障。区分服务商优劣的,不是故障是否发生,而是接下来的四个小时里发生了什么。
备件就在现场
每个机房都备有备用显卡、电源、硬盘,以及每种型号的一整套完整机箱。更换设备只需走到过道另一头,而不必等快递。
四小时目标
从您报修到硬件恢复正常运行,全天候不间断。如果我们未能达标,SLA 会自动为您延长租期——您无需主动申请。
您的硬盘始终属于您
出现故障的 GPU 或电源会被更换,硬盘保持原位不动。只有在需要动硬盘、且确实是硬盘出故障时,我们才会事先征询您的意见。
两位租户之间
这台服务器在您之后还会被再次出租。无论是否有人问起,下面的一切都会在它重新进入产品目录之前完成。
| 步骤 | 会发生什么 | 验证人 |
|---|---|---|
| 1. 网络 | 租期一结束,服务器就会立即从公网端口断开。等待期间,不会留下任何可访问的入口。 | 端口状态,已记录 |
| 2. 存储 | 每个 NVMe 设备都会先进行一次完整的加密擦除,再对整个地址空间做一遍覆写。 | 对每个设备进行读回抽样 |
| 3. GPU 显存 | 显卡会被重置,显存会被清除;系统会读取 ECC 计数器,并与烤机时记录的数值进行比对。 | nvidia-smi 重置日志 |
| 4. 固件 | BMC 和 BIOS 设置会被重新刷写为我们的参考配置,租期内所做的任何更改都会被丢弃。 | 与参考值进行校验和比对 |
| 5. 身份 | IPMI 凭据轮换,IP 地址归还到地址池,rDNS 记录清除。 | 地址保留,直至清白 |
这也是为什么租期结束后,我们无法恢复任何数据。不存在所谓的宽限期让您的数据仍然留存在某处——第 2步已经执行完毕。如果您需要这些数据,请在租期结束前将其取出。
我们不会做什么
对一张显卡进行分区。没有 MIG,没有 vGPU,没有时间片轮转。每张物理 GPU 只对应一个租户,这正是产品页面上的吞吐量数据可复现的原因。
超额出租一个节点。服务器上没有第二个账户,您和硬件之间也没有虚拟化层。
转售别人的算力。本页面上的每一张显卡,都是我们自己采购并上架的。这里没有任何一项是转售其他云服务商产品所赚取的差价。
用别的型号替换。如果您订购的型号无法交付,我们不会悄悄给您一个近似型号——我们会告知您,并为该租期退款。
进入您的操作系统。root 权限完全属于您。我们有 IPMI,可以进行电源循环和挂载介质;但我们不持有您服务器内部的登录权限。
保留任何东西的副本。我们不会备份您的硬盘。快照仅在您购买后才存在,并会随租期一同删除。