从付款确认到第一个 token。
交付消息中包含什么、已经预装了什么,以及第一小时要执行的具体命令。以下所有操作都在刚交付的机器上以 root 身份执行。
- 5 分钟以内从付款到下方消息送达
- 10可以为您预先写入的镜像
- root无需 sudo,无需跳板机,无需控制台
- 22交付时唯一开放的端口
送达内容
一条消息,在付款确认 5 分钟以内 后送达。其中包含您需要的一切,没有需要点击查看的内容。
首次连接
无需接受任何条款,也无需安装代理。如果您在配置器中提供了公钥,它已经写入 /root/.ssh/authorized_keys。
$ ssh root@203.0.113.42
# 然后,在做任何其他事之前——先核对交付消息中的指纹
# 必须与此处打印的一致:
$ ssh-keygen -lf /etc/ssh/ssh_host_ed25519_key.pub
如果您已提交密钥,请关闭密码登录。这只需一条命令,却能移除唯一可能被猜中的凭据。
# 请先确认您的密钥可以正常使用——在另一个终端窗口中测试,同时保持此处的登录状态。
$ sed -i 's/^#\?PasswordAuthentication.*/PasswordAuthentication no/' /etc/ssh/sshd_config
$ systemctl reload ssh
核验硬件
请在最初十分钟内完成此项检查。这是一台您尚未亲眼见过的服务器,而硬件故障的 SLA 计时,是从您告知我们的那一刻才开始的。
$ nvidia-smi --query-gpu=index,name,serial,memory.total,pcie.link.gen.current --format=csv
index, name, serial, memory.total [MiB], pcie.link.gen.current
0, NVIDIA H100 80GB HBM3, 1650123456789, 81559 MiB, 5
1, NVIDIA H100 80GB HBM3, 1650123456790, 81559 MiB, 5
# 在多 GPU 节点上,请检查拓扑是否与您所付费的配置相符。
# NV# 表示 NVLink;PIX/PHB/SYS 表示流量走 PCIe。
$ nvidia-smi topo -m
# 让每块显卡满载运行两分钟,观察其最终稳定的频率。
$ nvidia-smi -q -d PERFORMANCE,TEMPERATURE,CLOCK | grep -E 'Slowdown|SW Power|Graphics *:'
# 磁盘:请对照交付消息核实数量和型号。
$ lsblk -d -o NAME,MODEL,SIZE,ROTA
$ nvme list
预装的内容
在配置器中选择操作系统,并可选择在其之上叠加一套软件栈。以下内容均在交付前写入镜像,而非首次启动时下载。
| 镜像 | 用途 | 最低显存 | 操作系统 |
|---|---|---|---|
| vLLM 0.11 | 部署大语言模型 | 24 GB | Linux |
| SGLang 0.5 | 部署大语言模型 | 24 GB | Linux |
| Text Generation Inference | 部署大语言模型 | 24 GB | Linux |
| Ollama 0.12 | 部署大语言模型 | 8 GB | Linux |
| Axolotl 0.8 | 训练与微调 | 24 GB | Linux |
| PyTorch 2.9 · CUDA 12.8 | 训练与微调 | 8 GB | Linux |
| ComfyUI | 图像与视频生成 | 12 GB | Linux |
| JupyterLab · CUDA | 训练与微调 | 8 GB | Linux |
| Blender 4.5 | 3D 渲染 | 8 GB | Linux 或 Windows |
| 您自己的 Docker 镜像 | 您自带的任何内容 | 不限 | Linux |
无论您选择哪种技术栈,每个 Linux 镜像都已预装可用的 NVIDIA 驱动、CUDA、cuDNN 和 NCCL。您完全可以替换其中任何一项——这是您的 root 权限,重装不收费,也没有频率限制。
容器与 CUDA
Docker 和 NVIDIA 容器工具包已安装并配置完成。下面的检查只需三十秒,因为容器如果看不到显卡,稍后会以一种令人困惑的方式报错。
$ docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi
# 多 GPU 任务还需要共享内存和 IPC,默认限制会破坏这两者。
# 这三个参数标志通常是 NCCL 静默挂起的原因:
$ docker run --rm --gpus all --ipc=host --shm-size=16g --ulimit memlock=-1 …
部署模型
从交付机器到兼容 OpenAI 的接口,最短的可用路径。换成您自己的模型即可;重要的是这些参数标志。
$ docker run -d --name vllm --gpus all --ipc=host -p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--max-model-len 8192 \
--gpu-memory-utilization 0.92
# 在多 GPU 节点上,将任务拆分到机箱内的每张显卡:
$ … --tensor-parallel-size 4
# 然后,在您自己的机器上:
$ curl http://203.0.113.42:8000/v1/models
某个模型能否放进某台机器,是算术问题,不是主观判断——权重,加上随上下文长度增长的 KV 缓存。配置器会在您付款前为每种配置完成这一计算,显存容量计算指南展示了具体公式,供您核对。
磁盘与存储
除系统卷外,磁盘均以裸盘形式交付。我们不强制指定 RAID 级别,因为选择哪种级别取决于您存放的是不能丢失的检查点,还是一小时内就能重新下载的数据集。
# 请先确认哪些是未使用的——此操作会销毁指定设备上的数据。
$ lsblk
$ mdadm --create /dev/md0 --level=0 --raid-devices=2 /dev/nvme1n1 /dev/nvme2n1
$ mkfs.ext4 -E lazy_itable_init=0,lazy_journal_init=0 /dev/md0
$ mkdir -p /scratch && mount /dev/md0 /scratch
$ echo '/dev/md0 /scratch ext4 defaults,noatime 0 2' >> /etc/fstab
额外的 NVMe、归档 HDD 和异机快照均为按月计费的可选项,可在配置器中添加,也可以事后添加。本地磁盘我们不会备份,将来也不会——参见下方的快照说明。
防火墙与端口
除了您自己的服务器主动屏蔽的内容外,所有入站流量都是开放的:您前面没有任何网络过滤器,这是刻意设计的,责任也因此落在这里。唯一的例外是出站25号端口,默认在上游被关闭,需要您申请才会开放。
$ ufw default deny incoming
$ ufw default allow outgoing
$ ufw allow 22/tcp
$ ufw allow from 198.51.100.7 to any port 8000 proto tcp
$ ufw --force enable
# 比直接开放端口更安全的做法:让服务保持在 localhost 上
# 并从您自己的机器建立隧道连接到它。
$ ssh -N -L 8000:127.0.0.1:8000 root@203.0.113.42
IPMI 与重装
带外访问在每台机器上都有独立的地址。当您在凌晨三点把自己锁在机器之外时,无需询问任何人,就能凭它恢复访问。
电源
强制断电重启、正常关机,以及机箱电源状态——与操作系统是否响应无关。
串口与 KVM 控制台
接上显示器时机器会显示的画面,包括引导程序和内核崩溃信息。您可以在这里修复损坏的 fstab。
虚拟介质
通过网络挂载任意 ISO 镜像并引导。这既包括救援镜像,也包括我们并未提供的操作系统。
重新安装到我们提供的任意镜像,需要向我们提出申请,所需时间与最初交付时大致相同。这项服务不收费,也没有次数限制,服务器会保留其原有地址。重装会销毁磁盘上的全部内容——这正是重装的意义所在,且无法撤销。
快照
可选,按月付费,存放在机器之外。如果您不购买,除了您自己的磁盘之外,不存在任何数据副本——这对于 GPU 上运行的大多数工作负载而言是正确的默认设置,但对其余部分而言则是一场灾难。
结束租期
按月租期在已付费月份结束时终止,无需提前通知,也不收取取消费用。接下来发生的事情无法撤销,因此我们在此明确说明,而不是藏在脚注中。
- 没有任何内容会自动续费。系统不保存银行卡信息,也没有代扣——只有当您为下一期付款后,租期才会延续。
- 公网端口会在租期结束的那一刻被切断。服务器会立即变得不可访问,而不是等到宽限期结束。
- 磁盘会在一小时内被清除。先执行加密擦除,再进行一次完整覆写。不存在您的数据仍残留在某处的时间窗口。
- 快照会一并删除。如果您购买过快照服务,它们会在同一次操作中被删除。
- 该地址会被归还至地址池。需经过一段保留期,且仅在其状态清白后才会归还。
相关页面
- 指南八篇实用指南:显存选型、NVLink 对比 PCIe、图像与视频模型、月付对比按小时、自建对比 API、部署 Llama 70B,以及 QLoRA。
- 硬件政策我们运营的十二款 NVIDIA GPU 型号、节点出售前 72 小时的烤机测试、四小时内完成更换的目标,以及不同租户之间硬盘是如何被擦除的。
- 网络每个站点提供最高 25 Gbit/s 不限流量端口、两家运营商与一个 IX、全天候 DDoS 过滤、可路由 IPv6——以及我们明确不提供的四件事。
- 关于我们谁在运营 gpuserver.io、我们为何选择购买硬件而不是转售他人的硬件,以及我们始终坚持、绝不妥协的四条规则——包括那些让我们因此失去订单的规则。