指南。
更长的文章,探讨决定您该租用哪台机器的问题——基于我们实际运营的硬件撰写,并给出具体算法。
- 基于我们自己运营的硬件撰写
- 可直接粘贴的命令,而非伪代码
- 公式全部展示,供您核对
全部 10篇指南
5 on 选型 · 2 on 成本 · 2 on 实践 · 1 on 付款
-
选型 · 9 分钟
模型实际需要多少显存
“能否放得下”背后的完整计算方法:模型的权重大小、KV 缓存占用,以及经验法则常常出现三倍误差的两个关键环节,本文将为您逐一拆解。
阅读指南 -
选型 · 7 分钟
NVLink 还是 PCIe:您的任务需要哪一个
显卡之间的互联方式何时决定您的整体吞吐量、何时又毫无影响,以及如何在为错误的节点付费之前判断自己属于哪一种情况。
阅读指南 -
选型 · 9 分钟
为图像与视频模型选择显卡
FLUX、SDXL、SD 3.5 与 Wan 2.1 各需要多少显存、我们产品目录中哪款显卡能放下,以及为何能放下的最便宜显卡很少是该租的那一款。
阅读指南 -
选型 · 10 分钟
选择量化格式
AWQ、GPTQ、GGUF 与 FP8 各自在显存占用、运行速度与生成质量上分别付出的代价——以及为何参数权重最小的格式,却很少能带来体积最小的模型。
阅读指南 -
选型 · 10 分钟
运行混合专家模型
总参数决定该租用哪台服务器,激活参数决定生成速度。本文说明 DeepSeek V3 与 Qwen 3 235B 各自需要多少显存,以及应该为它们租用哪种节点。
阅读指南 -
成本 · 6 分钟
何时月付比按小时计费更划算
基于真实数字计算出的盈亏平衡点、按小时计价直到账单才会显现出的三项隐藏成本,以及让估算数字翻上三倍的闲置时间陷阱。
阅读指南 -
成本 · 9 分钟
自托管对比按 token 计费的 API
按 token 计费的 API 与租用 GPU 之间的盈亏平衡点,基于我们自己的价格与吞吐量计算得出——以及这套算法遗漏的四件事。
阅读指南 -
实践 · 11 分钟
在单个节点上部署 Llama 3.3 70B
从交付完成的服务器,到一个兼容 OpenAI 的推理端点:这中间有真正重要的启动参数,也有会悄悄把吞吐量拦腰砍半的那两个参数。
阅读指南 -
实践 · 10 分钟
在单张显卡上微调 70B 模型
在单张 48 GB 显卡上使用 QLoRA 微调:能放下什么样的模型、每月需要多少成本,以及为何完整微调需要完全不同量级的服务器。
阅读指南 -
付款 · 8 分钟
用加密货币支付服务器费用
从点击支付按钮到最终获得 root 权限之间究竟发生了什么、应该选择哪种加密货币,以及首次付款时容易亏钱的四个常见错误。
阅读指南