← 返回资讯

Vast.ai 怎么挑机器:可靠性评分、带宽与中断风险怎么看

2026-09-15

按价格排序,点最上面那一条 RENT,这是大多数人第一次在 Vast.ai 上租机器的动作。踩坑通常也发生在之后的一小时里:盘当初拖得太小,而官方文档写得很明白,磁盘分配在创建时就定死、之后改不了;offer 卡上的 Max Duration 只剩下不到你这轮训练需要的时长;权重往上传的时候才发现这台机的上行带宽是另一档,而带宽是按字节单独计费的。

价格那一栏没有骗你,它只是只回答了整个问题的一小部分。如果你还不清楚这个市场的基本结构,可以先看Vast.ai 是什么、适合谁用;这篇只谈一件事:offer 卡片上那一排字段,到底哪几个能当硬约束用,哪几个只是概率。

一、先把卡片上的字段分成两类

官方文档在讲 offer 卡时补了一句很关键的话:卡片上显示的所有指标,都是你租下来的那一份,不是整台机器的总量。CPU 核数和系统内存这两行是「本 offer 分到的数量/机器总量」的形式。Docker 执行环境那篇进一步说明了分配规则:CPU 基线按你占用的 GPU 比例分配,四卡机上租一卡就拿到四分之一的 CPU 基线;系统内存同理;/dev/shm 这类共享内存也按同一比例走 cgroup 自动配置。空闲时可以冲到基线以上,但争抢发生时只保证基线——内存上尤其要留神,文档直接警告超出配额用内存会有被 OOM killer 杀进程的风险。

按这个口径重新看卡片,字段自然分成两类。

硬约束类,选错了任务根本跑不起来,而且事后基本没有补救手段:

  • GPU 型号与数量、单卡显存、显存带宽。显存是第一道门,跑不进去就是跑不进去,没有折中。开搜索之前先把需要多少显存算清楚,参考大模型显存怎么估算;型号之间的取舍逻辑在推理 GPU 选型里已经拆过。
  • 磁盘分配。文档反复强调这一点:容器存储的大小在创建时固定、不可调整,实例销毁时数据全部丢失。默认值很小,而滑块既是搜索筛选条也是分配参数。文档给的建议是宁可估宽一点。
  • 网络带宽与端口数。卡片给的是上行/下行速率和可用端口数。数据集大、要反复拉镜像或推产物的活,这一行的重要性可能超过 GPU 本身。
  • PCIE 版本与通道数、主板型号、本地盘类型与读写速度。多卡互联和数据加载吃这几项。
  • Max Duration,这台机器上一份租约的最长期限。文档在讲按需实例时明确列了「租约到期后,主机方可能续租也可能直接停掉实例」,并且过期实例无法重启、过期后可能被删除。跨周的活不看这一栏是自找麻烦。

概率类,它们描述的是历史与倾向,不是承诺:

  • 可靠性评分(Reliability Score)
  • DLPerf,Vast 自定义的深度学习性能分。文档说它的用途是让不同 GPU 的 offer 能横向比较,而不是只看裸参数——换句话说它是个近似量,用来排序候选,不用来做容量规划。
  • Performance(总 TFLOPS),同理,标称峰值和你那份负载的实际吞吐不是一回事。

二、可靠性评分衡量的是过去,不是明天

文档对它的定义很短:机器历史正常运行时间与健康状况的度量。两处文档都补了同一个细节——新机器不是从零分起步,而是从一个统一的初始分开始,随着它持续证明可用性而往上爬。

这两句话合起来,评分的性质就清楚了:它是一个滞后指标。一台刚上架、零运行记录的机器,和一台跑了很久、恰好最近开始出问题的机器,分数上可能看不出差别——前者的分是「还没扣」,后者的分是「还没扣完」。历史正常运行时间这种统计量天然是往回看的,主机方所在机房今晚断不断电,它不知道。

还有一层更容易误读的地方:评分和认证状态是两根独立的轴。文档把认证层级(未认证/已认证/数据中心)描述成 Vast 团队测试与机房资质核实的结果,把评分描述成运行历史的统计;在预留实例那篇里,能让主机方被取消认证(deverified)、从而让你无罚金取回全部预付余额的,写的是「机器未能满足隐含或显式的服务等级协议」——触发点是实际发生的违约,不是分数掉到某条线以下。分数滑坡本身不构成一个状态变更事件。至于分数具体怎么算、多少算失格,官方文档没有明确说明,以控制台实际显示为准。

所以评分的正确用法不是「设一个全局门槛」,而是按租用时长和可恢复性分档

  • 跑几十分钟就结束、断了重跑代价很低的活,评分基本不用管,它带来的成本反而值得利用——文档在讲怎么找便宜 GPU 时就直说了,可靠性评分较低的机器可能给出更好的价格。
  • 跨天、跨周的长任务,文档自己的建议是「先核对主机方的可靠性评分」。租期越长,你暴露在这台机器历史之外的时间就越长,评分的参考价值也越高。
  • 对外提供服务、断线就是故障的活,光靠评分不够,得换一根轴去看。

三、数据中心机器和社区机器差的不只是稳定性

文档把机器分成三档:未认证的通常是新机器、尚未经过 Vast 团队测试,默认就被搜索结果过滤掉;已认证的是通过了内部测试;Secure Cloud(数据中心)这一档除了通过测试,还经 Vast 核实位于符合其机房标准的数据中心——文档给的口径是数据中心评级或 ISO 27001 这一类认证,卡片上带蓝色标签,文档明确推荐用于生产。

这个差别落到具体决策上有三处,而且都不是「稳定性高一点」这么笼统:

  • 数据可见性。文档在实例管理那篇写得很直白:主机方在技术上能够访问自己机器上的文件;敏感数据应当使用经认证的数据中心,关键数据要自己做加密。云同步功能也被明确限定为只在带 Secure 标识的可信数据中心上使用。这条对涉及客户数据的活基本是一票制约束。
  • IP 形态。部分实例的 IP 是动态的、会变。要固定入口,文档给的办法是搜索时按静态 IP 筛选,而不是事后补救。
  • 故障归属。文档列了 Offline 状态的常见原因是断网或断电,主机方会被自动通知。个人主机方的一台游戏机和一间有值守的机房,在这件事上的恢复速度不是一个量级。

反过来说,如果你的活是一次性的批量任务、数据本身不敏感、断了重跑成本很低,坚持只挑数据中心档就是在为你不需要的保障付钱。

四、带宽和存储是单独计费项,别只盯着 GPU

Vast 的总成本由三块组成:GPU 计算、存储、带宽。文档对这三块的计费时机讲得很清楚,这里只讲机制,具体数字随市场浮动,以控制台为准:

  • GPU 计算按秒计费,只在实例运行时计。镜像还在下载、状态显示 Loading 的阶段不计费。
  • 存储按实例存在的时间连续计费,与是否在运行无关。也就是说,你把实例停掉、数据留着,存储仍在扣;文档还提到停机状态的存储费率可能比运行时更高。要彻底停掉存储计费,只有销毁实例。卷(Volume)是另一套独立计费的持久存储,好处是能在实例销毁后留存并重新挂载,代价是它绑在那台物理机上、不能跨机器迁移。
  • 带宽按传输字节计费,上行下行都算,费率随主机方不同。文档专门提醒:在挑机器的阶段就该看带宽费率,数据密集的负载上它会显著影响总成本。

具体怎么看:卡片上的价格那一栏是 GPU 租金加上所分配存储的小时成本,把鼠标悬停在价格上,会展开 GPU、存储、带宽各自的价格明细。这个悬停动作很多人从来没做过,于是把一个三项成本当成了单价来比较。

顺带一个坑:账户余额归零时,实例会被自动停掉、GPU 被释放,正在跑的任务随之中断。文档说明,如果绑了银行卡会自动扣款续上、实例与数据保留;没有支付方式的话,实例和数据会被安排删除。长任务开跑前先确认这一条。

五、中断风险怎么量化

可中断实例走竞价:出价高的优先,被人出价超过、或者有按需请求进来时可能被暂停;暂停期间数据保留但实例不可用,优先级回来之后自动恢复。文档给可中断实例的配套要求是一组硬性动作——频繁存盘、重要产物写到云存储、代码里实现检查点、并且默认「会被打断」来设计。

把这组要求翻译成一个可量化的判据,只需要问三个问题:

  1. 被打断之后,我损失多少工作量? 有检查点、能从最近一次断点续上的任务,损失上限就是检查点间隔,风险是有界的。没有检查点的任务,损失是整段已运行时间,风险随时长线性放大。
  2. 恢复是自动的还是需要人? 可中断实例会在优先级恢复时自动继续。但如果你的恢复流程要人手动改配置、重新灌数据,那「自动恢复」这个优点就被你自己的流程吃掉了。
  3. 对外有没有在等? 有人在等一个 HTTP 响应,任何暂停都是故障;没人等,暂停只是跑得慢一点。

还有一个和中断相关但不属于竞价机制的风险:停掉的按需实例重启时,GPU 不保证还在。文档写得很清楚,实例进入 SCHEDULING 状态等待 GPU 可用,如果卡住不动,大概率是这块 GPU 已经被别人租走了,高优先级任务会挡住你的重启,极端情况可能无限等待,此时文档的建议是把数据拷到新实例。所以「停机省钱」这个直觉在 Vast 上是有代价的:省下的是计算费(存储照扣),押上的是能不能拿回同一块卡。中断场景的具体应对手法在可中断实例怎么用里有更细的展开。

六、按任务类型选租用类型

三种租用类型的定位:按需是固定价格、高优先级、在最长期限内资源有保障;预留是按需实例预付后拿折扣、优先级不变;可中断是竞价、最低成本、低优先级。文档还明确了类型转换规则——租下之后类型不能改,只有按需可以随时转预留;按需与可中断之间互转都要重建实例;预留转回按需会失去剩余折扣。这条规则意味着类型选择要在点 RENT 之前想好

任务类型租用类型判据
对外推理服务按需有人在等响应,可用性必须有保障,暂停等于故障
跨天/跨周训练预留用量可预测,长期承诺换折扣,同时看重可靠性
超参搜索可中断单次试验可弃、可重跑,成本是主要矛盾
数据预处理可中断能从断点继续,天然适合分片重跑
有硬截止时间的活按需承担不起打断,时间成本高于价差
调试与开发可中断会话短、对成本敏感,人就在跟前可随时处理
稳定的长期负载预留用量平稳,折扣可预期

预留还有两个细节值得先知道:预付的额度锁定在那一个特定实例上、不能在主机方之间迁移;而且每次追加额度都会重新计算折扣,文档专门警告在期中补一小笔可能反而让折扣变差。

七、这个平台的 SLA 是声誉约束,不是合同约束

挑机器这件事上,最该先接受的事实是:Vast 是一个市场,硬件不是它的。文档在回答「找不到想要的机器类型」时说得很坦白——它只是市场,不管理也不提供硬件,没有货源的时候它也没什么能做的。你的租约是你和主机方之间基于该 offer 当时条款成立的合同,Vast 提供的是测试、认证、评分和一套违约后的处置机制。

违约的处置是什么?预留实例那篇给了最实的一条:机器未能满足隐含或显式的服务等级协议并被取消认证,你可以无罚金取回全部预付余额。这是个事后的、以退款为上限的补偿——它保护你的钱,不保护你的截止日期。主机方有动力维护评分和认证,因为这直接影响接单和定价(文档也说了可靠性评分高的机器价格通常更贵),但这套激励是声誉性质的,不是一份对你承诺可用性百分比的合同。

所以我的判断是:这个平台适合承担「重跑的代价你自己能算清」的工作。可以算清的,用低分机器、用可中断、用便宜地区,价差是实打实的收益;算不清的——对外服务的可用性、客户数据的合规责任、无法延期的交付日——用数据中心档加按需,或者干脆别放在这里。中间还有一大片灰色区域,判断依据只有一条你必须自己算的账:一次中断让你损失多少,与省下来的钱比,哪个更大。这笔账的长期版本(一直租下去和自己买卡)在租 GPU 还是买 GPU里单独算过,结论同样取决于你的使用率,不存在一个通用答案。

最后一句提醒:本文所有机制描述都以 Vast 官方文档的口径为准,而搜索页的筛选项、控制台的菜单和价格结构都在变。真正开始挑之前,把那台候选机器的价格悬停明细展开看一遍,比读任何一篇选型文章都管用。

算完账发现自建推理不划算?

先用托管端点把业务跑起来,量上来了再回头算自建的平衡点。

去试用

这个页面有问题?

提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。