云 GPU 平台盘点:国内外主流算力租用选项对比
自购 GPU 门槛高、部署周期长,对于大多数开发者和中小团队来说,租用云 GPU 是更务实的起点。但云 GPU 市场碎片化严重——大厂云、专业 GPU 云、共享算力平台各有侧重,价格和适用场景差异显著。本文梳理主流平台的核心差异,帮你在不同阶段选对平台。
先说一个我踩过的真实场景:团队做一个 7B 模型的微调实验,图省事直接在阿里云开了台 A100 按小时实例,跑了三天三夜的训练加调参,账单出来吓一跳——同样的卡,专业 GPU 云的价格能砍掉一大截。后来才想明白,这两类平台压根不是一回事:大厂卖的是”数据中心里的整块资源池”,你付的钱里有很大一部分是 SLA、专属网络、7x24 支持这些生产级保障;专业 GPU 云卖的更像是”厂商自建机房里富余算力的批发价”,牺牲一部分稳定性和技术支持换低价。搞清楚这个底层逻辑,你就知道什么时候该多花钱、什么时候该省。
平台分类与定位
云 GPU 平台大致分三类:
| 类型 | 代表平台 | 定位 |
|---|---|---|
| 综合云厂商 GPU 实例 | 阿里云、腾讯云、华为云 | 稳定性高,SLA 保障,适合生产 |
| 专业 GPU 云 | AutoDL、趋动云、矩池云 | 价格更低,开发者友好,适合训练/实验 |
| 海外共享算力 | Vast.ai、RunPod | 价格灵活,显卡型号丰富,需自备网络工具 |
| Serverless 推理 | Replicate、Modal、together.ai | 按请求计费,零运维,适合低并发 |
这三类平台的差异不只是价格,更关键的是”资源确定性”。大厂云的实例一旦创建,除非你主动释放,否则会一直属于你;专业 GPU 云和海外共享算力平台里的很多低价机型,本质是别人机器上的闲置算力或竞价资源,可能被更高出价者抢走(后面竞价实例那节会细讲)。做原型验证时这点抖动无所谓,一旦涉及训练任务跑几十个小时不能中断,就得提前确认你租的是不是”稳定实例”而不是”竞价实例”。
国内平台对比
综合云厂商(生产首选):
| 平台 | 典型 GPU 型号 | 计费方式 | 特点 |
|---|---|---|---|
| 阿里云 ECS / PAI | A100 40G/80G、V100 | 按小时/包月 | 稳定,与阿里云生态集成好 |
| 腾讯云 GN 实例 | A100、V100、T4 | 按小时/包月 | 微信生态整合,文档较全 |
| 华为云 GPU 集群 | 昇腾 910、NVIDIA V100 | 按小时/包月 | 对昇腾有优化,自主研发路线 |
| 百度智能云 | A100、V100 | 按小时/包月 | 飞桨生态 |
综合云厂商的 GPU 实例价格相对专业 GPU 云更高,但提供更完整的 SLA、监控告警、VPC 网络等基础设施,适合生产服务。
专业 GPU 云(开发/实验首选):
| 平台 | 特点 | 适合场景 |
|---|---|---|
| AutoDL | 价格实惠,支持 A100/4090/3090,按小时计费,有镜像市场 | 训练实验、开发测试 |
| 趋动云 | 学术/企业双版,部分算力有免费额度 | 高校/研究机构 |
| 矩池云 | 提供 JupyterLab 界面,入门门槛低 | 新手实验 |
| 恒源云 | GPU 型号较多,有竞价实例 | 批量训练任务 |
AutoDL 是目前国内开发者最常用的实验平台,镜像市场有大量预装了 vLLM、LMDeploy 等框架的环境,5 分钟内可以开始推理实验,价格比大厂低 50% 以上。
用 AutoDL 时我踩过的几个坑,记一下方便你少走弯路:
- 实例关机后数据盘不一定保留。AutoDL 的系统盘关机会清空,数据盘(
/root/autodl-tmp)才是持久化的。第一次用的人经常把模型权重下到系统盘目录下,关机重开发现文件全没了,只能重新下载——训练中间产物、下载的权重,一律往数据盘放。 - 镜像市场版本不是实时最新。选环境时看清 PyTorch/CUDA 版本号,遇到过镜像里的 CUDA 11.8 和某些新版本的 flash-attention 预编译包不兼容,报
undefined symbol类的错误,解决办法是要么换一个匹配 CUDA 版本的 wheel,要么在容器里重新pip install对应版本。 - 无卡模式开发调试更省钱。AutoDL 支持只开机不挂载 GPU 的”无卡模式”,改代码、装依赖的时候用无卡模式,真正跑训练/推理时再切回 GPU 模式,能省下不少小时费。
- 公网访问要走平台自带的端口映射或 SSH 隧道,直接开放安全组端口这套云厂商的思路在这里不适用,第一次配置容易卡在”服务起来了但外网连不上”,本质原因是没走对内置的转发通道。
海外平台
| 平台 | 特点 | 注意事项 |
|---|---|---|
| Vast.ai | P2P 共享算力,价格极低,GPU 型号丰富 | 需科学上网,稳定性不如大厂 |
| RunPod | 比 Vast.ai 稍贵,稳定性更好,有 Serverless 选项 | 国内访问需工具 |
| Lambda Labs | GPU 型号以 A100/H100 为主,学术用户友好 | 价格中等,供应有时紧张 |
| CoreWeave | 大规模 H100/A100 集群,企业级 | 主要面向大规模训练 |
在 Vast.ai 上租卡有个新手常忽略的点:多卡任务一定要看清卡间互联方式。 Vast.ai 上同一台”实例”里挂的多张 GPU,有的是走 NVLink 互联,有的只是插在同一台主机的 PCIe 插槽上用 PCIe 总线通信。如果你要跑单机多卡的模型并行训练(比如张量并行),PCIe 带宽通常明显低于 NVLink,多卡扩展效率会打折扣,实测里张量并行的吞吐提升经常远低于卡数的线性增长。租之前平台详情页一般会标注互联方式和带宽,训练任务优先选标了 NVLink 的实例;如果只是多卡跑几个独立的推理任务(数据并行、互不通信),PCIe 就完全够用,没必要为 NVLink 多付钱。
海外平台还有一个绕不开的问题:网络出口。国内直连 Vast.ai、RunPod 这些平台的控制台和 SSH 经常不稳定,会遇到连接超时、SSH 断线重连的情况;训练任务如果依赖稳定的长连接(比如用 nohup 挂后台还好,用交互式 notebook 跑长任务就容易因为断线而中断)。稳妥的做法是训练脚本一律用 tmux 或 screen 包一层,配合 nohup xxx > log.txt 2>&1 & 让任务脱离终端会话独立运行,断线之后重连 tmux attach 就能看到进度,不用担心任务被杀掉。
选型决策
你的主要用途是什么?
开发调试 / 实验
→ 国内:AutoDL(A100/4090 按小时,便宜)
→ 海外:Vast.ai(价格最低)
生产推理服务(需要 SLA 保障)
→ 阿里云 / 腾讯云 GPU 实例
→ 或使用 Serverless 推理(按请求计费)
模型训练
→ AutoDL / 趋动云(实验)
→ 大厂 GPU 集群(大规模训练)
零运维,低并发,按量付费
→ Replicate / Modal / together.ai Serverless 推理
→ 或直接调用 API(最省心)
自托管 vs 租用云 GPU vs 直接调 API
这三条路径的成本结构截然不同:
| 路径 | 固定成本 | 变动成本 | 运维负担 | 适合阶段 |
|---|---|---|---|---|
| 购买 GPU 自托管 | 高(硬件购置) | 低(电费) | 高 | 稳定超高并发 |
| 租用云 GPU | 低/零 | 中(按时间/流量) | 中 | 开发到中等规模 |
| 调用 API | 零 | 高(按 token) | 极低 | 起步/原型/低并发 |
大多数团队的合理路径是:API 起步 → 流量增长后评估云 GPU 自建 → 到稳定高并发再考虑自购硬件。自托管 vs API 的详细账单对比见 自托管 vs 用 API 怎么算账。
竞价实例:便宜但要会算账
不管国内外,很多平台都提供”竞价实例”(Spot/抢占式实例),价格能比标准按需实例便宜不少,代价是随时可能被更高出价者抢走,你的任务会被强制中断。这类实例适不适合你,取决于你的任务能不能”断点续跑”:
- 适合竞价实例:训练脚本做了 checkpoint 定期保存(比如每隔几百 step 存一次模型状态),被抢占重启后能从最近的 checkpoint 继续跑,几乎不损失多少进度。批量离线推理、数据预处理这类可以拆成小任务分批跑的场景也很合适。
- 不适合竞价实例:交互式开发调试(被打断体验很差)、没做 checkpoint 机制的长训练任务(被抢占等于从头再来)、对外提供服务的推理接口(用户请求打到一半实例没了,直接就是故障)。
实操上有个简单原则:只要单次任务运行时间超过一两个小时,就一定要先把 checkpoint 保存逻辑写好,再考虑上竞价实例,这是用低价的前提条件,不是可选项。
成本测算的方法(举例说明思路,不是具体报价,请以各平台官方实时价格为准):假设你要跑一个模型微调任务,预计占用一张卡 40 小时。设该型号 GPU 在某平台的按需价格是每小时 X 元,竞价价格是 0.4X 元。如果你的任务能通过 checkpoint 无损续跑,且平均每次运行能撑 2 小时才被抢占一次(重启加载 checkpoint 耗时几分钟可忽略),那么总成本约等于 40 × 0.4X = 16X 元,相比按需的 40X 元省下了 60%。但如果你的任务没做 checkpoint、平均每次只能跑 1 小时就被打断从头开始,实际有效进度反而可能比按需实例更慢,省下的钱最后又亏在返工的时间上。算账时别只看每小时报价,要把”有效吞吐”也算进去。
常见问题
国内云 GPU 能访问 Hugging Face Hub 吗?
通常不能直接访问。建议使用国内 HF 镜像(HF_ENDPOINT=https://hf-mirror.com),或提前把模型权重上传到对象存储再挂载。AutoDL 等平台通常有公共模型缓存,常见模型已预下载。
AutoDL 的实例可以长期跑吗?
可以,但按小时计费,长期运行成本可能高于包月。需要长期稳定实例建议切换到大厂包月 GPU 实例。
云 GPU 实例的网络带宽够吗?
大厂云实例的内网带宽通常不是瓶颈,公网带宽取决于实例配置。如果推理服务需要对外暴露,注意配置安全组并评估公网出口带宽成本。
租来的云 GPU,数据和权重安全吗?
这是很多团队容易忽略的点。共享算力平台(尤其是 Vast.ai 这类 P2P 模式)的物理机器由第三方个人或小机房提供,理论上机器所有者是有能力接触到你实例里数据的,虽然平台会做隔离,但敏感数据、客户数据、未开源的自研模型权重,不建议放在这类平台上跑。涉及数据合规要求的任务,优先选大厂云或有明确企业资质的专业 GPU 云,同时权重和数据集在实例外做好加密存储,实例只在运行时临时拉取。
遇到过一次实例被释放后模型权重全丢的情况,怎么避免?
云 GPU 平台的”释放实例”和”关机”是两个概念——关机通常只是停止计费但保留磁盘(部分平台数据盘除外,参考前面 AutoDL 那条),而”释放/删除实例”往往意味着挂载的存储也一并清空。养成一个习惯:训练产出的 checkpoint、微调后的权重,跑完就同步一份到对象存储(阿里云 OSS、腾讯云 COS 或者七牛这类),别指望实例长期保留就万事大吉,便宜的竞价实例更是说没就没。
多张卡的实例,显存是不是可以”拼起来”用?
不是简单相加就能直接用。多卡场景下,模型能不能利用多卡的合并显存,取决于你用的推理/训练框架有没有做张量并行或流水线并行的支持——比如 vLLM 支持 tensor_parallel_size 参数把模型切分到多张卡上;如果框架不支持并行切分,多卡对你来说只是”能同时跑多个独立进程”,单个模型该装不下还是装不下,跟卡数无关,得先确认框架的并行能力再决定要不要为多卡多付钱。
延伸阅读:
- 算力基础全景:大模型算力基础指南
- GPU 选型对比:推理 GPU 选型:4090/A100/H100
- 自托管 vs API 账单:自托管 vs 用 API 怎么算账
- Serverless 推理方案:Serverless 推理方案对比
- 算力专题 Hub:算力专题
- 不想管 GPU 服务器?加入候补,直接调用 API