推理 GPU 选型:RTX 4090、A100、H100 怎么选
GPU 选型是自托管推理最关键的硬件决策,也是最容易踩坑的地方——很多团队用消费卡部署生产服务,结果在高并发下稳定性差、或者买了高端专业卡却跑着用不满显存的小模型。本文从推理场景的核心需求出发,帮你理清消费卡与专业卡的本质差异,给出可操作的选型框架。
推理场景 GPU 的核心指标
训练看 FP32/BF16 算力(TFLOPS),推理更看以下几个维度:
| 指标 | 含义 | 为什么重要 |
|---|---|---|
| 显存容量 | 能加载多大的模型 | 直接决定能跑哪些模型 |
| 显存带宽 | 每秒从显存读写的数据量 | 决定生成 token 的速度(memory-bound) |
| ECC 内存 | 内存错误自动纠正 | 长时间运行的生产稳定性 |
| 多卡互联 | NVLink vs PCIe | 多卡张量并行的效率 |
| 功耗/散热 | TDP | 数据中心上架密度限制 |
为什么推理是 memory-bound? 生成每个 token 需要把模型权重从显存读到计算单元,权重读取速度(显存带宽)往往比计算速度更先达到瓶颈。这就是为什么 H100 的推理速度相比 A100 提升远超过算力提升比例——主要来自 HBM3 带宽的飞跃。
这一点直接影响你的选型思路:如果你只盯着算力参数表挑卡,大概率会挑错。举个例子,两张卡算力(TFLOPS)差不多,但一张显存带宽 1 TB/s、另一张 2 TB/s,实际推理吞吐能差出接近一倍——这不是理论数字,而是显存墙决定的。所以看 GPU 参数表时,第一眼看显存带宽,第二眼看显存容量,算力反而是最后才需要关心的指标。
量化精度怎么影响你的选卡结果? 同一个模型,精度越低,占用显存越小,但带宽压力也会跟着降(读取的字节数少了),这是为什么量化后不光能塞进小显存的卡,速度往往还更快。粗略换算:
- FP16/BF16:每 1B 参数约占 2GB 显存
- INT8:每 1B 参数约占 1GB 显存
- INT4:每 1B 参数约占 0.5GB 显存(外加约 10%-20% 的 KV Cache 和推理框架开销,实际预留要比理论值宽松一些)
所以表里写”RTX 4090 可以 INT4 跑 34B 以内模型”,换算方式就是 34 × 0.5 ≈ 17GB,留出运行时开销和 KV Cache 空间,24GB 显存刚好够用;但如果你想用 FP16 精度跑同样的模型,34 × 2 = 68GB,一张 24GB 的卡直接免谈,只能上多卡或者换用大显存专业卡。选型前先把”我要跑的模型 + 想用的精度”换算成显存数字,再去对照上面的规格表,比记住每张卡的型号名字更有用。
主要 GPU 对比
| 型号 | 显存 | 显存带宽 | ECC | 多卡互联 | 定位 |
|---|---|---|---|---|---|
| RTX 4090 | 24 GB GDDR6X | ~1 TB/s | 无 | PCIe 5.0 | 消费旗舰 |
| RTX 3090 | 24 GB GDDR6X | ~936 GB/s | 无 | PCIe 4.0 | 上代消费旗舰 |
| A10G | 24 GB GDDR6 | ~600 GB/s | 有 | PCIe 4.0 | 专业入门 |
| L4 | 24 GB GDDR6 | ~300 GB/s | 有 | PCIe 4.0 | 低功耗专业卡 |
| A100 40GB | 40 GB HBM2e | ~1.6 TB/s | 有 | NVLink 3 | 生产主力 |
| A100 80GB | 80 GB HBM2e | ~2 TB/s | 有 | NVLink 3 | 生产主力大显存 |
| H100 SXM | 80 GB HBM3 | ~3.35 TB/s | 有 | NVLink 4 | 最高性能 |
| H20 | 96 GB HBM3 | ~4 TB/s | 有 | NVLink 4 | 大显存推理 |
注:以上数值来自官方规格,实际部署性能受 CUDA 版本、框架、模型架构影响,仅供量级参考,不代表绝对基准。
消费卡 RTX 4090:能用但有风险
优势:
- 价格相对专业卡低一个量级(零售价约 1–2 万人民币 vs A100 十几万)
- 24 GB 显存,可以用 INT4 量化跑 34B 以内模型
- 显存带宽在消费卡中最高,token 生成速度不差
劣势:
- 无 ECC 内存:长时间运行下内存错误概率更高,数据中心级别稳定性无保证
- 无官方数据中心支持:散热设计面向台式机,高功耗场景下稳定性差
- PCIe 互联:多卡张量并行带宽受限,4 卡 RTX 4090 的并行效率远不如 4 卡 NVLink A100
- 无法用于严格合规场景:部分金融/医疗场景要求 ECC
适合场景: 个人实验、小团队内部工具、对稳定性要求不高的低并发服务。
踩坑实录:多卡 RTX 4090 张量并行为什么跑不动。 有团队图便宜攒了 4 张 RTX 4090 做张量并行,结果发现推理速度不但没有随卡数线性增长,反而比单卡快不了多少,nvidia-smi 里 GPU 利用率忽高忽低。根因是 PCIe 互联的卡间通信带宽只有 NVLink 的十分之一左右,张量并行每一层都要做 all-reduce 通信,通信开销直接把计算收益吃掉了。排查方法很简单:跑一下 nvidia-smi topo -m,看卡与卡之间的连接是 PIX/PHB(走 PCIe/PCIe Host Bridge)还是 NV#(NVLink);如果是前者,多卡张量并行基本不划算,不如改用多实例并行(每张卡独立跑一份小模型或做数据并行),或者干脆放弃张量并行、用流水线并行(pipeline parallel)把不同层分摊到不同卡上,通信量会小很多。
二手卡/矿卡怎么鉴别。 RTX 3090/4090 二手市场里矿卡(长期挖矿高负载运行)比例不低,买之前至少做三件事:用 nvidia-smi -q 看 GPU 累计运行时长(GPU Uptime 或第三方工具读取的通电小时数),超过一两万小时的要谨慎;跑一轮满载压力测试(比如连续跑几个小时推理任务)观察是否降频或掉卡;检查保修卡和购买凭证是否齐全。数据中心场景不建议用无保修的二手卡,出问题排查成本和停机损失远超省下的差价。
A100:生产推理的主流选择
A100 是目前部署 7B–70B 模型生产服务的主流选择,平衡了显存、带宽、稳定性和价格(相对 H100):
- 40GB 版本:可以 FP16 加载 20B 以内模型,INT4 加载 70B 以内模型
- 80GB 版本:可以 FP16 加载 40B 模型,BF16 单卡跑 70B(刚好)
- 两张 A100 80GB NVLink 可以高效张量并行跑 70B FP16
云端租用:A100 是目前各大云厂商(阿里云、腾讯云、华为云等)提供最稳定的 GPU 型号,按小时计费。显存估算可参考 跑大模型要多少显存。
自建还是租用,怎么算这笔账。 很多人纠结买卡自建还是云端按需租用,其实这是一道简单的盈亏平衡题:把整机采购成本(GPU + 服务器 + 电源改造)加上预计的电费、运维人力、机房托管成本,除以云厂商同规格实例的小时单价,算出一个”盈亏平衡小时数”。如果你的日均使用时长能在合理周期内(比如硬件生命周期 3 年内)覆盖这个盈亏平衡点,自建更划算;如果业务量有明显波峰波谷(比如白天用晚上闲),云端按需付费几乎总是更省钱,因为自建的卡在低谷期也要摊折旧。具体单价以各云厂商官网当前报价为准(本文不列具体金额,价格浮动较快),建议自己拉一张 Excel 把两条曲线画出来再拍板,别凭感觉决定。
常见报错排查。 自建多卡集群最容易踩的几个坑:
RuntimeError: CUDA out of memory:先别急着换卡,检查是不是 batch size 或并发请求数设太高,或者没有释放上一次请求的 KV Cache;用nvidia-smi实时看显存占用曲线,确认是稳定超限还是瞬时峰值。NCCL error: unhandled system error或多卡训练/推理长时间卡住不报错:大概率是网卡/NVLink 拓扑没对齐,或者防火墙挡了卡间通信端口,先跑nvidia-smi topo -m和nccl-tests里的all_reduce_perf做一次带宽自检。CUDA driver version is insufficient for CUDA runtime version:驱动版本比框架依赖的 CUDA 版本低,去核对官方兼容矩阵重新装驱动,别只装框架要求的最低版本,留一点余量方便以后升级框架。
H100:极限吞吐场景
H100 主要优势是 HBM3 带宽(约 A100 的 1.7 倍),对推理速度影响显著:
- 同等模型、同等并发,H100 吞吐量通常比 A100 高 50–100%
- 价格也高出 A100 约 2–3 倍,边际价值需要按实际工作负载评估
- 适合对推理延迟和吞吐量极度敏感、愿意付出更高算力成本的场景
选型决策框架
你的场景是什么?
个人/开发测试
→ RTX 4090(或更低)+ Ollama,不需要专业卡
生产推理,<32B 模型,中等并发
→ 云端 A10G 或 A100 40GB 实例
生产推理,70B 模型,高并发
→ A100 80GB(单卡或多卡 NVLink)
极致吞吐,成本不是首要限制
→ H100 SXM
超大模型(>70B)或极大显存需求
→ H20 / H200 或多卡 H100
常见问题
RTX 4090 能不能用于生产?
技术上可以跑,但 ECC 缺失、散热设计和官方支持都是隐患。低流量内部工具风险可控;面向用户的高可用服务,建议至少用 A10G 这类专业卡。
A100 40GB 和 80GB 差在哪里?
除了显存容量(影响加载模型大小),80GB 版本的显存带宽也更高(约 2 TB/s vs 1.6 TB/s),吞吐量略好。如果模型 40GB 够用,40GB 版本性价比更高。
国内云厂商 GPU 租用可靠吗?
主流云厂商(阿里云、腾讯云、百度云、华为云)的 GPU 实例在 SLA 和稳定性上都有保障。按实际业务需求选型,按需购买预付费包月可以降低成本。详见 云 GPU 平台盘点。
延伸阅读:
- 算力基础全景:大模型算力基础指南
- 显存需求估算:跑大模型要多少显存
- 云 GPU 平台对比:云 GPU 平台盘点
- 推理框架选择:vLLM 部署高并发推理
- 算力专题 Hub:算力专题
- 不想买 GPU 自己维护?加入候补,按需调用 API