大模型价格战解读:为什么越来越便宜,该怎么用好这波红利
过去两年,主流大模型的 API 价格累计降幅超过 90%(以各厂商官方公告为准)。这场价格战不会很快结束——理解背后的驱动逻辑,才能帮你在成本规划中既利用红利,又防范供应商风险。
一、价格为什么一路下跌
推理效率的指数级提升
芯片算力(特别是 H100/H800 等 GPU)每年稳步提升,同时推理框架(vLLM、TensorRT-LLM 等)持续优化 KV Cache 命中率和批处理吞吐量。同样的模型能力,所需算力成本每年降低 30-50%。
具体拆开看,这块的降本主要来自三个方向叠加,不是单一因素在起作用。一是 PagedAttention 之类的显存管理机制,把 KV Cache 按页分配而不是提前给每个请求预留一整块连续显存,同样的显卡能同时撑更多并发请求,单位请求的显卡摊销成本自然下降。二是 continuous batching(连续批处理),老式的静态批处理要等一批请求全部生成完才能腾出资源处理下一批,长请求会拖慢短请求;连续批处理让每个请求生成完就立刻让位,GPU 利用率能从 40% 量级提到 80% 以上。三是 量化,把模型权重从 FP16 压到 FP8 甚至 INT8/INT4,显存占用直接减半到四分之一,推理速度也跟着提升,只是需要用校准数据集控制精度损失。这三项叠加起来,才是”同样模型、成本腰斩再腰斩”的真实来源,而不是厂商单纯在做亏本营销。
MoE 架构降低实际激活成本
混合专家架构(MoE)使得参数规模大但实际激活参数少,推理成本大幅降低。详见 MoE 架构科普。
打个更直观的比方:一辆有 12 个气缸的车,日常在城市里开时可能只有 3-4 个气缸在真正做功,其余气缸处于停缸节油状态,但你依然获得了大排量车该有的动力储备。MoE 模型也是同样的思路——总参数量可能是千亿甚至万亿级别,但路由机制(router)在处理每一个 Token 时只会激活其中一小部分专家网络,剩下的专家权重虽然占显存,却不参与这一步的计算。这意味着训练时你要为全部参数付出显存和存储成本,但推理时的算力开销只跟”激活参数量”挂钩,而不是总参数量。这也是为什么现在很多千亿级参数的模型,实际推理速度和成本反而接近早年几十亿参数的稠密模型——它们比的从来不是参数总量,而是每次推理真正调用了多少。
竞争加剧与市场份额争夺
当 API 成为同质化商品,价格就成为主要竞争工具。国内厂商之间、国内与海外厂商之间的竞争都在拉低定价。
规模效应摊薄边际成本
用户基数越大,数据中心固定成本越能被摊薄,头部厂商具备持续降价的底气。
二、降价格局速览
| 模型层级 | 2023年典型价格区间 | 2025年典型价格区间 | 降幅参考 |
|---|---|---|---|
| 顶级旗舰(如 GPT-4 级别) | 较高 | 有所下降 | 约 40-60% |
| 中端能力(如 GPT-3.5 级别) | 中等 | 大幅下降 | 约 70-90% |
| 国产主流 | 较低 | 极低 | 部分接近免费 |
具体价格以各厂商当前官方定价页面为准,以上仅为趋势参考。
这张表还漏掉了一个很多人第一次核账单时才会发现的事实:降价通常不是”整体打折”,而是分维度降的。至少要拆成三个计费维度分别看:输入 Token 单价、输出 Token 单价、以及部分厂商提供的”缓存命中”单价(也叫 prompt caching 或上下文缓存)。这三者的降幅往往完全不同——输出 Token 单价一般比输入贵好几倍(因为生成是逐 Token 串行计算,没法像输入那样一次性批量处理),价格战里厂商更愿意先降输入价格来拉低”起售价”的观感,输出价格降得慢一些。如果你的业务是长输入短输出(比如摘要、分类),感受到的降价幅度会比长输出场景(比如生成长文章、写代码)更明显。做预算测算前,先把自己业务的输入输出 Token 比例摸清楚,直接套用官网首页挂的”最低价”很容易算错预算。
三、对开发者的机遇
机遇 1:原本不可行的场景变得可行
高 Token 消耗的应用(长文档处理、全量日志分析、每用户每天多次 AI 辅助)在过去因成本问题被搁置,现在成本已降至可接受区间。
机遇 2:RAG 和 Agent 的经济性改善
多 Agent 协作、多轮检索增强生成(RAG)会产生大量中间 Token,定价下降使这类架构的 ROI 大幅改善。
机遇 3:更容易做多模型对比测试
低价格降低了实验成本,你可以用同等预算测试更多候选模型,找到任务最优解。
四、对开发者的风险
风险 1:供应商依赖与停服风险
低价背后可能是亏损换市场——当市场格局稳定后,价格可能回升,或小厂商直接退出市场。强绑定单一廉价供应商,切换成本极高。
应对:接入层使用 API 网关 封装,保持多供应商快速切换能力。
风险 2:质量随价格同步下降
部分厂商推出”廉价版”模型,名义上是同款,实际是蒸馏/量化版本,能力有所缩水。注意区分定价层级和实际模型版本。
风险 3:限流与 SLA 不透明
廉价套餐往往伴随更低的并发限制和更宽松的 SLA,生产环境需要仔细确认。
五、务实的成本规划建议
- 不要把最低价格当预算基准——用中等价格做预算,享受低价是惊喜而非预期
- 做好 Token 用量监控,而非依赖账单结算来发现超支,详见 Token 用量监控
- 按任务类型分级用模型:高价值任务用旗舰模型,批量/辅助任务用小/廉价模型
- 合同锁定关键定价:与量大的供应商签框架协议,锁定一定期限内的价格
六、真实踩坑:模型降价了,账单却没降
这是我见过最多人中招的误区——单价降了不代表总支出会同比例下降,因为价格战期间大家用得更多、用法也更”浪费”。具体有三个坑,都是账单复盘时才发现的:
坑 1:多轮对话的上下文重复计费。 很多聊天类应用每次请求都会把完整的历史对话重新拼进 Prompt 发给模型,模型没有”记忆”这回事——它每次都是从头读一遍上下文。对话进行到第 20 轮时,你实际付费的输入 Token 数可能是第 1 轮的十几倍,而单价再便宜,总量堆上去账单照样吓人。排查方法很直接:把某个真实会话的完整请求体导出来,数一下 messages 数组里累计的字符/Token 数,你大概率会发现历史消息占了 80% 以上的输入开销。
坑 2:System Prompt 越写越长,每次调用都在为它付费。 团队为了让模型行为更稳定,System Prompt 里塞了几百字的角色设定、输出格式约束、少样本示例(few-shot),这些内容看起来”只写一次”,但每次请求都要原样发一遍,等于每次调用都在为这几百字买单。如果你的 System Prompt 长期不变,优先看厂商是否支持 Prompt Caching(上下文缓存)——命中缓存的部分通常只收全价的一折到五折,没开启这个开关,等于白白多付钱。
坑 3:中文的 Token 膨胀系数比你以为的高。 大多数分词器对中文不友好,一个常用汉字平均要占 1.5-2 个 Token,某些生僻字或者标点组合甚至更高,而同样内容的英文单价对比反而更划算。用官网价格页给出的”每百万 Token 多少钱”直接乘以”文档字数”来估算成本,中文场景通常会算少,实际调用一次真实接口、用返回结果里的 usage.prompt_tokens 字段核对一下真实 Token 数,比拍脑袋估算靠谱得多。
七、限流和重试:价格战期间更容易踩到的坑
免费层或者低价套餐降价之后用户暴涨,最先扛不住的往往不是模型能力,而是并发限流。你大概率会在日志里见到这样的报错:
Error: 429 Too Many Requests
{"error": {"message": "Rate limit reached for requests", "type": "rate_limit_error"}}
根因通常是三选一:账号的每分钟请求数(RPM)或每分钟 Token 数(TPM)超限、同一时间段并发连接数超过套餐上限、或者你恰好撞上了厂商侧的临时限流保护(大促、降价活动上线当天最容易发生)。低价套餐的限流阈值往往比旗舰套餐低一个数量级,这也是”便宜但用不动”的常见原因。
对应的工程做法是指数退避 + 抖动重试,而不是收到 429 就立刻原样重发(那样只会让限流更严重):
import time
import random
def call_with_backoff(fn, max_retries=5):
for attempt in range(max_retries):
try:
return fn()
except RateLimitError:
if attempt == max_retries - 1:
raise
wait = (2 ** attempt) + random.uniform(0, 1)
time.sleep(wait)
这段代码的关键是 random.uniform(0, 1) 这个抖动量——如果所有失败请求都严格按 1s、2s、4s 这种固定节奏重试,大量客户端会在同一时刻集中重发,反而制造出新的流量尖峰。加一点随机抖动,能把重试请求在时间轴上打散,通过率会明显提升。如果你已经在用统一的 API 网关 做接入层,这类退避重试逻辑应该收敛到网关层统一实现,而不是每个业务方各写一套。
常见问题
国内模型”免费”是真的吗? 部分厂商提供限额免费层(如每天 N 次调用),但生产规模使用仍需付费。免费层适合开发测试,不能作为生产方案。
价格战会导致模型质量下降吗? 旗舰模型的质量不会主动下降,价格战的本质是低价层级的模型在升级(越来越便宜的价格买到越来越强的能力),而非旗舰降级。但新推出的廉价版模型需要自行评测验证质量。
现在是不是应该锁定长期合同? 价格仍处于下降通道,签长期合同有锁定在高价的风险。建议短合同/按量付费,每半年重新评估一次供应商格局。
延伸阅读:大模型 API 价格对比工具 · 国产与海外模型差距观察 · API 网关选型 · 怎么追踪大模型动态 · 返回 AI 资讯中心
看完想自己上手试试?
力达云是国内可直连的兼容端点,一期提供 DeepSeek,注册送 ¥5 额度。