← 返回资讯

大模型 API 价格表怎么读:六个让你算错一个数量级的陷阱

2026-08-07

价格表看起来是一个平台最简单的东西:几行模型名,几个美元数字,扫一眼就完了。但按我接过的这些家 API 的经验,它是最容易读错的一类表格——而且读错的结果不是差百分之几,是差一个数量级。

差百分之几你还能靠后面控成本补回来,差一个数量级意味着你的选型结论是反的:你以为选了便宜的那家,实际付账时才发现算反了;或者你在预算表里给某个功能留了三百块,上线第一周就烧到三千。

下面这六个陷阱,我每一个都见过有人真的踩进去。逐个拆。

陷阱一:同一张表里,计价单位可能不统一

这是最恶心的一个,因为它长得完全不像陷阱。

Replicate 官方定价页上的语言模型价目,是这样标的(来源:https://replicate.com/pricing,核对于 2026-08-07;以官方定价页为准):

模型输入输出
anthropic/claude-3.7-sonnet$3.00 / million input tokens$0.015 / thousand output tokens
deepseek-ai/deepseek-r1$3.75 / million input tokens$0.01 / thousand output tokens

请把这两列的单位再看一遍:输入按「每百万 token」标价,输出按「每千 token」标价。同一行,两个单位。

如果你像读普通表格那样只看数字,会得出一个荒谬的结论:claude-3.7-sonnet 的输入是 3.00、输出是 0.015,输出比输入便宜两百倍;deepseek-r1 更夸张,3.75 比 0.01,便宜三百七十五倍。这个世界上没有任何一家推理平台的输出比输入便宜——输出是逐 token 自回归生成的,它只会更贵。数字一旦离谱到反常识,第一反应应该是「我读错了单位」,而不是「这家好便宜」。

把单位统一到每百万 token(以下换算为本文按官方标价所做的算术,不是官方原文表述):

  • $0.015 / 千 token × 1000 = $15.00 / 百万 token
  • $0.01 / 千 token × 1000 = $10.00 / 百万 token

统一之后是这样:

模型输入($/1M)输出($/1M,本文换算)
anthropic/claude-3.7-sonnet3.0015.00
deepseek-ai/deepseek-r13.7510.00

现在它才是一张能比的表:输出分别是输入的 5 倍和约 2.67 倍。跟「便宜两百倍」相比,误差正好是一千倍——因为千和百万之间差一千。

算个具体的账。假设某个任务单月消耗 100 万输入 token、10 万输出 token(这两个量是我为了演示假设的,不是实测数据),用 claude-3.7-sonnet 的挂牌价:

  • 输入:1,000,000 ÷ 1,000,000 × $3.00 = $3.00
  • 输出:100,000 ÷ 1,000,000 × $15.00 = $1.50
  • 合计 $4.50

如果误把输出当成 $0.015 / 百万:输出算出来是 100,000 ÷ 1,000,000 × $0.015 = $0.0015,总额 $3.0015。你会以为输出成本可以忽略不计,实际上它占了整单的三分之一。同样口径下 deepseek-r1 是 $3.75 + 10 万 × $10/百万 = $3.75 + $1.00 = $4.75

铁律:把任何一家的价格抄进你自己的对比表时,第一件事是统一单位,第二件事才是抄数字。 我的习惯是自己的表只留一个单位(每百万 token),抄的时候当场换算、当场写下换算式,绝不把「0.015」这种原样数字留在表里过夜——过两天你自己都记不清它是千还是百万。

陷阱二:输入和输出不是一个价

上面顺带带出了第二个陷阱:输入价和输出价是分开的,而且输出通常贵一截。

看看这两张表里的倍率分布。Replicate 那两个模型换算后是 5 倍和 2.67 倍。再看 DeepInfra 的官方定价页(来源:https://deepinfra.com/pricing,核对于 2026-08-07;以官方定价页为准),它的单位是统一的每 100 万 token:

模型输入缓存输入输出
DeepSeek-V4-Pro$1.30$0.10$2.60
DeepSeek-V4-Flash$0.09$0.018$0.18
DeepSeek-V3.2$0.26$0.13$0.38
DeepSeek-V3.1-Terminus$0.27$0.13$0.95
DeepSeek-V3.1$0.25$0.13$0.95

输出/输入的倍率:V4-Pro 是 2 倍,V4-Flash 是 2 倍,V3.2 约 1.46 倍,V3.1 是 3.8 倍。加上 Replicate 的两行,这七个条目的倍率从约 1.46 倍散到 5 倍。所以「输出大概贵一倍上下」只能当粗略直觉,具体倍率必须逐个模型看,它甚至在同一家的同一代模型之间都不一样。

这件事有两个直接的工程后果。

一是让模型少废话就是直接省钱。同样的问题,回答控制在 200 token 还是 800 token,成本差的是那一列单价最高的部分。加一句「直接给结论,不要复述问题」、把输出限制成结构化 JSON、给 max_tokens 一个真实合理的上限,这些改动的成本收益比比换模型高得多,而且不牺牲质量。

二是按「总 token 数」估成本一定会低估。我见过的最典型错法是拿总 token 乘输入单价。用 DeepSeek-V3.1 的挂牌价算一笔(假设量级同样是演示用):某个偏生成的任务月耗 20 万输入、50 万输出。

  • 正确算法:0.2 × $0.25 + 0.5 × $0.95 = $0.05 + $0.475 = $0.525
  • 拿 70 万总 token 乘输入价:0.7 × $0.25 = $0.175

低估到只有实际的三分之一。输出占比越高,这个偏差越大。输入输出为什么分开定价、这个结构怎么反过来指导用法,我在输入价与输出价为什么不同里拆得更细。

陷阱三:是两档还是三档

第三个陷阱藏在列数里。上面那张 DeepInfra 的表有三列:输入、缓存输入、输出。很多人扫表时会自动把它读成熟悉的两列结构,中间那列直接跳过。

跳过的代价有多大?看 DeepSeek-V4-Pro:普通输入 $1.30,缓存输入 $0.10,差 13 倍。这已经接近一个数量级了。V4-Flash 是 $0.09 对 $0.018,差 5 倍。V3.2 和 V3.1 系列是 $0.26/$0.25/$0.27 对 $0.13,差不多减半。

算一笔命中缓存的账。假设一个客服类应用,每次请求 10,000 输入 token,其中 8,000 是固定不变的系统提示与知识片段、能命中缓存,2,000 是本次的用户内容;输出 500 token。用 V4-Pro 的挂牌价(命中比例是我为演示设定的假设,你的真实命中率只能自己压出来):

  • 缓存输入:8,000 ÷ 1,000,000 × $0.10 = $0.0008
  • 普通输入:2,000 ÷ 1,000,000 × $1.30 = $0.0026
  • 输出:500 ÷ 1,000,000 × $2.60 = $0.0013
  • 单次合计 $0.0047

同样的请求如果一次缓存都没命中:

  • 输入:10,000 ÷ 1,000,000 × $1.30 = $0.0130
  • 输出:$0.0013
  • 单次合计 $0.0143

$0.0143 ÷ $0.0047 ≈ 3.04 倍。也就是说,同一个应用、同一个模型、同一份提示词,仅仅因为你有没有把可缓存的部分固定在前缀位置,账单就能差三倍。

所以只拿「输入价」那一列去横向比价,会系统性地冤枉那些缓存档做得便宜的平台。反过来也成立:如果你的场景是每次请求内容都不一样、天然没有可复用前缀,那缓存档再便宜也跟你无关,这时候盯着别人的缓存价选平台同样是错的。缓存计费的触发条件、前缀怎么排、哪些改动会让缓存整段失效,可以看提示词缓存怎么计费

补一句诚实边界:这两张表以外的平台有没有缓存档、缓存怎么计费、有没有写入费用,我这里没有核实过的数据,一律以各家官方定价页为准。没有核实的数字,宁可空着也不要填进对比表——对比表里一个编造的数字,会污染整张表的结论。

陷阱四:同名模型,不同平台不是一个价

「DeepSeek 多少钱一百万 token?」——这个问题本身就是不成立的。

开源权重的模型会同时挂在很多家推理平台上,每家自己定价。就拿手上这两张表:Replicate 挂的是 deepseek-ai/deepseek-r1,DeepInfra 挂的是 DeepSeek-V3.1 / V3.2 / V4 这几个条目。两家连表的结构都不一样——Replicate 是两档且单位混用,DeepInfra 是三档且统一每百万。结构都不同,价格自然更不会自动相同。

这就意味着:

  1. 报价必须带平台名。 「deepseek-r1 是 $3.75 / 百万输入」这句话只有加上「在 Replicate 上」才成立,脱离平台就是错的。我在文档和预算表里强制自己写成「平台 + 模型 ID + 单位 + 核对日期」四件套,少一样都不算数。
  2. 模型 ID 的写法也是平台特有的。 同一个开源模型,有的平台是扁平名,有的是「组织/模型名」两段式,有的是三段式路径。你从别人的文章里抄一个模型 ID 换个平台去调,报错还不一定报在你以为的地方。
  3. 换平台不等于换 base_url。 有的平台根本不是 OpenAI 兼容形态——比如 Replicate 走的是它自己的 predictions API(https://api.replicate.com/v1/predictions,请求体是 version + input 结构,默认异步、靠轮询或 webhook 拿结果)。这类平台的迁移成本是「改调用范式」,不是「改三处配置」。比价之前先回答这个问题,否则你比出来的便宜可能根本吃不到。

陷阱五:版本快照和滚动别名,别看串行

模型条目的名字经常长得极像。DeepInfra 那张表里就有一对现成的:

  • DeepSeek-V3.1:输入 $0.25,缓存 $0.13,输出 $0.95
  • DeepSeek-V3.1-Terminus:输入 $0.27,缓存 $0.13,输出 $0.95

输出和缓存价一模一样,输入价差 $0.02。差得小,所以看串行了也不容易被发现——但你的报表从此就带着一个说不清来源的偏差。

同一张表里还有更凶的:DeepSeek-V4-Pro 输入 $1.30,DeepSeek-V4-Flash 输入 $0.09。都是「V4」,输入价差约 14.4 倍。你在需求文档里写「用 V4」,采购按 Flash 报预算,工程按 Pro 上线,差的就不是零头了。

另一类容易看串的是带日期后缀的版本快照。有些平台的模型 ID 直接把日期写进名字里(比如 Nebius Token Factory 文档里的示例模型 ID 就是 deepseek-ai/DeepSeek-R1-0528 这种「两段式 + 日期后缀」的写法)。带日期的快照条目和不带日期的滚动别名,可能同价,也可能不同价,这没有通例——只能在你要用的那家的定价页上,把你实际要传的那个字符串,一个字符一个字符地对到价格行上。

我的做法很笨但有效:预算表里存的不是「V3.1」这种人话,而是代码里真正会传出去的那个模型 ID 字符串,跟代码里的常量保持一致。这样对账的时候,表和代码能直接对上,不给「看串行」留缝。

陷阱六:主价目之外,还有折扣档和附加结构

最后一个陷阱是:你看到的那张表,可能不是全部的价目。

平台常见的做法是在主价目之外,再挂一些独立的价目结构:批处理/离线档(用延迟换单价)、不同地域或不同数据驻留要求的独立价格、不同优先级或不同 SLA 的档位、专属部署与按 GPU 时长计费的另一套口径。比如 Replicate 的定价页上,除了上面那张按 token 计费的语言模型表,还同时存在按 GPU 秒计费的另一套价目——同一家平台,两种完全不同的计价口径,取决于你跑的是什么。

这里我只讲「存在这类结构」,不给任何具体的折扣比例——各家的档位设置、折扣力度、生效条件都不一样,而且会变,我没有核实过的数字不会写进来。你要做的是:在决定用哪一档之前,把目标平台定价页从头到尾读完(包括页脚的小字和「查看全部」之类的折叠区),确认自己看到的是不是全部;再确认你实际的调用方式落在哪一档上。默认档和折扣档之间的差别,经常比不同平台之间的差别还大。

顺带说一句实操:如果你还没有核实到某家的完整价目结构,别急着把它写进选型表。先用一批真实请求跑出你自己的单位成本(每次会话多少钱、每个工单多少钱),这个数字比任何挂牌价都可信,因为它已经把你真实的输入输出比例、缓存命中率、重试率全都算进去了。

正确的比价流程

把上面六条反过来,就是一套可执行的流程:

  1. 先定模型,再谈价格。 确定你实际要用的那个模型 ID(连日期后缀一起),而不是模糊的模型代号。模型没定,比价是空的。
  2. 一家一家去官网查当次价。 不要用文章里(包括本文)的数字当依据,价格会变。本文引用的两组数字都有核对日期,过了这个日期就只是参考。
  3. 统一单位。 全部换算成每百万 token,换算式当场写下来。
  4. 对齐档位。 输入、缓存输入、输出分列填;对方没有缓存档就明确留空,不要用输入价顶上去。
  5. 按你的真实比例加权。 用自己业务的输入/输出/缓存命中比例算加权单价,而不是把三个价简单相加或取平均。别人的比例不是你的比例。
  6. 确认计价范式。 是按 token 还是按 GPU 时长,是同步还是异步,落在哪个折扣档上。
  7. 加上时间戳存档。 每一行都记「平台 + 模型 ID + 单位 + 核对日期」,下次复查时才知道哪些该重查。

第 3 到第 5 步是纯机械劳动,也正是最容易手滑的地方,交给工具做更稳:价格对比工具可以把不同单位的标价拉到同一口径下,再按你给的输入/输出比例算加权成本,省掉手工换算这一环。想先看看「便宜」这个词在不同场景下到底指什么,可以配合怎么找到最便宜的大模型 API一起看。

自查清单

抄价格表之前,逐条过一遍:

  1. 每一列的单位是什么?是每千还是每百万?同一张表里的不同列,单位可能不一样。
  2. 换算完了吗?换算式写下来了吗?自己表里只留一个单位了吗?
  3. 输入价和输出价分开了吗?输出/输入倍率是多少?有没有拿总 token 乘输入价?
  4. 这张表是两档还是三档?有没有缓存输入这一列?漏了这列会不会冤枉某一家?
  5. 模型 ID 抄全了吗?带日期后缀的和不带的,是不是同一行?V4-Pro 和 V4-Flash 这种同族不同价的,有没有看串?
  6. 每一行都标了平台名和核对日期吗?
  7. 定价页有没有从头读到尾?有没有批处理、地域、优先级之类的独立档位没看到?
  8. 有没有用自己的真实调用跑出过单位成本,用来验证挂牌价推算的结果?

本文引用的所有价格均来自 Replicate 与 DeepInfra 官方定价页,核对于 2026-08-07,换算部分已注明为本文所做的算术演示;两家的现价与完整档位以其官方定价页为准

要把手里几张单位不一的价目表拉到同一口径下对比,直接用价格对比工具

相关阅读