大模型 API 价格对比表
国内外主流大模型 API 输入/输出单价横向对比,按需选型。海外厂商按官方美元价、国内厂商按人民币刊例价,均为官方原文。
| 模型 | 厂商 | 输入价(每百万 token) ↕ | 输出价(每百万 token) ↕ | 上下文 | 多模态 | 备注 | 来源 / 核对日 |
|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | OpenAI | $5 | $30 | 以官方文档为准 | — | 短上下文档价;长上下文档为 $10/$45,表内取下限。缓存命中输入 $0.50、缓存写入 $6.25;Batch/Flex 档另有价 | OpenAI 官方2026-08-09 |
| gpt-5.6-terra | OpenAI | $2 | $12 | 以官方文档为准 | — | 短上下文档价;长上下文档为 $4/$18,表内取下限。缓存命中输入 $0.20 | OpenAI 官方2026-08-09 |
| gpt-5.6-luna | OpenAI | $0.2 | $1.2 | 以官方文档为准 | — | 短上下文档价;长上下文档为 $0.40/$1.80,表内取下限。缓存命中输入 $0.02;该系列最便宜档 | OpenAI 官方2026-08-09 |
| Claude Opus 5 | Anthropic | $5 | $25 | 以官方文档为准 | — | 缓存命中 $0.50;5 分钟缓存写入 $6.25、1 小时 $10 | Anthropic 官方2026-08-09 |
| Claude Sonnet 5 | Anthropic | $2 | $10 | 以官方文档为准 | — | 官方标注为限时引导价,2026-08-31 前有效;2026-09-01 起恢复标准价 $3/$15。缓存命中 $0.20 | Anthropic 官方2026-08-09 |
| Claude Haiku 4.5 | Anthropic | $1 | $5 | 以官方文档为准 | — | 缓存命中 $0.10;该系列最便宜档 | Anthropic 官方2026-08-09 |
| Gemini 3.6 Flash | $1.5 | $7.5 | 以官方文档为准 | 是 | 付费层级价;Batch API 五折($0.75/$3.75);上下文缓存存储 $1.00/百万 token/小时 | Google 官方2026-08-09 | |
| Gemini 3.1 Pro(Preview) | $2 | $12 | 以官方文档为准 | 是 | 按 prompt 长度分档:≤20 万 token 为 $2/$12,>20 万 token 为 $4/$18,表内取下限;Batch 五折;Preview 阶段价格可能调整 | Google 官方2026-08-09 | |
| Gemini 3.5 Flash-Lite | $0.3 | $2.5 | 以官方文档为准 | 是 | 官方标为最具成本效益的正式版档;Batch 五折($0.15/$1.25) | Google 官方2026-08-09 | |
| grok-4.5 | xAI | $2 | $6 | 500K | — | 官方当前主推的唯一旗舰文本模型(语音、图像视频为独立 API 另计费) | xAI 官方2026-08-09 |
| deepseek-v4-flash | DeepSeek | ¥1 | ¥2 | 1M | — | 缓存命中输入 ¥0.02。官方已公告近期将整体上调 API 定价、预计涨幅较大,做长期预算前务必复核 | DeepSeek 官方2026-08-09 |
| deepseek-v4-pro | DeepSeek | ¥3 | ¥6 | 1M | — | 缓 存命中输入 ¥0.025。官方涨价公告同上 | DeepSeek 官方2026-08-09 |
| GLM-5.2 | 智谱AI | ¥8 | ¥28 | 1M | — | 缓存命中 ¥2;缓存存储官方标注限时免费 | 智谱开放平台2026-08-09 |
| GLM-5 | 智谱AI | ¥4 | ¥18 | 以官方文档为准 | — | 按输入长度分档:<32K 为 ¥4/¥18,≥32K 为 ¥6/¥22,表内取下限;缓存命中 ¥1 | 智谱开放平台2026-08-09 |
| GLM-4.7-FlashX | 智谱AI | ¥0.5 | ¥3 | 200K | — | 缓存命中 ¥0.1;同系列 GLM-4.7-Flash 官方标注为免费 | 智谱开放平台2026-08-09 |
| kimi-k3 | 月之暗面 | ¥20 | ¥100 | 1M(1,048,576 tokens) | — | 缓存命中输入 ¥2,与未命中价差 10 倍,长会话务必开自动上下文缓存 | Kimi 开放平台2026-08-09 |
| kimi-k2.7-code | 月之暗面 | ¥6.5 | ¥27 | 256K(262,144 tokens) | 是 | 缓存命中输入 ¥1.3;官方标注 支持文本、图片与视频输入;高速版 kimi-k2.7-code-highspeed 为 ¥13/¥54 | Kimi 开放平台2026-08-09 |
| qwen3.8-max | 阿里云 | ¥12 | ¥36 | 1M | — | 0–1M token 单一档、不分段;Batch 调用半价,上下文缓存另有折扣(两者不能同时生效) | 阿里云百炼2026-08-09 |
| qwen3.7-plus | 阿里云 | ¥2 | ¥8 | 1M | — | 按输入长度分档:≤256K 为 ¥2/¥8,256K–1M 为 ¥6/¥24,表内取下限;官方另标注限时 8 折;Batch 半价 | 阿里云百炼2026-08-09 |
| qwen3.7-flash | 阿里云 | ¥0.2 | ¥0.8 | 1M | — | 按输入长度分档:≤32K 为 ¥0.2/¥0.8,32K–256K 为 ¥0.6/¥2.4,256K–1M 为 ¥1.2/¥4.8,表内取下限;Batch 半价 | 阿里云百炼2026-08-09 |
| doubao-seed-2.1-pro | 字节跳动 | ¥6 | ¥30 | 以官方文档为准 | — | 输入长度 ≤256K 档价;缓存命中 ¥1.2,缓存存储 ¥0.017/百万 token/小时 | 火山方舟2026-08-09 |
| doubao-seed-2.1-turbo | 字节跳动 | ¥3 | ¥15 | 以官方文档为准 | — | 输入长度 ≤256K 档价;缓存命中 ¥0.6 | 火山方舟2026-08-09 |
| doubao-seed-2.0-mini | 字节跳动 | ¥0.2 | ¥2 | 以官方文档为准 | — | 按输入长度分档:≤32K 为 ¥0.2/¥2,32K–128K 为 ¥0.4/¥4,128K–256K 为 ¥0.8/¥8,表内取下限;音频输入另计价(¥3 起) | 火山方舟2026-08-09 |
逐条核对官方定价页于 2026-08-09。表内 $ 为海外厂商官方美元价、¥ 为国内厂商人民币刊例价,均未折算; 点表头排序时按 1 美元 ≈ 6.7476 人民币(2026-08-09 取数)折算比较,仅影响行序。价格仅供参考,以各厂商官方定价为准。
这张表怎么用
选型的时候最容易犯的错,是打开某一家的定价页看一眼就下结论。价格这件事只有横着看才有意义—— 同一个能力档位上,各家差出几倍是常事。这张表把主流模型的单价拉到同一个口径下并排放, 目的就是让你在十几秒里看清楚「贵的贵在哪,便宜的便宜在哪」。
表格上方有两个筛选:厂商用来只看某一家的产品线, 多模态选「仅多模态」可以把纯文本模型过滤掉——如果你的业务要处理图片或文档截图, 这一步能直接砍掉一半候选。右上角会实时显示当前筛选下还剩多少个模型。 「输入价」和「输出价」两个表头是可以点的,点一次按升序排,再点一次切降序, 未标价的行会始终排在末尾,不会因为数值是空就跑到最前面误导你。
剩下的几列各有各的用处。上下文是这个模型的窗口上限,决定了你一次能塞进去多长的材料; 多模态标明能不能吃图;备注这一列容易被忽略,其实信息密度最高—— 分档规则、缓存命中的方向、有没有更轻量的同门型号、改名情况,都写在那里。 只看单价不看备注,很容易得出一个和真实账单相差很远的结论。
价格该怎么读
第一件事是统一计价单位。本表所有数字都是「元 / 百万 token」。 但各家官网的写法并不统一,有的按每千 token 标,有的按美元标。 每千和每百万之间差一千倍,人民币和美元之间还有汇率,这两个坑一旦踩中, 算出来的月成本就不是偏一点,而是错一个数量级。抄价格之前先确认单位,是最基本的动作。
第二件事是输入价和输出价必须分开看。这是两笔独立的账: 输入按你喂进去的 prompt、上下文、检索到的资料计费,输出按模型吐出来的内容计费。 绝大多数模型的输出单价高于输入单价,有的高出好几倍。 所以哪个模型更省钱,取决于你自己业务的输入输出配比: 做文档问答、长材料摘要,输入项占大头;做写作、代码生成、带思考过程的推理任务,输出项才是主要开销。 只按输入价那一列排序选出来的「最便宜」,换个场景可能就是最贵的。
第三件事是认清分档。国产模型普遍按上下文长度分档计费, 输入越长,单价档位越高。本表主列取的是基础档(约 32K 以内输入)的价格, 这是为了让横向对比有一个统一基准,但它也意味着:如果你的实际请求动辄十几万 token, 你真正命中的档位比表里贵。同样地,缓存命中价和批量处理价是另一套计价逻辑, 主列不体现,只在备注里给方向。带着「我这个场景到底命中哪一档」的问题去看官方定价页, 比直接抄一个数字要靠谱得多。关于这些价目表里的门道, 大模型 API 价格表怎么读 这篇拆得更细,建议在做预算之前先过一遍。
这张表的局限
必须说清楚:这是一张快照,不是实时行情。数据是人工按核对日期整理的, 页面上标了核对到哪个月份。这个行业的调价、改名、新版本发布的频率相当高, 时间一长,表里必然会有过期项。所以它的正确用法是「圈定候选范围」, 而不是「确定采购价格」——用它把十几个模型缩到两三个,然后逐个打开官方定价页核实当次显示的数字。 如果你需要建立一套长期跟踪价格变动的习惯,可以参考 大模型价格变动怎么持续跟踪。
另一个局限是价格不等于成本,更不等于选型结论。 单价只是账单的一个因子,同样一个任务,不同模型消耗的 token 数可能差很多: 回答啰嗦的模型输出更长,一次答不对要重试的模型请求次数更多, 这些都会摊进真实开销里,而表格是看不出来的。此外,稳定性、并发承载、 响应延迟、合规与数据驻留要求,都是价格之外的硬约束, 任何一条不满足,再便宜也没意义。
最后说一句币种。表里海外几家标 $、国内几家标 ¥,都是各自官方定价页上的原文,我们不做折算后再存—— 一折算,你看到的就不再是厂商说过的数字。要跨国比大小,点表头让它按折算后的值排序, 或者用成本估算器选个结算币种算总账。 另外,官方刊例价不等于你在国内实际付的钱:经合规聚合渠道接入时还要叠加渠道政策与汇率, 那部分需要按方案单独询价。
常见问题
怎么按用量算月成本?
分别计算输入 token 数 × 输入单价 + 输出 token 数 × 输出单价(单位均为元/百万 token),两项相加即为月调用成本。可先用 token 计算器估算文本的 token 数,再代入各模型单价计算。
海外模型标的是官方价还是渠道价?
是厂商官方定价页上的美元刊例价,每行都能点开来源链接自己核。国内经合规聚合渠道接入时,实际结算价还要叠加渠道政策与汇率因素,通常与官方刊例价有出入——那个数字因方案而异,需要单独询价,本表不代填。
表里的价格是实时的吗?
不是。表格是人工按核对日期整理的一次快照,页面上标注了核对到的月份。厂商调价、模型改名、新版本上线都可能让这里的数字过期,所以任何一次真实的采购或预算决策,都请以各厂商官方定价页当次显示的数字为准,本页只做横向参考。
为什么同一个模型的价格和我在官网看到的对不上?
最常见的原因是计费档位不同。国产模型普遍按上下文长度分档,表里取的是基础档(约 32K 以内输入)的价格,你如果跑的是长上下文请求,命中的是更高的档位。其次是缓存命中、批量(Batch)等特殊计价方式单独走一套价格,表格主列不体现,只在「备注」里提示方向。最后还有单位问题,有的页面标的是每千 token,和本表的每百万 token 差三个数量级。
输入价最低的模型就是最省钱的吗?
不一定。真实账单由输入量、输出量和各自单价共同决定,多数模型的输出单价明显高于输入单价,所以输出多的场景(长文写作、代码生成、带思考过程的推理模型)往往由输出项主导总价。正确做法是先估算你自己业务的输入输出 token 配比,再分别乘以两个单价相加比较,而不是只看表格里输入价那一列排序的结果。
一个 Key,接入所有主流模型
力达云聚合 API 内测开放中:统一接口调多家模型、按量计费、稳定合规接入。