在线工具

大模型 API 价格对比表

国内外主流大模型 API 输入/输出单价横向对比,按需选型。海外厂商按官方美元价、国内厂商按人民币刊例价,均为官方原文。

23 个模型
模型厂商输入价(每百万 token输出价(每百万 token上下文多模态备注来源 / 核对日
gpt-5.6-solOpenAI$5$30以官方文档为准短上下文档价;长上下文档为 $10/$45,表内取下限。缓存命中输入 $0.50、缓存写入 $6.25;Batch/Flex 档另有价OpenAI 官方2026-08-09
gpt-5.6-terraOpenAI$2$12以官方文档为准短上下文档价;长上下文档为 $4/$18,表内取下限。缓存命中输入 $0.20OpenAI 官方2026-08-09
gpt-5.6-lunaOpenAI$0.2$1.2以官方文档为准短上下文档价;长上下文档为 $0.40/$1.80,表内取下限。缓存命中输入 $0.02;该系列最便宜档OpenAI 官方2026-08-09
Claude Opus 5Anthropic$5$25以官方文档为准缓存命中 $0.50;5 分钟缓存写入 $6.25、1 小时 $10Anthropic 官方2026-08-09
Claude Sonnet 5Anthropic$2$10以官方文档为准官方标注为限时引导价,2026-08-31 前有效;2026-09-01 起恢复标准价 $3/$15。缓存命中 $0.20Anthropic 官方2026-08-09
Claude Haiku 4.5Anthropic$1$5以官方文档为准缓存命中 $0.10;该系列最便宜档Anthropic 官方2026-08-09
Gemini 3.6 FlashGoogle$1.5$7.5以官方文档为准付费层级价;Batch API 五折($0.75/$3.75);上下文缓存存储 $1.00/百万 token/小时Google 官方2026-08-09
Gemini 3.1 Pro(Preview)Google$2$12以官方文档为准按 prompt 长度分档:≤20 万 token 为 $2/$12,>20 万 token 为 $4/$18,表内取下限;Batch 五折;Preview 阶段价格可能调整Google 官方2026-08-09
Gemini 3.5 Flash-LiteGoogle$0.3$2.5以官方文档为准官方标为最具成本效益的正式版档;Batch 五折($0.15/$1.25)Google 官方2026-08-09
grok-4.5xAI$2$6500K官方当前主推的唯一旗舰文本模型(语音、图像视频为独立 API 另计费)xAI 官方2026-08-09
deepseek-v4-flashDeepSeek¥1¥21M缓存命中输入 ¥0.02。官方已公告近期将整体上调 API 定价、预计涨幅较大,做长期预算前务必复核DeepSeek 官方2026-08-09
deepseek-v4-proDeepSeek¥3¥61M缓存命中输入 ¥0.025。官方涨价公告同上DeepSeek 官方2026-08-09
GLM-5.2智谱AI¥8¥281M缓存命中 ¥2;缓存存储官方标注限时免费智谱开放平台2026-08-09
GLM-5智谱AI¥4¥18以官方文档为准按输入长度分档:<32K 为 ¥4/¥18,≥32K 为 ¥6/¥22,表内取下限;缓存命中 ¥1智谱开放平台2026-08-09
GLM-4.7-FlashX智谱AI¥0.5¥3200K缓存命中 ¥0.1;同系列 GLM-4.7-Flash 官方标注为免费智谱开放平台2026-08-09
kimi-k3月之暗面¥20¥1001M(1,048,576 tokens)缓存命中输入 ¥2,与未命中价差 10 倍,长会话务必开自动上下文缓存Kimi 开放平台2026-08-09
kimi-k2.7-code月之暗面¥6.5¥27256K(262,144 tokens)缓存命中输入 ¥1.3;官方标注支持文本、图片与视频输入;高速版 kimi-k2.7-code-highspeed 为 ¥13/¥54Kimi 开放平台2026-08-09
qwen3.8-max阿里云¥12¥361M0–1M token 单一档、不分段;Batch 调用半价,上下文缓存另有折扣(两者不能同时生效)阿里云百炼2026-08-09
qwen3.7-plus阿里云¥2¥81M按输入长度分档:≤256K 为 ¥2/¥8,256K–1M 为 ¥6/¥24,表内取下限;官方另标注限时 8 折;Batch 半价阿里云百炼2026-08-09
qwen3.7-flash阿里云¥0.2¥0.81M按输入长度分档:≤32K 为 ¥0.2/¥0.8,32K–256K 为 ¥0.6/¥2.4,256K–1M 为 ¥1.2/¥4.8,表内取下限;Batch 半价阿里云百炼2026-08-09
doubao-seed-2.1-pro字节跳动¥6¥30以官方文档为准输入长度 ≤256K 档价;缓存命中 ¥1.2,缓存存储 ¥0.017/百万 token/小时火山方舟2026-08-09
doubao-seed-2.1-turbo字节跳动¥3¥15以官方文档为准输入长度 ≤256K 档价;缓存命中 ¥0.6火山方舟2026-08-09
doubao-seed-2.0-mini字节跳动¥0.2¥2以官方文档为准按输入长度分档:≤32K 为 ¥0.2/¥2,32K–128K 为 ¥0.4/¥4,128K–256K 为 ¥0.8/¥8,表内取下限;音频输入另计价(¥3 起)火山方舟2026-08-09

逐条核对官方定价页于 2026-08-09。表内 $ 为海外厂商官方美元价、¥ 为国内厂商人民币刊例价,均未折算; 点表头排序时按 1 美元 ≈ 6.7476 人民币(2026-08-09 取数)折算比较,仅影响行序。价格仅供参考,以各厂商官方定价为准。

重要提示:价格随时会变。 本表是按核对日期整理的一次人工快照,不是实时行情。厂商调价、模型改名与版本迭代都可能让这里的数字失效, 一律以各厂商官方定价页当次显示的价格为准,本页仅供横向参考,不作为报价依据。
表里是官方刊例价,不是你在国内实际付的价。 海外模型经合规聚合渠道接入时,实际结算价还要叠加渠道政策、结算方式与汇率, 因方案而异,官方刊例价只是它的地板。需要按你的真实用量拿一份渠道接入报价, 可以申请力达云聚合 API 内测,我们按量给方案。

这张表怎么用

选型的时候最容易犯的错,是打开某一家的定价页看一眼就下结论。价格这件事只有横着看才有意义—— 同一个能力档位上,各家差出几倍是常事。这张表把主流模型的单价拉到同一个口径下并排放, 目的就是让你在十几秒里看清楚「贵的贵在哪,便宜的便宜在哪」。

表格上方有两个筛选:厂商用来只看某一家的产品线, 多模态选「仅多模态」可以把纯文本模型过滤掉——如果你的业务要处理图片或文档截图, 这一步能直接砍掉一半候选。右上角会实时显示当前筛选下还剩多少个模型。 「输入价」和「输出价」两个表头是可以点的,点一次按升序排,再点一次切降序, 未标价的行会始终排在末尾,不会因为数值是空就跑到最前面误导你。

剩下的几列各有各的用处。上下文是这个模型的窗口上限,决定了你一次能塞进去多长的材料; 多模态标明能不能吃图;备注这一列容易被忽略,其实信息密度最高—— 分档规则、缓存命中的方向、有没有更轻量的同门型号、改名情况,都写在那里。 只看单价不看备注,很容易得出一个和真实账单相差很远的结论。

价格该怎么读

第一件事是统一计价单位。本表所有数字都是「元 / 百万 token」。 但各家官网的写法并不统一,有的按每千 token 标,有的按美元标。 每千和每百万之间差一千倍,人民币和美元之间还有汇率,这两个坑一旦踩中, 算出来的月成本就不是偏一点,而是错一个数量级。抄价格之前先确认单位,是最基本的动作。

第二件事是输入价和输出价必须分开看。这是两笔独立的账: 输入按你喂进去的 prompt、上下文、检索到的资料计费,输出按模型吐出来的内容计费。 绝大多数模型的输出单价高于输入单价,有的高出好几倍。 所以哪个模型更省钱,取决于你自己业务的输入输出配比: 做文档问答、长材料摘要,输入项占大头;做写作、代码生成、带思考过程的推理任务,输出项才是主要开销。 只按输入价那一列排序选出来的「最便宜」,换个场景可能就是最贵的。

第三件事是认清分档。国产模型普遍按上下文长度分档计费, 输入越长,单价档位越高。本表主列取的是基础档(约 32K 以内输入)的价格, 这是为了让横向对比有一个统一基准,但它也意味着:如果你的实际请求动辄十几万 token, 你真正命中的档位比表里贵。同样地,缓存命中价和批量处理价是另一套计价逻辑, 主列不体现,只在备注里给方向。带着「我这个场景到底命中哪一档」的问题去看官方定价页, 比直接抄一个数字要靠谱得多。关于这些价目表里的门道, 大模型 API 价格表怎么读 这篇拆得更细,建议在做预算之前先过一遍。

这张表的局限

必须说清楚:这是一张快照,不是实时行情。数据是人工按核对日期整理的, 页面上标了核对到哪个月份。这个行业的调价、改名、新版本发布的频率相当高, 时间一长,表里必然会有过期项。所以它的正确用法是「圈定候选范围」, 而不是「确定采购价格」——用它把十几个模型缩到两三个,然后逐个打开官方定价页核实当次显示的数字。 如果你需要建立一套长期跟踪价格变动的习惯,可以参考 大模型价格变动怎么持续跟踪

另一个局限是价格不等于成本,更不等于选型结论。 单价只是账单的一个因子,同样一个任务,不同模型消耗的 token 数可能差很多: 回答啰嗦的模型输出更长,一次答不对要重试的模型请求次数更多, 这些都会摊进真实开销里,而表格是看不出来的。此外,稳定性、并发承载、 响应延迟、合规与数据驻留要求,都是价格之外的硬约束, 任何一条不满足,再便宜也没意义。

最后说一句币种。表里海外几家标 $、国内几家标 ¥,都是各自官方定价页上的原文,我们不做折算后再存—— 一折算,你看到的就不再是厂商说过的数字。要跨国比大小,点表头让它按折算后的值排序, 或者用成本估算器选个结算币种算总账。 另外,官方刊例价不等于你在国内实际付的钱:经合规聚合渠道接入时还要叠加渠道政策与汇率, 那部分需要按方案单独询价。

常见问题

怎么按用量算月成本?

分别计算输入 token 数 × 输入单价 + 输出 token 数 × 输出单价(单位均为元/百万 token),两项相加即为月调用成本。可先用 token 计算器估算文本的 token 数,再代入各模型单价计算。

海外模型标的是官方价还是渠道价?

是厂商官方定价页上的美元刊例价,每行都能点开来源链接自己核。国内经合规聚合渠道接入时,实际结算价还要叠加渠道政策与汇率因素,通常与官方刊例价有出入——那个数字因方案而异,需要单独询价,本表不代填。

表里的价格是实时的吗?

不是。表格是人工按核对日期整理的一次快照,页面上标注了核对到的月份。厂商调价、模型改名、新版本上线都可能让这里的数字过期,所以任何一次真实的采购或预算决策,都请以各厂商官方定价页当次显示的数字为准,本页只做横向参考。

为什么同一个模型的价格和我在官网看到的对不上?

最常见的原因是计费档位不同。国产模型普遍按上下文长度分档,表里取的是基础档(约 32K 以内输入)的价格,你如果跑的是长上下文请求,命中的是更高的档位。其次是缓存命中、批量(Batch)等特殊计价方式单独走一套价格,表格主列不体现,只在「备注」里提示方向。最后还有单位问题,有的页面标的是每千 token,和本表的每百万 token 差三个数量级。

输入价最低的模型就是最省钱的吗?

不一定。真实账单由输入量、输出量和各自单价共同决定,多数模型的输出单价明显高于输入单价,所以输出多的场景(长文写作、代码生成、带思考过程的推理模型)往往由输出项主导总价。正确做法是先估算你自己业务的输入输出 token 配比,再分别乘以两个单价相加比较,而不是只看表格里输入价那一列排序的结果。

一个 Key,接入所有主流模型

力达云聚合 API 内测开放中:统一接口调多家模型、按量计费、稳定合规接入。

申请内测

这个页面有问题?

提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。