在线工具

大模型对比器

勾选 2-4 个模型并排对比价格与能力。

选择 2–4 个模型进行对比

gpt-5.6-sol
OpenAI
输入价
5 $/百万
输出价
30 $/百万
上下文
以官方文档为准
备注
短上下文档价;长上下文档为 $10/$45,表内取下限。缓存命中输入 $0.50、缓存写入 $6.25;Batch/Flex 档另有价
gpt-5.6-terra
OpenAI
输入价
2 $/百万
输出价
12 $/百万
上下文
以官方文档为准
备注
短上下文档价;长上下文档为 $4/$18,表内取下限。缓存命中输入 $0.20
gpt-5.6-luna
OpenAI
输入价
0.2 $/百万
输出价
1.2 $/百万
上下文
以官方文档为准
备注
短上下文档价;长上下文档为 $0.40/$1.80,表内取下限。缓存命中输入 $0.02;该系列最便宜档

请先看这一句:本页是人工整理的横向参考,价格为 2026-08-09 核对的快照,不与厂商接口联动。 各家会调价、会分档、会对缓存命中与批量调用另行计价,具体规格与价格一律以各厂商官方页面当次显示的为准。 本页不提供任何模型的跑分、能力排名或评测名次,只并排陈列价格、上下文窗口、是否多模态与计费备注这几项可核对的事实。

这个对比器怎么用

上面的选择区列出了当前收录的模型,点一下名字就加入对比,最多同时并排 4 个,再点一次取消。 默认帮你选好了前三个,方便直接开始。每张对比卡上显示的就四件事:输入价、输出价、上下文窗口,以及是否多模态; 下面的备注栏用来放那些「一句话不说清楚就会算错账」的信息,比如这个价是哪一档上下文的价、缓存命中之后能便宜到什么程度、 同系列还有没有更轻的档位。价格按各厂商官方原文的币种显示——海外是美元、国内是人民币, 并排时别只看数字大小,$2 和 ¥2 差着一个汇率。

用法上有个小建议:不要一上来就把四个都勾上瞎看。先按你的硬约束筛一轮—— 比如「必须吃得下 20 万 token 的长文档」或者「必须能读图」,不满足的直接出局; 剩下的再选 2 到 3 个做细看。约束筛完之后往往只剩两三个候选,这时候的对比才有意义。

该看哪几个维度

第一是输入价和输出价要分开看。几乎所有厂商的输出价都明显高于输入价,两者的比例还各不相同。 这意味着「哪个便宜」这个问题没有统一答案,它取决于你的任务形状:做长文档摘要、检索增强问答这类重输入轻输出的活, 输入价才是大头;做内容生成、代码补全、长回复对话这类输出占比高的活,输出价的权重会被放大好几倍。 拿两个模型比价之前,先估一下自己单次请求的输入输出 token 大致比例,再决定该盯哪一栏。

第二是上下文窗口要按真实需求看,不是越大越好。窗口是能力上限,不是免费的。 很多国产模型按上下文长度分档计费,基础档和长文档的单价能差出一截,卡片上标的多是基础档价格, 真跑长上下文的时候账要重算。如果你的业务用不到那么长,选一个窗口刚好够用的模型往往更划算; 反过来,如果你必须整篇塞进去,那窗口不够的模型再便宜也是零分。

第三是多模态标记只回答「有没有」,不回答「好不好」。 它告诉你这个模型是否支持文本以外的输入形态,用来做第一轮硬性筛选。至于图片理解到底达不达得到你的要求, 这件事本页不做判断,也不该由任何横向表格来判断,只能你拿自己的样本去试。

第四是备注里的计费细节,往往比标价更能决定月账单。 缓存命中的折扣、轻量档的存在、分档的门槛,这些都不是花边信息。 如果你的请求里有大段固定不变的系统提示词或知识片段,缓存命中的优惠可能直接把输入侧的成本压掉一大截; 如果你的任务其实简单,同系列的轻量档就够用,那盯着旗舰型号比价本身就是选错了赛道。

核心观点:别看排行榜,看你自己那条验收线下的单位任务成本

这一页刻意不放任何跑分和排名,原因很直接:榜单衡量的是通用能力的平均表现,而你要付钱的是你那一个具体任务的成功率。 这两件事经常不一致。一个在综合榜上更靠前的模型,放到你那批带着行业黑话、格式古怪的真实数据上,未必比一个更便宜的模型做得好; 反过来也一样。看榜单选型,本质上是拿别人的评测集替自己做决定。

更靠谱的做法是先把验收线写下来:什么样的输出算合格?字段抽全了算合格,还是必须字段全对且格式可解析才算? 验收线定死之后,拿 2 到 3 个候选模型跑同一批你自己的真实样本,记三个数——通过率、平均输入 token、平均输出 token。 三个数一到手,就能算出真正该比的那个指标:单位合格任务成本,也就是「一次调用的花费 ÷ 通过率」。 通过率八成的模型,实际每拿到一个合格结果要付出的钱是标价的 1.25 倍;通过率五成的模型,是标价的两倍。 便宜模型的单价优势,很容易被返工和重试吃干净——这笔账怎么算,可以看 降级模型省钱前先算清楚的那笔账

按这个口径算完,结论常常是分层而不是二选一:简单、量大、容错高的请求交给便宜模型, 难的、关键的、错了代价大的请求才走贵的那档,中间用规则或轻量判据分流。 整体选型思路可以延伸阅读 按成本而不是榜单来选模型。 最后再重申一次:本页只是帮你把可核对的事实并排放好,方便做第一轮筛选; 真正的决定要靠你自己那批样本跑出来的数据,而具体规格与价格,请以各厂商官方页面当次显示的为准。

常见问题

可以对比哪些维度?

本工具支持并排对比已选模型的输入/输出单价(元/百万 token)、上下文窗口大小、是否支持多模态以及备注说明,帮助你快速判断哪个模型最符合业务需求与预算。

最多可以选几个模型对比?

最多同时选择 4 个模型进行并排对比。建议先根据上下文需求或价格区间筛选,再精选 2-4 个重点模型做细致对比。

页面上的价格是实时的吗?

不是。本页数据是人工整理的横向参考快照,标注了核对月份,不与厂商接口联动。各家的价格会调整,也常按上下文长度分档、按缓存命中和批量调用另算,所以具体规格与价格请以各厂商官方页面当次显示的为准;决定采购前务必自己去官方定价页复核一遍。

为什么有的卡片价格标 $、有的标 ¥?

因为厂商官方就是这么标的。海外几家的定价页写美元,国内几家写人民币刊例价,我们按原文币种显示,不折算后再存。要跨币种比总账,去成本估算器选结算币种,那里会明写用的是哪天的汇率。

对比完之后该怎么做决定?

先把业务的验收线写清楚(什么样的输出算可用),再用 2-3 个候选模型跑同一批你自己的真实样本,记录各自的通过率与实际消耗的输入/输出 token,然后算「单位合格任务成本」。价格便宜但返工多的模型,最终单位成本未必低;这一步只能自己测,任何横向表格都替代不了。

一个 Key,接入所有主流模型

力达云聚合 API 内测开放中:统一接口调多家模型、按量计费、稳定合规接入。

申请内测

这个页面有问题?

提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。