Novita AI 收费怎么读懂:价格表、版本快照与月账单实算
第一次打开 Novita AI 的定价页,我盯着两行看了好一会儿:Deepseek V4 Flash 0731 和 Deepseek V4 Flash,输入都是 $0.14 /Mt,输出都是 $0.28 /Mt,一分钱不差。
一开始我以为是页面渲染重复了。不是。这是两个不同的东西:一个是钉死在某个日期的版本快照,一个是会随平台更新往前滚的滚动别名。它们同价这件事,本身就传递了一个信息——平台没打算让你为”要不要钉版本”付钱。所以这不是一道省钱题,是一道工程题。
我把这篇写成”怎么读这张价格表”,而不是”这家便宜不便宜”。因为价格表本身信息量不小,只是大部分人扫一眼数字就走了。
一、价格表原样
以下五行来自 Novita 官方定价页,/Mt 表示每一百万 token。价格会变,最终以官方定价页为准,我这里只保证抄写没抄错:
| 模型 | 输入 | 输出 |
|---|---|---|
| Deepseek V4 Flash 0731 | $0.14 /Mt | $0.28 /Mt |
| Deepseek V4 Flash | $0.14 /Mt | $0.28 /Mt |
| Deepseek V4 Pro | $1.6 /Mt | $3.2 /Mt |
| Deepseek V3.2 | $0.269 /Mt | $0.4 /Mt |
| DeepSeek-OCR 2 | $0.03 /Mt | $0.03 /Mt |
该页面同时还提供 GPU 资源(Novita 既卖模型 API 也卖 GPU),型号与价格以官网为准,我没有逐项核实,这里就不展开了。
读法上有三件事要先立住。
第一,输入和输出是分开计价的,不是一个”平均单价”。 很多人估算成本时习惯拿一个数乘总 token,这在输入输出价差两倍的模型上会算歪。你的应用是”长 prompt 短回答”还是”短 prompt 长报告”,直接决定账单结构。这一层我在输入与输出为什么分开计价里单独讲过,这里不重复。
第二,输出普遍贵一倍上下。 V4 Flash 是 $0.14 → $0.28,正好 2 倍;V4 Pro 是 $1.6 → $3.2,也是正好 2 倍。V3.2 是 $0.269 → $0.4,倍率约 1.49,比另外两个温和。倍率不一样意味着:同样把输出压短 30%,在 V4 系列上省下的比例要大于 V3.2。
第三,价格里没有的东西,别自己脑补。 免费额度、注册赠送、优惠券、限速数值——这些我没有核实过的,一个数都不写。你自己去控制台看,别信任何二手转述(包括这篇)。
二、版本快照 vs 滚动别名:一个不用花钱买的选择
回到开头那两行。
带日期后缀的 Deepseek V4 Flash 0731 是快照:它指向某一次固定的模型版本。不带后缀的 Deepseek V4 Flash 是滚动别名:平台更新时,它指向的实际权重会往前走。
这两条路各有代价,而且代价不对称。
钉版本的代价是”模型不再变好”。 上游做了推理能力提升、指令跟随修复、格式稳定性优化,你都吃不到。更麻烦的是快照不会永远存在——迁移迟早得做,只是被你推迟了,推迟得越久,一次跨越的差距越大。我见过把版本钉了一年多不动的服务,最后升级时输出差异大到要重写整套后处理。
不钉版本的代价,是某天悄无声息地坏掉。 注意”悄无声息”这四个字:模型更新一般不会让接口报错,也不会让回答变得离谱,它只是把语气、段落结构、markdown 用法、JSON 里字段的顺序或有无微调了一点。如果你的下游是人在读,基本无感;如果你的下游是正则或者一段假设了固定结构的解析代码,那就是线上悄悄开始丢数据,而监控上什么都看不出来——因为 HTTP 200,token 消耗正常,只有业务指标在慢慢往下漂。
所以判断标准不是”哪个更稳”,是你的下游有多脆:
- 输出直接给人看(客服草稿、摘要、翻译)→ 滚动别名的风险很低,能白拿更新收益。
- 输出进正则、进固定 schema 的解析器、进下游自动化流程 → 快照,别犹豫。
- 输出用于 A/B 对比或效果基线 → 必须快照,否则你根本不知道指标变化是产品改动引起的还是模型换了。
我自己用的折中办法是按环境分:生产环境钉快照,预发环境跑滚动别名。 预发每天用同一批固定样例(几百条就够,覆盖各种边界格式)跑一遍,把输出和生产快照的输出做 diff。只要没有结构性差异就攒着,攒够一个周期一次性把生产切到新快照;一旦 diff 里出现字段缺失、包装格式变化这种硬伤,就在预发把解析层改掉再切。成本上这套双跑几乎不值一提——预发那点回归样例的 token 量,和生产流量比是零头。
关键在于:这两行价格完全一样。 也就是说,Novita 没有把”版本可控性”做成一个收费档位。你选快照不用多付钱,选滚动也不会更便宜。既然价格不参与决策,那就纯按工程风险来选,别让”我怕贵”这种不存在的顾虑污染判断。
三、对称定价:OCR 那一行为什么不一样
DeepSeek-OCR 2 输入 $0.03、输出 $0.03,一模一样。整张表里只有它是对称的。
这背后是任务形态的差别。对话和推理类模型,输出是逐 token 自回归生成的,每生成一个 token 都要过一遍完整的前向计算,而输入可以批量并行处理——这是输出普遍贵一截的根本原因。而 OCR 这类任务,重头在把图像/文档内容转成 token 送进去,模型要做的更接近”转录 + 结构化”,输出长度基本被输入内容决定,不存在自由发挥出一篇长文的情况。定价对称,某种程度上是在说:这个任务里输出不是那个需要额外定价的稀缺资源。
对我们的直接影响是用法可以变。在 V4 Pro 上,我会本能地约束输出——“只返回字段值,不要解释”,因为每多一段解释都是 $3.2 /Mt 在烧。到了 OCR 2 这里,这种吝啬没意义了:多要一份结构化输出,成本增量和多读一段输入是等价的。
所以在对称定价下我会主动多要:
- 除了纯文本,一并要出表格的行列结构,而不是让文字挤成一坨再自己写规则拆。
- 要出位置/分区信息,比如这段属于表头、页眉还是正文块。
- 要出字段级的置信标注或”此处不清晰”的显式标记,比模型硬猜一个值然后你在下游查不出来强得多。
- 一次性输出 JSON 包装,别为了省几个花括号的 token 而回退到自定义分隔符——那点省下的钱,抵不过解析出错一次的排查时间。
算笔账体会一下量级。假设一个月处理的文档折合输入 100 Mt,让它输出得比较充分,输出 30 Mt:
- 输入:100 × $0.03 = $3.00
- 输出:30 × $0.03 = $0.90
- 合计 $3.90
哪怕把输出翻倍到 60 Mt,也不过多 $0.90。在这种价位和这种倍率下,为了压缩输出而牺牲结构化程度,是典型的捡芝麻。
四、月账单实算:V4 Flash 和 V4 Pro 差多少
光看单价没手感,套一个中等规模应用算一遍。
假设(自己替换成你的真实数据):月请求量 30 万次,每次输入 1500 token、输出 500 token。
- 月输入总量:300,000 × 1,500 = 450,000,000 token = 450 Mt
- 月输出总量:300,000 × 500 = 150,000,000 token = 150 Mt
走 Deepseek V4 Flash($0.14 / $0.28):
- 输入:450 × 0.14 = $63.00
- 输出:150 × 0.28 = $42.00
- 合计 $105.00 / 月
走 Deepseek V4 Pro($1.6 / $3.2):
- 输入:450 × 1.6 = $720.00
- 输出:150 × 3.2 = $480.00
- 合计 $1,200.00 / 月
差额 $1,095 / 月,倍数 1200 ÷ 105 ≈ 11.43 倍。
这里有个巧合值得记一下:Pro 对 Flash 的输入倍率是 1.6 ÷ 0.14 ≈ 11.43,输出倍率是 3.2 ÷ 0.28 ≈ 11.43,两者完全相同。这意味着在这两个模型之间做选择时,你的输入输出配比再怎么变,总账单的倍数都是 11.43,不会因为”我输出很短”就把差距拉近。这一点很省事——你不需要为不同业务线分别建模,一个倍数走天下。
顺带说,同样这套流量走 Deepseek V3.2($0.269 / $0.4)是:450 × 0.269 = $121.05,150 × 0.4 = $60.00,合计 $181.05 / 月。它落在 Flash 和 Pro 中间,但明显更靠近 Flash 那一侧。
11 倍的差价意味着什么?意味着分流策略的收益极高。如果你能把 80% 的请求(格式化、抽取、分类、改写这类)交给 Flash,只让 20% 的硬任务走 Pro,账单是 105 × 0.8 + 1200 × 0.2 = 84 + 240 = $324,比全量走 Pro 省下 $876,降幅 73%。这个粗算的建模方法我在怎么估算一个 AI 应用的月度 token 成本里写得更细,包括怎么从日志里反推真实的 token 分布。
五、和 DeepInfra 的可比部分:同名模型,不同挂牌价
有三个模型口径,两家都挂了牌,可以直接对照(单位同为每百万 token):
| 模型口径 | DeepInfra 输入 / 输出 | Novita 输入 / 输出 |
|---|---|---|
| DeepSeek V4 Pro | $1.30 / $2.60 | $1.6 / $3.2 |
| DeepSeek V4 Flash | $0.09 / $0.18 | $0.14 / $0.28 |
| DeepSeek V3.2 | $0.26 / $0.38 | $0.269 / $0.4 |
把上一节那套流量(450 Mt 输入 / 150 Mt 输出)分别套进去:
- V4 Pro:DeepInfra 450 × 1.30 + 150 × 2.60 = 585 + 390 = $975;Novita $1,200。相差 $225,Novita 高约 23.1%。
- V4 Flash:DeepInfra 450 × 0.09 + 150 × 0.18 = 40.50 + 27.00 = $67.50;Novita $105.00。相差 $37.50,Novita 高约 55.6%。
- V3.2:DeepInfra 450 × 0.26 + 150 × 0.38 = 117.00 + 57.00 = $174.00;Novita $181.05。相差 $7.05,Novita 高约 4.1%。
结论只能说到这一步:就这三个模型口径而言,DeepInfra 的挂牌价低于 Novita。 不能推广成”DeepInfra 全线更便宜”——两家的完整模型目录我没有逐项比过,超出这三行的任何断言都是编的。
比这个结论更重要的是下面这段,算是同行之间的实话。
我自己吃过只看挂牌价选平台的亏。挂牌价最容易被过度加权,因为它是唯一一个明晃晃写在网页上、不需要任何验证就能抄进对比表格的数字。而真正决定这笔钱花得值不值的几项,恰恰都不在定价页上:
限速。 单价再低,如果你的并发打不上去,业务侧就要排队。用户等三秒还是十秒,这个差别的商业代价通常远大于每百万 token 几毛钱。这两家的具体 RPM/TPM 数值我都没有核实,一个数都不敢写,你必须自己去控制台或者文档里确认——尤其要确认的是你这个账号等级下的实际值,而不是文档里某个默认层级的示例值。
稳定性。 长尾延迟、超时率、错误率在一天之内怎么波动,只有跑真实流量才知道,任何静态对比表都给不了答案。这项也未核实,我不做任何两家的强弱判断。
版本策略。 就是第二节那件事。一家平台是否提供带日期的快照、快照保留多久、下线时提前多少通知,这些直接决定你的迁移成本。挂牌价便宜 20%,但快照说没就没,对一个已经上线的解析链路来说未必划算。
我的建议是:把挂牌价当作入围条件而不是决胜条件。先按价格筛出候选,然后老老实实各开一个 key,用同一套真实样例、同一个时间窗,各打一轮压测和一轮质量回归,把限速、超时、输出格式差异都记下来再定。这一轮验证的花费——按上面 Flash 的价位算,跑个几十 Mt 也就几美元——相比选错平台后的迁移成本,便宜到可以忽略。
另外,模型定价这两年一直在往下走,今天的对照关系不一定是三个月后的对照关系。别把架构写死在某一家的模型 ID 上,这方面的观察可以看模型价格的长期走势。
六、选型清单
给要在 Novita 上做决定的人一份可执行清单:
- 先分清快照和滚动别名,再挑模型。 下游有正则或固定 JSON 解析的,钉带日期后缀的快照;输出直接给人看的,用滚动别名白拿更新。两者同价,这个选择不花钱。
- 建一条预发回归线。 固定几百条覆盖边界格式的样例,每天在滚动别名上跑一遍,和生产快照做 diff,攒够一个周期再统一切版本。成本是零头,省的是线上静默故障。
- 成本估算按输入/输出分开算。 V4 系列输出正好是输入的 2 倍,V3.2 约 1.49 倍——倍率不同,压缩输出的收益也不同。
- 记住 Pro 对 Flash 是 11.43 倍,且输入输出倍率一致。 配比怎么变都不影响这个倍数,所以分流策略的收益是确定的,值得优先做。
- 对称定价的任务放开手要结构。 OCR 2 输入输出同价,别再为省输出 token 牺牲结构化字段、位置信息和置信标注。
- 跨平台比价只比你真正会用的那几个模型。 同名模型两家挂牌价确实不同,但结论不要外推到没核实过的模型上。
- 上线前必须自己在控制台确认限速、稳定性和版本保留策略。 这三项决定了挂牌价的便宜是不是真便宜,而它们都不在定价页上。
价格表能告诉你的东西比大多数人以为的多——前提是你得逐行读,包括那些看起来像是重复的行。