网易首页 > 网易号 > 正文 申请入驻

中国大模型调用量连赢20周,然后算一本成本账

0
分享至

来源:市场资讯

(来源:机器学习算法那些事)

榜单第一,就是赢?

中国大模型连赢20周

然后,算一本成本账

OpenRouter 口径 · 单任务成本 · 缓存定价 · 任务级 ROI

9月7日至13日这一周,中国模型在 OpenRouter 上的 token 用量约为61.2万亿,美国模型约为21.8万亿。按相关报道的统计口径,中国模型已经连续20周领先;用量前十的模型中,有7款来自中国,一年前这个数字还是2。[1]

不过,“中国大模型赢下全球调用量”这个说法,需要收一收。OpenRouter 统计的是经由自身平台处理的输入和输出 token,并非全球所有大模型的使用量,也不等于 API 请求次数。厂商直连服务、其他云平台和私有部署,不能靠这张榜单一并概括。[2]

即便如此,这20周依然值得认真看。在一个便于比较不同模型的平台上,中国模型持续获得大量使用,说明它们已经进入了开发者的实际选择范围。接下来要追问的是:用户为什么选它们,这种选择又能维持多久?

价格显然是一个重要原因。但“因为便宜”只解释了一半。一个模型如果总是做错,价格再低,也很难长期留在生产系统里。真正影响选型的是另一笔账:达到同样的交付要求,究竟要花多少钱。

数据速览

口径与数字

统计周期

2026年9月7日至13日(OpenRouter 周度数据)

中美用量

中国模型约61.2万亿 token,美国模型约21.8万亿

领先纪录

连续20周领先;用量前十中7款来自中国(一年前为2款)

口径边界

仅统计 OpenRouter 平台处理的输入输出 token,不含厂商直连、其他云平台与私有部署

核心追问

用户为什么选它们,这种选择又能维持多久

01

PART

开发者买的,是能交付的结果

DELIVERABLE · 验收标准优先

看模型发布会,最容易记住的是它又在哪项测试里拿了第一。轮到自己选型,问题通常具体得多:能不能读懂项目里的代码,能不能按要求返回数据,连续调用时稳不稳定,出了错需要花多少时间补救。

这与追求能力上限并不矛盾。只是一个模型能解决多难的问题,与它是否适合承担眼前这项工作,是两回事。

Artificial Analysis 的评测给了一个颇有代表性的例子:在其列出的配置下,GLM-5.3-Flash 与 GPT-5.6 Terra 的智能指数同为42分,但每项测试任务的平均成本分别约为0.25美元和1.40美元。前者不到后者的五分之一。[3]当然,综合分数接近,不代表两个模型在所有业务里都能相互替换;这里更值得注意的是,达到相近的评测水平,成本可以相差很大。

模型

智能指数

每项任务平均成本

GPT-5.6 Terra

42 分

约 $1.40

GLM-5.3-Flash

42 分

约 $0.25

对一个每天只调用几次模型的人,这种差距可能不值得折腾。对一个需要持续处理文档、生成代码、响应客户请求的产品,它就足以影响业务能否成立。尤其是那些单笔收入不高的服务,模型成本降下来,才有空间覆盖其他开支。

所谓“够用”,也不该被理解成“差一点没关系”。它应当有明确的验收标准:字段有没有提取完整,测试能不能通过,回复是否符合业务规则,需要人工接手的比例有多高。达到这些要求之后,再比较价格、延迟和稳定性,选型才有意义。

反过来,如果较便宜的模型需要反复重试,或者经常留下不易察觉的错误,人工检查的时间可能就把省下的钱吃掉了。一个收费更高、但能一次完成工作的模型,完全可能是更经济的选择。

本部分核心判断

以较低成本通过越来越多任务的验收,而不是让用户为了省钱降低验收标准

这也解释了为什么不能把用量增长简单理解成“开发者不在乎能力了”。他们仍然在乎,只是开始要求厂商证明:多出来的能力,在自己的业务里,值不值得多出来的价格。

02

PART

Agent 把这笔账放大了

AGENT COST · 多轮调用

在普通聊天里,用户提一个问题,模型回答一次,成本相对容易理解。Agent 的账就没这么简单了。

以修复一个软件问题为例,模型可能要先阅读项目,查找相关文件,判断错误原因,修改代码,运行测试,再根据测试结果继续调整。用户看到的是一个任务,背后却可能经历多轮模型调用。Anthropic 对 Agent 的介绍也强调,这类系统会根据环境反馈动态决定后续步骤,而更复杂的执行过程,往往意味着额外的成本和等待时间。[4]

于是,“这款模型每百万 token 多少钱”就不够用了。还要看它走了多少步,重复读了多少上下文,在哪些地方返工,最终有没有把任务做完。

这也是讨论 Token ROI 时最容易被忽略的地方。token 是投入,不是产出。多消耗了多少 token,本身不能证明多创造了多少价值;价格表上的单价更低,也不能直接证明一项工作更便宜。

对使用方而言,一个更有用的口径是:在质量要求相同的前提下,完成一项合格任务的总成本是多少。这笔成本包括模型调用,也包括必要的验证、失败后的重试,以及人工收尾。倘若一个系统省了30% 的 API 费用,却让工程师多花了一倍时间检查结果,那就很难称得上优化。

从这个角度看,同一个 Agent 是否需要全程使用同一款模型,也就成了可以重新讨论的问题。总体规划、关键判断和复杂错误定位,可以使用能力更强的模型;边界清楚、容易验证的步骤,则可以尝试交给成本更低的模型。这类按任务分流的做法,也出现在 Anthropic 的工作流设计建议中。[4]

但分流本身需要判断能力。步骤短,不代表风险低;看似简单的一次工具调用,如果选错了参数,也可能让后续工作全部失去意义。不能只根据输入长度,或者给任务贴上“写代码”“查资料”这样的标签,就决定该用便宜模型。

因此,真正困难的部分是判断哪里可以省,哪里不能省,以及省下来的成本有没有被后续失败抵消。这比把所有请求切到一个低价模型复杂得多,也更接近企业实际需要的东西。

03

PART

价格表背后,是一项项具体的工程改进

REAL ENGINEERING · 缓存与定价

把中国模型的低价全部归因于补贴,并不准确;反过来,断言所有低价都来自技术优势,同样过于简单。要看价格能不能持续,最终还是得看服务一项任务的成本,以及厂商能否覆盖长期投入。

已经有一些可见的进展。路透社9月的分析提到,智谱称其单位推理成本较年初下降80%,API 业务上半年毛利率升至约25%。但同一时期,智谱研发支出仍超过收入的两倍;MiniMax 的研发投入也超过收入的2.5倍。[5]

这组数字放在一起看,比单独强调“价格战”或者“技术降本”更有解释力。推理服务可以越做越高效,公司却仍要为下一代模型投入大量资金。降低一次调用的成本,与收回整个研发周期的投入,不是同一道题。

对开发者来说,影响账单的工程细节中,缓存尤其值得关注。Agent 连续执行任务时,系统指令、工具说明和项目背景可能被反复使用。对支持提示词缓存的服务,复用已处理的上下文可以减少费用;但能否命中缓存,与请求组织方式、服务提供方和路由策略都有关系。OpenRouter 为此提供了保持后续请求落到同一服务方的机制。[6]

因此,看见某款模型极低的“缓存输入价”,不能直接把它当成整体使用成本。DeepSeek V4.1 Flash 的平台页面就分别列出了普通输入、输出和缓存读取价格,它们对应的是不同的计费项。实际账单取决于请求中各类 token 的构成,而不是价格表里最低的那个数字。[7]

一个没有可复用上下文的请求,和一个缓存命中率很高的长程任务,即使使用同一款模型,成本结构也会不同。模型之间的比较若不说明这些条件,很容易算出漂亮却没有实际意义的差价。

这些工作没有发布会上的榜单直观,却会直接影响产品。少读一次重复内容,少走一轮无效推理,避免一次不必要的重试,每一项改善都可以在完整任务的成本里体现出来。对高频使用的系统,它们值得被单独衡量。

04

PART

用得多,不等于已经赢下了生意

USAGE ≠ BUSINESS · 信任与收入

用量增长值得重视,但不能让它承担太多结论。token 更多,不等于完成的任务更多,也不等于收入更高,更不能直接推导出利润更好。

能力上的差异仍然有价值。Artificial Analysis 的评测中,Anthropic 和 OpenAI 的旗舰配置仍处于高分区间。评测当然不能代替业务测试,但它提醒人们:模型之间的能力差距,并没有因为低价产品获得大量使用而消失。[3]

对一些复杂任务,多一点能力可能就意味着少一次失败。尤其当错误难以发现、后果又比较严重时,模型费用未必是最值得压缩的开支。企业愿意为可靠性付钱,并不代表它没有认真算账;有时恰恰是因为算过账,才知道哪里不能省。

同样,没有理由预先认定,中国模型只能承接低价任务,海外模型只负责高端任务。具体该用谁,仍然应当由任务测试决定。新模型可能改变能力差距,价格调整可能改变成本差距,服务质量的变化也可能让一个原本合适的选择不再合适。

开发者容易切换模型,对新进入者是机会,对已经拿到流量的厂商则是压力。用户因为性价比迁入,也可能因为新的性价比选择离开。一次排名领先无法证明长期优势,连续20周也不等于此后不必再竞争。

还有一些问题,根本不在模型分数和价格表上。企业把业务接到一项 AI 服务之前,需要知道数据经过哪里,日志如何处理,服务中断后如何恢复,换供应商要付出多少迁移成本。这些要求会因业务而异,却不能用一句“模型便宜好用”代替回答。

允许私有部署的开放权重模型,可以给企业更多控制权。但部署、维护和安全验证仍然需要投入。开放权重是一种选择,并不自动附带一份低成本、免维护、无风险的解决方案。

所以,对中国模型更有价值的问题可能是:这些用量中,有多少会留下来成为持续付费的业务?用户在什么任务里愿意长期依赖它?厂商能否一边保持服务价格的吸引力,一边承担后续研发?

这几件事,比某一周又增加了多少 token 更接近生意本身。

05

PART

接下来要优化的,是整个任务

TASK-LEVEL ROI · 全链路视角

原文把 token 比作一种新的标准化商品。这个比喻有启发,但也有边界。

一百万 token 是一个计量数量,不是一份统一规格的工作成果。同样一个任务,不同模型可能消耗不同数量的 token,花费不同时间,交付不同质量的结果。单价一样,也不代表买到的服务一样。

这意味着,围绕 AI 成本的竞争不该停在“谁卖得更便宜”。更值得尝试的是,把模型选择、上下文管理、缓存复用、结果验证放到同一个任务里考虑,看看它们怎样配合,才能减少无效开支。

例如,为了获得更低的调用价格而频繁切换模型,可能破坏原本可以复用的缓存。为了减少输入而压缩上下文,也可能丢掉关键约束,导致后续反复返工。单独看,每一步似乎都省了钱;合起来看,任务却可能更贵。

OpenRouter 的缓存机制已经体现出这种取舍:它会尽量让同一会话的后续请求继续使用相同的服务端点,以保留缓存收益,而不是每次都只看即时价格。[6]

由此看,模型与应用之间确实有一类值得投入的工作:帮助使用方持续找到合适的模型组合,管理执行过程,并用任务结果验证成本是否真的下降。这可以由应用团队自己完成,也可以成为独立的服务。但它的价值必须体现在结果上,不能只靠接入模型的数量来证明。

用户需要的,是在预算内稳定完成工作

背后调用一款模型还是五款,只在影响结果和成本时才重要

这也给“Token ROI”一个更实在的含义。它不必是一句新的行业口号,更不该变成另一场 token 消耗量竞赛。对一个团队来说,能说明同样的预算现在多完成了多少合格任务,或者同样的工作量现在少花了多少钱,就已经足够有说服力。

PRODUCT

关于 TierFlow

把任务级 ROI 做成产品

最近一款叫做 TierFlow 的产品联合清华大学韩军功教授团队发布,这款产品的思路——不看单价,看单个任务的总成本——不是纸上谈兵。TierFlow(tierflow.cn),一个面向 AI 智能体的 token 使用效率优化平台。


官网套餐价格参考

TierFlow 的核心是自研的 BrainNet 技术,以约20毫秒的粒度感知智能体的每一步执行状态,在此基础上做动态模型调度:把总体规划、关键判断交给能力更强的模型,把边界清楚、容易验证的步骤交给成本更低的模型——正是前文所说的按任务分流,甚至按照步骤级别精细化分流,只是分流决策由系统自动完成。配合 OWG 执行状态图还原完整执行链路,再通过统一 API 接入上层应用,开发者不需要改动业务逻辑。

效果最终落在任务级账本上:在 PinchBench 评测中任务完成率达 92.47%;SWE-Bench 解决率从 72% 提升至 76%;而平均单任务成本从 0.64 美元降至 0.35 美元——完成率上升、成本下降同时发生,也就是本文反复强调的那件事:同样的预算,多完成合格任务。

指标

优化前

优化后

PinchBench 任务完成率

92.47%

SWE-Bench 解决率

72%

76%

平均单任务成本

$0.64

$0.35

如果你也在为智能体的 token 账单发愁,欢迎到 tierflow.cn 了解更多。这篇文章里的每一笔账,都是 TierFlow 每天在算的账。目前官网限时充值就送30元额度,每邀请一人赠送20元额度,邀请人数不设上限。

LAST

FINAL WORDS · 信任和收入

回到中国模型的20周领先,它的意义不在于宣布能力竞争结束,而在于说明:在一个重要的开放 API 市场里,开发者愿意把大量工作交给这些模型。接下来要做的,是把这种使用变成持续的信任和收入。

月底核算时,模型叫什么、发布时拿过第几名,都只是参考。更具体的问题是:这个月交付了多少工作,出了多少次错,还有多少活最后需要人来补。中国大模型能否继续扩大优势,要在这些问题上给出答案。

编辑说明:本文将“全球调用量”收窄为 OpenRouter 平台口径;“连续20周”及9月7日至13日的数据按公开报道引用,不表述为截至9月21日的最新周榜。原稿中未能可靠核实的个人引语、部分融资和政策消息,以及容易混淆统计范围的份额数字,未予沿用。

参考来源

[1] Radar Digital — Chinese models advance on OpenRouter with lower-cost AI [2] OpenRouter — LLM Rankings [3] Artificial Analysis — LLM Leaderboard [4] Anthropic — Building Effective AI Agents [5] Reuters Breakingviews — China's brutal AI economics hold lessons for US(2026-09-16) [6] OpenRouter Docs — Prompt Caching [7] OpenRouter — DeepSeek V4.1 Flash

本文为原创深度分析,转载请注明出处

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
75岁大爷与保姆生下儿子,做亲子鉴定后,大爷却被子女们气得心梗

75岁大爷与保姆生下儿子,做亲子鉴定后,大爷却被子女们气得心梗

黄家湖的忧伤
2025-03-06 09:30:21
不用担心了!苹果确认 iPhone Duo 可以简单更换屏幕层,仅需 188 元

不用担心了!苹果确认 iPhone Duo 可以简单更换屏幕层,仅需 188 元

XCiOS俱乐部
2026-10-02 10:36:33
终身不得糖尿病:为了不得糖尿病,请坚守这25条

终身不得糖尿病:为了不得糖尿病,请坚守这25条

鼠鼠健康图鉴
2026-10-01 06:00:15
两天票房1.38亿,陈思诚新片轻松夺冠,国庆档最强电影诞生

两天票房1.38亿,陈思诚新片轻松夺冠,国庆档最强电影诞生

影视高原说
2026-10-02 19:24:34
谁也没想到,1998年纽约这张合影,竟埋下命运伏笔:52岁的特朗普,身旁是28岁的梅拉尼娅

谁也没想到,1998年纽约这张合影,竟埋下命运伏笔:52岁的特朗普,身旁是28岁的梅拉尼娅

扶苏聊历史
2026-09-30 16:46:18
一场0-5验出国足3大庸才,个个难当大任,邵佳一最好果断弃用他们

一场0-5验出国足3大庸才,个个难当大任,邵佳一最好果断弃用他们

零度眼看球
2026-10-03 07:10:25
金鹰奖这一夜,人情冷暖,江湖地位,在朱亚文身上体现得淋漓尽致

金鹰奖这一夜,人情冷暖,江湖地位,在朱亚文身上体现得淋漓尽致

陈意小可爱
2026-09-30 07:17:52
一名极为罕见的乌友

一名极为罕见的乌友

YY团长
2026-10-01 07:26:06
爆火半年后,佛山莫氏鸡煲莫叔已还清180多万旧债,自曝贷款建养鸡场:搞好质量,不怕没生意

爆火半年后,佛山莫氏鸡煲莫叔已还清180多万旧债,自曝贷款建养鸡场:搞好质量,不怕没生意

小强热线
2026-10-02 19:29:51
拉夫罗夫等60名高官集体辞职,腾出的席位给了什么人?

拉夫罗夫等60名高官集体辞职,腾出的席位给了什么人?

观星赏月
2026-10-02 06:29:26
北京41岁独身女子离世,叔叔姑姑舅舅姨妈9人争遗产,法院判了:价值400万元房产收归国家,银行存款、保险金等110余万元9人共同继承

北京41岁独身女子离世,叔叔姑姑舅舅姨妈9人争遗产,法院判了:价值400万元房产收归国家,银行存款、保险金等110余万元9人共同继承

台州交通广播
2026-10-02 13:08:22
与陈若琳恋爱水落石出!樊振东德国近况曝光,难怪首谈退役及心愿

与陈若琳恋爱水落石出!樊振东德国近况曝光,难怪首谈退役及心愿

琴琴有氧运动
2026-10-03 00:35:20
官宣!CBA银河战舰强队!霍华德自曝可能也会加盟

官宣!CBA银河战舰强队!霍华德自曝可能也会加盟

篮球实战宝典
2026-10-02 14:08:08
西媒:葡足协选帅曾设条件 新帅不能让C罗留队!候选人有穆帅

西媒:葡足协选帅曾设条件 新帅不能让C罗留队!候选人有穆帅

新英体育
2026-10-02 09:29:46
从碾压安踏李宁,到月亏过亿:曾经的运动品牌顶流,到底错在哪?

从碾压安踏李宁,到月亏过亿:曾经的运动品牌顶流,到底错在哪?

一些小事
2026-10-01 20:27:33
再传噩耗!俄乌战局!迎来最残酷时刻!

再传噩耗!俄乌战局!迎来最残酷时刻!

大嘴说天下
2026-10-02 20:22:40
油价暴跌,美科技股强劲反弹

油价暴跌,美科技股强劲反弹

证券时报
2026-10-02 23:22:35
女子体验户外项目遭马蜂袭击,全身被蜇约180处住院21天 与商家未就赔偿金额达成一致

女子体验户外项目遭马蜂袭击,全身被蜇约180处住院21天 与商家未就赔偿金额达成一致

红星新闻
2026-10-02 22:44:15
出差半年妻子意外怀孕,我冷静离开,次日家中传来噩耗

出差半年妻子意外怀孕,我冷静离开,次日家中传来噩耗

悬案解密档案
2026-04-21 09:08:33
刘欢去世没几天,香港演员佘诗曼传出噩耗,给所有演员提了个醒

刘欢去世没几天,香港演员佘诗曼传出噩耗,给所有演员提了个醒

星河不入我
2026-10-02 20:47:04
2026-10-03 07:51:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4952446文章数 9710关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

男子错订机票3分钟内申请退款被扣90%手续费 多方回应

头条要闻

男子错订机票3分钟内申请退款被扣90%手续费 多方回应

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

潘玮柏老婆被猜怀二胎 中秋vlog露馅

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

教育
数码
艺术
公开课
军事航空

教育要闻

应该怎么做?太多小盆友没有做出来

数码要闻

英伟达推出64GB版DGX Spark:售价4999美元 128GB版本价格已突破6000美元

艺术要闻

法国画家德尔芬笔下的女子,肌肤白皙光泽诱人,美到惊艳,看一眼就沦陷!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装:24小时内沙特空袭也门47次

无障碍浏览 进入关怀版