用上 AI 这几年,我一直没有看额度的习惯。订阅的服务太多,这个那个摊开来,怎么用都够,压根想不起来去查还剩多少。
这个习惯是最近才被打破的。起因是我把整条工作流搬到了一个 AI 办公工具上——说得直白点,是搬到了一个智能体集群上——从那以后,看一眼今天烧了多少 Token,成了我每天都要干的事,因为那个数字跑得太快了。快到我这么一个仅仅在用它干些自动化程度并不那么高的活儿的人,都得盯着看。
比我焦虑的人多的很。2026年春天,一家三十五人的工程团队算了算当月的 AI 支出,八万七千美元。LeanOps 的调查里,重度使用 Claude Code 或 Cursor 的开发者,月均要在 AI 上花四百到一千五百美元,跑得凶的几天就烧掉四千。国内也一样,有人到处寻找便宜的API,自嘲成了"AI 时代的下沉市场人群"。大家的普遍感觉是,工具的确好用了,但积分烧完会焦虑,续费又心疼。
王坚打过一个比方:早期的 AI 应用像点电灯,耗电有限;以 OpenClaw 为代表的这一代智能体像开空调,耗电指数级地涨。他后面还跟了一句——"电价不降,老百姓用不起空调。"
8月26日晚上,千问办公推出标准模式,做的就是“降电价”。它首发了刚刚发布的 Qwen3.8-Flash,实现Token 消耗减少约 75%,生成速度差不多翻了一倍,同时任务质量还有保障,这也意味着,95% 的日常任务在标准模式下就能跑完。
但如果只把这当成"Agent又上线了一个新模型",就完全失焦了——千问办公想做的更大——给眼下这场 AI 办公大战划一条斩杀线:论性价比我比你高,论功能我比你全,论价格我也比你便宜。用户为什么要走?
——导语
但它凭什么敢这么讲?
先说一件这半年硅谷和国内都在争、大众媒体却没讲透的事:同一个模型,套在不同的"驾驭层"里,效能差距大得离谱。
驾驭层,行业里叫 harness,就是围绕模型搭起来的那套东西:工具怎么调、上下文怎么管、任务怎么拆、出错了怎么兜。这个词不性感,但它常常比换一个更贵的模型更能左右结果。
Cursor 的研究团队做过一组对比:同一个底座模型,换不同的 Agent 框架去跑,得分从 46% 拉到了 80%。模型一个字节没改,只是框架换了,成绩差了将近一倍。
Harness-Bench 的结论也很类似:不动模型、只换框架,同一批任务的分数能差出 23.8 分。在 SWE-bench 上,同一个模型因为 harness 配置不同,解题率从个位数跳到三成以上。
山姆·奥特曼跟 Ben Thompson 聊的时候说过一句话:他已经没法把模型和驾驭层看成两个独立的东西了,当 Codex 表现好的时候,他自己都分不清功劳归谁。他还有一个更干脆的判断:多数 Codex 失败是上下文问题,不是模型能力问题。
国内这边,清华刘知远团队提出的"密度定律"(Densing Law)从另一个角度讲了同样的事:大模型的能力密度大约每一百天翻一倍,换句话说,每过三个多月,你用一半参数就能跑到当前最强模型的水平。
![]()
这其实是一个很清醒的判断,就是单纯堆参数的红利在快速收窄,把模型用好的红利才是结构性的。就像手机芯片一样,如果你6个月就更新一次,其实意义不大。如何把芯片调教到性能释放极致,才知真功夫。
这几件事放到一起,说的其实是同一件事:一个好模型如果不跟工具链深度整合,就是法拉利的发动机配了一小面包车的底盘和传动系统,发动机再好也跑不出该有的成绩。这叫暴殄天物。
千问办公这次的更新正是踩在这个判断上。光有好模型不够,模型得长在 Agent 里面。千问办公上线的是和千问大模型团队联合设计的专属版Qwen3.8-Flash,所以在原有模型的基础之上,获得了更高的性能收益。
可有人会说,模型一旦长进 Agent 里,账单就开始不受控制。
前面我已经讲过AI工具带来的token焦虑。但是要从底层理解 Token 焦虑,要先理解 Agent 和普通对话的结构性差异。
一个人跟 AI 聊一个小时,撑死十几二十轮。而一个智能体后台跑一小时,为了完成任务可能来回交互几千轮。一次看上去轻飘飘的"帮我整理一下会议纪要",背后触发的是多轮工具调用、上下文检索、自我纠错、格式重排,实际消耗可以是一次普通问答的十到五十倍。
Anthropic 自己也承认,Agent Teams 模式下消耗大约是标准会话的七倍,“三个 Agent 跑一小时,顶一个 Agent 跑一整天”。IDC 给了一个更长周期的数据:企业智能体的 Token 消耗年均增幅超过 30 倍。
原来按对话设计的那套成本结构,撑不住这种量级。
所以千问办公出手的时机就在于,此刻,正是AI工具的放量期,且Agent工具正在趋同。谁能拿出一款"量大管饱"的模型和Agent组合,谁就在这场仗里握住了“取胜之匙”。千问办公首发 Qwen3.8-Flash 的底层意图在这里。
![]()
但光说便宜还不够——因为这场竞争里还横着另一个问题:慢。
很多文章在谈模型质量的时候只说“聪不聪明”,很少说“快不快”。但在真实的办公场景里,快不快才是体感最直接的那个维度。
那些公认更强的模型,因为参数大,往往也更慢。大不是问题,要命的是大带来的慢。
用过 Claude MAX模式或者 Kimi K3极致模式的人都有体会:坐在那里,盯着它一圈一圈地转,进度条好像粘住了,什么都干不了。你以为你在用一个强大的助手,其实你只是在等。对于那种高密度、连续性很强的办公场景来说,这种"坐等"非常致命,它打断的是人的心流。
对 Agent 工具来说,慢的代价还会被放大。它不像人可以边读边等,每一步都要等上一步的完整输出才能继续,延迟一层层累加。
有一组对比可以说明问题:一个三十万 Token 规模的复杂任务,在每秒一百个 Token 的速度下要跑将近五十分钟;拉到每秒四百个,只要十二分钟。省下来的那三十八分钟,就是一个人留在心流里还是切出去刷手机的分界线。
密度定律有一条推论:模型的推理开销会随时间指数级下降。高质量和慢,不需要永远绑在一起。千问办公把速度拉高一倍,解决的就是这个问题。让办公真正流动起来,而不是卡在一个转圈圈的等待里。
![]()
可便宜和快,都会被追平。真正的斩杀线,得往别处找。
驾驭层到底是不是护城河?
有一派很有分量的声音说不是。
TechCrunch 最近的报道就援引了 AI 领域那条著名的“苦涩教训”:从长远看,更强的通用模型终究会把外围那些精巧的工程一口吞掉。他们还举了个例子。Databricks 的实测里,一个叫 Pi 的开源极简 harness,用着和 Codex 完全相同的底座模型,成绩反而更好。在这一派看来,harness 是一根"随着模型变强而不断贬值的拐杖"。
这个反问很尖锐。但它恰恰指向了千问办公真正在做的事:斩杀线从来不靠某一个单点。模型会被追平,这是事实。驾驭层会随模型进步而贬值,这也是事实。但如果你能把三样东西同时叠到一起,取一个相对最优解,局面就不一样了。
第一,是模型和 Agent 的双向协同优化。模型在训练阶段就专门为 Agent 场景调过,Agent 框架又反过来围绕这个模型的特性做调度,两边互相优化、互相迁就。这件事情,“通用模型加一层薄封装”的产品做不到。你手里得同时握着自研模型和自研 Agent。
第二,是靠一版一版磨出来的工程沉淀。上下文压缩、会话恢复、长程任务里的目标保持,单拎出来都不性感,但极难复制。
第三样最吃劲:生态和上下文。千问办公把钉钉和 MyContext 接了进来,可以帮助企业构建一个Agent 的专属上下文,让Agent更懂业务工作流。模型可以下载,框架可以模仿,但一家企业沉淀在你这里的上下文,组织的记忆、业务的习惯,换一个产品带不走。业界有个说法叫"替换测试":悄悄把背后的模型换掉,用户还是离不开你,那才叫护城河。
![]()
三张牌叠在一起,就是千问办公说的"斩杀线"。它不靠哪一张牌去碾压谁,只是把对手可能进攻的每个方向都堵上了。性价比更高,功能更全,价格也不更贵。那你告诉我,客户凭什么走?
至此,阿里也成了全球第一个把"模型、办公平台、企业 IM、上下文层"打通的公司。这条全栈链路本身,就是壁垒的一部分。
但对我这样的用户来说,判断它有没有走对,还有个更土的标准——等哪天我又变回那个懒得看额度的人,就说明它做成了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.