![]()
![]()
智能上界决定任务边界
作者 |魏 强
编辑 |卢旭成
8月31日,智谱发布了2026年半年报,2026年上半年收入达到 9.54 亿元,约 1.42 亿美元,同比增长近 400%。
其中,开放平台及API 业务收入为 8.25 亿元,折合约 1.23 亿美元,同比增长超过 27 倍;占总收入的比例由2025年同期的15.2%、2025年年末的26.3%,提升到 86.5%。
截至2026 年 8 月底,智谱 ARR 已经达到 16 亿美元(如按最近一周的数据乘以52,ARR 已超 20 亿美元)。
截至今8 月末,智谱MaaS平台的 token 调用量较年初整体增长超过 40 倍,其中 coding plan 的调用量增长超过 23 倍,API 的平均定价提升了约 101%。
智谱开放平台及API 业务的毛利率,从2025年上半年的-0.4%,提升到今年的 24.6%,较2026年全年(18.9%)也抬升了 6 个百分点。
2026 年上半年,智谱研发支出达21.3 亿元,约合 3.17 亿美元。智谱期内亏损约20.72 亿元,较去年同期减少 12.1%,整体亏损率较去年上半年收窄 4.7 倍;经调整净亏损为 19.64 亿元,经调整亏损率较去年上半年收窄 3.5 倍。
截至2026 年 8 月,智谱 MaaS 平台注册用户数已超过 740 万(6 月底580 万),较年初增长144%,其中付费日活用户数较年初增长 603%;从收入口径计量,前十大用户的日均调用量较年初已增长 98 倍。截至 8 月末,按年化贡献(ARR 口径)超过 10 万美元、50 万美元、100 万美元、1000 万美元、2500 万美元、2.5 亿美元的高质量用户群组,分别达到 115 个、25 个、37 个、8 个、2 个和 2 个。
智谱今年算力乘数(每投入一元算力-含训练侧与推理侧所对应的开放平台及API 收入的比例)较2025年上半年整体提升14 倍。
财报发布后的业绩电话会上,智谱创始人、董事长刘德斌对智谱半年表现做了深度解析,物理AI大观有编辑:
今年上半年(我们)的关键词就是”能力兑现”。模型第一次被证明不再只是工具,而具有独立把一件事做完的能力。收入结构随之完成置换,模型的商业价值开始规模化兑现。
首先,智能上界决定了任务的边界,任务价值决定了商业的空间。今年3 月的年度业绩会上,我们提出了一个公式:AGI 商业价值 = 智能上界 × token 消耗规模。智能上界决定了模型能处理哪些任务,单位token 能创造多少价值;更高的智能上界意味着模型能处理更高价值密度的任务,每单位智能对应更多的经济产出;token 消耗规模反映智能被使用的广度和深度。
同样一个token,拿去闲聊,或拿去修复一个生产环节的漏洞,产出相差几个数量级。因此智能上界决定了任务的边界,任务的价值决定商业空间;token 落在什么价值密度的地方,取决于模型能打开什么样的任务边界。而任务边界每上一级,市场空间就放大一个量级。
![]()
大模型能力演进是按顺序走完的阶梯
我们认为,大模型能力的演进不是几条并列的产品线,而是一条只能按顺序走完的阶梯,(分为)Chat、Coding、Agent、Co-work、Autonomous AI 这五个阶段。
Chat 交付的是一次性的回答,Coding 交付的是一段可运行的代码,Agent 交付的是一条被执行完的多步任务链,Co-work 交付的是一份可以被专业人士”验收通过”的工作成果,自主体 AI 交付的则是持续运行的能力。每一级向上都有一个具体的技术门槛,跨不过去,上一层的商业模式就不成立。
从Chat 到 Coding,门槛是”结果可验证”;从 Coding 到 Agent,门槛是”长程规划与错误恢复”;从 Agent 到 Co-work,门槛是”可靠性达到专业人士愿意验收而不推倒重做的水平”;从 Co-work 到 Autonomous AI,门槛是”模型能否自己判断做得对不对”。
报告期内,公司的重心处在阶梯的第二级到第四级之间。在Co-work 之前,公司已在网络安全、法律、金融、教育等方向展开尝试,其中网络安全进展最快,其余方向仍处于早期,尚未形成规模化收入。公司在网络安全上取得了84.5% 的成绩,超过了(若干海外前沿模型)。在ExploitBench上完成了 130 项任务,仅居于Anthropic之后。
过去一年,行业对”冠军”的理解正在被改写——单点榜单领先不再是最重要的事,真正值得关注的是谁能以更快的节奏、更优的成本,持续把更强的模型推向市场。单点冠军只是转瞬即逝的一个点,”持续最优”才是一条不断向上推进的轨迹。GLM 系列在约 11 个月内完成了六次迭代,智能指数从32 提升至 60,单任务成本稳定在 0.2 美元档位;GLM-5.3-Flash 更是以 0.045 美元的单任务成本进入了智能的成本前沿。
其中GLM-5 以 coding 为入口打开了”长程智能”,能力重点由代码生成延伸至系统理解、任务规划、工具调用与工程交付,推动模型从”web coding”走向”Agentic Engineering”(智能体工程)。编程方向已成为公司收入的主要来源,在 coding 中积累的长程任务能力也已在网络安全等方面得到迁移验证。
![]()
GLM-5.2 是面向长程任务时代的旗舰模型,支持真正可用的长上下文编码,实测可承载项目级、工程级上下文,长程任务执行更稳定,工程规范遵循更可靠,开发场景成功率进一步提升,一次任务即可完成从需求到多端可部署产物的完整开发链路。
GLM-5.3 是智谱最新的旗舰模型,复杂软件工程与 agent 任务能力全面进阶。它使用与 GLM-5.2 相同的基础模型,所有提升均来自后训练,但在复杂编程与长程任务方面表现更加出色。在 GLM-5.3 的训练中,我们进一步推进”任务环境规模化”训练,使训练任务不再只是传统的编程题,而是更接近专家在真实工作中承担的完整专业工作单元;同架构、同参数、同几何参数下,唯一变量是后训练规模,端到端完成率提升超过 50%。
![]()
GLM-5.3 也证明,scaling 不止参数一个因素,而训练与后训练是当前余量最大的那一个。如果说 GLM-5.3 代表当前的能力上限,GLM-5.3-Flash 则代表成本前沿——它面向高频、大规模、对成本敏感的调用,采用全新架构专为极低成本设计,总参数 320B、激活参数 18B,稀疏注意力与线性注意力混合,价格为 GLM-5.2 的十分之一,基准测试与实际应用均优于 GLM-5.2。发布前它与匿名模型在OpenRouter与 OpenCode 上接受了真实调用的检验,上线首日冲至榜单榜首,刷新单日token 用量纪录,六天调用总量超过 62 万亿,带动平台整体调用量提升超过 20%。
自年初起,我们将国产芯片纳入主力推理算力。GLM-5.3-Flash 是公司第一次在超大规模真实流量中全面使用国产芯片集群提供服务的模型,芯片之间通过自研高带宽互联网连接整个推理引擎。由GLM-5.3 驱动的推理 agent 大幅加速算子开发,周期缩短一半;”模型优化系统承载模型”这一循环第一次在公司内部跑通,结果是在与同一硬件初始基线相比时,端到端的服务性能提升三倍。公司已实现十万卡级国产芯片的规模化、低成本推理,单位 token 推理成本较年初下降 80%。在全球算力供给持续紧张的条件下,这条路径意味着我们的成本曲线已经开始掌握在自己手里。
![]()
下一步让大模型承担一个完整的业务
上半年,我们验证了模型可以独立完成一个完整的工作。下一步是让它承担一个完整的业务。
围绕这个目标,我们对未来有一些判断:
首先,从模型任务上讲,我们正从”长程任务”向”自主系统”演变。今天的前沿是数小时量级的一个工程任务,下一步是”数天量级的完整交互”,让模型在更长的周期里保持目标一致,持续拆解任务、调用工具、与环境交互、修复错误、验证结果。同时,从单一agent 走向多 agent 分工协作,由模型承担完整的业务流程,从”辅助工作”走向”执行工作”。这一步的门槛不完全在智能本身,而在可靠性或可审计性,模型能在没人逐步检查的条件下干活,同时留下可验收的痕迹。
第二,关于能力,我们看到 scaling 从未停止,它依然是通向更高智能的主要路径。这一点没变,变的是”给你什么”的东西。今天决定一个模型能否上线的是四个因素的组合——基座规模、有效深度、训练深度、任务环境。四者边际收益不同、随阶段轮换,公司的资源分配就是在不同阶段判断哪个因素当前回报最高。GLM-5.3 证明了训练深度是当下余量最大的旋钮;而把后训练做到极致之后,下一阶段增长必须回到基座。
GLM-5.3-Flash 已经用新一代架构「以 30 万亿多模态语料验证的效率」验证了方向;下一代基座模型的训练已经在路上,方向包括更大的有效规模、更长的原生上下文,以及原生多模态的统一建模。
![]()
第三,在系统层面实现 fully self-training(完全自训练)。更深层的变化发生在训练系统内部:数据环境、基础设施都出现了被AI 接管的早期证据。数据开始自产,model-vs-model 的自我对弈管线让数据质量的上限不再取决于人类标注速度,而取决于模型自身的验证能力。环境开始制造,研究智能体采集任务、裁判智能体逐一试做、验证器自动合成。环境成了流水线上的标准产品。基础设施开始自我优化——推理系统的优化本质上就是代码工程任务,而这恰恰是模型最强的能力。
这三条线指向同一个终极命题——模型参与自身的改进,形成递归式的自我改进,这就是我们的技术愿景 fully self-training(完全自主训练)。下一代的GLM,将在上一代 GLM 搭建的环境里实现自训练。
第四,边界与治理。能力越强,越需要把评估和判断交给外部。对模型能力的评估、对风险的判断,最终必须由人来裁量,并引入外部机构独立评估。上半年在网络安全方面,我们已经这样做了——最敏感的能力受控、实现受控开放,开源之前由第三方专业团队独立评估漏洞,通过国家漏洞库完成责任披露;基准分数由我们自己报告,风险判断则交给外部团队。这个分工不会因为能力提升而改变,只会随着能力上移而加强。
最后,我想把今天所有的数字收回到一句话上:模型能力的代际水平,是公司所有产品与商业逻辑的起点。从GLM 预训练架构到悟道系列,再到今天的 GLM-5 系列,七年时间我们专注做的基本只有一件事——训练更强的模型。而收入的每一次快速增长都发生在模型能力提升、新的任务场景被解锁之后,而不是之前。先有能力,再有生意。2026年上半年收入结构的翻转与量价齐升已经验证了这套逻辑,接下来就轮到更大的用户规模、商业规模和全球影响力来继续验证它。路还很长,方向笃定。
![]()
什么决定大模型的定价权?
单点的榜单第一本身并不能形成长期定价权——今天某个 benchmark 第一,可能几周之后就被追平。所以我们真正想建立的,不是永远保持某个榜单第一,而是持续把”人力成本前沿”往外推的能力。我们主要看四件事。
第一、迭代速度。过去约11个月,GLM 从 4.6、4.7 到 5.3 连续迭代六代,智能指数(转写存疑)从 32 提升到 60;旗舰模型单任务成本基本维持在 0.2 美元量级,GLM-5.3-Flash 又把这个成本进一步推进到约 0.045 美元。单次领先是可以被复制的,但如果一个团队能持续以较快节奏提高智能、同时控制单位任务成本,这条能力曲线就更难复制。
第二、从benchmark 拉开到真实任务的完成率。短回答、知识类等很多公开benchmark 的能力一定会越来越趋同,但任务越长,差异反而越容易被放大——让两个模型回答同一道题可能只差几分,但让它们连续执行几个小时的软件工程任务(自己理解代码库、调用工具、处理失败、再规划并交付结果),差距会非常明显。5.3 的训练和评测已经越来越多转向这种长程、可执行、可验证的真实环境,而不只是追逐静态题库。
第三、从低价值任务进入高价值任务。真正决定定价权的不是token 本身,而是这些 token 最终能完成什么任务——同样 100 万 token,用来闲聊,或用来完成一个工程任务、修复一个生产系统漏洞,对客户创造的价值完全不同。所以我们的路径是从 coding 走向 agent for work(任务型智能体);模型能承担的任务越完整,客户购买的东西就越从”token”接近于”任务的结果”。到那个阶段,客户更关心的是”一次任务能不能完成、节省多少工程师时间、降低多少错误和风险”,而不是单纯比较每百万 token 便宜几毛钱。
第四、进入客户工作流后形成使用深度和迁移成本。基础模型最终不是一个孤立的API——一旦进入客户代码库、工具链、内部数据和工作流,客户就会围绕它积累 prompt、agent workflow、权限体系、评测标准和工程集成。这时候切换模型,考虑的不只是API 单价,而是整体任务完成率、稳定性以及重新适配的成本。
(2026年)上半年商业数据已经开始验证这套逻辑——API 平均售价提高约 101% 的同时,token 调用量仍在大幅增加;按收入计,前十大用户的日均调用量较年初增长 98 倍。换句话说,我们看到价格在提高,但核心客户反而用得”更深”——说明用户不是单纯因为模型便宜才使用,而是模型能力提高后,愿意把更多真实任务交给它,并为更强的能力付更高的价格。
我们认为,未来行业会出现两条价格曲线:同等智能的价格一定会持续下降;但对于真正能打开新任务边界、显著提升任务成功率的frontier 模型,仍然会有 premium,甚至有进一步提价的空间。
我们真正希望拉开的,不是某个benchmark 的几分;而是四个差距——更快的模型迭代、更高的真实任务完成率、更低的单位智能成本,以及进入更高价值工作流的能力。
只有这四件事持续成立,单次SOTA 被追平并不会消灭定价权。真正决定定价权的,是用户下一次更难的任务,是否愿意优先选择我们的模型。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.