8月28日深夜,没有发布会,只有一篇文章加一个开源仓库,混元Hy4 preview就这么上线了。7700亿总参数、490亿激活、100万Token上下文,Apache 2.0全开放。三天后的8月31日,真正的“发布会”以另一种方式上演:任务队列频繁排队,官方紧急发公告道歉并扩容。
腾讯公关总监张军说调用量“出奇猛增”,技术团队整个周末都在推进扩容,并将持续动态调配资源。他还补了一句,“受限于高端算力总量和高峰期并发集中,仍不排除个别时段排队。”一个模型用排队的方式,替自己的公司把“焦虑”说了出来。
![]()
船是怎么“漏”的
腾讯做AI的焦虑不是今天才有的。今年5月13日的腾讯股东大会上,有人问马化腾,腾讯的AI是不是落后了。马化腾打了个比方,“原来一年前我们以为上了船,后来发现那个船漏水了,又开始换一艘船。现在感觉站上去了,还坐不下去,还是希望船速能快一点。”
“上船”说的是2024年大模型起跑,“漏水”说的是混元,一个被内部外部都承认“落后”的模型。《财经》此前采访的某位AI研究人员说得更直白,混元此前长期“躺平”,自姚顺雨加入后,“走向正轨不少”。
姚顺雨,1998年生,清华姚班、普林斯顿博士,ReAct和思维树(Tree of Thoughts)的共同提出者,2024年进入OpenAI参与Deep Research和Operator。2025年下半年回国,12月空降腾讯首席AI科学家,向刘炽平汇报。他接手的更像是一个“烂摊子”,但也是个明白的摊子。
2026年1月底,混元启动底层基础设施全面重建,覆盖预训练、强化学习、数据和评估。3月,腾讯撤销成立近十年的AI Lab;7月23日,大语言模型部与多模态模型部合并为基础模型部,28岁的姚顺雨统管腾讯全部底层模型研发。
根据最新财报,二季度腾讯研发支出272.8亿元,同比涨了35%;资本开支527.8亿元,同比涨了176%,大头都进了AI算力和训练。按姚顺雨说的节奏,混元平均每两个月迭代一次大版本:4月发布Hy3 preview,7月6日发布Hy3正式版,发布一周调用量较Hy2涨了超68倍,到8月28日,Hy4 preview上线。
押家底般的投入和跑分里的一些真话
先看规格。Hy3是295B总参、21B激活、256K上下文;Hy4 preview直接拉到770B、49B和1M,注意力机制从GQA换成了Gated DSA加上IndexCache,残差改成4路iHC。说人话就是,从长上下文里挑重点看,信息多路并行传,模型变大了近两倍半,但每token激活的只有49B,成本可控。
有博主称,在架构层面,这是混元第一次真正摸到国内顶级模型的边。定位也换了个说法,不再喊通用,而是为生产力而生。在软件工程、办公分析、游戏开发和科学研究四个场景,靠腾讯内部专家共建数据和WorkBuddy/CodeBuddy产品协同打磨。
姚顺雨之前反复讲过一个思路,不训练刷榜的做题家,关心模型在真实场景好不好用。官方还讲了个更玄的故事,递归自我改进。说Hy4 preview是第一次参与了自己训练方法、数据策略、评估体系和底层算子的自动优化,自主做算子融合和通信优化,端到端吞吐提升了31.8%。科学方面,把3DBlaschke-Lebesgue问题的体积下界从0.380799推到了0.41104,离Meissner四面体猜想只剩2%的差距。
顺带官方也坦白了,preview版本复杂任务容易长思考、过度自我验证。这句话后面会反复应验。
腾讯官方公布了一组12项评测的对比,对手是GLM 5.3、Kimi K3、DeepSeek V4 Pro、Qwen 3.8 Max,以及闭源阵营的GPT 5.6 Sol和Claude Opus 5。别被这一锅粥的表骗了,分三档来看:
- 第一档是跟国产开源同侪,的确是站住了。Terminal Bench 2.1拿85.4(GLM 5.3约88.2–88.8、Kimi K3约85.7–88.3,不同转引会有出入);DeepSWE 64.3,略低于Kimi的74.0;但SWE-bench Multilingual 82.9,是开源阵营第一;SWE Atlas Refactoring、Toolathlon-Verified、OneMillionBench(工具)都领先。
- 第二档是跟闭源旗舰,差距还是比较明显的。GDPval-AA V2上,混元1678,Claude Opus 5是1831,GLM 5.3都压它一头(1763);物理推理的CritPt上,混元16.9,处于全场垫底区,GPT 5.6 Sol是32.3,Claude是29.1;SWE-bench Pro上,Claude 79.2,混元65.7;HLE纯文本,Claude 54.9、GPT 49.5,混元43.4。
- 第三档是跟自己比,的确进步惊人。DeepSWE从28.0干到64.3,翻倍还多;ProgramBench从3.6到17.5;Terminal Bench从70.8到85.4。一个半月追回这么多,混元自己都说这是最大的代际增益,这回真不是吹。
还有两个数字,得单独拿出来捋一捋。一个是官方盲测,有163名内部专家、203个工程任务,Hy4 preview均分2.99/4,略优于GLM 5.3(2.92)和Kimi K3(2.94)。听着很提气是吧?但仔细看胜负比,对GLM是胜46.8%、负40.4%,对Kimi是胜51.2%、负40.9%。负率四成,这就是五五开里探出一个头。而且打分的是腾讯自己的工程师,任务是自家工程任务。这个略优于的含金量,或许是要打折扣的。
另一个是第三方榜单,在Arena.ai的Code Arena WebDev上,Hy4 preview排第5,1633分、开源模型第3,和Grok-4.6、GPT-5.6 Sol咬在同一区间。这是混元模型头一回出现在这种位置。注意措辞是出现在这个位置,不是站上第一位。混元从落后到第一梯队的叙事,目前一半还靠官方自己的数据撑着,独立机构的大规模横评还没出来。
干活的时候,它到底行不行
跑分归跑分,最终还是得看干活的时候它到底行不行。官方把Hy4 preview定位为生产力模型,四个场景里软件工程和办公分析是重头。从已有的评测数据看,它在开源阵营里确实能打,但跟闭源旗舰的差距依然明显,尤其是物理推理和复杂任务上。
官方自己承认的“复杂任务容易长思考、过度自我验证”,在真实使用里会变成什么?可能是任务做到一半开始反复检查,消耗更多token和时间。这对追求效率的生产力场景来说,未必是加分项。
焦虑或许传导到了资本市场。8月28日,Hy4 preview上线当日,交易日收盘腾讯股价455.2港元,总市值为41437.52亿港元。截至发稿,8月31日收盘股价回落至452.4港元,市值约为4.12万亿港元。看起来,技术圈一片叫好,但并未催生出二级市场的股价市值行情,市场仍在权衡AI持续高额投入带来的成本压力。
腾讯的AI焦虑能不能靠Hy4消解,现在下结论还太早。模型规格上来了,跑分也追上来了,但独立机构的大规模横评还没出来,真实场景的口碑也需要时间沉淀。排队扩容的热闹背后,高端算力总量的瓶颈还在那里。船速能不能快起来,得看下一个版本,以及更重要的,看它能不能在真实工作里站稳。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.