Hy4 preview发布才3天,腾讯WorkBuddy就对它的推理集群做了紧急扩容,官方说会持续动态调配资源。但WorkBuddy也承认,受限于高端算力总量和高峰并发集中,个别时段仍可能出现排队。官方推荐用户在排队期间切到Hy3,同时把WorkBuddy的Hy3限免延长到2026年9月30日23:59。
Hy4 preview总参数770B,激活参数49B,上下文1M。Terminal Bench 2.1得分85.4,开源第一、全球第三;SWE-bench Multilingual得分82.9,同样是开源第一。8月28日发布当天,API排队用户就超过5000人。
![]()
为什么排队这么猛
一方面WorkBuddy自己的用户量在涨,6月数据显示MAU突破2000万。更关键的是,这是腾讯基础模型部成立后的第一个新模型,也是一款从头到尾贯彻姚顺雨理念的产品。在Hy4 preview的技术报告里,腾讯明确标出用了哪家的技术,并说明做了哪些修改。
有意思的是,即使用了别人的技术,Hy4 preview还是形成了自己的风格。它的README里写着,灵感来自DeepSeek和GLM。注意力模块用DeepSeek的Gated和MTP层做投机解码,配智谱的IndexCache做跨层稀疏索引复用,残差通路用字节的iHC。
三种“自进化”路线
混元团队在论文里说,Hy4 preview第一次全程参与了制造自己的过程,在训练方法、数据策略、评估体系和底层算子四个环节,全部引入模型的自进化机制。但它的自进化方向和DeepSeek、GLM完全不同。
智谱的自进化发生在训练阶段,目标是让模型本身变聪明。GLM-5.3搭了一条“自己出真题自己做”的流水线,让一个“AI研究员”去真实工程师的工作场景里观察,把实际业务提炼成训练数据。再让一个“AI判卷员”先闭卷做一遍,确认真的有解,才把题目放进题库。配合SAO和slime框架,GLM-5.3在不换基座的前提下,长程编码训练速度比GLM-5.2提升约2.3倍。这套逻辑本质是生物学意义上的进化,基因在迭代中更适应环境。
DeepSeek的自进化发生在运行阶段,目标是通过DSH让模型的“身体”可以无限重组。DSH的核心设计原则是“一切皆插件”,Agent发现缺什么就现场补什么,用完再无痕拆下来,官方叫self-modification。这是工具学意义上的进化,人没变,只是学会用各种工具干更多的事。
腾讯Hy4 preview的自进化既不在训练阶段,也不在运行阶段,它发生在研发流程本身。它不是智谱那样“让自己变聪明”,也不是DeepSeek那样“让自己的工具变多”,而是在定义自己:“我作为Hy4 Preview,应该是什么样?”训练方法怎么设计、数据策略怎么定、评估体系怎么建,先定义好自己是什么,再朝那个方向去发展。
组织打通之后,全链路才跑得起来
要想全链路自进化,第一件事是统一组织。Hy4 preview自进化的4个环节,就是大模型研发的完整链条:训练、数据、评估,再到怎么把训好的模型高效跑起来。这意味着姚顺雨能完整统筹整个大模型研发了。
过去这些事是分开的。腾讯把大语言模型部和多模态模型部分成两个平行部门,各自有独立的训练数据、技术框架、研发流程和评测标准。当时的腾讯还有AI Infra、AI Data和数据计算平台部分别掌管不同数据。7月合并成基础模型部,姚顺雨一个人统管之后,这条链路才第一次被打通。Hy4 preview能参与全链路,本身就代表组织现在是一条心了。
姚顺雨对工程化非常重视。三家里面,只有腾讯混元把“底层算子优化”和“推理吞吐量提升”这些关乎模型实际运行的东西纳入自进化列表。姚顺雨入职后第一件事就是重建基础设施,他在6月与汤道生对谈中提到:“我们把Infrastructure重建了,无论是预训练还是强化学习。”哪怕是OpenAI和Anthropic,算力都是最稀缺的资源,汤道生曾公开承认“算力严重不足拖慢了模型训练与产品发展”。姚顺雨必须把每一分算力都榨干。
Co-design从产品层扩展到全研发流程
一切的核心在于姚顺雨的方法论——Co-design,边训边用,让产品反馈倒逼模型迭代。Hy3时期,Co-design主要发生在模型和产品之间,比如把CodeBuddy、WorkBuddy的用户反馈回流到模型训练里。到了Hy4 preview,Co-design的范围扩大了,整个模型研发流程都遵从这套方法论。
也就是说,姚顺雨统一了混元模型,并且让模型与腾讯的所有条线接轨,把他对AI的理解完全倾注其中。模型成了姚顺雨方法论的物质化证明。
ReAct和ToT:两个代表作撑起Agent底层
之所以要把姚顺雨的理念贯彻进模型,是因为他本身就是语言Agent研究的开创者之一。ReAct是姚顺雨的代表作,论文于2022年10月挂出,发表在ICLR 2023上,被评为notable top 5%,引用量超过10000次。ReAct也是如今所有Agent的工作原理。
它的核心是把“推理”和“行动”从两个分离的步骤放进同一个prompt模板里交替循环:想一步、做一步、看结果、再想。不管是Claude Code还是Codex,底层“思考—调用工具—观察结果—继续思考”循环,本质上都是ReAct的变体。
姚顺雨的第二大代表作是Tree of Thoughts(ToT),一种增强推理的策略。在关键决策点展开多条思路,分别评估,再选最优路径继续。这个方法在研究层面影响很大,但实际产品中直接用ToT的并不多,因为树搜索的token成本太高,产品里更多是简化版的“多路径尝试”或者“遇到岔路时多想一下”。ToT扩展了模型的“深度思考”能力,尤其是当ReAct循环中遇到关键决策点时,ToT提供了一种展开多条思路再评估的机制。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.