网易首页 > 网易号 > 正文 申请入驻

腾讯猛踩油门,混元追赶的127天

0
分享至

文 | 深流研究所,作者 | 吴绛枫

8 月 28 日,腾讯混元发布并开源 Hy4 preview。

从今年 2 月重建预训练与强化学习基建算起,混元把大版本的迭代周期,压缩到两个月左右。

这已经接近 Anthropic、OpenAI、智谱等头部模型厂商的更新频率。

差别在于,腾讯是在重建地基的同时跑出了这个速度。

版本间隔在缩短,混元能力跃升的幅度也在持续变大。

Hy4 preview 总参数达到 770B,是 Hy3 的 2.6 倍;激活参数从 21B 提升到 49B,上下文从 256K 扩展到 1M。


图注:Hy4 preview在各项benchmark的评分表现

7 月初,Hy3 在软件工程实战基准 DeepSWE 上拿到 28.0 分,同期 Claude Opus 4.8 是 58.0。

不到两个月,Hy4 preview 在同一项测试上拿到 64.3,超过 DeepSeek V4 Pro 的 62.7。

同一天公布的Terminal-Bench 2.1 上,Hy4 preview 拿到 85.4 分,与 Claude Opus 5 持平。

如果把 Hy3 preview 以来的三个版本放在一起看,混元在多项主流 benchmark 上都画出了一条显著上升的曲线。


总的来说,混元整体仍在追赶阶段。但在更接近真实生产力的任务上,混元实打实追赶上来了,尤其是长上下文任务、代码库重构、专业科学推理等方面。

那么,猛踩油门的腾讯混元,它的“加速度”究竟从何而来?

1、每一次发布,都是实战

Hy4 preview 发布当天,WorkBuddy 和 CodeBuddy 同步开启两周免费体验。

混元团队在说明中提到:“如同 Hy3 preview,我们希望通过 Hy4 preview 的尽快发布获得广泛的真实反馈,从而显著提升 Hy4 正式版。”

同一套流程,混元已经走过一遍。

4 月 23 日,Hy3 preview 开源上线,同时接入元宝、WorkBuddy、CodeBuddy、ima 和 QQ 等多个业务产品。

三个月后,Hy3 正式版发布。团队表示,Hy3 preview 已在 50 多个业务中获得广泛反馈,修复了大量体验问题;正式版在此基础上,进一步提升后训练数据的质量与多样性,并扩大了强化学习的算力规模。

变化体现在核心指标上。

对比preview版,Hy3 正式版的幻觉率从 12.5% 降到 5.4%,常识错误率从 25.4% 降到 12.7%,多轮对话问题率从 17.4% 降到 7.9%。

这不是单靠增加参数就能解决的。

模型在真实任务里会犯一些非常具体的错误。比如忘记用户几轮前提出的限制,工具调用失败后盲目重试,任务已经完成却不知道什么时候该停等等。

只有把模型放进产品,让它持续面对真实用户,再把失败过程拆开,找到问题发生在哪一步,补充正确的任务轨迹和判断标准,错误才可能被一条条纠正。

Preview 不是一个版本标签,而是将真实使用纳入模型研发的行业机制。

早在 2022 年,OpenAI 就把 ChatGPT 作为 research preview 推向公众,希望借此收集用户反馈,了解模型在真实世界中的优势与局限。后来的 o1-preview、GPT-4.5,也延续了相似的发布方式。

OpenAI 将其称为“迭代式部署”:不是等系统在实验室里变得完美再推出,而是让一个仍有不足的版本受控地进入真实世界,再根据实际使用不断修正。

如今,分阶段开放、早期测试和 preview-first,已经成为前沿模型常见的研发机制。

每一次 preview 都不只是一次产品公测,也是一次大规模实战。

正如混元团队所说,Hy3 preview 是混元从读万卷书到行万里路的开端。

2、实战反馈,如何变成模型能力

发布大模型只是第一步。

它能不能真的进步,取决于收回来的是什么,以及这些东西能不能变成有效的训练材料。

Hy4 preview 的官方说明里,有一句容易被略过的话:模型能力的提升,来自与腾讯内部软件工程、游戏、金融、安全等领域专家的高质量数据共建。

Hy3 时期,重点是与 CodeBuddy、WorkBuddy 等产品深度协同,把真实任务中的用户反馈和失败案例送回训练环节。

到了 Hy4 阶段,在产品反馈之外,来自各个专业领域的专家共建被放到了更靠前的位置。

这是两个不同层次的反馈。

用户告诉模型“哪里不好用”,专家告诉模型“什么才算真正做好”。

一个金融分析任务,普通用户可能只能判断最后的报告能不能用;专业人士则可以进一步判断统计口径是否一致、证据链是否完整、风险提示是否充分。

一个软件工程任务,测试通过不等于代码可以合入,工程师还会看架构、可维护性、性能和潜在回归。

让产品反馈和专家判断组织起来,参与模型训练的方法,腾讯内部叫 Co-Design。

什么信息该给模型,什么时候给,以什么结构给;模型可以调用哪些工具,怎样判断任务完成,失败后又该如何恢复——这些都不是模型团队关在实验室里能独立想明白的。

Co-Design 做的,是让多方一起定义问题,而不是等模型训练完成,再由产品接上一个 API。

混元内部还建立了 50 多套评测,用真实考题、人工评测和产品众测进行验收,不再把外部排名作为唯一标准。

姚顺雨的判断是,真正有价值的进步来自产品侧回流的真实 Prompt 分布:模糊提问、多轮追问、省略表达、隐含意图、前后矛盾,以及用户自己都没有完全说清楚的需求。

用户提供问题分布,专家提供质量标准,产品提供任务环境,模型团队再把三者变成后训练和评测体系。

这才是反馈真正转化成模型能力,实现Co-Design loop的全过程。

3、腾讯的Agent产品矩阵,混元的训练场

WorkBuddy 的界面上,摆着多个厂商的十余款模型。

混元、DeepSeek、GLM、Kimi、MiniMax,用户点一下就能切换,没有唯一选项。

这给混元设置了一个比内部评测更直接的考场。

每一次切换都是一次投票。每一次重复使用也是一次投票。

结果是 Hy3 留住了用户。

今年 7 月 8 日,Hy3 正式版在 WorkBuddy 上线后,调用量一度把算力打满。当天下午排队率超过 50%,团队紧急扩容。原定两周的免费体验,也因为需求过大延长到了 8 月底。

自上线 WorkBuddy 以来,主动选择 Hy3 preview 的用户数量增长了 6 倍。接入 Hy3 正式版后,WorkBuddy 内部测评的任务成功率从 72% 提升到 90%,平均耗时缩短 34%。

这些数字至少证明了一件事:

模型在内部评测中获得的提升,有一部分转化成了用户能够直接感知的体验。

用户选择只是结果。

对模型研发更重要的是,用户为什么选择它,又为什么放弃它。

在多模型共存的产品里,混元获得的不只是一句“好用”或者“不好用”,而是一组带有对照关系的反馈:

同一个任务,不同模型用了多长时间,采取了什么路径,调用了哪些工具,在哪一步失败,用户最终接受了哪一个结果。

这让 WorkBuddy 不只是混元的考场,也成了它的训练场。

WorkBuddy 只是其中一个入口。

混元已经接入腾讯内部百余个业务场景。腾讯也在推动企业微信、腾讯文档、ima、腾讯会议和 iwiki 与 WorkBuddy 进一步打通。

入口越多,模型面对的任务类型越丰富;工具越多,模型能完成的任务链条越长;任务链条越长,暴露出来的问题也越接近真实生产。

对拥有产品矩阵的公司来说,优势不只是用户多,而是环境多。

元宝提供搜索和对话,CodeBuddy 提供代码库和开发工具,WorkBuddy 提供本地文件与办公流程,ima 提供知识库,腾讯会议和企业微信则提供协作上下文。

这些产品提供的环境不同,但模型在其中习得的能力可以迁移。

搜索中练出来的信源判断,可以用于研报分析;编程中练出来的规划、调试和验证,可以迁移到办公任务;长文理解中练出来的上下文管理,又可以帮助模型完成跨文件协作。

单个产品只能提供一种反馈。产品矩阵提供的是一整套能力进化的环境。

4、把实战闭环搬进模型内部

到这里,混元的加速逻辑已经形成了一条外部闭环:

模型进入产品,用户和专家提供反馈,反馈被加工成训练与评测材料,再进入下一个版本。

Hy4 preview 往前又走了一步。

它开始把同样的循环搬进模型研发内部。

产品侧的循环是“发布—使用—反馈—改进”;模型内部的循环则是“提出方案—运行实验—读取结果—继续修改”。

前者由模型、产品和专家共同完成,后者开始由模型参与执行。

用 AI 优化 AI,并不是 Hy4 独有的方向。

随着编程 Agent 的长程执行能力增强,越来越多模型开始参与训练框架、GPU 算子、编译器和芯片设计等研发任务。行业正在从 AI for Coding,走向 AI for AI。

Hy4 preview 的不同之处在于,它开始参与一条与自身研发直接相关的链条:训练方法、数据策略、评估体系和底层算子的自动优化。

这虽然远不是严格意义上的“自己训练自己”,但模型与研发对象之间的距离,已经缩短了一步。

一个直接结果是,Hy4 preview 首次给自己的推理系统做了一次优化。

模型先分析系统瓶颈,再围绕算子融合、通信优化等方向提出方案,运行实验,根据日志继续调整。最终,端到端吞吐相对基线提升了 31.8%,而且在不同上下文长度和并发度下都获得了稳定收益。

简单说,同样一套算力,现在可以承接更多请求。

模型不只是被部署到基础设施上,也开始参与改造承载自己的基础设施。

在一个小模型后训练任务中,Hy4 preview 作为 researcher 协调多个 Codex Session,并行优化多个评测目标,8 项评测全部优于 Codex 独立探索。

过去,这些工作主要由研究员完成:提出假设、修改代码、启动实验、阅读日志、比较结果,再决定下一轮怎么做。

现在,模型自身也开始进入这个闭环。

5、实战驱动的加速度

回过头看,这也解释了混元这半年的加速度。

它不是只靠一次更大规模的预训练,把模型憋到足够强再发布。

它把发布变成获取反馈的入口,把产品变成任务环境,把用户和专家的判断变成训练弹药,又开始让模型参与下一轮研发。

这条链条可以概括成四步:发布,实战,反馈,再训练。

到了 Hy4 preview,这条链又向内延伸了一步:模型开始参与改进承载自己的系统。

对腾讯而言,这款模型的意义,不只是混元又追上了一段距离,而是腾讯开始把模型、Agent产品、真实任务、数据反馈,以及推理基建组织成一个持续运转的系统。

过去,大模型竞争主要看算力、参数和文本数据。

现在,竞争正在转向另一组能力:

谁能找到真正有价值的问题,谁能构造足够真实的环境,谁能把用户、专家、产品和模型组织进同一条反馈链,以及谁能让这条链转得更快。

模型仍然重要。

决定下一次迭代速度的,还有围绕模型运转的整个系统。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本刚拿到12年稀土大单就飘了,叫嚣反制无效,不料麻烦才开始!

日本刚拿到12年稀土大单就飘了,叫嚣反制无效,不料麻烦才开始!

疯狂小菠萝
2026-08-29 15:18:51
8月27日俄乌最新:西尔斯基的新动向

8月27日俄乌最新:西尔斯基的新动向

西楼饮月
2026-08-27 20:12:40
大炮打蚊子啊!深圳中学录用名单曝光,满眼都是顶尖院校的名字,网友:考上清北剑桥,最后去当老师?

大炮打蚊子啊!深圳中学录用名单曝光,满眼都是顶尖院校的名字,网友:考上清北剑桥,最后去当老师?

火山詩话
2026-08-29 06:53:15
总价1.44亿!利物浦大手笔:将签下欧冠冠军边锋 只待官宣

总价1.44亿!利物浦大手笔:将签下欧冠冠军边锋 只待官宣

叶青足球世界
2026-08-29 15:29:13
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

财经保探长
2026-08-23 21:43:55
我今年60岁,通过观察发现,寿命长的人走路一般有4个特征

我今年60岁,通过观察发现,寿命长的人走路一般有4个特征

蝉吟槐蕊
2026-08-18 13:11:31
哈佛揭秘:毁掉孩子自律的元凶,不是贪玩,是泛滥的廉价多巴胺

哈佛揭秘:毁掉孩子自律的元凶,不是贪玩,是泛滥的廉价多巴胺

户外阿毽
2026-08-27 01:41:54
景甜前男友孙宇晨:读书的才华,可以济世,也可以成为一把镰刀

景甜前男友孙宇晨:读书的才华,可以济世,也可以成为一把镰刀

十为先生
2026-08-28 13:59:57
被悬赏1000万美元后,特朗普小儿子过上更加“隐秘”的生活

被悬赏1000万美元后,特朗普小儿子过上更加“隐秘”的生活

红星新闻
2026-08-29 12:56:24
逃离北上广!中国年轻人挤爆尼泊尔:30元住店20元上课,太香了

逃离北上广!中国年轻人挤爆尼泊尔:30元住店20元上课,太香了

白米饭怎么吃
2026-08-09 20:40:42
“戈壁西瓜”危害有多大?硒砂瓜一年长一茬,可为何被局部禁种?

“戈壁西瓜”危害有多大?硒砂瓜一年长一茬,可为何被局部禁种?

抽象派大师
2026-08-27 17:24:50
八十岁以后,来日不多了,就算身体再好,也请记住这“七句话”!

八十岁以后,来日不多了,就算身体再好,也请记住这“七句话”!

王二哥老搞笑
2026-08-15 12:16:08
广东盐洲岛一民宿如厕收费1元被游客投诉,十分委屈:曾经免费过,但是…

广东盐洲岛一民宿如厕收费1元被游客投诉,十分委屈:曾经免费过,但是…

广东活动
2026-08-27 12:13:38
研究发现:阿尔兹海默症早期不是记性差,而是身上5表现,需注意

研究发现:阿尔兹海默症早期不是记性差,而是身上5表现,需注意

全球军事记
2026-08-28 10:46:05
男篮世预赛第一大冷门!西班牙被世界第45爆冷:中国队该警惕起来了!

男篮世预赛第一大冷门!西班牙被世界第45爆冷:中国队该警惕起来了!

篮球快餐车
2026-08-29 11:56:25
今天才知道:家里“这6样”都含有玻璃纤维,危害很大,别再用了

今天才知道:家里“这6样”都含有玻璃纤维,危害很大,别再用了

Home范
2026-08-26 12:16:19
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
美国真掀桌了!凌晨2点准时动手,中方做好最坏打算,奉陪到底

美国真掀桌了!凌晨2点准时动手,中方做好最坏打算,奉陪到底

观史搜寻着
2026-08-27 09:39:13
特朗普将正式宣告“美国不保证台湾安全”,以避免中美冲突?

特朗普将正式宣告“美国不保证台湾安全”,以避免中美冲突?

安安说
2026-08-29 14:14:00
越吃血管越通,建议中老年敞开吃,给血管洗个澡,别错过

越吃血管越通,建议中老年敞开吃,给血管洗个澡,别错过

华庭讲美食
2026-08-26 03:18:40
2026-08-29 15:52:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
138717文章数 862539关注度
往期回顾 全部

科技要闻

美团扭亏为盈后,外卖大战结束了吗?

头条要闻

孙宇晨诉景甜返还3000万"彩礼" 律师:彩礼性质有争议

头条要闻

孙宇晨诉景甜返还3000万"彩礼" 律师:彩礼性质有争议

体育要闻

米兰、巴黎、拉莫斯、巴克拉:所得与所失

娱乐要闻

孙宇晨最新发声:惊扰景女士非本意

财经要闻

刑自强:AI投资下半场中国蓄势待发

汽车要闻

东风日产NX8“喜柿橙意”限定色正式上市

态度原创

本地
时尚
家居
旅游
亲子

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

今日热点:景甜回应;陈绮贞拿回歌曲版权……

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

宁夏4座博物馆最新公告:恢复常态化开放

亲子要闻

双手并指宝宝保住无名指,家长对外观功能挺满意

无障碍浏览 进入关怀版