腾讯Hy4 Preview的官方技术公告里,最刺眼的不是770B参数,也不是1.56TB的MoE体量,而是腾讯自己写下的那句“largest generation-over-generation gain we've measured”——他们承认这是迄今测到的最大跨代提升。从Hy3到Hy4只用了一个月,所有数字都挂在Hugging Face官方页面上。
但Simon Willison翻完模型文件后,发现公告没说的另一面:这个“想太多”的毛病,腾讯自己点了头。
![]()
MoE的“大而轻”逻辑
先拆术语。MoE(Mixture of Experts)不是把所有参数同时跑起来,而是每个token只激活相关的那几组“专家”。所以1.56TB的体量听着吓人,实际推理时并不重。Reasoning effort是“思考强度”档位,调高就是让模型在回答前多打几轮内部草稿;reasoning trace就是那些草稿本身。
打个比方:reasoning effort像给会议设时长,high等于拉长讨论再拍板,no_think等于凭直觉秒回。Hy4 Preview的档位只有两档——high(默认)和no_think,没有中间值。其他家常见的low/medium/high阶梯,在腾讯这里被砍成了“全速想”或“完全不想”。
一个月跳了多大
从Hy3到Hy4,腾讯官方口径是“largest generation-over-generation gain we've measured”。这句话的分量在于,它出自腾讯自己,不是第三方评测。Hugging Face页面上的数字支撑了这个说法,但具体提升幅度公告没有展开成单一百分比,而是散在几个任务里。
最值得看的是三个“最难的战场”。腾讯把Hy4 Preview的强项锁定在三个重任务上,而不是刷通用榜单。这种选场方式本身就说明,他们清楚这代模型的边界在哪里。
能真做出Unity游戏
官方展示的demo是一个Unity 3D第三人称游戏:企鹅在雪地里探索,捡浆果、开箱子、打怪物,菜单、加载、暂停齐全,还带animation blend tree、inventory、quest HUD、音乐和音效。这不是生成一段代码片段,而是从零搭出一个可运行的游戏项目。
这个demo的含金量在于,它把“能写代码”推到了“能组织一个完整工程”的层面。对开发者来说,后者才是真正省时间的部分。
当“研究主管”管多个Codex
技术公告里最值得琢磨的一点:Hy4 Preview被用来当researcher,同时管理多个Codex会话,根据中间结果调整研究方向。腾讯称,这种“一个模型当大脑、指挥其他agent”的玩法,在8个benchmark上全部赢过单打独斗的Codex。
这是真正的multi-agent orchestration。不是简单地把几个模型拼起来,而是让一个模型做调度和决策。Simon Willison对这部分没有展开质疑,但公告里的“8个benchmark全胜”需要看具体口径——是同一批任务、同一套评分标准,还是各自为战。
盲测数字要读准
163位专家给203个工程任务打分,Hy4 Preview赢了GLM-5.3,但赢得很“窄”。官方公告写的是“小胜”,不是碾压——对手还拿下了40%的任务。这个数字必须读准:它不是domination,是一场有来有回的较量。
如果把“盲测获胜”简化成“全面超越”,就偏离了公告原意。腾讯自己都没这么说。
价格还是中国式打法
API定价:输入每百万token 0.834美元,输出每百万token 2.501美元,走腾讯云和OpenRouter。CodeBuddy、WorkBuddy前两周免费,Yuanbao和ima也能免费用。这个价格放在770B MoE模型上,确实延续了“便宜大碗”的路线。
但价格低不等于推理成本低。MoE的“轻”是相对的,1.56TB的权重加载和专家路由本身有开销。腾讯没在公告里给出单次推理的实测成本,这部分只能等第三方跑分。
Simon Willison翻出的三件事
Simon Willison直接读了模型的chat_template.jinja,发现reasoning effort只有high和no_think两档。没有中间档,意味着用户要么接受“全速思考”的延迟和token消耗,要么关掉思考换速度。这对需要精细控制成本的场景不友好。
第二件事更具体。他让模型画“骑自行车的鹈鹕”SVG——这是他常用的经典测试prompt。结果图很漂亮,但reasoning trace里出现了这样的内部草稿:“Let's maybe add a helmet?... The user didn't ask; can add red helmet? Might be cute. But pelican with big beak; a helmet might obscu……”
这段trace被截断了,但已经能看出问题:模型在“用户没要求”的情况下,自己纠结要不要加头盔、加红色头盔可不可爱、鹈鹕嘴大头盔会不会挡住。这就是腾讯承认的overthink——在不需要的地方反复横跳,消耗额外的推理资源。
“想太多”的代价
Overthink不是玄学,是实打实的token消耗。reasoning trace里的每一句“maybe”“might”都是要付费的输出。当模型在“用户没问”的细节上自我辩论时,用户等得更久、花得更多,而最终结果未必更好。
腾讯在公告里承认这一点,说明他们清楚这个行为模式的存在。但承认不等于解决。Hy4 Preview目前只给了high和no_think两档,用户没法选一个“适度思考”的中间态。要么忍受overthink,要么完全放弃推理深度。
两档设计的真实影响
对开发者来说,这个限制比想象中更实际。很多场景需要的是“想一下,但别想太多”——比如代码补全、简单问答、格式转换。Hy4 Preview的no_think可能太快太浅,high又可能陷入不必要的自我讨论。没有中间档,意味着用户要在两个极端之间做选择。
Simon Willison没有直接批评这个设计,但他把chat_template翻出来这件事本身,就是在提醒:别只看公告,去看模型文件里真正写死的逻辑。
一个月迭代的隐忧
从Hy3到Hy4只用一个月,这个速度本身值得追问。腾讯说这是“最大跨代提升”,但一个月能做的,更多是训练策略、数据配比、后训练调整,而不是底层架构的彻底重构。770B的MoE不是从零训出来的,是在前代基础上快速迭代。
这种速度的好处是快,风险是某些行为模式——比如overthink——可能被继承甚至放大。腾讯在公告里承认overthink,某种程度上也是在给用户打预防针:这个版本还有明显毛病,别当成品用。
盲测“小胜”该怎么看
163人、203个任务,这个样本量不算小,但也不是大规模基准。40%的任务输给GLM-5.3,说明两者差距没有拉开。对用户来说,选哪个可能更取决于具体任务类型和价格,而不是一个笼统的“谁更强”。
腾讯把盲测结果放出来,姿态是透明的。但“小胜”这个表述本身,也留了余地——它没有宣称全面领先,只是说在工程任务上略占上风。
价格战的另一面
0.834美元/百万输入token,放在770B MoE上确实有竞争力。但用户真正要算的是总成本:输入+输出+reasoning trace的额外消耗。如果overthink导致输出token膨胀,实际花费可能比标价高出一截。
腾讯没在公告里给出“典型任务的平均输出token数”,这个数据对评估真实成本至关重要。免费渠道(CodeBuddy、WorkBuddy、Yuanbao、ima)能降低试用门槛,但生产环境的成本还是要自己测。
Simon Willison的测试方法
他用“骑自行车的鹈鹕”这个prompt,不是为了考画图能力,而是为了看reasoning trace里的决策过程。SVG画得好不好是结果,trace里怎么想才是他关心的。结果就是那段被截断的英文草稿,暴露了模型在非必要细节上的自我纠结。
这个方法值得开发者借鉴:别只看最终输出,去翻模型的内部推理。很多问题——overthink、重复、逻辑跳跃——都藏在trace里,而不是最终答案里。
腾讯的“承认”意味着什么
厂商在官方公告里承认自家模型overthink,不算常见。大多数时候,这类问题会被包装成“深度思考”或“谨慎推理”。腾讯选择直接说出来,可能是为了管理预期,也可能是为了给后续版本留出改进空间。
对用户来说,这个“承认”是好事。它意味着你知道自己会面对什么:一个能力强但偶尔想太多的模型,一个只有两档思考强度的模型,一个盲测小胜但没拉开差距的模型。
接下来该盯什么
Hy4 Preview还是Preview,不是正式版。腾讯没给正式版时间表,但一个月一代的速度,说明后续版本不会太远。值得盯的三个点:overthink是否被抑制、reasoning effort是否增加中间档、盲测差距是否拉大。
Simon Willison已经用行动给出了建议:别等官方总结,自己去读模型文件、跑测试、翻trace。对770B的MoE来说,真正的评测不在公告里,在那些被截断的英文草稿里。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.