WORKBUDDY × HY4 混元 Hy4 preview 开始独立交活 49B 激活 · 1M 上下文 · 31.8% 提速 模型 × 产品 × 工作流,闭环交付 MODEL CAPABILITY · DELIVERY PARAMS 770B / 49B CONTEXT 1M WORK MODE SELF CHECK EXECUTION RUNTIME HY4 × WORKBUDDY REPORT PPTX WEB GAME
3 PARTS · CONTENT MAP
PART 01
发布拆解
770B、49B、1M
PART 02
四场景实测
研报、展馆与游戏
PART 03
独立交付
模型 × 产品 × 工作流
大家好啊,我是甲木。
这几天的模型发布是真的多...感觉这个月在扎堆发布新模型,而且国内一个比一个猛,
这段时间一直在 WorkAgent 里泡着。写蓝皮书那会跑了几十个任务,后面日常也在用,算是比较熟了。
8月28号腾讯混元发了 Hy4 preview,当天我就试了下。
![]()
提升幅度有点超预期。之前用 Hy3,我基本当它是“需要带教的新人”,简单杂活能接,但碰到多文件协作、稍微复杂的任务就得人盯着,经常中途卡住要救。
Hy4 preview明显不一样,会主动建校验脚本、会回头核数字,更像是能独立交活的人。
看一眼官方 benchmark,Hy3 到Hy4 preview几乎每项都是台阶式跳升:
![]()
而且最主要的是:WorkBuddy 又开了两周免费。现在干活多多少少都要用 AI,很多人等于花钱上班,WorkBuddy免费一开,大量办公族就涌进来了。
![]()
Hy3 那波也是这个打法,但 Hy3 能力上限摆在那,用户进来了,很多场景接不住。
Hy4 preview 的打击面不一样了,多文件、跨文档、长程任务都能接了。同样免费,能做的事多了一圈,留下来的概率就不同了。
模型升级 + 免费拉新,连续打,「为生产力而生」。
口号挺大的,先来看个创意前端:
这些都是 Hy4 在 WorkBuddy 里一句话跑出来的,我们直接拿真活试。
01
PART
这次发布讲了什么
Hy4 Preview · WHAT'S NEW
先简单过一遍发布内容。
770B 总参,激活 49B,上下文 1M。官方主推四个方向,除了我实在不太懂的科研..外,其他的都测了:
01
办公分析
数据分析、跨文件协作到文档/表格/PPT 完整交付。
02
游戏开发
一句话出可玩原型,多轮迭代。
03
软件工程
长程开发和前端审美。
04
科研
分子动力学、凝聚态物理这些,跳过。
有两个点值得单独提。
这个模型完成了自进化。
Hy4 preview参与了自身的研发:怎么训、用什么数据、怎么评估、底层怎么优化,它自己提方案、跑实验、看结果再改。之前 OpenAI 和 Anthropic 都提过类似的事,现在混元也做到了,官方第一次把这个写进发布口径。
![]()
还给自己提了速。模型自己找推理环节哪里慢,优化了六轮,整体速度比基线快了31.8%。
![]()
内部盲测:163 名专家、203 个工程任务,均分 2.99/4.00,略优于5.3和K3等其他几家模型。
定价:输入 ¥6,输出 ¥18,缓存 ¥0.3(每百万Token),这么来看Hy4 preview 在国内旗舰模型中定价是最低的了...
![]()
节奏上:2月重建基础设施到现在,混元平均两个月一个大版本,preview 先行、正式版跟进。
这个飞轮想清楚了其实挺恐怖的:模型越好 → 用户越多 → 数据越多 → 模型更好。
免费把人拉进来用,用的人多了,真实场景的数据和反馈就多了,下一版模型就训得更好,用户每隔两个月就感觉到“又变强了”,然后继续用,这就是一个正向飞轮~
02
PART
WorkBuddy + Hy4 preview四大场景实测!
WorkBuddy × Hy4 Preview · REAL TEST
CASE 01
AI 情报局:两份真财报 + 30 条热点 → 研究报告 + 汇报 PPT
给它腾讯和阿里的真财报 PDF 加本周 AI 热点 30 条,让它出研究报告(docx)和汇报 PPT(pptx),每个数字注明出处到页码。
![]()
![]()
45 分钟跑完。它自己建了校验脚本核数据,还建了渲染脚本把 PPT 逐页出图自查。复核轮查出阿里财报两处口径不一致,自动修正了。
![]()
![]()
CASE 02
青花志:非遗数字展馆
最近做case真的做到吐太多,模型要测了,也不知道做什么好。
正好看到官方推文做的是天坛,就想着我们也参考着做个非遗方向的,做一个青花瓷数字展馆。三个展厅从元代逛到清代,纹样全部程序画,不许贴图。
![]()
这个 case 最大的亮点是 SVG 能力。它自己画的青花瓷纹理非常好,缠枝莲、龙纹这些细节都能出来,比那种糊成一团的矢量图强太多了。
![]()
同样的 prompt 拿 Hy3 跑过一遍做对比:
![]()
CASE 03
弹窗大作战:复古 OS 梗
流氓弹窗疯狂蹦,关闭按钮会躲鼠标,点错原地分裂。撑过 90 秒不蓝屏就赢。全套 Windows 95 复古窗口,98.css 和像素字体全部内联,断网双击就能玩。
![]()
VIDEO · 16:9 横版视频
![]()
这个 case 的亮点在它的工作方式。它花了很长时间自己建测试、跑校验:三种打法各跑一局(认真撑、完全不管、专点身子触发分裂),确认三种结局都能跑通,还测了手机端触摸和 26 个弹窗同屏的压力上限。
![]()
![]()
对现在的顶级模型来说,这种"做完了自己检查、自己测"已经快成基本能力了。真正能拿来用的长程调度,就是这个样子。
CASE 04
窑变:烧瓷小游戏
和青花志组成非遗双 case。玩家当窑工,按住"添柴"控温,松手自然降温,90 秒烧完一窑。贴合度决定开窑成色:90% 以上发色纯正,中间档偏色带开片,烧过头直接窑塌给你一堆碎片。
![]()
![]()
03
PART
结语
Final Thoughts · 以上
办公 Agent 这个赛道,今年进入了拼交付的阶段。
之前各家发模型,比的是跑分、参数、上下文长度。但跑分高不代表能干活,很多模型拉到真实场景里,该卡的还是卡。
Hy4 preview这次让我觉得不太一样的地方是,它的工作方式变了。
AI 情报局那个 case,它自己建校验脚本核数据、自己渲染 PPT 逐页走查;弹窗大作战,它花了很长时间建三套测试方案,自己跑完确认没问题再交。这些事以前都是人盯着做的,现在它自己闭环了。45 分钟出两份能交差的文件,中间不用人插手。
![]()
「为生产力而生」这种口号谁都能喊。
但生产力落到实处,靠的是模型、产品、工作流三件事能对上。
腾讯现在的做法是把模型直接塞进 WorkBuddy,用户不用管底层换了什么,打开就是新的。
![]()
在最新的榜单中,腾讯混元 Hy4 preview 登上 Code Arena WebDev 榜单第 5 名,开源模型中位列第 3。
我们一直都说:让 AI 走进真实业务场景中。Hy4 preview已经基本能做到不需要回头再次 check,虽然还差最后几步。
毕竟还是 preview,复杂任务偶尔会过度自我验证,跑着跑着绕进去。
但按目前的迭代节奏,正式版应该不远了。
以上。
![]()
我是甲木,热衷于分享一些AI干货内容,同时也会分享AI在各行业的落地应用。觉得有用的话,点个赞、在看、转发三连,谢谢大家。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.