● 砚数 · 模型评测 · 2026-04-23
腾讯混元 Hy3 preview 来了,一切围绕 Agent 能力展开
2026 年 4 月 23 日,腾讯发布并开源了其混元 Hy3 preview 语言模型。这是一款融合快思考与慢思考的混合专家(MoE)模型,拥有 2950 亿总参数量、210 亿激活参数量,最大上下文长度达 256K token。这是混元基础设施重构后训练的首个模型,也是混元有史以来最聪明的模型,在复杂推理、指令遵循、上下文学习、编程、Agent 能力和推理性能方面均有显著提升。
2026 年 2 月,腾讯重构了其预训练和强化学习基础设施,并确立了追求实用性的三大原则:
1. 系统化能力: 公司不主张"专业化"——即便是一个代码 Agent 应用,也涉及推理、长文本、指令遵循、对话、代码、工具等多方面的深度协同。
2. 真实评估: 主动回避容易被刷榜的公开排行榜,转而使用自建题目、最新考试、人工评估和产品众测来评估和提升模型的"真实战斗力"。
3. 性价比追求: 实用性需要商业可行性。模型架构与推理框架设计的深度协同显著降低任务成本,让智能变得可负担、可用。
Hy3 preview 可以被视为混元快速探索解决真实世界问题的实用大模型的开端。
腾讯首席 AI 科学家姚顺宇表示:"Hy3 preview 是重构混元大模型的第一步。我们希望通过这次开源发布,获得开源社区和用户的真实反馈,帮助我们提升正式版 Hy3 的实用性。" 与此同时,公司正在持续扩大预训练和强化学习的规模,以提升模型的智能上限,并通过与众多腾讯产品的深度协同设计,不断提升模型在真实场景中的综合表现,并开始探索具有特色的模型能力。
Hy3 preview 现已上线腾讯云、元宝、ima、CodeBuddy、WorkBuddy、QQ、QQ 浏览器、腾讯文档和腾讯乐享,微信公众号、和平精英、腾讯新闻、腾讯自选股、腾讯客服和微信读书等产品也在陆续接入。它还支持 OpenClaw、OpenCode 和 KiloCode 等主流开源 Agent 产品,并已在腾讯云大模型服务平台 TokenHub 上架。
Hy3 preview 聚焦综合实用性,Agent 能力显著提升
多项评测结果显示,Hy3 preview 的能力得到全面提升。
4. 出色的上下文学习与指令遵循能力
在各种真实生产和生活场景中,理解杂乱冗长的上下文并遵循复杂多变的规则是模型面临的首要挑战。受腾讯业务场景启发,混元提出了 CL-bench 和 CL-bench-Life,创新性地评估模型的上下文学习能力,Hy3 preview 在上下文学习和指令遵循方面均有显著提升。
5. 卓越的复杂推理能力,清华数学博士资格考试最高分
复杂推理是模型解决各类问题的基础。Hy3 preview 在 FrontierScience-Olympiad 和 IMOAnswerBench 等高难度 STEM 推理任务上表现优异,并在最新清华大学求真书院数学博士资格考试(2026 年春季)和全国中学生生物学联赛(CHSBO 2025)中取得出色成绩,展现出可泛化的强大推理能力。
6. 代码与 Agent 能力提升最显著,性价比突出
代码和 Agent 是 Hy3 preview 提升最大的领域。得益于重构后的预训练和强化学习框架以及强化学习任务规模的扩大,混元在 SWE-Bench Verified 和 Terminal-Bench 2.0 等主流代码 Agent 基准测试,以及 BrowseComp 和 WideSearch 等搜索 Agent 基准测试中迅速取得了具有竞争力的成绩。
在数字世界中,代码聚焦于模型在开发环境中的执行能力,而搜索聚焦于在开放信息空间中的检索、筛选和整合能力。两者共同决定了模型在复杂 Agent 场景(如 OpenClaw)中是否真正可用。Hy3 preview 在 ClawEval 和 WildClawBench 等评测中表现良好,表明其 Agent 能力正稳步走向全面和实用。
除公开基准测试外,混元还构建了多个内部评测集来评估模型在真实开发场景中的表现。结果显示,Hy3 preview 在后端工程任务集 Hy-Backend、聚焦用户交互的 Hy-Vibe Bench,以及高难度软件工程开发任务集 Hy-SWE Max 上均极具竞争力。
对比各开源模型的规模和整体 Agent 表现,Hy3 preview 展现出极高的性价比。
腾讯核心业务全面接入,多款 AI 产品收益明显
在正式发布前,Hy3 preview 已在腾讯主要 AI 产品上测试,并展现出明显的正向收益。
在元宝方面,混元与元宝进行了深度协同设计。一方面,针对性地提升了模型在意图理解准确率、文本创作质量和深度搜索等硬指标上的表现;另一方面,对写作风格、情商、内容组织和专业性进行了精细调优。模型与产品的深度协同为用户带来了更聪明、更"像人"的交互体验。
在 ima 知识库问答和通用问答两个场景中,测试结果显示 Hy3 preview 擅长处理长文本,尤其在检索任务上表现良好,准确性、覆盖度和全面性俱佳。
在 CodeBuddy 和 WorkBuddy 上,Hy3 preview 将首 token 延迟降低了 54%,端到端时间缩短了 47%,成功率提升至 99.99% 以上。在真实用户环境中,Hy3 preview 已能稳定驱动高达 495 步的复杂 Agent 工作流,涵盖文档处理、数据分析、知识检索和 MCP 工具链编排等多样化办公场景。
在微信公众号 AI 分身和 AI 客服专项评测中,相比 Hy2,Hy3 preview 展现出更全面的能力升级。新模型在用户意图理解、复杂上下文处理和知识信息组织方面更加成熟。面对模糊提问、简短追问和多轮对话时,能更准确地把握用户需求并输出更清晰、更稳定的回复。在结合知识库、用户记忆和上下文生成回答时,更符合 AI 分身或客服的角色定位,过度想象、主观投射和情感表达显著减少,整体交互更趋近"可信、自然、高效"的目标。
在和平精英 AI NPC 评测中,和平精英团队在 Hy3 preview 发布后立即接入并进行了评测,整体表现令人印象深刻。在游戏外角色扮演场景中,Hy3 preview 不仅能准确理解角色设定,还能针对开放式问题输出高度相关、具有增值内容,带来更真实、自然、沉浸的对话体验。在复杂的游戏内对战场景中,模型的回复节奏接近真实玩家聊天,展现出优秀的稳定性和出色的人类化角色扮演能力。
在腾讯文档 AI PPT 场景中,相比上一代(Hy2)取得了显著进步:生成成功率提升 20%,评测得分提升 10%,生成时间缩短 20%。整体而言,新模型在评测场景中表现优异,在模板选择、配色、大纲生成和内容补充等多个阶段均表现强劲——无幻觉、贴合主题、视觉效果良好。
在 QQ AI 助手小 Q 产品评测中,相比上一代显著优化了长文本首字节延迟、整体响应速度和流式输出效率。在核心能力方面,数学推理表现显著提升,多场景指令遵循和泛化能力进一步增强。工具调用推理和多轮指代消解更加稳定高效,在 OpenClaw 官方 PinchBench QQ Agent 场景测试中取得优异成绩,整体体验实现明显跃升。
推理效率提升 40%,同等成本下最佳智能密度
得益于模型与推理框架的深度协同,以及推理框架、算子性能和量化算法的全面优化,整体推理效率提升 40%,Hy3 preview 的成本相比上一代大幅下降。
在腾讯云大模型服务平台 TokenHub 上,Hy3 preview 的输入价格低至每百万 token 1.2 元,输入缓存命中价格为每百万 token 0.4 元,输出价格低至每百万 token 4 元。腾讯云还与混元联合推出了定制版 Hy3 preview Token 套餐包,个人版每月 28 元起,为 Agent 开发和搭建"小龙虾"应用提供了更具性价比的选择。
原文信息(译介标注)
原文出处:Testing Catalog
原文网址:https://testingcatalog.net/tencents-hunyuan-hy3-preview-is-here-and-its-all-about-agents/
作者 / 网站:Testing Catalog
栏目:砚数 · 模型评测
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.