网易首页 > 网易号 > 正文 申请入驻

刚刚,国产2B小钢炮开源!逼近人类水平,跑出端侧通用Agent雏形

0
分享至


新智元报道


全球4B参数规模以下开源基座模型的新榜首,居然是一个2B模型!

9月8日,面壁智能与OpenBMB正式开源新一代端侧「小钢炮」——MiniCPM5-2B。在国际权威基准Artificial Analysis Intelligence Index(AA榜单)的最新评测中,MiniCPM5-2B以23分的综合成绩登顶全球4B以下开源基座模型第一。

更引人注目的是其在智能体任务上的断层式领先:在专门评测Agent能力的 Agentic Index指标上,MiniCPM5-2B斩获20分。这一成绩不仅让同级2B-4B模型(普遍仅2分)难以望其项背,甚至超越了包括Qwen3.5 9B、Gemma 4 12B等参数量数倍于己的模型,展示出了端侧模型探索通用Agent的可能性。

与行业内普遍的模型仅开放权重不同,面壁智能与OpenBMB此次同步开源了MiniCPM5-2B背后的训练Recipe(配方)、RL框架及核心数据集,造福广大开发者!

AA榜单4B以下性能第一

Agent能力断层领先

按照AA Index最新榜单成绩,MiniCPM5-2B是全球4B参数以下得分最高的开源模型(23分),高于参数量甚至数倍于己的Gemma 4 12B(22分)、Qwen3.5 9B(22分)、Qwen3.5 4B(20分)。


如果把所有模型按「参数量—得分」放进同一张坐标系,会看得更清楚:根据 AA榜单,在4B参数规模之下,MiniCPM5-2B站在整条帕累托线的最顶端,先前开源的MiniCPM5-1B版本也落在这条线上——两个尺寸,各自占住了同级别的性能天花板。

这正是面壁智能所坚持的「密度定律」最直观的印证:MiniCPM5-2B以极高的单位参数智能密度,仅用约一半的参数体量(2B),就跑出了领先于4B模型的智能水平。


高分不是靠「堆 token 硬想」换来的。在完成同样的Intelligence Index任务时,MiniCPM5-2B平均只消耗21k输出token(其中推理14k、回答7k),处于全场最低一档——而得分相近的Qwen3.5 9B需要34k,Granite 4.2 8B需要26k。对端侧部署来说,这意味着更快的响应和更低的推理成本。


本次评测覆盖通用知识、数学与代码推理、指令遵循、长文本、工具调用等任务。但比总榜名次更值得注意的是其Agent能力:在AA Agentic Index上,MiniCPM5-2B拿下20分——不仅是第二名Granite 4.2 8B(9分)的两倍以上,更远超gpt-oss-20b(3分)等参数量十倍于己的模型;而多数同级端侧模型仅有2分,拉开明显差距。


在衡量真实工作任务完成度的GDPval-AA v2榜单上(以人类基线1000分为锚点的Elo评分),MiniCPM5-2B拿到891分,是所有参评模型中最接近人类水平的一个,领先第二名Granite 4.2 8B(702分)近190分,更把同尺寸模型(如:Granite 4.2 3B 325分、Ministral 3 3B 286分)远远甩在身后。


根据公开数据集的评测,MiniCPM5-2B在「通用智能体 」、「搜索智能体 」、「工具调用」、「代码推理」等关键维度上均斩获最高分,用实际结果验证了通用Agent能力在高密度端侧模型上的技术可行性,为「端侧Agent」打开了新的想象空间。


端侧Agent的落地价值,也正在变得更加清晰:


  • 隐私安全:在用户授权和操作系统权限机制允许的范围内,端侧Agent可以直接读取屏幕内容、调用本地应用,并处理设备上的本地数据——这些权限出于安全原因很难完全开放给云端服务。因此,「处理敏感重要信息」「实时感知用户状态」等体验可能会是端侧相对云端的能力增量。

  • 离线可用与确定性响应:端侧模型的核心推理不依赖网络连接和远程服务,因此可以减少网络波动、云端限流或服务故障带来的影响。对嵌入操作系统和硬件产品的Agent(手机、车机、机器人),这种确定性比绝对速度更重要。

  • 成本优势:在硬件已经购置的前提下,本地推理通常不需要按照调用次数或 Token数量持续支付云端API费用。对于常驻个人助理、每日自动化流程等长期高频Agent任务而言,端侧方案有望降低长期使用成本。


要知道,Agent应用能否规模化,推理成本是其中一个重要约束,一个复杂 Agent任务动辄消耗数十万token。如果高密度端侧模型能承接相当一部分 Agent工作任务,整个应用层的成本结构会发生实质性变化——这可能是 MiniCPM5-2B最值得继续观察的行业价值。

在开源生态支持上,MiniCPM5-2B延续了面壁智能一贯的开放性:微调侧已适配LLaMA-Factory、ms-swift,推理侧覆盖 vLLM、SGLang、llama.cpp、Ollama等主流框架,开发者在常规硬件上即可快速部署验证。

截至2026年8月,MiniCPM系列模型的开源下载量已突破5000万——社区用下载量投的票,往往比跑分更诚实。

那么问题来了:一个2B的模型,凭什么能够承载起复杂的Agent与思考能力?

从数据治理到训练体系

高密度端侧模型是怎样炼成的

当参数规模受到端侧设备的硬约束时,底层的数据治理与训练技术栈就成为决定模型上限的关键变量。

在数据侧,这次与MiniCPM5-2B一同开源的四个数据集,将数据治理延伸到了训练流程的不同环节:


  • UltraX(预训练):用一个0.6B的小模型,对网页数据做「行级别」的自动编辑,避免了让大模型端到端改写整篇文本带来的语义漂移,原文的信息保真度更高,并且整个精修过程可审计、可追溯。用UltraX修复后的数据训练 1B规模模型,160亿token达到了原始数据训200亿token的效果。换算下来,同样的算力预算,数据处理得好,能「省」出20%的训练量。对于「寸 token寸金」的预训练来说,这不是小数字。

  • UltraData-Code(代码预训练):按L0–L3分级治理,从约1.92亿个GitHub仓库逐级精炼,完成L1清洗去重、L2算法代码筛选(约400B Token)和L3任务导向的结构化合成(约150BToken),将真实代码转化为任务、推理、实现与测试对齐的高质量训练样本;

  • UltraData-SFT-Agent-2609(SFT):包含50多万条Agent训练样本,覆盖从基础工具调用到长链路复杂工作流等多样化的任务,为端侧Agent模型提供全链路训练信号;

  • UltraData-RL-2609(RL后训练):针对答案不可验证、奖励标签不可信、难度不匹配三大痛点,设计了「可验证性过滤→多模型共识校验→rollout难度筛选」的三阶段清洗流水线,为强化学习提供高信噪比的奖励信号。


在训练框架侧,面壁智能随MiniCPM5-2B一同开源了全新的自研强化学习框架Meshy。Meshy彻底去掉了RL训练的中央控制器和Ray依赖,将训练、推理、奖励计算等全部建模到对等服务,利用TransferQueue中的数据就绪状态来驱动实际控制流,能够简单的在同步、异步、全异步三种训练模式中灵活切换,便于扩展。

在算法层面,端侧模型做长思维链强化学习,常常训练过程中分数不升反降:一方面训练数据里噪声多、难度不匹配,奖励信号容易带偏模型;另一方面GRPO信用分配太粗糙,面对上万词元的推理链,分不清哪步对、哪步错。

为此,MiniCPM团队提出基于奖励的强化学习策略JustRL II:数据上,用三阶段流水线筛选校准训练数据;算法上,给GRPO装上Critic,实现词元级信用分配。在JustRL II加持下,MiniCPM5-2B在RL后训练中获得了显著的性能收益。


从行级精修的数据管线,到底层自研的轻量框架与信用分配算法,这些技术最终转化成了MiniCPM5-2B的智能密度。

同样值得关注的是面壁智能在开源生态层面的选择:面壁智能并未将这些筑起性能壁垒的核心资产留作私产,而是将模型权重+训练数据集+RL框架+训练Recipe一并开源了。

熟悉开源大模型生态的人应该能看出这份清单的分量,这在头部大模型团队里是绝对罕见的做法。面对行业普遍将数据视为「绝对黑箱」的现状,不妨来算一算面壁智能这本不同寻常的「开源账」。

一本开源账

十个数据集,三年时间线

行业里有个心照不宣的共识:数据管线是各家真正的护城河。

厂商不公开数据的理由也不难理解:模型架构写进论文,半年内就会被全行业消化;真正留得住的差距在数据管线——数据从哪来、怎么筛、怎么配比、怎么合成等等。所以如果较真去看,绝大多数所谓的「开源模型」,开的其实只是权重。

开放源代码促进会(OSI)在2024年发布「开源AI定义」(OSAID)时,就曾因为「是否必须公开训练数据」引发过一轮激烈争论——按照严格标准,市面上能称得上「开源AI」的大模型寥寥无几。

「open weights」(开放权重)这个更精确的说法在学界越来越通行,某种程度上就是对现状的一种妥协性描述。

这种现状的后果由社区承担——数据黑箱意味着可复现性差:你可以微调一个开源模型,但你无法验证它为什么是这个水平、无法在它的基础上做真正的训练侧研究。

正因为如此,面壁智能这次MiniCPM5-2B的开源动作才更加值得关注。单看一次发布,你可以说这是营销策略。但把时间线拉长看,会发现这件事对面壁智能来说更像是惯性动作。

从2023年底至今,面壁智能和它背后的OpenBMB开源社区,累计开源了超过10个大模型训练数据集,覆盖网页语料、数学、代码、对话、偏好对齐等几乎所有训练环节:

2023年4月,UltraChat。约150万条合成多轮对话,至今已被全球超过200个大模型用于对齐训练,月均下载量破百万,成为开源微调领域引用最广的数据基座之一。

2023年12月,UltraFeedback。6.4万条提示词、38万条GPT-4反馈的偏好数据集,可用于训练奖励模型。基于它训练的UltraRM曾刷新开源奖励模型的SOTA,Zephyr-7B等社区明星模型的对齐训练均采用了该数据集。

2025年12月,Ultra-FineWeb。约1T英文+120B中文token的高质量网页预训练语料,开源后登上过Hugging Face热门榜第一。

2026年,节奏明显加快。2月的UltraData-Math(290B+ token 的分级数学语料)、5月的Ultra-FineWeb-L3(600B token,其中中文200B+,是目前开源社区规模最大的中文预训练合成数据集之一)、7月的UltraX-Preview、8月的Ultra-FineWeb-L1,几乎「按月上新」。


截至2026年9月,UltraData系列数据集的开源总下载量超过266万次。

这条时间线说明两件事。第一,开源数据不是一次性的发布动作,而是面壁智能及OpenBMB社区一以贯之的长期贡献。第二,开源的数据绝非边角料,而是实打实进入了全球主流模型训练管线、被反复验证过的高价值资产,不是「开了但没人用」的姿态性开源。

模型跑分是台前的热闹,数据是幕后的苦工。这种「授人以渔」的开源方式,正在实质性地降低社区内研究端侧大模型的门槛,为广大开发者提供了极具研究和复现价值的基石。

通往AGI的路上

高质量数据是最厚的地基

数据的功夫做在暗处,但它的回报写在明处——而且不止写在一款模型上。把这次MiniCPM5-2B开源放进行业坐标系里看,它回应的其实是一个更大的问题:当算力红利见顶,模型能力的增量从哪里来?

过去几年,提升模型能力最直接的路径是堆参数、堆算力,但这条路的边际收益在肉眼可见地递减——参数翻倍带来的提升越来越小,成本却照旧翻倍。

当「更大」不再自动等于「更好」,各家比拼的重心就在向数据侧转移。数据治理正在从不见光的后台工作,变成决定成败的核心竞争力。MiniCPM5-2B综合性能登顶全球同级模型,本身就是这个判断的一个证明。

从长期看,开源训练数据以及数据治理的工具和方法,可能比开源模型本身对行业的持续影响更大。一个模型的先进性是有保质期的,几个月后就会被新模型盖过;但一套公开的修复方法、一个人人可用的0.6B修复工具、一批高质量的数据集,是别人可以接着往上盖的地基。

模型开源给行业的是一件成品,数据治理开源给行业的是造成品的能力——后者的复利,要用更长的时间尺度才能看清。

MiniCPM5-2B开源链接 (含模型与UltraData系列数据):

  • Hugging Face:https://huggingface.co/collections/openbmb/minicpm5

  • GitHub:https://github.com/OpenBMB/MiniCPM

Meshy框架开源链接:

  • GitHub:https://github.com/OpenBMB/Meshy

  • 博客:https://maydomain.notion.site/meshy-blog-zh

JustRL II强化学习算法:

  • 博客:https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
山西省原省长金湘军,被判死缓

山西省原省长金湘军,被判死缓

新京报
2026-09-08 17:08:08
本土被炸就拉北约下水!立陶宛释放强信号,欧洲东部成新火药桶?

本土被炸就拉北约下水!立陶宛释放强信号,欧洲东部成新火药桶?

新姐看世界
2026-09-07 19:40:08
车企推出自愿离职计划:计划裁员4000人

车企推出自愿离职计划:计划裁员4000人

小南看车
2026-09-07 11:50:12
马斯克发出警告!接下来全世界将面临一场危机,或许只有中国是个例外

马斯克发出警告!接下来全世界将面临一场危机,或许只有中国是个例外

扶苏聊历史
2026-09-08 18:10:42
眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

坠入二次元的海洋
2026-09-08 10:50:25
“把孩子吃死你就老实了!”一个红薯叶窝窝头让孩子奶奶被骂惨!网友:这婆婆揍起来没有心理负担!

“把孩子吃死你就老实了!”一个红薯叶窝窝头让孩子奶奶被骂惨!网友:这婆婆揍起来没有心理负担!

林林先生
2026-09-08 11:51:39
我和同事合买彩票中了20万,他立马转我20块说两清,我笑了:忘了跟你说,我自己买的那张,好像中了500万头奖

我和同事合买彩票中了20万,他立马转我20块说两清,我笑了:忘了跟你说,我自己买的那张,好像中了500万头奖

晓艾故事汇
2026-09-08 15:19:18
“出卖”父亲后果凄凉?傅作义之女傅冬菊为何至今仍被黑得如此惨?

“出卖”父亲后果凄凉?傅作义之女傅冬菊为何至今仍被黑得如此惨?

舆图看世界
2026-09-06 11:40:12
77.8%超高投票率,魏德尔率德国选择党迎来大胜!默克尔出面也劝不住

77.8%超高投票率,魏德尔率德国选择党迎来大胜!默克尔出面也劝不住

爱吃醋的猫咪
2026-09-08 20:50:37
多地公交重启燃油车,不是新能源落败,残酷现实给行业敲醒警钟

多地公交重启燃油车,不是新能源落败,残酷现实给行业敲醒警钟

你在偷看谁
2026-09-06 21:02:10
女篮世界杯八强赛,中国女篮VS波多黎各开球时间敲定,央视直播

女篮世界杯八强赛,中国女篮VS波多黎各开球时间敲定,央视直播

阿嚼影视评论
2026-09-08 13:38:05
卖惨还是炫富?大厂失业员工哭诉没了工作后家庭年收入从140万降至50万,开始抠搜过日子了!

卖惨还是炫富?大厂失业员工哭诉没了工作后家庭年收入从140万降至50万,开始抠搜过日子了!

黯泉
2026-09-08 18:52:08
中国建设科技有限公司原党委委员、副总经理徐文龙被开除党籍

中国建设科技有限公司原党委委员、副总经理徐文龙被开除党籍

新京报
2026-09-08 17:08:08
广东技术师范大学最狠的地方,不是师范,是把当老师和进企业、进车间放在一张表里

广东技术师范大学最狠的地方,不是师范,是把当老师和进企业、进车间放在一张表里

牛锅巴小钒
2026-09-08 16:45:21
46岁熊黛林太风骚!秀美腿性感撩人,浴袍开叉到大腿根侧躺床上

46岁熊黛林太风骚!秀美腿性感撩人,浴袍开叉到大腿根侧躺床上

八星人
2026-09-07 11:42:30
国家体育总局重磅发声!朱婷拿到145万欧顶薪,郎平能松口气了

国家体育总局重磅发声!朱婷拿到145万欧顶薪,郎平能松口气了

旧史新谭
2026-09-08 18:00:39
4年1.07亿美金!两项生涯新低!离开控卫之神,特纳不香了

4年1.07亿美金!两项生涯新低!离开控卫之神,特纳不香了

微评体育圈
2026-09-08 21:21:55
15万级!吉利“迈巴赫”,9月7日,将上市!

15万级!吉利“迈巴赫”,9月7日,将上市!

电动内参
2026-09-08 13:06:33
甲醛超标!很多人爱囤家里,网友:以前不知道,还以为省钱了

甲醛超标!很多人爱囤家里,网友:以前不知道,还以为省钱了

第一财经资讯
2026-09-07 13:22:17
越南新娘嫁到浙江18年,第一次回娘家,丈夫给了她一箱方便面

越南新娘嫁到浙江18年,第一次回娘家,丈夫给了她一箱方便面

流萤叙情
2025-09-05 18:22:25
2026-09-08 21:52:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16137文章数 67050关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

高一女生在"军训"中遭强制猥亵:他掀我衣服说想亲我

头条要闻

高一女生在"军训"中遭强制猥亵:他掀我衣服说想亲我

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

教育
游戏
艺术
时尚
家居

教育要闻

追求完美一定是优点吗?丨思辨表达与写作

曝又一《怪物猎人》或将登陆NS2!任天堂发布会见?

艺术要闻

吴冠中 一次画了六张富春江,这张1437.5万

看到41岁的苍井优,她们说:不当少女也挺好

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版