端侧大模型这几年一直在突破能力边界。最早大家只关心手机能不能跑一个基础语言模型,后来长文本理解、数学推理、代码生成、多语言能力被一点点压进更小的模型里。现在问题又往前推了一步:Agent能力,能不能也从云端挪到设备本地?
这不是把聊天模型塞进设备那么简单。一个Agent要理解目标、拆任务、调工具、根据反馈改策略,还要在多轮交互里持续把任务往前推。过去这些复杂工作流默认属于云端大模型,但端侧模型能力上来之后,设备侧独立运行开始有了可能。
![]()
2B参数拿下开源第一
9月8日,面壁智能开源了新一代端侧语言基础模型MiniCPM5-2B,把工具调用、深度搜索、代码生成这些智能体核心能力带到了端侧。团队这次开放的也不只是模型权重和算法,还包括部分训练Recipe、自研强化学习框架Meshy、基于奖励的强化学习策略JustRL II,以及一批SFT数据。在当前大模型开源生态里,这套组合并不常见。
根据Artificial Analysis Intelligence Index榜单,MiniCPM5-2B在开源模型类别中排名第一。这个榜单综合了9项评测,覆盖知识推理、代码能力和Agent任务执行等多个维度。结果显示,MiniCPM5-2B以23分领先Gemma 4 12B、Qwen3.5 9B这些参数规模更大的模型。
在衡量Agent工作流的榜单里,MiniCPM5-2B以20分排名第一,领先Granite 4.2 8B的9分、Qwen3.5 9B的7分。推理效率上也有优势,完成单个任务平均只需要约21K output tokens,和同规模模型相比处于较低水平。更值得注意的是,它在真实工作任务评测中拿到了接近人类基准的成绩,端侧模型的能力边界正在从简单问答延伸到真实任务处理。
从预训练就开始为Agent铺路
综合能力评测里,MiniCPM5-2B在多项benchmark测试中平均分达到53.9分,领先Qwen3.5-2B等模型。评测覆盖代码推理、数学推理、工具调用、代码智能体、搜索智能体多个维度,MiniCPM5-2B在多个方向保持均衡,说明提升不是来自单一能力,而是整体能力的增强。
过去提到Agent,大家默认云端大模型才玩得转。MiniCPM5-2B的意义在于把端侧和通用Agent拼在了一起:模型原生支持工具调用、深度搜索、代码生成,并且从预训练阶段就开始为Agent能力铺路,一路贯穿到SFT和大规模强化学习对齐,确保这些能力在实际使用中稳定可靠,而不是能跑但不好用的半成品。
强化学习阶段,MiniCPM5-2B采用了面壁智能自研的强化学习框架Meshy和基于奖励的强化学习策略JustRL II。Meshy在训练框架侧彻底去掉了RL训练的中央控制器和Ray依赖,把训练、推理、奖励计算全部建模到对等服务,利用TransferQueue中的数据就绪状态驱动实际控制流,能在同步、异步、全异步三种训练模式中灵活切换。
算法层面,端侧模型做长思维链强化学习时,训练分数常常不升反降。一方面训练数据噪声多、难度不匹配,奖励信号容易带偏模型;另一方面GRPO信用分配太粗糙,面对上万词元的推理链分不清哪步对、哪步错。JustRL II的解法是:数据上用三阶段流水线筛选校准训练数据,算法上给GRPO装上Critic实现词元级信用分配。在JustRL II加持下,MiniCPM5-2B在RL后训练中获得了显著的性能收益。
本地跑通长文本、简历筛选和网页生成
真实效果怎么样?我们上手测了一下。先让MiniCPM5-2B在本地处理一篇长篇会议纪要,连续提出多个问题,比如本次会议缺席人员是谁、Atlas V2.0正式上线日期是哪一天。结果显示,MiniCPM5-2B能从长文本中提取关键事实,并区分讨论过程与最终结论,给出正确答案,满足日常需求。
接着让它根据5份简历提取每位候选人的姓名、年龄、工作年限、核心技能,整理成结构化表格。MiniCPM5-2B能从多份长文本简历中准确提取关键信息,并完成后续匹配分析。整个过程无需把候选人资料上传云端,模型直接在本地完成文档理解和信息处理。
对企业来说,招聘筛选、资料整理这类任务往往涉及大量敏感信息。端侧Agent的价值就在于让模型具备处理真实业务流程的能力,同时降低数据离开本地带来的安全风险。最后测试了网页生成能力,MiniCPM5-2B能根据简单描述完成页面布局设计和代码生成,产出包含多个功能模块的网页。从这些案例看,MiniCPM5-2B已经开始具备理解任务、处理信息并生成结果的端侧Agent雏形。
0.6B精炼模型做数据治理
除了算法,数据质量正在成为决定模型能力的重要因素。对参数规模有限的端侧模型来说,怎么从海量数据里筛选、提炼高价值信息,直接影响模型能力上限。面壁智能这次进一步公开了支撑MiniCPM5-2B能力提升的数据体系,包括全新的预训练数据处理工具UltraX和三个最新开源的数据集。
UltraX是一个函数调用式的精炼框架,核心思路和过去用大模型端到端重写文本不同:它训练了一个仅0.6B参数的轻量模型,去预测一套结构化的编辑操作,包括保留、删除、替换、插入,然后由确定性的执行器把这些操作实际应用在原始文本上。
传统数据处理是文档级过滤:判断一篇网页文章质量好不好,差就整篇丢掉。但有价值的部分和垃圾内容往往交织在一起,整篇扔掉损失太大。UltraX的做法是让模型像一个精细的编辑,逐行判断这段留、那段删、这句换个说法。这样既避免了端到端重写容易带来的语义漂移和结构破坏,又因为编辑操作本身可保存、可审计,让整个精炼过程完全可追溯,数据被改了什么、为什么改,都有据可查。
效果上,UltraX在FineWeb、RedPajama-v2、AICC等五个主流语料上做了验证。公开数据治理、开源数据集,这在行业里很罕见。面壁智能这次把模型、数据、RL框架和训练方法一起开放,等于把端侧Agent从模型到数据再到训练的全链路都摆到了台面上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.