网易首页 > 网易号 > 正文 申请入驻

Marcaron V1:站在 GLM-5.2 肩膀上教 GLM-5.2 做人

0
分享至


作者黄小艺
微信|H997Hbiu

一个应用公司,突然宣布成立 AI Lab,一般有两种结果。

一种是换个名字、攒几篇 Blog,拿到新的投资,但继续做原来的事儿。

一种是找来训练模型的人,组成新的业务架构,真的去尝试一些实验性的激进的前沿技术路线。

Mind Lab 看起来属于第二种。

2025 年底,个人 Agent Macaron 背后的 AI 公司 Mindverse 宣布成立 Mind Lab,并把它定义成一家 Neo Lab。很多人的第一反应是:怎么Agent 产品公司也要做前沿实验室了?

7 月 22 日,Mind Lab 正式发布并开源 Macaron V1,第一次正面回答了这个问题。

Macaron V1 包括两个版本:旗舰版 Venti(748B)和面向本地部署的 Tall(50B)。其中,Venti 有744B参数来自于GLM-5.2 ,自己训练的只有 4B——四组各约 1B 的 LoRA,分别优化 Chat、Agent、Coding 和 UI。

也就是说,99.47% 的参数已经在那里,Mind Lab 只动了剩下的 0.53%。

但就是这小小的4B,根据 Mind Lab 公布的结果,让 Macaron V1-Venti 在12项评测里全部超过了原始 GLM-5.2,其中7项同时超过 GPT-5.5 和 Claude Opus 4.8,包括 TerminalBench 2.1、PinchBench等。


这个跑分效果想要说明的是,小参数LoRA也能带来前沿模型的性能提升,它也在验证另一件事:模型在发布后,还能通过一组组轻量参数的后训练,持续提升效果。

这刚好撞上了一个突然变热的行业问题:模型如何在进入真实世界后持续学习?

虽然这个话题被提出很久了,但最近,梁文锋把“持续学习”称为继Agent 之后,模型需要突破的下一个问题;Thinking Machines Lab 则用 Inkling 和 Tinker 演示了模型“自己训练自己”并切换新权重的过程,让很多人联想到了它在持续学习领域的潜力。

Mind Lab 想做的也是这件事。V1 的背后,Mind Lab 把 MoL(Mixture-of-LoRA)、近万亿参数模型上的后训练、递归自我改进和多智能体协作这些仍带着实验色彩的要素,组合在了一起。

1

实测:从交互设计到本地执行

在介绍他们在技术上做了哪些有意思的工作前,我们先把玩了一下这个模型。

我们通过 API 给 Macaron V1 -Venti 准备了三项开放测试,分别观察它的 UI4A、前端实现和 Agent 能力,一个核心的感受就是,它执行任务的完整度很高,时间和步骤很长。

实测一:把一段“吃瓜群聊”变成可以玩的界面

第一项测试中,我们让 V1 模拟一个有些诡异的群聊:几个人表面上聊办公室八卦,实际上在生活闲扯里交换暗号,并把整段对话做成 UI4A 界面。

V1 基本理解了“明里吃瓜、暗里对暗号”的双层叙事。它设计了五个群聊成员:有人负责夸张起哄,有人不断追问,有人只说极短的指令。明面上的话题是新同事保温杯里泡了什么,另一层则把时间、人数和行动安排藏进这些闲聊中。

它还给页面增加了一个“解密”按钮。普通状态下,用户看到的是一段节奏很快的办公室群聊;点开解密后,与暗号有关的消息会被重新标注,并显示对应解释。


原本只能从头读到尾的一段文字,因此变成了一个交互小品,游戏趣味性很强。

但不足之处是,解密对话的设计不够精巧,比如“今晚八点,老地方”“三个,都穿黑”,并没有真正藏进生活闲聊。

实测二:完成一个餐厅官网

我们只给出餐厅名 FENNEL,以及“现代小酒馆”的定位,要求模型做一个官网页面,包含餐厅介绍、四类菜单、标签筛选、菜品详情和订位流程。

结果是 V1 对主题的理解相当到位,它从 FENNEL 这个名字出发,把茴香和植物线稿变成贯穿页面的视觉元素,菜单则围绕现代欧洲小酒馆展开,使用大幅留白、精细分隔线和克制的酒红色按钮。

页面的交互逻辑也完全成立,用户可以按素食、无麸质和辛辣筛选菜品,点击菜名后在侧边卡片查看配料和推荐酒款;订位部分则完整走通了日期、人数、时间、姓名和电话的流程。


但最致命的问题在于,菜单把一道含有北非粗麦粉的菜品标成了“无麸质”,没有在交付之前完整地自检文本。

实测三:在本地渲染一艘未来深海潜艇

第三个测试,我们要求 V1 使用 Blender 制作一艘高级质感的未来深海科研潜艇, PBR 材质、体积光、粒子和景深,并交付 Blender 工程与最终渲染图。


单看最终效果,这个案例的完成度不错:深色背景、蓝绿色设备灯和暖色舷窗、船体、推进器和外部设备,有明显的电影概念图质感。

整个任务运行了近40分钟,经历了脚本调试和多轮测试渲染。最终交付给到了一份能继续编辑的 Blender 工程和生成脚本。

这里体现出的能力,是模型能够围绕一个目标持续操作本地环境,在编写代码、运行程序、查看结果和再次修改之间保持任务连续性。

需要说明的是,我们没有使用原始 GLM-5.2 复跑同一组任务,因此这三项测试不能被视为一组严格的 LoRA 增益对照。

但它们至少呈现了 Macaron V1 的能力取向:它擅长把基座已有的文本、代码、工具和视觉能力组织成一条可以交付的行动链。

1

744B 负责能力,4B 负责把能力用对

要理解这种能力从哪里来,就需要回到 Mind Lab 真正训练的 4B 参数。

这 4B 参数采用的 LoRA 技术,在 2021 年就已经被提出,后来又因为 Stable Diffusion 的风格训练被更多人认识。

它通过在训练时冻结基座权重,只在部分网络层旁加入小规模可训练矩阵,用一笔增量修正模型输出。因此,过去它更多被视为全参数后训练的平替方案。

但Mind Lab 想证明的是,它还可以成为前沿模型的正式组成部分。

在Macaron V1 Venti 中,Mind Lab 冻结了 GLM-5.2 的基础权重,并在其上分别训练了四个约 1B 参数的 LoRA 专家,面向 Chat、Agent、Coding 和 UI 四类能力,这套架构称为 MoL(Mixture of LoRA)。


这么做是因为后训练里的能力并不总能和平共处。

聊天需要自然、连贯,Coding 要求精确、克制;Agent 需要持续调用工具,UI 又要求模型同时理解内容、代码和交互协议。如果所有目标都在一组参数里反复拉扯,一种能力提升,另一种可能就在退化。

MoL 的办法很直接:既然训练目标不同,那就分开练。需要新能力时,不必重新合并整台模型,再挂一组 LoRA 就行。

官方评测结果展示了Macaron V1中,多个LoRA对不同场景的匹配。

以TerminalBench为例,由于GLM-5.2 已经掌握了代码、命令和工具调用,LoRA 只需要把模型偶尔做对的操作变得更加稳定,就能获得明显的提升。

但到了SWE Atlas QnA 的测试中,由于它要求 Agent 进入真实工程仓库,通过代码搜索、运行时分析和跨文件推理回答架构问题,基础模型很难通过一组1B参数迅速补齐,最终这一项只提高了0.6分。

这些结果把 LoRA 的能力边界说得很清楚:它更擅长改变模型调用已有能力的方式,补充基座的短板则要困难得多。

先有足够强的 744B,才有值得训练的 4B LoRA。

1

模型发布以后,“经验”还要继续进入参数

既然 LoRA 这么好用,为什么长期以来,它在很多人眼中只是平替,直到当下这个节点?

一个原因是它要求基础模型本身有相当高的智能水平;另一个原因,和Agent的广泛使用有关。

Agent 长期进入工作和生活后,会反复操作同一套工具、阅读同一个代码库,也会不断犯错并接受纠正。这些预训练无法提前获得的经验信息,会直接影响它下一次能否完成任务。

常见处理方式是把这些信息写进 Memory、Skill、知识库或者系统提示词,需要时重新放回上下文,但这仍然属于外部存储和调用,等到下一次推理时,系统需要重新检索、拼接和读取这些材料,也会继续消耗上下文。

而参数训练带来的改变不一样。

一段经验如果被写进了参数,即使 Prompt 里没有再提起它,模型的行为倾向也会改变。这是“记住”和“每次都被提醒”的区别。

考虑到全参数训练的成本摆在那,不可能为每个用户、每个代码库、每个 Agent 分别训一遍 744B 模型,这个时候,LoRA就为这些经验与习惯类的信息,提供了一条中间路径:成本足够低,可以单独训练、保存、加载、评测和回滚,同时直接参与模型内部计算。

当然,Macaron V1 目前交付的四组 LoRA 仍然属于通用能力模块,覆盖 Chat、Agent、Coding 和 UI。 Mind Lab下一步想推进的,才是为每个用户在线训练一组个人 LoRA。

但V1 给出了它的第一步验证:在强基座上的少量参数更新,可以获得稳定收益。

1

为LoRA的持续迭代,搭一套后训练“系统”

如果要进化到为“一户一LoRA”,那么 Mind Lab 必须拥有一套自己的、完善的、稳定的后训练系统。

V1 的背后,就有这样一套系统。

在 V1 中,只训练 0.53% 参数,很容易让人误以为这件事的工程量也只有 0.53%。

实际完全不是。LoRA 省掉的是基座权重的梯度和优化器状态,但 744B 模型本身仍然要完整运行。每生成一次答案、计算一次奖励、更新一次参数,数据都要穿过整台模型。

Agent的长轨迹和模型的 MoE 架构还带来了额外压力:前者让激活保存与反向传播占用大量显存;后者可能因为推理和训练阶段的实现或数值精度不同,使同一个 token 在两次计算中被分配给不同专家,这样一来,训练时重算的概率就不再对应实际生成轨迹,策略梯度也会失真。

Mind Lab 过去八个月的大部分工作,其实都在解决这些问题。

2025 年 12 月,Mind Lab 先在 Kimi K2 上完成万亿参数 LoRA-RL 实验,使用的 GPU 数量约为传统全参数 RL 的 10%;2026 年 1 月发布 MinT,把计算调度、分布式训练、模型状态和故障恢复封装成后训练基础设施; 2 月提出 Context Learning,研究哪些上下文经验值得进入参数;4 月完成 GLM-5 和 GLM-5.1 的 LoRA 训练、DSA 与 MTP 适配;6 月发布 Macaron V1 Preview;7 月连续公开了 LongStraw、UI4A 等长上下文 RL 和生成式界面工作。


这些看起来相对分散的项目,最后在 Macaron V1 上汇合了。

MinT 管理训练、评测、服务和回滚;LongStraw 解决百万 token 级长上下文 RL 的执行问题;R3 对齐生成和训练时的 MoE 专家路由;MindForge 则把生产环境使用的 Agent Harness 带进强化学习,尽量避免模型训练一套、部署以后又换成另一套。

这是一项庞大的系统工程。

1

更新模型的能力,正在成为产品

不止Mind Lab,Thinking Machines Lab 也在探索相似方向。

它推出的 Tinker 是一套 LoRA 训练 API。开发者决定数据、奖励和训练循环,平台负责算力与分布式系统。不同的是,TML 首先面向外部研究者和开发者提供通用训练基础设施,Mind Lab 则同时运营 Macaron Agent,并尝试把 Agent 在真实产品中产生的任务轨迹和用户反馈带回训练循环。

两家公司从不同位置出发,得出了相近判断:越来越强的基础模型会成为起点,模型发布后的更新能力会形成新的竞争层。

这条路线仍有很多问题需要解决。现实反馈经常延迟、模糊甚至互相冲突,模型也可能把偶然偏好写成长期习惯。哪些信息可以进入参数,谁拥有删除权限,模型学坏以后怎样恢复,都需要长期研究和产品验证。

面向每个用户的持续在线学习仍处于未来阶段。但V1的价值在于,把Mind Lab自己所相信的这条技术路线推进成了一套可以训练、评测和运行的工程系统。

如果基础模型会逐渐成为基础设施,那么安全、便宜、持续地修改这些模型,会成为一项独立且重要的能力。

而Mind Lab 想要制造出这种能力。


点个爱心,再走 吧


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
40℃的高温,可乐和冰红茶却“没人要”

40℃的高温,可乐和冰红茶却“没人要”

刺猬公社
2026-08-06 07:38:33
迈阿密国际4-2逆转!获北美联盟杯开门红 梅西2射1传+生涯已进921球

迈阿密国际4-2逆转!获北美联盟杯开门红 梅西2射1传+生涯已进921球

我爱英超
2026-08-06 10:15:22
邓正红软实力哲学:传统粒子物理本体范式危机 底层规则探索带来技术跃迁

邓正红软实力哲学:传统粒子物理本体范式危机 底层规则探索带来技术跃迁

邓正红软实力
2026-08-06 09:39:01
分红实现率背后的较量:保险资管三大流派PK,富卫资管靠什么穿越周期?

分红实现率背后的较量:保险资管三大流派PK,富卫资管靠什么穿越周期?

保观
2026-07-30 16:09:30
床车露营大军,开始白嫖酒店了

床车露营大军,开始白嫖酒店了

旅界Pro
2026-08-06 07:48:36
“他的智商已经不是普通人了”,宝妈公开厌恶天才儿子:只想揍他

“他的智商已经不是普通人了”,宝妈公开厌恶天才儿子:只想揍他

泽泽先生
2026-08-06 11:01:17
24小时四箭齐发,中方强硬拖船,马科斯后路已断,老杜长子已动

24小时四箭齐发,中方强硬拖船,马科斯后路已断,老杜长子已动

我叫汤姆
2026-08-06 08:07:58
“梅姨”真名曝光,案件进入审查起诉阶段 被拐儿童家属:梅姨已经是老年人

“梅姨”真名曝光,案件进入审查起诉阶段 被拐儿童家属:梅姨已经是老年人

红星新闻
2026-08-05 22:07:04
李亚鹏含泪感谢“地铁吐血女孩”胡心瑶为嫣然天使捐99999元:这份捐赠太沉重,尊重其捐赠意愿,个人向胡心瑶和她的病友之家各捐赠99999元

李亚鹏含泪感谢“地铁吐血女孩”胡心瑶为嫣然天使捐99999元:这份捐赠太沉重,尊重其捐赠意愿,个人向胡心瑶和她的病友之家各捐赠99999元

极目新闻
2026-08-06 00:23:22
抢劫刺死19岁少女的死刑改死缓当事人自述:出狱11年间始终刻意躲避被害人家属

抢劫刺死19岁少女的死刑改死缓当事人自述:出狱11年间始终刻意躲避被害人家属

澎湃新闻
2026-08-05 21:18:27
日本网友破防!日本博主实测京沪高铁直言:和新干线不是一个时代

日本网友破防!日本博主实测京沪高铁直言:和新干线不是一个时代

行者聊官
2026-08-05 15:34:08
WTT冠军赛:男单16强全部出炉!国乒2人晋级,陈垣宇3:0大获全胜

WTT冠军赛:男单16强全部出炉!国乒2人晋级,陈垣宇3:0大获全胜

国乒二三事
2026-08-06 13:15:53
于东来真玩过火了!和友人来到汝河河滩湿地,一群老男人玩起打水仗、吃西瓜

于东来真玩过火了!和友人来到汝河河滩湿地,一群老男人玩起打水仗、吃西瓜

火山詩话
2026-08-06 07:46:25
五角大楼一个命令,管到特朗普本届任期届满时!

五角大楼一个命令,管到特朗普本届任期届满时!

新民周刊
2026-08-06 09:18:15
父亲贪腐儿子洗钱,肖军、肖锐父子俩,双双被查处

父亲贪腐儿子洗钱,肖军、肖锐父子俩,双双被查处

大风新闻
2026-08-06 14:37:24
泰航拒载22名中国乘客,安保人员做“拉眼角”动作,泰国机场最新回应:拒绝登机决定由航司作出;亲历者:曾承诺免费改签但没兑现

泰航拒载22名中国乘客,安保人员做“拉眼角”动作,泰国机场最新回应:拒绝登机决定由航司作出;亲历者:曾承诺免费改签但没兑现

都市快报橙柿互动
2026-08-06 08:23:11
离世四年的外国前夫,竟给韦唯留下一手好牌,她自己也没想到

离世四年的外国前夫,竟给韦唯留下一手好牌,她自己也没想到

寒士之言本尊
2026-08-06 12:31:25
云南这个案子,已经不是“恐怖”的问题了

云南这个案子,已经不是“恐怖”的问题了

清书先生
2026-08-06 08:00:16
情况紧急!朱女士获得巨大声援:女儿的985双料班主任力挺,同学纷纷站队,还有陌生姐姐几句话点醒了她

情况紧急!朱女士获得巨大声援:女儿的985双料班主任力挺,同学纷纷站队,还有陌生姐姐几句话点醒了她

火山詩话
2026-08-06 08:34:09
10万级家用家轿对决:2026款朗逸Pro 1.5L对比全新轩逸

10万级家用家轿对决:2026款朗逸Pro 1.5L对比全新轩逸

钟叔驾道
2026-02-26 16:37:16
2026-08-06 15:24:49
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3306文章数 10520关注度
往期回顾 全部

科技要闻

凌晨谷歌AI地震!4位大牛离职 CEO退居二线

头条要闻

男子遭抢劫遇害头部被捅得像个马蜂窝 凶手曾潜逃30年

头条要闻

男子遭抢劫遇害头部被捅得像个马蜂窝 凶手曾潜逃30年

体育要闻

大梦鲨鱼上将尤因:90年代四大中锋有多强

娱乐要闻

ENHYPEN西村力站姐和成员互动被审判

财经要闻

离岸信托的黄昏来了!顶级富豪排队补税

汽车要闻

绅士越野 享界G9是真正兼顾豪华与硬派的方盒子SUV

态度原创

健康
艺术
时尚
手机
旅游

耳鼻喉科专家破解耳石症八大谣言

艺术要闻

冷军少见的风景写生《海风 2005》,卖了172.5万!

运动混搭风再见,今年流行的“阿普瑞风”穿搭太时髦了!

手机要闻

消息称iPhone 18 Pro/Ultra量产遇挑战,苹果紧急抢购DRAM内存

旅游要闻

清凉气候叠加文化体验 云南暑期入境游持续升温

无障碍浏览 进入关怀版