网易首页 > 网易号 > 正文 申请入驻

Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了

0
分享至

AI新浪潮观察

11min read

Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了

Founder Park2026/09/28


摘要

MindLab想把训模型这件事变得像用模型一样简单。

本文首发于 Founder Park 公众号 · 2026 年 7 月 25 日

7 月 15 日,明星创业公司 Thinking Machines Lab(TML)发布了他们的开放权重模型 Inkling,这是他们成立一年后发布的首款针对持续学习场景的模型。

也是本月,图灵奖得主、强化学习之父 Richard Sutton 下场创业,方向是持续学习 Agent。

「持续学习」已经成了硅谷当下的热门创业赛道。国内这边,也有一些新的创业公司,开始瞄准这个方向,并且推出了一些产品。

本月 21 日,专注于强化学习的实验室 Mind Lab 发布了基于 GLM 5.2 进行后训练的模型 Macaron V1,使用混合 LoRA 架构,原生支持持续学习。

持续学习这件事,也开始在国内成为了一门「显学」赛道。

Founder Park 正在持续寻找值得被看见的 AI 团队与项目。

我们将通过「AI 产品市集」、内容报道、社群分发等方式,帮你触达早期用户、获得真实反馈,以及建立关键连接。

如果你正在做 AI 相关的事,欢迎和我们聊聊。


01持续学习:让模型用得越多越好用

从 RLHF、RLVR 到思维链再到 Agent,过去两年,模型的智能在持续提升,思维链和推理扩展让模型学会了「慢思考」,Agent 框架则通过工具调用、规划和记忆,把模型能处理的任务范围又往外推了一层。

但有一个问题是,这些能力提升要么发生在部署之前(pre-training、post-training),要么在运行时靠外部机制补充(prompt、memory、RAG、harness)。模型本身的参数,训完就不会有变动了。

Mind Lab 在官方博客中把这些外部补充手段统称为「提示词空间的迭代」——prompt、memory、RAG、skill、harness,本质上都是在参数不变的前提下,通过调整上下文和执行流程来利用经验。这条路径走出了今天几乎所有的 Agent 产品,但它有一个结构性约束:经验保存在模型之外,每次使用时必须被重新读取、重新理解。随着经验积累,上下文越来越长,记忆可能相互冲突,规则和检查不断叠加,执行成本持续上升。

更麻烦的是,把信息放进 context 不等于模型掌握了其中的规律。模型缺某项能力时,再多的 prompt 也补不上。

所谓持续学习,走的是另一条路:「参数空间的迭代」。把经验直接写进模型的可训练状态,模型面对相似任务时直接给出更合适的判断,不用每次从上下文重新读一遍。一个 Coding Agent 反复接触的代码规范,一个个人助理逐渐确认的用户偏好,都可以通过训练沉淀成稳定的行为。Mind Lab 管这个叫构建「经验智能机器」——模型的能力不再停在训练结束的那一刻,用得越多,越好用。

两条路径不是替代关系。事实可以继续放在 context、memory 和 RAG 里,验证过的操作流程可以存成 skill 和工具,反复出现、相对稳定的行为变化,才适合写进可训练参数。

参数空间的迭代本身不新鲜,SFT 和 RLHF 就是。但过去的后训练,数据、奖励、流程,全都靠人。持续学习要做的,是让训练这件事在部署之后自己转起来:模型行动,获得经验,找到信号,写回参数。

目前还没有团队把这个循环完全跑通,但一些新的尝试开始得到了验证。


02怎么做持续学习,硅谷有了不少新的尝试

2025 年 4 月,Sutton 和 AlphaGo 前首席研究员 David Silver 联合发表《Welcome to the Era of Experience》,判断 AI 的下一阶段能力,主要不会再来自继续吸收人类已有的数据,而是来自 Agent 自己在真实环境中行动、获取反馈、持续学习。Sutton 把这称为「经验时代」,和之前靠人类数据喂出来的「数据时代」做了区分。

2026 年 7 月,Sutton 亲自下场创业,创办 Oak Lab,从目前透露的信息看,方向正是低成本、高效持续学习的万亿参数 Agent 模型。

Thinking Machines Lab(TML)也在验证同一条路线。这家公司 2025 年 2 月由 Mira Murati 创办,五个月后完成约 20 亿美元融资,估值 120 亿美元,投资方包括 a16z、Nvidia 和 AMD。主打产品 Tinker 是面向研究者的模型微调 API,采用 LoRA 高效微调,支持 Qwen、DeepSeek、Kimi 等一系列开源模型,普林斯顿、斯坦福、伯克利的团队已经在用。

TML 的首席科学家 John Schulman(OpenAI 联合创始人、PPO 算法发明者)在 2025 年 10 月发表的《LoRA Without Regret》中给出了一个关键结论:在大多数后训练场景下,LoRA 的样本效率和最终性能与全参数微调完全一致。他把这种情况称为「低遗憾区间」(low-regret regime),发现它覆盖了绝大多数实际的后训练任务。在强化学习场景中,即便是 rank-1 的 LoRA(最小的配置)也能匹配全参数微调的效果。

这篇论文扭转了行业对 LoRA 的认知:效果几乎无损,还能独立训练、独立部署、随时回滚。持续学习在工程上能成立,前提就是这个。

7 月 15 日,TML 交出了自己的第一个模型 Inkling:975B 总参数的 MoE 开放权重模型,激活 41B,原生支持文本、图像、音频,上下文最长 100 万 token。官方说得很坦率,Inkling 不是今天最强的模型,即使在开源模型里也不是;它的定位是一个适合微调定制的基座,发布当天就能在 Tinker 上训。

LoRA 推动者不只有研究机构。Fireworks AI(估值 175 亿美元)已经能在一个基座模型上托管数百个 LoRA,根据每次请求动态选择 adapter;Together AI(刚完成 8 亿美元 C 轮,估值 83 亿美元)也将 LoRA 设为默认微调方式。

还有一些收购案例。过去一年,三家后训练方向的创业公司先后被大厂吃掉:Predibase(Google、Uber AI 团队成员创办,开发了开源 LoRA 服务框架 LoRAX)2025 年 7 月被 Rubrik 收购;OpenPipe(把生产日志自动转成微调数据)2025 年 9 月被 CoreWeave 收购;Adaptive ML(强化学习后训练的 RLOps 平台,Index Ventures、ICONIQ 投资)2026 年 6 月被 Datadog 收购。大厂的意图很明确,后训练是基础设施级的能力,值得买下来。

「基础模型 + 大量 LoRA + 持续学习和切换」的产业链正在形成。


03Mind Lab:把 LoRA 做成持续学习的入口

Mind Lab 成立于 2025 年 10 月,是心洲科技(Mindverse)旗下的前沿研究实验室。今年年初,Mindverse 完成累计 5000 万美元 A 轮融资,美团领投,元禾璞华、韶音、变量资本跟投,历史股东包括蚂蚁、源一、红杉中国、真格、高榕等。

早在 2023 年,Mind Lab 创始人 Andrew Chen 就与 Karthik Narasimhan(GPT-1 作者之一)、姚顺雨合作发表了 FireAct,第一篇用参数学习提升 Agent 能力的工作:把 Agent 的任务轨迹直接写进模型参数,减少对 few-shot 示例的依赖,单次执行时间从 9.0 秒降到 2.7 秒。

Mindverse 在 2025 年发布的 C 端产品 Macaron 是一个个人 AI 助理,要服务千人千面的用户,团队实践下来的体会是:光靠 prompt 和记忆做不到,个性化最终要落到模型层面。

Schulman 的论文认为 LoRA 在后训练中不打折扣,但持续学习的要求更苛刻:万亿参数的超大规模上还站得住吗?学习单元能压到多小?Mind Lab 其实比 TML 更早拿到了类似的结论。团队说,2025 年 9 月他们在大规模 MoE 模型上验证了 LoRA 强化学习无损,「做出这个结果时我们第一反应是怀疑自己。直到 TML 随后发了《LoRA Without Regret》,结论完全一致,我们反而踏实了。」

Mind Lab 的论文《On the Scaling of PEFT》把这个结论推得更远。在万亿参数的稀疏 MoE 模型(基于 Kimi K2,总参数 1.04 万亿,激活 326 亿)上,LoRA 强化学习跑通了,算力压到全参数微调的约 10%,训练曲线保持稳定。压缩极限也比预期更低:轻量适配模块可以压到 rank-1,每层只保留一个可调方向,仍然稳定可靠。

意料之外的发现是「群体智能」。在一组控制实验中,从相同的 Qwen3-30B 出发,保持训练目标和方法一致,只改变数据顺序和 masking,训出一批不同的 adapter。单个 adapter 在 AIME24 上的准确率是 36.44%,198 个不同 adapter 多数投票后提升到 48.67%——从同一个 adapter 重复采样,只能到 43.78%。不同学习轨迹带来的差异,包含超出普通采样的互补性。这个发现让团队很兴奋:「挂上去的模型越多,整体智能稳定往上走,差不多是一个自然对数 scale 的线性提升。」模型数量本身成了一个新的 scaling 维度。

Mind Lab 由此给了 LoRA 一个新定位:「持久的本地状态」。共享的基础模型管通用能力,adapter 管每个具体实例的个性化行为。


04Macaron V1:2M 上下文,首个基于 GLM-5.2 完成后训练的模型

过去一年,Mind Lab 发布了不少成果:2025 年 12 月在 Kimi K2 上的万亿参数验证,2026 年 1 月的后训练基础设施 MinT,6 月的 Macaron-V1-Preview,再到 7 月的长上下文方案 LongStraw 和 Agent RL 训练框架 MindForge。Macaron V1 是这些成果的集中呈现。

V1 采用 Mixture-of-LoRA(MoL)架构:在冻结的 GLM-5.2 基座模型(744B 参数)上搭载四个 1B 的 LoRA 专家,分别负责对话(Chat)、智能体(Agent)、编程(Coding)和生成式 UI(UI4A)。新能力以插件式 LoRA 加入,不动摇已有知识,不同来源的专家可以在同一个基座上组合和路由。需要模型学新东西时,训一个新 LoRA 插进去就行,不用碰整个模型。

在大规模基座上做强化学习本身就是高门槛的事。30B 参数的模型做强化学习相对容易,参数量级到千亿、万亿,训练难度指数级上升。强化学习最麻烦的问题之一是训推不一致,训练和推理的精度偏差会漂移累积,导致结果无法收敛;万亿参数的 MoE 模型分布在多张 GPU 上,要保证不同切片之间的通信和并行计算全部以同样的精度高度对齐。据 Mind Lab 称,目前全球能在万亿参数规模上同时跑数百个 LoRA 强化学习训练的团队,只有他们和 TML。


V1 在个人生活与生成式 UI 任务上超过或持平 Opus 4.8、GPT 5.5 等前沿基线,

编程任务与前沿水平接近。

国内的开源生态也对 Mind Lab 有不少助力。V1 旗舰版 Venti 基于 GLM-5.2 构建,原生支持 2M 超长上下文。轻量版 Tall(35B 级)基于通义千问构建,此前的验证实验用的是 Kimi K2。不需要从头训练基座,直接站在国内头部基模公司的肩膀上做后训练。

使用 Macaron v1 生成的喜茶风格的交互页面。

目前官方 API 已开放体验:https://mintcn.macaron.xin/

配套的 macaron-artifacts 插件可以在 Claude Code 里直接看到模型渲染的生成式 UI。


05以前卖的是 Token,未来卖的是学习能力

官方介绍说,Mind Lab 的商业化也从 7 月开始,两周内实现了 1000 万美金 ARR。

而且交付的,并不是单纯的推理能力和模型算力,是让模型在客户场景中的持续成长。科学研究、复杂工业、高知识密度行业都有类似的困境,通用模型很难天然理解所有任务,客户又未必愿意把核心数据交给基模公司重新训练。持续学习提供了第三条路:在通用模型基础上,用轻量训练构建专属能力,数据和模型版本都由客户自己管理。

而 LoRA 的成本弹性让这件事在商业上站得住,团队的说法是,最小的个人级 LoRA「用一个人一个月的数据去训,可能就是几十美金」;最大的、追平全参数效果的企业级 LoRA,也不过几万到几十万美金。目前公司已与国内的头部手机厂商和 AI 硬件公司建立了合作。

Mind Lab 内部有一句话:「我们希望训练模型这件事,最后能像调用模型一样简单。会用 Token,就能训 Token。」

离这个愿景还有距离。早期合作仍需要公司与客户共同定义训练目标,Mind Lab 正在尝试把训练脚本、数据处理、评估与交付逐步交给 Agent 完成,目标是让持续学习成为可以规模化使用的模型能力,不靠堆售前和定制人力,真正实现模型和 Agent 能力的自进化。

而在 Inkling 的发布演示里,TML 也让模型自己用 Tinker 写微调任务、跑训练、换上新权重,全程没有人插手。殊途同归。

方向很明确,但技术今天还没收敛。

从经验中找到可靠的学习信号仍是未解问题,现实反馈延迟、模糊、难以归因,模型的自我反思可能出错;持续更新还带来了稳定性问题,新经验可能覆盖旧能力,学什么、不学什么,本身就需要判断力。正如梁文锋所说,目前「全世界都还没有找到好的方法」。

但基模公司之外,一批专门做后训练、帮模型和 Agent 变强的公司正在冒出来,Mind Lab、TML、Oak Lab 走的都是这条路。基座模型管通用智能,至于怎么让模型在具体场景里持续变强,这活儿基模公司不一定自己干,也不一定干得最好。



转载原创文章请添加微信:founderparker

FounderParkAIAGI

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国时装界大佬枪杀亚裔妻后自尽,玩“金融赌博”输掉1个亿,精神迅速崩溃

美国时装界大佬枪杀亚裔妻后自尽,玩“金融赌博”输掉1个亿,精神迅速崩溃

译言
2026-10-04 14:56:14
央视曝光后,湖南、湖北、云南等地开展核查处置

央视曝光后,湖南、湖北、云南等地开展核查处置

政知新媒体
2026-10-04 19:48:01
郑钦文中网第3轮时间确定!对决赛会18号种子,时隔2年再冲16强

郑钦文中网第3轮时间确定!对决赛会18号种子,时隔2年再冲16强

全景体育V
2026-10-04 19:21:09
苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

快科技
2026-10-04 17:28:04
孙千一口黄牙坐在CELINE秀场头排,旁边人牙白得反光,她愣是没贴片

孙千一口黄牙坐在CELINE秀场头排,旁边人牙白得反光,她愣是没贴片

西楼知趣杂谈
2026-10-04 17:52:11
快讯!“台独”分子赖清德发表声明了!

快讯!“台独”分子赖清德发表声明了!

做个平凡的轩友
2026-10-04 16:48:27
今天亚运会闭幕式现场,亚奥理事会宣布了本届最有价值女运动员。

今天亚运会闭幕式现场,亚奥理事会宣布了本届最有价值女运动员。

果妈聊娱乐
2026-10-04 16:52:57
空姐下跪新后续:东航报警,男乘客找到了!除了社死,还有三大噩耗等着他…

空姐下跪新后续:东航报警,男乘客找到了!除了社死,还有三大噩耗等着他…

潇拾亿郎
2026-10-04 17:37:08
菲律宾警方突袭查获244名外籍涉诈人员,多为中国籍

菲律宾警方突袭查获244名外籍涉诈人员,多为中国籍

风向观察
2026-10-04 16:03:09
巴西大选今日投票!卢拉对阵前总统之子,双方民调胶着谁将胜出

巴西大选今日投票!卢拉对阵前总统之子,双方民调胶着谁将胜出

红星新闻
2026-10-04 18:10:02
11.78万 !丰田新车正式上市

11.78万 !丰田新车正式上市

科技堡垒
2026-10-04 11:10:43
台湾可以保留自己的军队,大陆不派一兵一卒进台

台湾可以保留自己的军队,大陆不派一兵一卒进台

小马姨
2026-10-04 17:17:00
美国已保不住日本,俄罗斯通告全球:中国的一切都在按照计划进行

美国已保不住日本,俄罗斯通告全球:中国的一切都在按照计划进行

兵鉴史
2026-10-04 11:23:10
44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

追影客栈
2026-10-03 16:08:17
网红“慧慧饱饱”被封号:一年内多次翻车,这次平台直接清空了她的主页;巅峰期年收入近千万,单条广告报价10万元

网红“慧慧饱饱”被封号:一年内多次翻车,这次平台直接清空了她的主页;巅峰期年收入近千万,单条广告报价10万元

蓬勃新闻
2026-10-04 15:26:38
财政部部长蓝佛安:推进消费税征收环节后移并稳步下划地方、地方附加税改革等,支持地方拓展税源

财政部部长蓝佛安:推进消费税征收环节后移并稳步下划地方、地方附加税改革等,支持地方拓展税源

界面新闻
2026-10-01 13:02:49
中方决定撤离援助后,对中国的态度立马变了

中方决定撤离援助后,对中国的态度立马变了

麓谷隐士
2026-10-04 00:15:04
10万游客涌入5万人口的青海祁连县城致酒店满房,当地紧急安排免费宿舍,游客:-4℃住进暖气房,祁连上大分!

10万游客涌入5万人口的青海祁连县城致酒店满房,当地紧急安排免费宿舍,游客:-4℃住进暖气房,祁连上大分!

极目新闻
2026-10-04 17:31:17
田馥甄直播称“现在讲话要小心” 曾因立场争议被下架作品

田馥甄直播称“现在讲话要小心” 曾因立场争议被下架作品

东方不败然多多
2026-10-03 21:38:25
拿斧头砍机长的副驾驶身份披露,发了3000条“仇女”消息

拿斧头砍机长的副驾驶身份披露,发了3000条“仇女”消息

中国新闻周刊
2026-10-04 11:40:23
2026-10-04 21:23:00
极客公园
极客公园
让最棒的创新成为头条
12873文章数 78947关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

“成都天价回锅肉3片卖105”登上热搜 商家回应

头条要闻

“成都天价回锅肉3片卖105”登上热搜 商家回应

体育要闻

“小将”吴曦,中国的莫德里奇

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

亲子
艺术
旅游
健康
公开课

亲子要闻

带孩子出游的三个规矩,你做到了吗?

艺术要闻

弗兰茨·亨宁森:19世纪丹麦著名的现实主义画家

旅游要闻

“重走长征路”上热搜!“长征游”圈粉年轻人

刷酸祛痘,为什么有人翻车?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版