网易首页 > 网易号 > 正文 申请入驻

Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了

0
分享至

7 月 15 日,明星创业公司 Thinking Machines Lab(TML)发布了他们的开放权重模型 Inkling,这是他们成立一年后发布的首款针对持续学习场景的模型。

也是本月,图灵奖得主、强化学习之父 Richard Sutton 下场创业,方向是持续学习 Agent。

「持续学习」已经成了硅谷当下的热门创业赛道。国内这边,也有一些新的创业公司,开始瞄准这个方向,并且推出了一些产品。

本月 21 日,专注于强化学习的实验室 Mind Lab 发布了基于 GLM 5.2 进行后训练的模型 Macaron V1,使用混合 LoRA 架构,原生支持持续学习。

持续学习这件事,也开始在国内成为了一门「显学」赛道。

⬆️关注 Founder Park,最及时最干货的创业分享

Founder Park 正在持续寻找值得被看见的 AI 团队与项目。

我们将通过「AI 产品市集」、内容报道、社群分发等方式,帮你触达早期用户、获得真实反馈,以及建立关键连接。

如果你正在做 AI 相关的事,欢迎和我们聊聊。

01持续学习:让模型用得越多越好用

从 RLHF、RLVR 到思维链再到 Agent,过去两年,模型的智能在持续提升,思维链和推理扩展让模型学会了「慢思考」,Agent 框架则通过工具调用、规划和记忆,把模型能处理的任务范围又往外推了一层。

但有一个问题是,这些能力提升要么发生在部署之前(pre-training、post-training),要么在运行时靠外部机制补充(prompt、memory、RAG、harness)。模型本身的参数,训完就不会有变动了。

Mind Lab 在官方博客中把这些外部补充手段统称为「提示词空间的迭代」——prompt、memory、RAG、skill、harness,本质上都是在参数不变的前提下,通过调整上下文和执行流程来利用经验。这条路径走出了今天几乎所有的 Agent 产品,但它有一个结构性约束:经验保存在模型之外,每次使用时必须被重新读取、重新理解随着经验积累,上下文越来越长,记忆可能相互冲突,规则和检查不断叠加,执行成本持续上升。

更麻烦的是,把信息放进 context 不等于模型掌握了其中的规律。模型缺某项能力时,再多的 prompt 也补不上。

所谓持续学习,走的是另一条路:「参数空间的迭代」。把经验直接写进模型的可训练状态,模型面对相似任务时直接给出更合适的判断,不用每次从上下文重新读一遍。一个 Coding Agent 反复接触的代码规范,一个个人助理逐渐确认的用户偏好,都可以通过训练沉淀成稳定的行为。Mind Lab 管这个叫构建「经验智能机器」——模型的能力不再停在训练结束的那一刻,用得越多,越好用。

两条路径不是替代关系。事实可以继续放在 context、memory 和 RAG 里,验证过的操作流程可以存成 skill 和工具,反复出现、相对稳定的行为变化,才适合写进可训练参数。

参数空间的迭代本身不新鲜,SFT 和 RLHF 就是。但过去的后训练,数据、奖励、流程,全都靠人。持续学习要做的,是让训练这件事在部署之后自己转起来:模型行动,获得经验,找到信号,写回参数。

目前还没有团队把这个循环完全跑通,但一些新的尝试开始得到了验证。

02怎么做持续学习,硅谷有了不少新的尝试

2025 年 4 月,Sutton 和 AlphaGo 前首席研究员 David Silver 联合发表《Welcome to the Era of Experience》,判断 AI 的下一阶段能力,主要不会再来自继续吸收人类已有的数据,而是来自 Agent 自己在真实环境中行动、获取反馈、持续学习。Sutton 把这称为「经验时代」,和之前靠人类数据喂出来的「数据时代」做了区分。

2026 年 7 月,Sutton 亲自下场创业,创办 Oak Lab,从目前透露的信息看,方向正是低成本、高效持续学习的万亿参数 Agent 模型。

Thinking Machines Lab(TML)也在验证同一条路线。这家公司 2025 年 2 月由 Mira Murati 创办,五个月后完成约 20 亿美元融资,估值 120 亿美元,投资方包括 a16z、Nvidia 和 AMD。主打产品 Tinker 是面向研究者的模型微调 API,采用 LoRA 高效微调,支持 Qwen、DeepSeek、Kimi 等一系列开源模型,普林斯顿、斯坦福、伯克利的团队已经在用。

TML 的首席科学家 John Schulman(OpenAI 联合创始人、PPO 算法发明者)在 2025 年 10 月发表的《LoRA Without Regret》中给出了一个关键结论:在大多数后训练场景下,LoRA 的样本效率和最终性能与全参数微调完全一致。他把这种情况称为「低遗憾区间」(low-regret regime),发现它覆盖了绝大多数实际的后训练任务。在强化学习场景中,即便是 rank-1 的 LoRA(最小的配置)也能匹配全参数微调的效果。

这篇论文扭转了行业对 LoRA 的认知:效果几乎无损,还能独立训练、独立部署、随时回滚。持续学习在工程上能成立,前提就是这个。

7 月 15 日,TML 交出了自己的第一个模型 Inkling:975B 总参数的 MoE 开放权重模型,激活 41B,原生支持文本、图像、音频,上下文最长 100 万 token。官方说得很坦率,Inkling 不是今天最强的模型,即使在开源模型里也不是;它的定位是一个适合微调定制的基座,发布当天就能在 Tinker 上训。

LoRA 推动者不只有研究机构。Fireworks AI(估值 175 亿美元)已经能在一个基座模型上托管数百个 LoRA,根据每次请求动态选择 adapter;Together AI(刚完成 8 亿美元 C 轮,估值 83 亿美元)也将 LoRA 设为默认微调方式。

还有一些收购案例。过去一年,三家后训练方向的创业公司先后被大厂吃掉:Predibase(Google、Uber AI 团队成员创办,开发了开源 LoRA 服务框架 LoRAX)2025 年 7 月被 Rubrik 收购;OpenPipe(把生产日志自动转成微调数据)2025 年 9 月被 CoreWeave 收购;Adaptive ML(强化学习后训练的 RLOps 平台,Index Ventures、ICONIQ 投资)2026 年 6 月被 Datadog 收购。大厂的意图很明确,后训练是基础设施级的能力,值得买下来。

「基础模型 + 大量 LoRA + 持续学习和切换」的产业链正在形成。

03Mind Lab:把 LoRA 做成持续学习的入口

Mind Lab 成立于 2025 年 10 月,是心洲科技(Mindverse)旗下的前沿研究实验室。今年年初,Mindverse 完成累计 5000 万美元 A 轮融资,美团领投,元禾璞华、韶音、变量资本跟投,历史股东包括蚂蚁、源一、红杉中国、真格、高榕等。

早在 2023 年,Mind Lab 创始人 Andrew Chen 就与 Karthik Narasimhan(GPT-1 作者之一)、姚顺雨合作发表了 FireAct,第一篇用参数学习提升 Agent 能力的工作:把 Agent 的任务轨迹直接写进模型参数,减少对 few-shot 示例的依赖,单次执行时间从 9.0 秒降到 2.7 秒。

Mindverse 在 2025 年发布的 C 端产品 Macaron 是一个个人 AI 助理,要服务千人千面的用户,团队实践下来的体会是:光靠 prompt 和记忆做不到,个性化最终要落到模型层面。

Schulman 的论文认为 LoRA 在后训练中不打折扣,但持续学习的要求更苛刻:万亿参数的超大规模上还站得住吗?学习单元能压到多小?Mind Lab 其实比 TML 更早拿到了类似的结论。团队说,2025 年 9 月他们在大规模 MoE 模型上验证了 LoRA 强化学习无损,「做出这个结果时我们第一反应是怀疑自己。直到 TML 随后发了《LoRA Without Regret》,结论完全一致,我们反而踏实了。」

Mind Lab 的论文《On the Scaling of PEFT》把这个结论推得更远。在万亿参数的稀疏 MoE 模型(基于 Kimi K2,总参数 1.04 万亿,激活 326 亿)上,LoRA 强化学习跑通了,算力压到全参数微调的约 10%,训练曲线保持稳定。压缩极限也比预期更低:轻量适配模块可以压到 rank-1,每层只保留一个可调方向,仍然稳定可靠。

意料之外的发现是「群体智能」。在一组控制实验中,从相同的 Qwen3-30B 出发,保持训练目标和方法一致,只改变数据顺序和 masking,训出一批不同的 adapter。单个 adapter 在 AIME24 上的准确率是 36.44%,198 个不同 adapter 多数投票后提升到 48.67%——从同一个 adapter 重复采样,只能到 43.78%。不同学习轨迹带来的差异,包含超出普通采样的互补性。这个发现让团队很兴奋:「挂上去的模型越多,整体智能稳定往上走,差不多是一个自然对数 scale 的线性提升。」模型数量本身成了一个新的 scaling 维度。

Mind Lab 由此给了 LoRA 一个新定位:「持久的本地状态」。共享的基础模型管通用能力,adapter 管每个具体实例的个性化行为。

04Macaron V1:2M 上下文,首个基于 GLM-5.2 完成后训练的模型

过去一年,Mind Lab 发布了不少成果:2025 年 12 月在 Kimi K2 上的万亿参数验证,2026 年 1 月的后训练基础设施 MinT,6 月的 Macaron-V1-Preview,再到 7 月的长上下文方案 LongStraw 和 Agent RL 训练框架 MindForge。Macaron V1 是这些成果的集中呈现。

V1 采用 Mixture-of-LoRA(MoL)架构:在冻结的 GLM-5.2 基座模型(744B 参数)上搭载四个 1B 的 LoRA 专家,分别负责对话(Chat)、智能体(Agent)、编程(Coding)和生成式 UI(UI4A)。新能力以插件式 LoRA 加入,不动摇已有知识,不同来源的专家可以在同一个基座上组合和路由。需要模型学新东西时,训一个新 LoRA 插进去就行,不用碰整个模型。

在大规模基座上做强化学习本身就是高门槛的事。30B 参数的模型做强化学习相对容易,参数量级到千亿、万亿,训练难度指数级上升。强化学习最麻烦的问题之一是训推不一致,训练和推理的精度偏差会漂移累积,导致结果无法收敛;万亿参数的 MoE 模型分布在多张 GPU 上,要保证不同切片之间的通信和并行计算全部以同样的精度高度对齐。据 Mind Lab 称,目前全球能在万亿参数规模上同时跑数百个 LoRA 强化学习训练的团队,只有他们和 TML


V1 在个人生活与生成式 UI 任务上超过或持平 Opus 4.8、GPT 5.5 等前沿基线,

编程任务与前沿水平接近。

国内的开源生态也对 Mind Lab 有不少助力。V1 旗舰版 Venti 基于 GLM-5.2 构建,原生支持 2M 超长上下文。轻量版 Tall(35B 级)基于通义千问构建,此前的验证实验用的是 Kimi K2。不需要从头训练基座,直接站在国内头部基模公司的肩膀上做后训练。

使用 Macaron v1 生成的喜茶风格的交互页面。

目前官方 API 已开放体验:https://mintcn.macaron.xin/

配套的 macaron-artifacts 插件可以在 Claude Code 里直接看到模型渲染的生成式 UI。

05以前卖的是 Token,未来卖的是学习能力

官方介绍说,Mind Lab 的商业化也从 7 月开始,两周内实现了 1000 万美金 ARR。

而且交付的,并不是单纯的推理能力和模型算力,是让模型在客户场景中的持续成长。科学研究、复杂工业、高知识密度行业都有类似的困境,通用模型很难天然理解所有任务,客户又未必愿意把核心数据交给基模公司重新训练。持续学习提供了第三条路:在通用模型基础上,用轻量训练构建专属能力,数据和模型版本都由客户自己管理。

而 LoRA 的成本弹性让这件事在商业上站得住,团队的说法是,最小的个人级 LoRA「用一个人一个月的数据去训,可能就是几十美金」;最大的、追平全参数效果的企业级 LoRA,也不过几万到几十万美金。目前公司已与国内的头部手机厂商和 AI 硬件公司建立了合作。

Mind Lab 内部有一句话:「我们希望训练模型这件事,最后能像调用模型一样简单。会用 Token,就能训 Token。」

离这个愿景还有距离。早期合作仍需要公司与客户共同定义训练目标,Mind Lab 正在尝试把训练脚本、数据处理、评估与交付逐步交给 Agent 完成,目标是让持续学习成为可以规模化使用的模型能力,不靠堆售前和定制人力,真正实现模型和 Agent 能力的自进化。

而在 Inkling 的发布演示里,TML 也让模型自己用 Tinker 写微调任务、跑训练、换上新权重,全程没有人插手。殊途同归。

方向很明确,但技术今天还没收敛。

从经验中找到可靠的学习信号仍是未解问题,现实反馈延迟、模糊、难以归因,模型的自我反思可能出错;持续更新还带来了稳定性问题,新经验可能覆盖旧能力,学什么、不学什么,本身就需要判断力。正如梁文锋所说,目前「全世界都还没有找到好的方法」。

但基模公司之外,一批专门做后训练、帮模型和 Agent 变强的公司正在冒出来,Mind Lab、TML、Oak Lab 走的都是这条路。基座模型管通用智能,至于怎么让模型在具体场景里持续变强,这活儿基模公司不一定自己干,也不一定干得最好。



转载原创文章请添加微信:founderparker

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杜塞主教练自嘲"教不了樊振东,只能教德语":全队敬畏到不敢搭话,8月22日红袍首秀

杜塞主教练自嘲"教不了樊振东,只能教德语":全队敬畏到不敢搭话,8月22日红袍首秀

好乒乓
2026-07-30 18:34:17
临港四年跌两百万,最怕的不是房价下跌,而是把规划当现钱

临港四年跌两百万,最怕的不是房价下跌,而是把规划当现钱

林子说事
2026-07-31 00:15:42
日本作家东野圭吾去世,易中天发悼文,项立刚:我咋不知道这个人

日本作家东野圭吾去世,易中天发悼文,项立刚:我咋不知道这个人

许三岁
2026-07-30 11:21:43
女性偷腥后当晚与丈夫同房是什么感觉?一位39岁的女人说出实情

女性偷腥后当晚与丈夫同房是什么感觉?一位39岁的女人说出实情

混音情感
2026-07-30 15:15:48
短跑飞人韦永丽大婚,老公是国家队队医,袁琦琦担任伴娘

短跑飞人韦永丽大婚,老公是国家队队医,袁琦琦担任伴娘

米修体育
2026-07-30 15:28:20
中午12点!亚足联官宣2030年世预赛赛程,国足亮相时间正式确定

中午12点!亚足联官宣2030年世预赛赛程,国足亮相时间正式确定

兵哥篮球故事
2026-07-30 18:27:10
医生发现:7种食物最能长肌肉,第一名多数人家里没有

医生发现:7种食物最能长肌肉,第一名多数人家里没有

新时代的两性情感
2026-07-30 01:30:39
曾被骂“吉卜力最差”,20年后《地海传说》还能翻盘吗?

曾被骂“吉卜力最差”,20年后《地海传说》还能翻盘吗?

渡川5
2026-07-30 09:01:37
奥尼尔:只有2个人隔扣过我,一个2米08,一个1米98

奥尼尔:只有2个人隔扣过我,一个2米08,一个1米98

篮球大视野
2026-07-30 15:17:22
中国女子泰国被群殴全面失控!泰网民持续辱华,旅游局也下场拱火

中国女子泰国被群殴全面失控!泰网民持续辱华,旅游局也下场拱火

青烟小先生
2026-07-30 14:20:31
微胖反而更长寿!研究:40岁后这个体重是“长寿黄金点”,很多人没达标

微胖反而更长寿!研究:40岁后这个体重是“长寿黄金点”,很多人没达标

人民日报健康客户端
2026-07-30 07:36:20
日本改组内阁,小泉进次郎、茂木敏充、片山皋月位子都应不保

日本改组内阁,小泉进次郎、茂木敏充、片山皋月位子都应不保

锅锅爱历史
2026-07-30 14:45:00
康佳创投发展(深圳)有限公司原经理郭奕绵被查

康佳创投发展(深圳)有限公司原经理郭奕绵被查

界面新闻
2026-07-30 12:26:06
中方必须无条件割让领土?美发话后,马来西亚叫嚣:中国放弃南海

中方必须无条件割让领土?美发话后,马来西亚叫嚣:中国放弃南海

梦在深巷aqa
2026-07-31 02:01:50
公务员大势已定不出意外的话,未来6年,体制内或将出现巨大变化

公务员大势已定不出意外的话,未来6年,体制内或将出现巨大变化

马蹄烫嘴说美食
2026-07-30 08:49:11
中共中央决定:罗文任河北省委书记,倪岳峰另有任用

中共中央决定:罗文任河北省委书记,倪岳峰另有任用

政知新媒体
2026-07-31 09:44:46
一些既得利益者理直气壮的认为自己退休金高,是多缴多得的结果!

一些既得利益者理直气壮的认为自己退休金高,是多缴多得的结果!

奇葩游戏酱
2026-07-25 00:37:48
因没给小姑子盛饭,老公抬手给我一巴掌,我当着全家的面拨打110

因没给小姑子盛饭,老公抬手给我一巴掌,我当着全家的面拨打110

荷兰豆爱健康
2026-07-30 15:49:21
今明两年,持有多套房的家庭,可能会面临三个麻烦

今明两年,持有多套房的家庭,可能会面临三个麻烦

职场资深秘书
2026-07-31 09:40:21
因妻子爱吃甜品,浙江男子从银行辞职开面包店;开了9年后发帖求助,网友积极支招:这么好的店,不能倒

因妻子爱吃甜品,浙江男子从银行辞职开面包店;开了9年后发帖求助,网友积极支招:这么好的店,不能倒

台州交通广播
2026-07-30 21:14:31
2026-07-31 10:28:49
FounderPark incentive-icons
FounderPark
关注AI创业,专注和创业者聊真问题
1288文章数 163关注度
往期回顾 全部

科技要闻

苹果财报亮眼:产品卖得太好 芯片开始不够

头条要闻

龙正才被查 曾在问政节目公开承认公车私用:见怪不怪

头条要闻

龙正才被查 曾在问政节目公开承认公车私用:见怪不怪

体育要闻

曝皇马将签罗德里!转会费6000万签约4年

娱乐要闻

李小璐澄清夜宿门,被网友质疑想洗白

财经要闻

打新日确认!宇树科技IPO冲刺“冰与火”

汽车要闻

FREELANDER神行者8下线 8月10日开启预售/海外版同步推进

态度原创

游戏
教育
亲子
旅游
公开课

PS5模拟器重大突破 多款3D游戏能以可玩帧率运行

教育要闻

初中数学解方程:y²-y=3080

亲子要闻

敖润姑姑给咕咕嘎嘎制作机器狗

旅游要闻

江苏扬州:博物馆里长见识

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版