网易首页 > 网易号 > 正文 申请入驻

Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了

0
分享至

7 月 15 日,明星创业公司 Thinking Machines Lab(TML)发布了他们的开放权重模型 Inkling,这是他们成立一年后发布的首款针对持续学习场景的模型。

也是本月,图灵奖得主、强化学习之父 Richard Sutton 下场创业,方向是持续学习 Agent。

「持续学习」已经成了硅谷当下的热门创业赛道。国内这边,也有一些新的创业公司,开始瞄准这个方向,并且推出了一些产品。

本月 21 日,专注于强化学习的实验室 Mind Lab 发布了基于 GLM 5.2 进行后训练的模型 Macaron V1,使用混合 LoRA 架构,原生支持持续学习。

持续学习这件事,也开始在国内成为了一门「显学」赛道。

⬆️关注 Founder Park,最及时最干货的创业分享

Founder Park 正在持续寻找值得被看见的 AI 团队与项目。

我们将通过「AI 产品市集」、内容报道、社群分发等方式,帮你触达早期用户、获得真实反馈,以及建立关键连接。

如果你正在做 AI 相关的事,欢迎和我们聊聊。

01持续学习:让模型用得越多越好用

从 RLHF、RLVR 到思维链再到 Agent,过去两年,模型的智能在持续提升,思维链和推理扩展让模型学会了「慢思考」,Agent 框架则通过工具调用、规划和记忆,把模型能处理的任务范围又往外推了一层。

但有一个问题是,这些能力提升要么发生在部署之前(pre-training、post-training),要么在运行时靠外部机制补充(prompt、memory、RAG、harness)。模型本身的参数,训完就不会有变动了。

Mind Lab 在官方博客中把这些外部补充手段统称为「提示词空间的迭代」——prompt、memory、RAG、skill、harness,本质上都是在参数不变的前提下,通过调整上下文和执行流程来利用经验。这条路径走出了今天几乎所有的 Agent 产品,但它有一个结构性约束:经验保存在模型之外,每次使用时必须被重新读取、重新理解。随着经验积累,上下文越来越长,记忆可能相互冲突,规则和检查不断叠加,执行成本持续上升。

更麻烦的是,把信息放进 context 不等于模型掌握了其中的规律。模型缺某项能力时,再多的 prompt 也补不上。

所谓持续学习,走的是另一条路:「参数空间的迭代」。把经验直接写进模型的可训练状态,模型面对相似任务时直接给出更合适的判断,不用每次从上下文重新读一遍。一个 Coding Agent 反复接触的代码规范,一个个人助理逐渐确认的用户偏好,都可以通过训练沉淀成稳定的行为。Mind Lab 管这个叫构建「经验智能机器」——模型的能力不再停在训练结束的那一刻,用得越多,越好用。

两条路径不是替代关系。事实可以继续放在 context、memory 和 RAG 里,验证过的操作流程可以存成 skill 和工具,反复出现、相对稳定的行为变化,才适合写进可训练参数。

参数空间的迭代本身不新鲜,SFT 和 RLHF 就是。但过去的后训练,数据、奖励、流程,全都靠人。持续学习要做的,是让训练这件事在部署之后自己转起来:模型行动,获得经验,找到信号,写回参数。

目前还没有团队把这个循环完全跑通,但一些新的尝试开始得到了验证。

02怎么做持续学习,硅谷有了不少新的尝试

2025 年 4 月,Sutton 和 AlphaGo 前首席研究员 David Silver 联合发表《Welcome to the Era of Experience》,判断 AI 的下一阶段能力,主要不会再来自继续吸收人类已有的数据,而是来自 Agent 自己在真实环境中行动、获取反馈、持续学习。Sutton 把这称为「经验时代」,和之前靠人类数据喂出来的「数据时代」做了区分。

2026 年 7 月,Sutton 亲自下场创业,创办 Oak Lab,从目前透露的信息看,方向正是低成本、高效持续学习的万亿参数 Agent 模型。

Thinking Machines Lab(TML)也在验证同一条路线。这家公司 2025 年 2 月由 Mira Murati 创办,五个月后完成约 20 亿美元融资,估值 120 亿美元,投资方包括 a16z、Nvidia 和 AMD。主打产品 Tinker 是面向研究者的模型微调 API,采用 LoRA 高效微调,支持 Qwen、DeepSeek、Kimi 等一系列开源模型,普林斯顿、斯坦福、伯克利的团队已经在用。

TML 的首席科学家 John Schulman(OpenAI 联合创始人、PPO 算法发明者)在 2025 年 10 月发表的《LoRA Without Regret》中给出了一个关键结论:在大多数后训练场景下,LoRA 的样本效率和最终性能与全参数微调完全一致。他把这种情况称为「低遗憾区间」(low-regret regime),发现它覆盖了绝大多数实际的后训练任务。在强化学习场景中,即便是 rank-1 的 LoRA(最小的配置)也能匹配全参数微调的效果。

这篇论文扭转了行业对 LoRA 的认知:效果几乎无损,还能独立训练、独立部署、随时回滚。持续学习在工程上能成立,前提就是这个。

7 月 15 日,TML 交出了自己的第一个模型 Inkling:975B 总参数的 MoE 开放权重模型,激活 41B,原生支持文本、图像、音频,上下文最长 100 万 token。官方说得很坦率,Inkling 不是今天最强的模型,即使在开源模型里也不是;它的定位是一个适合微调定制的基座,发布当天就能在 Tinker 上训。

LoRA 推动者不只有研究机构。Fireworks AI(估值 175 亿美元)已经能在一个基座模型上托管数百个 LoRA,根据每次请求动态选择 adapter;Together AI(刚完成 8 亿美元 C 轮,估值 83 亿美元)也将 LoRA 设为默认微调方式。

还有一些收购案例。过去一年,三家后训练方向的创业公司先后被大厂吃掉:Predibase(Google、Uber AI 团队成员创办,开发了开源 LoRA 服务框架 LoRAX)2025 年 7 月被 Rubrik 收购;OpenPipe(把生产日志自动转成微调数据)2025 年 9 月被 CoreWeave 收购;Adaptive ML(强化学习后训练的 RLOps 平台,Index Ventures、ICONIQ 投资)2026 年 6 月被 Datadog 收购。大厂的意图很明确,后训练是基础设施级的能力,值得买下来。

「基础模型 + 大量 LoRA + 持续学习和切换」的产业链正在形成。

03Mind Lab:把 LoRA 做成持续学习的入口

Mind Lab 成立于 2025 年 10 月,是心洲科技(Mindverse)旗下的前沿研究实验室。今年年初,Mindverse 完成累计 5000 万美元 A 轮融资,美团领投,元禾璞华、韶音、变量资本跟投,历史股东包括蚂蚁、源一、红杉中国、真格、高榕等。

早在 2023 年,Mind Lab 创始人 Andrew Chen 就与 Karthik Narasimhan(GPT-1 作者之一)、姚顺雨合作发表了 FireAct,第一篇用参数学习提升 Agent 能力的工作:把 Agent 的任务轨迹直接写进模型参数,减少对 few-shot 示例的依赖,单次执行时间从 9.0 秒降到 2.7 秒。

Mindverse 在 2025 年发布的 C 端产品 Macaron 是一个个人 AI 助理,要服务千人千面的用户,团队实践下来的体会是:光靠 prompt 和记忆做不到,个性化最终要落到模型层面。

Schulman 的论文认为 LoRA 在后训练中不打折扣,但持续学习的要求更苛刻:万亿参数的超大规模上还站得住吗?学习单元能压到多小?Mind Lab 其实比 TML 更早拿到了类似的结论。团队说,2025 年 9 月他们在大规模 MoE 模型上验证了 LoRA 强化学习无损,「做出这个结果时我们第一反应是怀疑自己。直到 TML 随后发了《LoRA Without Regret》,结论完全一致,我们反而踏实了。」

Mind Lab 的论文《On the Scaling of PEFT》把这个结论推得更远。在万亿参数的稀疏 MoE 模型(基于 Kimi K2,总参数 1.04 万亿,激活 326 亿)上,LoRA 强化学习跑通了,算力压到全参数微调的约 10%,训练曲线保持稳定。压缩极限也比预期更低:轻量适配模块可以压到 rank-1,每层只保留一个可调方向,仍然稳定可靠。

意料之外的发现是「群体智能」。在一组控制实验中,从相同的 Qwen3-30B 出发,保持训练目标和方法一致,只改变数据顺序和 masking,训出一批不同的 adapter。单个 adapter 在 AIME24 上的准确率是 36.44%,198 个不同 adapter 多数投票后提升到 48.67%——从同一个 adapter 重复采样,只能到 43.78%。不同学习轨迹带来的差异,包含超出普通采样的互补性。这个发现让团队很兴奋:「挂上去的模型越多,整体智能稳定往上走,差不多是一个自然对数 scale 的线性提升。」模型数量本身成了一个新的 scaling 维度。

Mind Lab 由此给了 LoRA 一个新定位:「持久的本地状态」。共享的基础模型管通用能力,adapter 管每个具体实例的个性化行为。

04Macaron V1:2M 上下文,首个基于 GLM-5.2 完成后训练的模型

过去一年,Mind Lab 发布了不少成果:2025 年 12 月在 Kimi K2 上的万亿参数验证,2026 年 1 月的后训练基础设施 MinT,6 月的 Macaron-V1-Preview,再到 7 月的长上下文方案 LongStraw 和 Agent RL 训练框架 MindForge。Macaron V1 是这些成果的集中呈现。

V1 采用 Mixture-of-LoRA(MoL)架构:在冻结的 GLM-5.2 基座模型(744B 参数)上搭载四个 1B 的 LoRA 专家,分别负责对话(Chat)、智能体(Agent)、编程(Coding)和生成式 UI(UI4A)。新能力以插件式 LoRA 加入,不动摇已有知识,不同来源的专家可以在同一个基座上组合和路由。需要模型学新东西时,训一个新 LoRA 插进去就行,不用碰整个模型。

在大规模基座上做强化学习本身就是高门槛的事。30B 参数的模型做强化学习相对容易,参数量级到千亿、万亿,训练难度指数级上升。强化学习最麻烦的问题之一是训推不一致,训练和推理的精度偏差会漂移累积,导致结果无法收敛;万亿参数的 MoE 模型分布在多张 GPU 上,要保证不同切片之间的通信和并行计算全部以同样的精度高度对齐。据 Mind Lab 称,目前全球能在万亿参数规模上同时跑数百个 LoRA 强化学习训练的团队,只有他们和 TML。


V1 在个人生活与生成式 UI 任务上超过或持平 Opus 4.8、GPT 5.5 等前沿基线,

编程任务与前沿水平接近。

国内的开源生态也对 Mind Lab 有不少助力。V1 旗舰版 Venti 基于 GLM-5.2 构建,原生支持 2M 超长上下文。轻量版 Tall(35B 级)基于通义千问构建,此前的验证实验用的是 Kimi K2。不需要从头训练基座,直接站在国内头部基模公司的肩膀上做后训练。

使用 Macaron v1 生成的喜茶风格的交互页面。

目前官方 API 已开放体验:https://mintcn.macaron.xin/

配套的 macaron-artifacts 插件可以在 Claude Code 里直接看到模型渲染的生成式 UI。

05以前卖的是 Token,未来卖的是学习能力

官方介绍说,Mind Lab 的商业化也从 7 月开始,两周内实现了 1000 万美金 ARR。

而且交付的,并不是单纯的推理能力和模型算力,是让模型在客户场景中的持续成长。科学研究、复杂工业、高知识密度行业都有类似的困境,通用模型很难天然理解所有任务,客户又未必愿意把核心数据交给基模公司重新训练。持续学习提供了第三条路:在通用模型基础上,用轻量训练构建专属能力,数据和模型版本都由客户自己管理。

而 LoRA 的成本弹性让这件事在商业上站得住,团队的说法是,最小的个人级 LoRA「用一个人一个月的数据去训,可能就是几十美金」;最大的、追平全参数效果的企业级 LoRA,也不过几万到几十万美金。目前公司已与国内的头部手机厂商和 AI 硬件公司建立了合作。

Mind Lab 内部有一句话:「我们希望训练模型这件事,最后能像调用模型一样简单。会用 Token,就能训 Token。」

离这个愿景还有距离。早期合作仍需要公司与客户共同定义训练目标,Mind Lab 正在尝试把训练脚本、数据处理、评估与交付逐步交给 Agent 完成,目标是让持续学习成为可以规模化使用的模型能力,不靠堆售前和定制人力,真正实现模型和 Agent 能力的自进化。

而在 Inkling 的发布演示里,TML 也让模型自己用 Tinker 写微调任务、跑训练、换上新权重,全程没有人插手。殊途同归。

方向很明确,但技术今天还没收敛。

从经验中找到可靠的学习信号仍是未解问题,现实反馈延迟、模糊、难以归因,模型的自我反思可能出错;持续更新还带来了稳定性问题,新经验可能覆盖旧能力,学什么、不学什么,本身就需要判断力。正如梁文锋所说,目前「全世界都还没有找到好的方法」。

但基模公司之外,一批专门做后训练、帮模型和 Agent 变强的公司正在冒出来,Mind Lab、TML、Oak Lab 走的都是这条路。基座模型管通用智能,至于怎么让模型在具体场景里持续变强,这活儿基模公司不一定自己干,也不一定干得最好。



转载原创文章请添加微信:founderparker

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
诺奖评委:诺贝尔奖评奖不看顶刊论文

诺奖评委:诺贝尔奖评奖不看顶刊论文

必记本
2026-10-05 20:34:44
国庆高速充电"内战"爆发:纯电车主排5小时,怒斥增程车抢桩

国庆高速充电"内战"爆发:纯电车主排5小时,怒斥增程车抢桩

刘哥谈体育
2026-10-04 13:32:36
“看似丰盛,其实毫无蛋白质!”中学女儿营养餐,给人看无语了

“看似丰盛,其实毫无蛋白质!”中学女儿营养餐,给人看无语了

熙熙说教
2026-09-25 14:31:02
韩国"MZ巫女"怒怼恶评者:你们骂我,是穷得只剩这点多巴胺

韩国"MZ巫女"怒怼恶评者:你们骂我,是穷得只剩这点多巴胺

追星雷达站
2026-10-04 16:49:10
最新!上海的消费也绷不住了——

最新!上海的消费也绷不住了——

叶初七
2026-10-06 16:03:27
火遍全网后,谭警官陷入抑郁,离开体制又离婚,如今活成了这样

火遍全网后,谭警官陷入抑郁,离开体制又离婚,如今活成了这样

奇怪的鲨鱼们
2026-10-06 10:33:24
女篮亚青赛出线形势!中日韩澳4队提前晋级:中国日本收官战争第1

女篮亚青赛出线形势!中日韩澳4队提前晋级:中国日本收官战争第1

篮球快餐车
2026-10-06 10:22:05
老公被洗脑了?27万的奥迪Q5L不买,要买24.98万的汉兰达双擎

老公被洗脑了?27万的奥迪Q5L不买,要买24.98万的汉兰达双擎

侃故事的阿庆
2026-10-04 09:18:38
亲眼目睹藏族少女天葬之行,参加全过程后心悸:颠覆我对生死的认知

亲眼目睹藏族少女天葬之行,参加全过程后心悸:颠覆我对生死的认知

古怪奇谈录
2025-09-09 14:36:35
54岁瞿颖满头白发扎马尾,这状态不是明星,是活明白了!

54岁瞿颖满头白发扎马尾,这状态不是明星,是活明白了!

做一个合格的吃瓜群众
2026-10-06 07:41:01
从3万狂跌到8000!广州新塘彻底熄火,数十万买家亏光首付

从3万狂跌到8000!广州新塘彻底熄火,数十万买家亏光首付

爱看剧的阿峰
2026-10-06 03:12:03
穆里尼奥彻底镇不住!皇马亿元巨星失控摆烂,全队上下无人能管

穆里尼奥彻底镇不住!皇马亿元巨星失控摆烂,全队上下无人能管

奶盖熊本熊
2026-10-06 07:44:27
落幕!小宝结束WNBA赛季 数据大幅下滑 或回归WCBA争冠?

落幕!小宝结束WNBA赛季 数据大幅下滑 或回归WCBA争冠?

林子说事
2026-10-06 14:19:04
孙心然遭争议改判科普:广告牌闪烁是否算干扰 死球后申诉是否合理?

孙心然遭争议改判科普:广告牌闪烁是否算干扰 死球后申诉是否合理?

醉卧浮生
2026-10-06 11:50:00
智谱暴跌80%后怒涨8%,高盛高呼翻倍,但三大问题需要警惕

智谱暴跌80%后怒涨8%,高盛高呼翻倍,但三大问题需要警惕

金石随笔
2026-10-06 15:48:42
钱再多有什么用?自曝不想活后,王嘉尔的现状,给所有男星提了醒

钱再多有什么用?自曝不想活后,王嘉尔的现状,给所有男星提了醒

精彩背后的故事
2026-10-06 11:37:53
杭州商K集体停业,投资2亿的顶端商K豪华门头一片漆黑

杭州商K集体停业,投资2亿的顶端商K豪华门头一片漆黑

Mr王的饭后茶
2026-09-23 09:32:37
10月抽到上上签!年底前清空负债,余钱越攒越多的3个生肖

10月抽到上上签!年底前清空负债,余钱越攒越多的3个生肖

毅谈生肖
2026-10-06 11:50:33
解放军台海有大动作,美放狠话:中国若敢打击美国本土,后果自负

解放军台海有大动作,美放狠话:中国若敢打击美国本土,后果自负

明天后天大后天
2026-10-05 02:42:37
一篇内参让领导人反思,中央由此取消副总理级专机,她究竟写了什么

一篇内参让领导人反思,中央由此取消副总理级专机,她究竟写了什么

瑾瑜聊情感
2025-08-23 09:43:36
2026-10-06 18:03:00
FounderPark incentive-icons
FounderPark
关注AI创业,专注和创业者聊真问题
1296文章数 163关注度
往期回顾 全部

科技要闻

光遗传学是什么,为什么这项发现如此重要

头条要闻

贵州女子五天爬完五岳 当事人:耗时最长的是华山

头条要闻

贵州女子五天爬完五岳 当事人:耗时最长的是华山

体育要闻

30天30队·雄鹿:没有扬尼斯,重新试错吧

娱乐要闻

身家千万独居的王曼昱,私底下有多壕

财经要闻

杨植麟断腕:Kimi的至暗时刻与远征

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

游戏
旅游
本地
公开课
军事航空

龙与地下城新游《术士》缩小开放世界 减少手把手引导

旅游要闻

“泰山躲雨80元一小时”冲上热搜,泰山景区辟谣:国庆前五天景区零降水,且要求商家对游客避雨不得收费

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

也门政府军称收复红海港口城市穆哈

无障碍浏览 进入关怀版