网易首页 > 网易号 > 正文 申请入驻

Karpathy说还要十年,可这条路已经挤满了人

0
分享至

编辑|Panda


最近我们报道了不少剑指「持续学习」方向的创业公司和研究成果,比如《Mind Lab 连续发布 LoRA 最新进展,大模型「持续学习」新范式浮现》、《告别 KV Cache 枷锁,将长上下文压入权重,持续学习大模型有希望了?》、《ICML 2026 | 突破极限!港大提出首个适配 300+任务的持续学习架构,破解遗忘难题》、《能让 DeepSeek 自进化的 Harness!LlamaFactory 作者开源新工具:0.2 元自动造 Agent》、《当「变大」不再是唯一的路,又一国产模型开源了》……

是的,相当密集,「持续学习」也正在成为我们最常遭遇的关键词之一。而这背后也昭示着一个被反复念叨的判断。

2025 年 10 月,Andrej Karpathy 在 Dwarkesh Patel 的播客里说:当下的大模型「没有持续学习。你没法告诉它一件事,然后指望它记住」,他认为把这些认知缺陷补齐,大概还要花上十年。两个月后,他在年度回顾里把这句话放进了更大的图景:2025 年模型能力的跃迁主要来自可验证奖励强化学习(RLVR),但整个 LLM 技术栈里,记忆、多模态感知、持续学习、操作电脑的能力仍是明显的短板,「我们有原型,但还没有能当同事用的智能体」。



持续学习(Continual Learning,也叫终身学习/Lifelong Learning)由此成了过去一年里最热的概念之一。

它指的是模型在部署之后,还能像人一样从新任务、新知识、新经验里持续吸收,并且不把之前学会的东西忘掉。

这件事听上去理所当然,做起来却极难,难到足以成为通往「AI 同事」路上最硬的一块骨头。而上面那一串报道也说明,这条路已经不是一个方向,而是好几条岔开的路线在同时往前拱。

围绕怎么让模型「边用边学」,学术界和产业界这一年里岔出了好几条互不相同的技术路线。有的往模型外面挂记忆,有的持续改写权重,有的干脆重新预训练,还有一批更新的思路试图重新定义「学习」这件事本身。这篇文章尝试把这些方向逐一摊开,说清楚每条路在赌什么、卡在哪里。

先说清楚:难的不是「学」,是「不忘」

持续学习的核心障碍有一个专门的名字:灾难性遗忘(catastrophic forgetting)。神经网络的知识存储在数十亿个权重里,当你用新数据去微调模型、更新这些权重时,模型学会新任务的同时,往往会覆盖掉承载旧能力的那部分参数,导致在之前擅长的任务上性能骤降。



灾难性遗忘示意图。当人工深度神经网络顺序地在两个任务上进行训练时,它会在训练第二个任务时迅速且彻底地遗忘第一个任务。

这个现象在小模型时代就有大量研究,但到了 LLM 身上出现了新的麻烦。TRACE 这个专门评测 LLM 持续学习的基准发现,对一个已经对齐好的模型做连续微调,不仅会让它忘掉旧任务,还会连带损害通用能力和指令跟随能力。换句话说,你想教模型一件新事,代价可能是它整体变笨、变得不听话。

正因为直接改权重风险这么大,「持续学习」才分裂成了好几个流派。它们的根本分歧,其实就是在「改不改权重」以及「在哪里存新知识」这两个问题上做了不同的取舍。

把记忆挂在模型外面

最直接、也最快落地的思路是:干脆不动模型权重,把新知识存到模型外部的一个数据库里,需要时再检索回上下文。这条路线从 RAG(检索增强生成)一路演化而来,如今已经长成了一个专门的领域:智能体记忆(Agent Memory)。

代表性工作是 MemGPT(其背后公司现已更名 Letta)。它把 LLM 的上下文管理类比成操作系统的内存管理,区分出有限的「工作上下文」和更大的「外部存储」,让模型像操作系统调度内存那样,自己决定什么该调进上下文、什么该写回归档。

沿着这个思路,一批系统各有侧重:Mem0 主打生产级、可规模化的长期记忆存取;Zep 在检索之上加了时序知识图谱,用来处理跨会话的时间推理;A-MEM 借鉴卡片盒笔记法(Zettelkasten),给每条记忆打上结构化标签并自动关联到相关旧条目,让检索更贴合上下文。

Karpathy 本人也押注这个方向。他反复强调,未来需要的不是「更大的硬盘」式记忆,而是一个精简的「认知内核」(cognitive core,他估计一两 B 参数就够)外加一套会自己复利增长的结构化外部记忆。

基于这一思路,他在 GitHub 上发布了一个叫「LLM Wiki」的模式:不再每次查询都用 RAG 去捞原始文本块,而是让智能体主动把资料编纂成一个持续更新、互相链接的知识库,之后再去查询它。



Karpathy 的 LLM Wiki 文档已经收获了近 4.5 万 star,也已被 fork 9 千多次

Letta 自己则把这套东西上升成了「token 空间里的持续学习」这一命题。他们指出,今天默认的做法是「先追加、再摘要」,即把原始经验一直堆到上下文溢出,再压缩成摘要,这有两个毛病:追加把所有表征工作都推到了推理时,每次前向传播都要重新处理原始日志;而摘要是有损且突兀的,重要细节会毫无预警地消失。Letta 的赌注是,未来在 token 空间里学到的记忆,会比模型权重本身更有价值。

这个方向的长处是安全、可控、可解释,改错了随时能删;短处是它本质上没有真正把知识「内化」进模型,每次都要靠检索和上下文这道窄门,一旦记忆库膨胀,检索精度和成本都会成为瓶颈。

让上下文自己进化成「攻略手册」

从外挂记忆再往前走一步,是一类更精巧的思路:不改权重,但让模型输入的上下文本身持续进化。这被称作上下文工程(Context Engineering)。

2025 年 10 月,斯坦福、SambaNova 和 UC 伯克利提出的 ACE(Agentic Context Engineering)是其中的代表。它把上下文当作一本会不断成长的「攻略手册」(playbook),通过三个分工角色来维护:Generator 负责生成推理轨迹,Reflector 从成功和失败里提炼具体经验,Curator 把这些经验整理成结构化的增量更新,合并进手册。



ACE 想解决的是同类方法的两个通病。一是「简洁偏好」(brevity bias):让 LLM 反复重写上下文时,它倾向于压缩、丢掉领域细节;二是「上下文坍缩」(context collapse):反复重写会让细节逐渐流失。

ACE 用增量式的小改动(delta updates)而非整段重写来规避这两点。据论文数据,ACE 在智能体任务上相比基线提升 10.6%、金融推理上提升 8.6%,同时把适配延迟降了约 86.9%;在 AppWorld 榜单上,用较小的开源模型 DeepSeek-V3.1 配上 ACE,平均分能追平基于 GPT-4.1 的生产级智能体 IBM CUGA。

值得注意的是,ACE 强调它能在没有标注监督的情况下工作;它靠的是执行过程中天然产生的反馈信号(比如代码跑通还是报错)来指导反思和整理。这让它和「智能体从自己的经验里学」这条更大的叙事接上了头。

持续后训练:改权重,但要改得聪明

外挂记忆和上下文工程回避了改权重的风险,但也回避了真正的知识内化。另一派研究者认为,长期来看,有些知识和技能终究得写进参数里才够用。这就是持续后训练(Continual Post-training),主要分成持续指令微调、持续偏好对齐等阶段。

Thinking Machines 的 John Schulman 给出过一个分层的看法:他把学习类比成心理学里的运动学习、情景记忆和程序性记忆几类,认为上下文学习会继续处理好短程的学习任务,而参数微调(包括 LoRA 这类方法)会叠在上面,尤其适合那些需要较大容量、要真正吸收知识的任务——时间跨度一长,上下文学习不够用时,参数微调就赢了。

这条路线最大的敌人依然是灾难性遗忘,而近期一个有意思的解法来自 Thinking Machines 的 Tinker。



Tinker 是他们 2025 年 10 月发布的第一款产品,一个基于 LoRA 的微调 API,把分布式训练的复杂度抽象掉,只暴露 forward_backward、optim_step 这类底层原语,让研究者专注于数据和算法。

在持续学习上,他们主推一套叫自蒸馏微调(SDFT)的配方:核心洞察是,普通的监督微调是「离策略」(off-policy)的,模型被迫去模仿一些它自己根本不会生成的 token,于是每学一个新技能都会侵蚀旧能力;SDFT 让模型充当自己的老师,从示范中学新技能而不忘旧的。一家叫 Trajectory 的创业公司已经把 Tinker 当作其持续学习平台的核心基础设施。

顺带一提,Tinker 用 LoRA 而非全量微调,还有个务实的好处:多个微调任务可以共享同一个算力池,成本被摊薄。这也解释了为什么「持续学习即服务」正在成为一门生意:把频繁的模型更新变成一个可以按需调用的 API,正是产业界当下的尝试方向。

重新预训练与持续预训练

如果说后训练是在模型的「表层」动刀,那么持续预训练(Continual Pre-training, CPT)就是回到最底层,用新的语料继续预训练模型,让它适应新的领域、新的语言或随时间漂移的知识分布。相比把新旧数据混在一起从头重训一遍,CPT 建立在已有模型的基础上,算力上要划算得多。

它的典型用武之地有三种:知识随时间漂移、跨语言扩展、跨领域适配。但代价同样明确:多项实证研究反复表明,持续预训练计算成本高昂,且容易引发对已学知识的灾难性遗忘。也因此,学界一直在找「免重放、免任务标注」的持续预训练方法,试图在 LLM 规模上做到不遗忘。

对绝大多数公司而言,从头重新预训练一个前沿模型的成本高到不现实,这正是 Karpathy 那句「大模型不适合频繁重训」的由来。所以严格意义上的「重新预训练」更多是前沿实验室内部的选项,而持续预训练则是一个更可行的折中。

更新的思路:让模型学会自我修改

前面四个方向,多少还是在「外挂 vs 改权重」的二元框架里打转。而最近一年冒出的一批新工作,试图跳出这个框架,重新定义学习本身。

一条思路是让模型自己生成训练数据、自己决定怎么更新自己。

MIT 的SEAL(Self-Adapting Language Models)就是典型。给定一个新输入,模型会生成一段「自我编辑」(self-edit);这是一段自然语言指令,说明了该怎么重构信息、用什么超参数去更新权重,甚至调用什么工具来做数据增强;然后模型据此微调自己,形成持久的权重更新。而「怎样的自我编辑才有效」这件事,由一个外层强化学习循环来训练,奖励信号就是更新后模型在下游任务上的表现。



NeurIPS 2025 版本进一步证明了这套自适应能力会随模型规模变大而增强,并借助强化学习缓解了遗忘。它的作者展望的是一种能在推理中途自己判断「要不要现在学一下」的模型,把一次性的思维链蒸馏成永久的能力。

另一条更激进的思路来自 Google 的嵌套学习(Nested Learning),发表于 NeurIPS 2025。它的核心是把一个模型重新理解成一组彼此嵌套、多层次、各自带着不同「上下文流」和不同更新频率的优化问题——架构和优化算法在这个视角下被统一成了同一件事的不同层级。



作为概念验证,他们做了一个叫 Hope 的自我修改架构,它在 Titans 长期记忆架构基础上做了两点扩展:无上限的嵌套学习层级,以及一套「连续记忆系统」(CMS)。简单来说,不再只是短期/长期记忆的二分,而是一整个跨时间尺度更新的记忆模块谱系。



实验里 Hope 在语言建模、长上下文推理和持续学习任务上都优于标准 Transformer 和现代循环模型 。有意思的是,还有后续工作给这类架构引入了「睡眠」阶段——像人类在睡眠中巩固记忆那样,让模型在活跃会话之间抽出算力,把有用的抽象蒸馏进更持久的参数记忆。

再往上抽象,是 David Silver 和 Richard Sutton 提出的「经验时代」(Era of Experience)叙事。



他们的判断是:在数学、代码、科学这些关键领域,从人类数据里能榨取的知识正在逼近上限,要继续往前,得让 AI 从自己与环境交互产生的经验里持续学习,形成一个自我供给数据的闭环。他们把 2024 年 DeepMind 的 AlphaProof(通过「与形式化证明系统的持续交互」拿到 IMO 奖牌)视作这个时代的开端。这条叙事把持续学习和强化学习、智能体自主探索绑到了一起,也埋下了一个尚未解决的问题:谁来设计那些把原始信号变成有用指引的奖励函数。

此外还有一个容易和持续学习混淆、但目标不同的邻近方向:知识编辑(Knowledge Editing)。以 ROME、MEMIT 为代表,它通过定位并修改存储特定事实的 MLP 层,做到精准的单条或批量事实更新,而无需全量重训 。但它和持续学习的目标其实不一样——知识编辑追求的是精确覆盖某个事实,在连续、终身编辑的场景下,反复的参数改动会互相干扰、逐渐累积「毒性」导致模型坍缩,这也催生了 WISE、AlphaEdit 等一批专门应对序列化编辑的方法。



结语

把这几个方向摊在一起看,会发现它们其实是沿着一根「知识存在哪里」的轴线排开的。



最外侧是外挂记忆和上下文工程,知识完全存在模型之外的 token 空间里,安全可控但没有真正内化;中间是持续后训练和持续预训练,知识被写进权重,能力上限更高但要直面灾难性遗忘;最里侧、也最前沿的,是让模型自我修改、自我进化的那批新思路,试图让「学习」这个动作本身变成模型能力的一部分。

一个务实的观察是:这些方向大概率不是互斥的,而是会分层协作。Schulman 的分层学习观、Karpathy 的「认知内核 + 外部记忆」构想,本质上都在说同一件事:短程、易变的知识交给上下文和外挂记忆,长程、需要沉淀的能力交给参数微调,各司其职。ACE 能在无监督下靠执行反馈进化、SEAL 用强化学习去优化自我编辑,则都在暗示一个共同的趋势:未来的持续学习,很可能是让模型自己来主导「学什么、怎么学」。

那么回到 Karpathy 那个「还要十年」的判断,持续学习到底解决了没有?答案恐怕是——还没有,但已经不再是一片空白。灾难性遗忘这个核心障碍至今没有被彻底攻克,SDFT、嵌套学习这些方法都还是在「缓解」而非「消除」它。纯靠更好的上下文管理加微调能不能解决持续学习,还是需要全新的想法?这个更根本的问题连 Schulman 自己都坦承尚无定论。

可以确定的是,2025 到 2026 这段时间,持续学习从一个被反复念叨的「缺失能力」,变成了一个真正岔出多条路线、且开始有创业公司下场做产品的活跃战场。哪条路能率先把「AI 同事」从原型变成现实,值得接着盯下去。

https://www.lesswrong.com/posts/qBsj6HswdmP6ahaGB/andrej-karpathy-on-llm-cognitive-deficits

https://karpathy.bearblog.dev/year-in-review-2025/

https://www.letta.com/blog/continual-learning/

https://arxiv.org/abs/2510.04618

https://arxiv.org/abs/2402.01364

https://thinkingmachines.ai/tinker/

https://arxiv.org/pdf/2604.05096

https://arxiv.org/pdf/2606.03979

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
隐忍一年,两名海警烈士名单公布!美菲该懂了,中国主权绝不妥协

隐忍一年,两名海警烈士名单公布!美菲该懂了,中国主权绝不妥协

何轐说
2026-08-08 20:07:52
国务院关于出境入境管理的规定(全文)

国务院关于出境入境管理的规定(全文)

澎湃新闻
2026-07-31 17:31:07
原子弹炸后宣称百年寸草不生,如今广岛却人满为患,专家揭秘真相

原子弹炸后宣称百年寸草不生,如今广岛却人满为患,专家揭秘真相

千秋文化
2026-08-03 21:01:01
太让人揪心了!太行山失联12天的22岁漂亮女孩,一张爬山照片流出,哥哥确认是其本人

太让人揪心了!太行山失联12天的22岁漂亮女孩,一张爬山照片流出,哥哥确认是其本人

火山詩话
2026-08-08 10:23:15
汪小菲带女儿吃法餐,12岁玥儿难得露正脸,穿衬衫后更像大S了!

汪小菲带女儿吃法餐,12岁玥儿难得露正脸,穿衬衫后更像大S了!

娱乐团长
2026-07-16 10:05:51
白酒立大功?医生发现:经常喝白酒的老人,或有7个健康益处

白酒立大功?医生发现:经常喝白酒的老人,或有7个健康益处

岐黄传人孙大夫
2026-07-31 18:35:03
云南女孩差1分落榜国防科大,拒北大10万奖学金,复读693分圆梦

云南女孩差1分落榜国防科大,拒北大10万奖学金,复读693分圆梦

糖逗在娱乐
2026-08-08 15:12:51
成都“牵手门”事件女主现今状况曝光,太惨了......

成都“牵手门”事件女主现今状况曝光,太惨了......

许三岁
2026-03-17 07:34:05
预计“白海豚”明晚将在浙江舟山到福建福鼎一带沿海登陆

预计“白海豚”明晚将在浙江舟山到福建福鼎一带沿海登陆

上观新闻
2026-08-08 06:53:21
全红婵以后很难跳水了。不是因为他胖,不是不想跳,而是她太痛了

全红婵以后很难跳水了。不是因为他胖,不是不想跳,而是她太痛了

阿废冷眼观察所
2026-08-08 06:06:53
73岁大妈的明智养老:不请保姆不住养老院,而是找个年轻老伴照顾

73岁大妈的明智养老:不请保姆不住养老院,而是找个年轻老伴照顾

烙任情感
2026-08-04 16:15:42
德国政坛大地震!最新民调曝出:47%民众支持默克尔出任联邦总统

德国政坛大地震!最新民调曝出:47%民众支持默克尔出任联邦总统

史之韵
2026-08-09 20:34:38
“白海豚”登陆,北京预计大暴雨!时间预测——

“白海豚”登陆,北京预计大暴雨!时间预测——

家住大兴
2026-08-09 20:00:13
越南用最残忍的现实,给中国上了永生难忘的一课!

越南用最残忍的现实,给中国上了永生难忘的一课!

贱议你读史
2026-08-04 11:50:46
难道《广告法》管不住那些吹牛的车企?

难道《广告法》管不住那些吹牛的车企?

清哲木观察
2026-08-05 15:19:25
姚明第18名!美媒重排最强国际球员:亚历山大第7文班亚马屈居50

姚明第18名!美媒重排最强国际球员:亚历山大第7文班亚马屈居50

锅子篮球
2026-08-09 08:56:39
中超争议判罚!李镇全踩人逃红,复出首战险酿大祸,海港全队不满

中超争议判罚!李镇全踩人逃红,复出首战险酿大祸,海港全队不满

奥拜尔
2026-08-09 20:09:59
10岁男孩发现,蝴蝶有毛虫时期记忆

10岁男孩发现,蝴蝶有毛虫时期记忆

量子位
2026-08-07 09:59:01
零GPU跑通DeepSeek!中国超算用CPU打了一场翻身仗:16节点顶80张显卡

零GPU跑通DeepSeek!中国超算用CPU打了一场翻身仗:16节点顶80张显卡

快科技
2026-08-07 19:21:24
139万辆车、多起起火、一句“零燃烧”:余承东的数学是跟谁学的

139万辆车、多起起火、一句“零燃烧”:余承东的数学是跟谁学的

民间胡扯老哥
2026-08-07 06:38:45
2026-08-10 03:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13713文章数 142716关注度
往期回顾 全部

科技要闻

苹果官网:Mac电脑可配合苹果智能使用千问

头条要闻

39岁女演员破产失业 炒股亏掉20年积蓄靠年迈母亲接济

头条要闻

39岁女演员破产失业 炒股亏掉20年积蓄靠年迈母亲接济

体育要闻

豪尔赫·梅西去世,球王的人生导师离开了

娱乐要闻

刘嘉玲晒与周星驰合影,情谊深厚

财经要闻

伯克希尔罕见爆买200亿美元股票

汽车要闻

增配激光雷达 全新一代smart精灵1号限时权益价14.99万起

态度原创

艺术
教育
时尚
数码
旅游

艺术要闻

看完他的画,我只想辞职去街头晒太阳!这位美国画家把平凡日常画成了人间天堂

教育要闻

上午10点!山东合格考成绩可查!入口+教程

陈都灵:人生海海,万般重逢

数码要闻

内存短缺蔓延至苹果供应链 MacBook Air多款配置交货周期拉长

旅游要闻

京城逛公园 一站式感受三地文脉

无障碍浏览 进入关怀版