网易首页 > 网易号 > 正文 申请入驻

递归语言模型登场!MIT华人新作爆火,扩展模型上下文便宜又简单

0
分享至

机器之心报道

编辑:+0、冷猫

目前,所有主流 LLM 都有一个固定的上下文窗口(如 200k, 1M tokens)。一旦输入超过这个限制,模型就无法处理。

即使在窗口内,当上下文变得非常长时,模型的性能也会急剧下降,这种现象被称为「上下文腐烂」(Context Rot):模型会「忘记」开头的信息,或者整体推理能力下降。

这种现象在现实使用中远比在标准化基准测试中更明显。当用户与 ChatGPT 等主流 LLM 进行长时间、多轮的复杂对话时,会明显感觉到模型开始变「笨」,变得难以聚焦、遗忘关键信息。

来自 MIT 的研究者从一个直观的想法出发:也许可以把超长上下文切分,分别交给模型处理,再在后续调用中合并结果,以此避免衰退问题?

基于此,他们提出了递归语言模型(Recursive Language Models,RLMs),这是一种通用的推理策略:语言模型将输入上下文视作变量,对其进行分解并递归式交互。

  • 将上下文视为一个可操作的「变量」:主模型(root LM)在一个类似 Jupyter Notebook 的编程环境(REPL)中工作,完整的上下文只是一个它能用代码访问的变量,而不是直接的输入。
  • 递归调用自身或小模型:主模型可以编写代码来查看、切分、过滤(比如用 grep)这个巨大的上下文变量,然后把小块的任务外包给一个个小的、临时的 LLM 调用(递归调用)。
  • 综合结果:主模型收集这些「外包」任务的结果,最终形成答案。

研究者还设计了一个具体实现:在一个 Python REPL 环境中调用 GPT-5 或 GPT-5-mini,并将用户的 prompt 存入变量中进行迭代式处理。

结果很惊人:在能获取到的最难的长上下文评测集之一 OOLONG 上,使用 GPT-5-mini 的 RLM 正确答案数量是直接使用 GPT-5 的两倍以上,而且平均每次调用的成本更低。

研究者还基于 BrowseComp-Plus 构建了一个全新的长上下文 Deep Research 任务。在该任务中,RLM 显著优于 ReAct + 推理时索引 / 检索等方法。令人意外的是,即使推理时输入超过 1000 万 tokens,RLM 的性能也没有出现衰减。

他们相信,RLM 很快会成为一个强大的范式

同时,相比于仅依赖 CoT 或 ReAct 风格的代理模型,显式训练以递归式推理为核心机制的 RLM,很可能成为推理时扩展能力领域的下一个里程碑

  • 博客文章:https://alexzhang13.github.io/blog/2025/rlm/
  • 原帖压缩总结见推文:https://x.com/a1zhang/status/1978469116542337259

博客作者为 MIT CSAIL 的 Alex Zhang 和 Omar Khattab。

这是一个递归语言模型 (RLM) 调用的示例。它作为一种从文本到文本(text → text)的映射,但比标准的语言模型调用更灵活,并且可以扩展到近乎无限的上下文长度。RLM 允许语言模型与一个环境(在此实例中为 REPL 环境)进行交互,该环境存储着可能非常庞大的上下文。在其中,模型可以递归地子查询「自身」、调用其他 LM 或其他 RLM,从而高效地解析这些上下文并提供最终的响应。

评论区的反馈也非常积极,并且进行了很多深入的讨论。

递归语言模型 RLM

RLM 的通用性与其底层语言模型本身相同。实际上,从用户角度来看,RLM 的调用方式与普通模型调用并没有区别,但它在内部可以生成(递归式的)LM 子调用来完成中间计算。

当你向一个 RLM 发起查询时,「根」语言模型(root LM)可以把整个上下文当作可操作的环境来探索和处理。它会通过递归调用(R)LM,将对任意结构或任意长度上下文的处理任务分解并逐级委托,从而实现可扩展的推理能力。

递归语言模型(RLM)调用取代了传统的语言模型调用。它为用户提供了一种「仿佛上下文无限大」的体验,但在底层,语言模型会自动对上下文进行管理、分区,并根据需要递归调用自身或其他 LM,从而避免出现 context rot(上下文退化)问题。

研究者将这一机制实现为一个类似 Jupyter 的 REPL 环境:

核心思想是:将用户的 prompt 存入一个 Python 变量中,然后提供一个 REPL 循环给 LLM,让它可以在不一次性读取全部内容的前提下,主动尝试理解和操作 prompt。

「根」语言模型(root LM)通过编写代码并查看每个单元格的输出,与这个环境进行交互;在此过程中,它还可以在 REPL 环境中递归调用其他 LM 或 RLM,以此在上下文中进行导航和解析。

这种方式要比任何「分块(chunking)」策略都更加通用且更智能。研究者认为:应该让语言模型自己决定如何探索、拆解并递归地处理长 prompt,而不是由人为制定固定的切分策略。

RLM 框架实例为根 LM 提供了在 Python 笔记本环境中分析上下文的能力,并能在任何存储在变量中的字符串上启动递归 LM 调用(深度 = 1)。LM 通过输出代码块进行交互,并能在其上下文中接收(截断的)输出版本。完成时,它输出带有 FINAL (…) 标签的最终答案,或者可以选择使用代码执行环境中的字符串 FINAL_VAR (…)。

这种结构在实际使用中带来了多项明显的优势:

  • 根语言模型(root LM)的上下文窗口很少被「塞满」 —— 因为它从不直接读取完整上下文,它接收的输入规模增长得很慢。
  • root LM 拥有灵活的上下文访问策略 —— 它可以只查看部分上下文,或者对上下文块进行递归处理。例如,当任务是寻找「needle-in-the-haystack」信息或需要多跳推理时,root LM 可以先通过正则表达式(regex)等方式粗略筛选上下文范围,再对筛选结果发起递归式 LM 子调用。这对于任意长度的上下文输入尤其有价值,因为对整个长文档现检索(on-the-fly indexing)通常代价很高。
  • 理论上,RLM 能处理任何可以加载到内存的模态数据 —— root LM 可以完全掌控数据的查看与转换方式,并在此基础上继续向递归 LM 发起子查询。

RLM 框架的一个显著优势在于:可以在一定程度上解释它的行为轨迹,理解它是如何一步步推理并得出最终答案的。研究团队编写了一个简易可视化工具,用来观察 RLM 的推理路径,展示了 RLM 实际在「动手做什么」。

令人振奋的早期结果

研究者一直在寻找能够真实反映长上下文任务场景的基准测试,例如 长时间多轮的 Claude Code 会话。他们希望通过这些任务重点突出当今前沿模型面临的两类核心限制:

1. 上下文退化现象 —— 模型性能随着上下文长度增加而退化;

2. 系统层面的约束 —— 模型在处理超大型上下文时出现的架构或交互瓶颈。

激动人心的成果 — 处理上下文退化

RLMs 旨在解决上下文退化问题,即当你有一个很长的 Claude Code 或 Cursor 实例时,它无法正确处理你的长历史记录的奇怪现象。

OOLONG 是一个具有挑战性的新型长上下文基准,其中模型在极其密集的上下文中回答查询。研究者选择了一个特别困难的分割点,在 OOLONG 基准测试的 trec_coarse 数据集上报告结果,GPT-5 在 132-263k token 上下文中得分约为 33%。

与此同时,一个使用 GPT-5-mini 的 RLM 在 132k 情况下以超过 114%(即超过两倍)的低查询成本优于 GPT-5,在 263k 情况下以49% 的成本优于 GPT-5!

RLM (GPT-5-mini) 比 GPT-5 高出 34 分以上(约增长 114%),并且几乎每个查询的成本都相同(研究者发现中位数查询更便宜,因为有些异常昂贵的查询)。

RLM (GPT-5-mini) 比 GPT-5 高出 15 分以上(约 49% 的提升),并且平均每个查询的成本更低。

令人兴奋的结果 — 超大上下文

RLM 的设计目标之一,就是在无需额外辅助结构的情况下,处理近乎无限长度的上下文。

BrowseComp-Plus(BC+) 是一个 DeepResearch 任务基准,模型需要通过检索多个离线文档,来回答多跳组合性问题(multi-hop compositional questions)。

在目前的初步实验中,研究者从 BC+ 中抽取了一个小规模的查询子集,然后直接将不同数量的文档(从 10 份扩展到 1000 份,对应约 10 万到 1000 万 tokens)原样塞进上下文中。实验结果显示:基于 GPT-5 的 RLM 在跨越这些规模时性能并未下降,甚至优于采用 ReAct + 检索循环(retriever loops)的方法

研究者在 BrowseComp-Plus 上对 20 个随机查询绘制了各种方法的性能和每个答案的 API 成本,随着上下文文档数量的增加。只有迭代方法(RLM、ReAct)在 100 篇文档以上时仍保持合理性能。

这些实验结果令人振奋:在没有进行任何额外的微调或架构改动的前提下,就能够在真实基准上处理超过 1000 万 tokens 规模的上下文,并且完全不依赖检索器(retriever)!

思考与总结

RLM 不是 agent,也不只是作总结。一个系统中使用多次 LM 调用的想法并不新颖 —— 从广义上讲,这正是多数 Agent 框架所做的事情。在现实中,最接近的例子是 ROMA Agent,它会分解问题并运行多个子代理来解决每一部分。另一个常见的例子是 Cursor 和 Claude Code 这样的代码助手,它们会在上下文越来越长时对历史进行摘要或裁剪。这些方法通常是从任务或问题的角度来理解多轮 LM 调用的分解。而研究者们坚持认为,LM 调用可以从上下文的角度进行分解,而分解方式应完全由语言模型自己来决定。

固定格式对 scaling laws 的价值。从 CoT、ReAct、指令微调、推理模型等理念中,得到的经验是:以可预测或固定的格式向模型呈现数据,对于提升性能至关重要。基本思路是,如果能将训练数据的结构约束到模型预期的格式,就可以用合理的数据量显著提升模型性能。将这些理念应用到改进 RLM 之上,或许可以作为另一条扩展轴。

随着 LM 的进步,RLM 也会进步。最后,RLM 调用的性能、速度和成本与底层模型能力的提升直接相关。如果明天最强的前沿语言模型可以合理处理 1000 万 token 的上下文,那么一个 RLM 就可以合理处理 1 亿 token 的上下文(可能成本还只有一半)。

研究者认为,RLM 与现代 Agent 是两种根本不同的押注方向。Agent 是基于人类 / 专家的直觉来设计如何将问题拆分为语言模型可以消化的形式。而 RLM 的设计原则是,应该由语言模型自己决定如何拆分问题,使之可被语言模型消化。

研究者坦言:「我个人并不知道最终什么会奏效,但我很期待看到这个思路会走向何处!」

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
A股唯一一家,半年报五大社保集体重仓科技股,半年报大增75%

A股唯一一家,半年报五大社保集体重仓科技股,半年报大增75%

长风价值掘金
2026-08-16 13:56:39
社保全额实缴时代来了!以前查不到现在藏不住,2030年目标100%!

社保全额实缴时代来了!以前查不到现在藏不住,2030年目标100%!

聚焦真实瞬间
2026-08-16 03:26:24
血崩!日元沦为废纸,日媒罕见低头:这场汇率战争,日本已彻底战败

血崩!日元沦为废纸,日媒罕见低头:这场汇率战争,日本已彻底战败

生活新鲜市
2026-08-15 11:17:24
捏蛋女已社死:正脸曝光面目狰狞,工作单位被扒,一家都是狠角色

捏蛋女已社死:正脸曝光面目狰狞,工作单位被扒,一家都是狠角色

吃瓜盟主
2025-08-30 15:53:04
以色列太狠,真主党被炸出断代史!

以色列太狠,真主党被炸出断代史!

寰球经纬所
2026-08-14 20:53:06
美国国会发公开信,号召清除中国留学生,局势恶化,中方留了一手

美国国会发公开信,号召清除中国留学生,局势恶化,中方留了一手

天注定
2026-08-13 17:05:23
《重器》直到夏英杰车祸遇害,陈一众方知,余高远对他隐瞒的真相

《重器》直到夏英杰车祸遇害,陈一众方知,余高远对他隐瞒的真相

娱乐倾城巷
2026-08-16 13:55:28
日本新盾舰建造速度惊人,取代055成亚洲第一舰,为何这么大?

日本新盾舰建造速度惊人,取代055成亚洲第一舰,为何这么大?

装甲铲史官
2026-08-14 08:21:11
大爆冷!梦百合杯中日5盘对抗,中国队0:5惨败,日本棋手全员晋级

大爆冷!梦百合杯中日5盘对抗,中国队0:5惨败,日本棋手全员晋级

L76号
2026-08-16 09:59:19
随着松岛辉空4-3,WTT欧洲大满贯男单4强诞生3席:2日本选手在列

随着松岛辉空4-3,WTT欧洲大满贯男单4强诞生3席:2日本选手在列

侧身凌空斩
2026-08-16 02:49:31
森林北满盘皆输?汪峰不愧是高端情场猎手,不动声色完成全盘收割

森林北满盘皆输?汪峰不愧是高端情场猎手,不动声色完成全盘收割

草莓解说体育
2026-08-15 02:26:23
“又闷又潮,比黄梅天雨还多,都长蘑菇了”,上海的雨要持续到什么时候?转折来了!

“又闷又潮,比黄梅天雨还多,都长蘑菇了”,上海的雨要持续到什么时候?转折来了!

鲁中晨报
2026-08-16 11:46:07
马斯克的妹妹从小就坚信,跟着哥哥有肉吃,瞒着妈妈把南非家里的房和车都卖了去加拿大投奔哥哥!妈妈哭笑不得的承认是事实!

马斯克的妹妹从小就坚信,跟着哥哥有肉吃,瞒着妈妈把南非家里的房和车都卖了去加拿大投奔哥哥!妈妈哭笑不得的承认是事实!

大白聊IT
2026-08-14 01:29:05
热身赛:王俊杰末节上场连续强攻打进,目前7中4得到8分

热身赛:王俊杰末节上场连续强攻打进,目前7中4得到8分

林子说事
2026-08-16 00:10:40
爱国主义的叫床声

爱国主义的叫床声

将军箭
2026-08-15 01:59:41
首例5胞胎长大了,父亲已劳累去世,母亲直言:如能重来一个也不要

首例5胞胎长大了,父亲已劳累去世,母亲直言:如能重来一个也不要

柳絮忆史
2025-07-22 07:15:03
今日重要赛事!8月16日,央视CCTV5、CCTV5+直播节目表

今日重要赛事!8月16日,央视CCTV5、CCTV5+直播节目表

薇说体育
2026-08-16 11:23:02
国防部对菲下通牒,尽快拖走破船,不到24小时,马科斯态度变了

国防部对菲下通牒,尽快拖走破船,不到24小时,马科斯态度变了

共工之锚
2026-08-16 00:16:37
养老金调整推迟何原因,涨幅与补发时间讲明白

养老金调整推迟何原因,涨幅与补发时间讲明白

李博世财经
2026-08-16 10:04:21
吉利被骂!内部员工吐槽:为什么有些领导见不得员工周末休息,但凡员工周末在家休息,没有加班,他们就浑身难受!

吉利被骂!内部员工吐槽:为什么有些领导见不得员工周末休息,但凡员工周末在家休息,没有加班,他们就浑身难受!

谭谈社会
2026-08-15 10:33:19
2026-08-16 15:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13772文章数 142718关注度
往期回顾 全部

科技要闻

210亿美元,黄仁勋投了马斯克

头条要闻

20岁大学生登山失联92天 穿雨衣坐在山路边成最后画面

头条要闻

20岁大学生登山失联92天 穿雨衣坐在山路边成最后画面

体育要闻

体系球员与体系本身

娱乐要闻

李小冉疑承认离婚 多次强调“一个人”

财经要闻

事关8万亿养老金!长周期考核落地中

汽车要闻

杨洋成001号车主 岚图追光S正式上市

态度原创

亲子
教育
艺术
家居
公开课

亲子要闻

一家三口都没证太难了

教育要闻

正方形的边长为6cm,求阴影部分的面积是多少?

艺术要闻

布鲁西洛夫:一位会画又会写的俄罗斯画家

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版