网易首页 > 网易号 > 正文 申请入驻

機器人怎么才能“记住”十秒钟前发生的事

0
分享至

有一个实验场景特别有意思。

桌上摆着几个方块,机器人先看到红色和蓝色两个方块被短暂高亮了一下,标记很快就消失了。接着任务指令是:把刚才被标记过的方块都捡起来。

一个只看当前画面的机器人会怎么做?它会在桌上来回扫视,因为眼前的画面里根本没有任何高亮痕迹,那两个方块和其他方块长得一模一样。实验里这样的机器人最终超时失败,什么都没抓到。

而另一个机器人做到了。它记得几秒钟前看到的那个高亮瞬间,径直走向蓝色方块抓起来,再走向红色方块抓起来,任务完成。

这个对比揭示了一件很朴素但常被忽略的事:机器人光靠"看当前这一帧"是远远不够的,很多任务的关键信息压根不在眼前的画面里,而在几秒钟、几十秒前发生过的某个瞬间。

**核心问题出在哪**

先说一个具体到扎心的数字。

在一个叫RoboMME的评测基准上,一个只看当前观测的机器人控制模型(论文里称为π0.5)成功率只有17.93%。哪怕给它加上过去动作的记录,成功率也只涨到19.73%。而人类做同样的任务,成功率是90.50%。

> RoboMME*:一个专门用来测试机器人"记忆能力"的评测基准,包含16个任务,分为计数、物体恒存、指代消解、模仿学习四大类,考察机器人能不能记住之前看到但当下已经消失的信息。

这个差距不是小打小闹,而是接近73个百分点。换句话说,人类做10个任务能成9个,而当时最好的无记忆机器人做10个任务,成功的还不到2个。这基本上说明:不是机器人的手不够灵巧,是它的"脑子"根本没有把过去的信息用起来。

那为什么不直接给机器人加个记忆模块呢?其实业内已经有不少团队在做这件事了,方法五花八门:有的把历史画面采样后压缩塞进控制器(FrameSamp+Modul),有的建立一个专门的关键帧检索库(MemER),有的用分割模型建一个视觉记忆库(SAM2Act+)。这些方法都要为"记忆"这件事单独设计一套机制,采样规则怎么定、存储结构怎么建、检索时机怎么触发,每一样都要工程师精心调试。

论文的研究者们想问一个更根本的问题:既然大语言模型天生就很擅长处理长篇上下文,能记住几万字之前提到的细节,能不能直接把这种能力搬过来给机器人用,而不是从零造一套记忆系统?

这就好比你要给一个新员工配一套档案管理系统。一种做法是专门设计一套文件柜、索引卡片、检索流程,让他每次需要查资料时去翻卡片。另一种做法是,这个员工本身脑子里就装着大量知识和长期记忆的能力(就像一个博览群书的老员工),你只需要让他把工作过程中看到的东西自然地记在脑子里,需要时直接想起来就行,不用额外配一套外部档案系统。如果不利用他本身的记忆能力,非要给他配一套外部系统,那这套系统的可靠性、检索速度、覆盖面都要单独从头验证,而且系统规模想扩大时,往往要把整个流程推倒重来。

论文提出的方法,就是选择了后一种思路。

**PonderPounce:两套系统,一快一慢**

这套系统给自己起了两个名字,一个叫Ponder(意为"沉思"),一个叫Pounce(意为"扑击")。

> Ponder*:论文里的"System 2",一个90亿参数的多模态大语言模型(MLLM),负责持续积累任务指令、历史观测、演示视频等信息,在自己的上下文里进行慢速但深入的思考。

> Pounce*:论文里的"System 1",一个负责实际控制机械臂动作的模型,接收当前画面、指令和机器人自身姿态信息,输出具体的动作指令,运行速度快,是真正干活的那个。

这两个名字其实借用了心理学家丹尼尔·卡尼曼在《思考,快与慢》里提出的双系统理论:System 1负责快速直觉反应,System 2负责慢速深思熟虑。机器人控制里也有类似的分工,动作要快(论文里做到了20赫兹的播放频率,也就是每秒钟输出20次动作指令),但理解和记忆可以慢一点。

Ponder做的事情很像一个不停记笔记的观察者。它把每次看到的画面、收到的指令、看过的演示视频,全部append(追加)进自己的上下文里,从来不删除,只往后堆。这个上下文机制本质上就是大语言模型自带的因果注意力结构,模型天生就知道怎么在一长串历史信息里找关联、做推理。论文没有给它加任何额外的采样器、检索器或者压缩模块,就是让它用自己原本的能力去"记住"。

每隔一段时间,Ponder会把自己当前的思考状态浓缩成一个东西,叫作认知令牌(cognition token)。

> 认知令牌*:Ponder把当前的思考状态压缩成的一小段连续向量(不是文字),传给Pounce使用,是连接"慢脑"和"快脑"的信息通道。

Pounce并不直接读取Ponder的完整历史记录,它只拿到最新的一份认知令牌,以及这份令牌"多老了"(论文里叫年龄,也就是这份认知距离现在过去了多长时间)。

这个设计其实特别像一个大公司里的运作方式。总部(Ponder)不断收集各地分公司的报表、市场动态、历史数据,做长期的战略分析,这个分析过程可能需要几分钟甚至更久。但一线的执行团队(Pounce)不可能等总部想清楚了才动手,他们需要立刻响应眼前的客户需求。所以总部会定期发一份"战略简报"给一线,简报上还标注了发布时间。一线团队拿着这份简报加上眼前的实际情况做决策,而不是每次决策都要连线总部从头汇报一遍。如果不这样分工,让一线团队每次做决定都要等总部实时分析完整份历史资料再答复,那响应速度会慢到无法忍受,客户早就走了。论文里给出的具体数字是,如果每次都要重新编码整个历史上下文,一次认知刷新要花521毫秒,优化过后压缩到了78毫秒,这中间的差距决定了机器人是"卡顿"还是"流畅"。

这套异步机制还有个细节值得说一下:两个系统的时钟是完全独立的。训练时,Pounce大约每100毫秒被调用一次,Ponder大约每1秒生成一次新的认知,中间还加了300毫秒的计算延迟模拟真实系统里的信息传递耗时。评测时两者都固定在1赫兹,也就是一秒一次。

**怎么训练这套系统,怎么让认知令牌真正有用**

光有架构还不够,怎么训练是另一个大问题。

论文的做法是端到端联合训练,两个模型的参数(除了底层动作模型本身冻结的那部分)一起更新,没有单独给"桥接"部分做预训练。这在直觉上有点反常,因为很多类似的系统会先分别训练两个模块,再想办法拼接,论文里提到已有研究报告过这种联合训练容易失败,或者容易出现"捷径"现象,也就是模型学会了偷懒,绕过真正该学的东西走捷径达到低损失。

为了应对这个问题,论文引入了一个叫grounding(落地监督)的机制。

> grounding*:让Ponder的语言模型头(LM head,负责生成文字的那部分)在训练时接收额外的监督信号,包括判断"现在是不是该生成子目标了"的转换判断、具体的子目标文字描述,以及演示推理文字,这些文字信号帮助Ponder的认知状态学到更有意义的内容,但最终这些文字本身不会传给Pounce,只是用来"塑形"认知令牌。

这里有个很微妙的设计:文字本身留在System 2内部,不出门。Pounce始终只拿到那个连续的认知向量,从没见过具体的文字。这是因为论文观察到,如果直接让Pounce依赖文字子目标,一来生成文字要花时间(论文里测出生成45个字符的子目标要花0.82秒,比认知令牌刷新慢了十倍),二来纯文字容易压缩掉太多细节,变成一句笼统的"去抓那个方块",却丢了"哪个方块之前被标记过"这种关键但难以用一句话讲清楚的视觉线索。

实验结果证实了这套监督确实有用。去掉演示推理这部分监督,RoboMME上的平均成功率从60.83%掉到48.21%,掉了超过12个百分点。如果把所有LM头的监督全部去掉,成功率进一步跌到27.96%,几乎腰斩。这说明这个"内部说话"的训练过程,哪怕最后不直接传给动作模型,也在实实在在地塑造着认知令牌里装的内容。

论文还做了个对照实验,测试如果换一种更"传统"的方式,直接把子目标文字(而不是连续向量)传给Pounce会怎样。结果是59.96%,比连续认知令牌的60.83%略低一点点,但这个差距(0.87个百分点)比同一个模型不同评测批次之间的正常波动(2.63个百分点)还要小。这说明连续认知令牌至少不比传统文字方案差,但也没有压倒性优势,更准确的说法是打了个平手,只是连续方案在速度上占了大便宜。

**认知必须要"新鲜"吗**

这里有个特别值得琢磨的实验。

论文测试了一件事:如果Ponder持续在后台工作,但Pounce只在"该切换子目标"的那一刻才接收新认知,中间的时间就一直复用上一次的状态,会怎样?

结果相当惊人:成功率从60.83%直接暴跌到1.83%。

这就像你本来每隔几秒钟就跟对讲机另一头的同事同步一次现场情况,突然改成只有在任务彻底切换时才通话一次,中间几十秒完全靠沉默硬扛。哪怕你手里的信息理论上还是"有效"的,缺了那种持续的、细粒度的更新节奏,整个配合就散架了。这个实验说明,至少论文报告的这个训练配置下,模型已经学会了依赖那种频繁刷新的节奏,突然改变节奏它就懵了。

但这不代表稀疏更新这条路走不通,只是说明如果训练时用的是"频繁刷新"这套逻辑,测试时就不能临时改成"稀疏刷新",这是训练和推理之间必须匹配的一个约定,而不是认知内容本身没用。

论文还专门做了个"陈旧度"实验,让认知令牌故意延迟0.3秒、1.3秒、2.3秒、4.3秒才送达,看模型的动作预测损失怎么变化。用1秒刷新频率训练出来的模型,在认知延迟到2.3秒时损失飙升到新鲜状态的7.11倍,到4.3秒时飙到9.22倍。但如果换成用2秒或4秒刷新频率训练的模型,同样在4.3秒延迟下,损失只涨到3.19倍和1.14倍。

这揭示了一个权衡:训练时刷新越快,模型对"新鲜度"的依赖就越强,一旦真实场景里认知稍微慢了半拍,表现就崩得厉害;训练时故意用慢一点的刷新频率,模型反而对延迟更宽容,但代价是在正常新鲜状态下的基础表现会打折扣(论文里的具体数字是,1秒训练下新鲜损失是0.117,2秒和4秒训练下涨到0.213和0.232)。这就跟人一样,如果你习惯了实时刷新的信息流,一旦网络卡顿你会特别抓狂,但如果你本来就习惯每天只看一次新闻,突然断网一天你完全不会觉得有什么异常。

**换一个更小的"大脑"会怎样**

论文还做了一个特别直白的对照实验,用来验证一个核心猜想:控制器的表现,是不是真的会随着这个"记忆大脑"的规模变大而变好?

他们把90亿参数的Ponder换成8亿参数的版本,其他所有东西(包括Pounce的架构和两者之间的接口协议)保持不变。结果,90亿参数版本的成功率是60.83%,8亿参数版本是50.04%,差了整整10.79个百分点。

这个结果支撑了论文一个很关键的论点:System 2的规模可以独立于控制器进行扩展,换句话说,你想让机器人变得更聪明,不需要重新设计整个控制器架构,只需要给它换一个更大的"记忆大脑"就行。

不过论文也很坦诚地报告了一个失败案例:如果不用预训练的语言模型,而是让90亿参数的Ponder从随机初始化开始训练,训练完全不收敛,最终成功率是0%。这说明这套方法目前高度依赖预训练模型自带的那种"理解和整合信息"的底子,不是随便找个同等大小的神经网络架构就能凑效。

**数据说了什么**

在RoboMME这个16任务的评测基准上,用基础规模的训练数据,PonderPounce拿到60.83%的平均成功率,而此前最强的非oracle基线FrameSamp+Modul是44.51%,差了16.32个百分点。当训练数据扩大到9倍规模,PonderPounce涨到75.54%,FrameSamp+Modul涨到57.88%,差距进一步拉大到17.66个百分点。

分类目来看,PonderPounce在"物体恒存"(Permanence,比如记住藏在杯子下面的东西)和"指代消解"(Reference,比如记住演示里选中的是哪个目标)这两类任务上表现尤其突出,两个数据规模下都是最强。但在"模仿学习"(Imitation,需要精确复现一个演示动作序列的细节)这类任务上,FrameSamp+Modul反而更强一些。这说明依赖上下文推理适合处理那种"需要记住抽象事实"的任务,而直接复用具体画面帧对那种需要精确复现动作细节的任务可能更直接有效。没有一种记忆方式能通吃所有情况。

在另一个叫RoboCasa-DC的评测里,任务是给机器人看一段演示视频,让它学着完成同样的操作。这个数据集没有额外的子目标或推理标注,训练只靠动作监督本身。PonderPounce拿到12.5%的成功率,此前最强的公开基线SeeTraceAct是11.6%。如果把认知令牌换成一个学习到的"空状态"(相当于完全不给Pounce任何来自Ponder的信息),成功率跌到8.6%。这个跌幅证明,哪怕没有文字层面的额外监督,认知令牌本身依然在实实在在地影响着控制效果。

**这套系统跑得动吗**

这套方法听起来很美好,但一个现实问题是:一个90亿参数的语言模型持续跑在机器人的控制回路里,会不会慢得没法用?

论文花了不少篇幅讲工程优化。核心手段是用append-only(只追加不重写)的StaticCache,配合融合过的Triton内核。优化前,Pounce单次调用要142毫秒,优化后降到25毫秒,快了5.7倍。Ponder的认知刷新,未优化时要521毫秒,优化后降到78毫秒,支撑住了每秒一次的刷新频率,同时动作播放能跑到每秒20次。

这个数字背后其实藏着一个朴素的道理:再聪明的大脑,如果反应慢到跟不上手脚的节奏,也没用。这套系统能落地,一半功劳在架构设计,另一半功劳在把工程细节磨到位。

写在后面

读完这篇论文,最让我意外的一点是,"记忆"这件事在机器人研究里居然长期被当成一个需要专门造轮子的问题。大家默认的思路是:既然机器人任务和自然语言任务不一样,那记忆机制也得重新设计一套。但这篇论文用一个挺朴素的实验证明了另一种可能,预训练语言模型积累的那种"整合长篇上下文"的能力,本身就是一种现成的、质量很高的记忆基础设施,直接拿来用,可能比从零造一套专门的机制更省事也更有效。

论文里有个细节我觉得特别值得单独说一下:8.6%对12.5%,这个差距看起来不大,但它出现在一个几乎没有任何标注监督的场景(RoboCasa-DC没有子目标或推理标注)。这说明就算完全靠动作数据本身的反馈,认知令牌依然能学到有用的东西,这比"必须靠精心设计的文字监督才能让认知有意义"这个假设走得更远一点。

另外一个让我反复想的地方是那个"稀疏更新"实验的暴跌结果,从60.83%到1.83%。这不是一个渐进式的性能下降,是断崖式的崩溃。这提醒我一件事:很多AI系统的"鲁棒性"其实是训练配方决定的,而不是架构本身天然具备的。同一套架构,换一种训练节奏,行为可能完全不一样。这对任何想把这套思路搬到别的场景里用的人都是个提醒,接口设计好了不够,训练和部署时的节奏必须严格对齐。

论文里没有回答的问题还有不少。比如这套方法在真实机器人(而不是模拟器)上到底行不行,作者自己也承认目前只在两个模拟基准上验证过。再比如,认知令牌里到底装的是什么内容,论文用消融实验证明了它"有用",但没有真正打开黑箱看看里面装的是抽象的空间坐标、颜色标签,还是别的什么东西。

一个记忆系统,规模越大记性越好,这事听起来理所当然,可如果哪天有人证明反过来更小的记忆反而更稳,那会不会又是一次认知颠覆?

Q&A

Q1:PonderPounce是什么?

A:PonderPounce是一套让机器人具备情景记忆能力的双系统架构,用预训练大语言模型Ponder负责记忆和思考,用动作模型Pounce负责实际控制,两者通过一个连续的认知令牌异步通信。

Q2:PonderPounce和传统的机器人记忆方案有什么区别?

A:传统方案通常要专门设计采样器、检索库或压缩模块来存储历史信息,而PonderPounce直接复用预训练大语言模型自带的因果上下文能力作为记忆,不需要额外造一套记忆机制,规模也能独立扩展。

Q3:PonderPounce的效果到底好在哪里?

A:在RoboMME基准上,PonderPounce基础数据规模下成功率达到60.83%,9倍数据规模下达到75.54%,均高于此前最强基线FrameSamp+Modul的44.51%和57.88%,在RoboCasa-DC上也超过了公开最强基线。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
孙宇晨2018年6月被限制出境,结果不到4个月人就在美国了

孙宇晨2018年6月被限制出境,结果不到4个月人就在美国了

江启
2026-08-31 04:00:08
国产手机集体涨价遇冷,经销商懵了,消费者:我可以三年半不换

国产手机集体涨价遇冷,经销商懵了,消费者:我可以三年半不换

小柱解说游戏
2026-09-08 17:10:03
一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

旧史新谭
2026-09-07 18:40:37
曼联引援遭重创!曝霍尔与纽卡续约5年 彻底无缘加盟红魔

曼联引援遭重创!曝霍尔与纽卡续约5年 彻底无缘加盟红魔

球事百科吖
2026-09-09 04:20:56
不管在哪个公司,千万要记住:工龄满十年,尽早主动留两类凭证!

不管在哪个公司,千万要记住:工龄满十年,尽早主动留两类凭证!

另子维爱读史
2026-07-22 20:13:10
全球最“开放”的国家:男女不注重隐私,性交易合法,政府给补贴

全球最“开放”的国家:男女不注重隐私,性交易合法,政府给补贴

轩逸阿II
2026-08-24 08:56:08
中国烟草突然拿出600亿,买了工行和农行

中国烟草突然拿出600亿,买了工行和农行

李荣茂
2026-09-08 06:57:28
和工藤静香结婚26年,54岁木村拓哉仍帅气,两女儿颜值高给他争光

和工藤静香结婚26年,54岁木村拓哉仍帅气,两女儿颜值高给他争光

东方不败然多多
2026-09-08 09:21:04
死在加州路边的阿里总监:最残忍的不是没钱,是枕边人不如网友亲

死在加州路边的阿里总监:最残忍的不是没钱,是枕边人不如网友亲

只能离开
2026-09-08 05:03:24
“同志”,该回来了

“同志”,该回来了

贰把刀
2026-08-15 19:45:36
凯莉·詹娜展示建造6年的意式豪宅:我的美丽梦想之家

凯莉·詹娜展示建造6年的意式豪宅:我的美丽梦想之家

热搜摘要官
2026-09-08 05:39:53
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
34岁赛琳娜晒新生儿照配文“有一天”,自曝无法怀孕后首谈当妈计划

34岁赛琳娜晒新生儿照配文“有一天”,自曝无法怀孕后首谈当妈计划

追星雷达站
2026-09-08 22:49:19
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
国外游客到国内商场大肆采购,看到购物清单,中国人都震惊了

国外游客到国内商场大肆采购,看到购物清单,中国人都震惊了

兰姐说故事
2025-08-01 00:00:09
澳门冠军赛!1场爆大冷,国乒2大新星零封,张本智和大战东道主

澳门冠军赛!1场爆大冷,国乒2大新星零封,张本智和大战东道主

帛河体育
2026-09-08 14:29:22
38岁后才明白:生活中没必要的9类消费支出,白白浪费十几万!

38岁后才明白:生活中没必要的9类消费支出,白白浪费十几万!

优活Life
2026-09-07 12:15:08
哈佛大学惊人发现:寿命长的人,从来不是靠多运动,而是靠这3点

哈佛大学惊人发现:寿命长的人,从来不是靠多运动,而是靠这3点

千秋文化
2026-06-21 19:47:58
家属证实:知名演员去世

家属证实:知名演员去世

91.6陕西交通广播
2026-09-08 08:53:31
00后女孩上海遇“完美男友”,上百万被骗还背上高额网贷,直到一条私信,才发现他早已与他人同居,同时与多名女生交往……

00后女孩上海遇“完美男友”,上百万被骗还背上高额网贷,直到一条私信,才发现他早已与他人同居,同时与多名女生交往……

都市快报橙柿互动
2026-09-08 00:57:37
2026-09-09 05:04:49
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
840文章数 9464关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

艺术
旅游
本地
时尚
公开课

艺术要闻

他画的光,能透进心里——这位风景画大师笔下的森林,美得让人想住进去!

旅游要闻

探访金刚碑温泉老村 名人故居有了不同的打开方式

本地新闻

宁波,中国制造的隐藏大佬

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版