网易首页 > 网易号 > 正文 申请入驻

正略机器人等机构让摄像头看到的一切都不再被遗忘

0
分享至


这项由正略机器人(Rightly Robotics)、中国科学院大学杭州高等研究院以及浙江大学联合完成的研究,于2026年7月14日以预印本形式发布在arXiv平台,论文编号为arXiv:2607.09759v2,研究方向属于计算机视觉领域。

你有没有遇到过这样的烦恼:你的手机里有几千张照片,但当你想找出"去年某个周末在哪家餐厅拍的那张合影"时,手机完全帮不上忙?它只会按时间排列,却不知道"那个穿蓝衬衫的朋友叫小李",也不知道"那家餐厅就在你家附近"。换句话说,你的手机能"看",却不会真正地"记"。

现在把这个问题放大一百倍,变成一台每天24小时都开着摄像头的家用机器人,或者一副可以录下你整个工作日的智能眼镜。摄像头产生的视频量是海量的,但现有的AI系统却很难回答"昨天下午我把水杯放哪儿了"或者"上周三那个送包裹的人长什么样"这类极其自然的问题。原因在于,现有的系统要么把"记忆"塞进AI模型自身有限的容量里,要么就把视频画面一帧一帧地堆在数据库里,根本没有按照"人"和"物体"这样有意义的单位来组织信息。

正是为了解决这个问题,上述研究团队提出了一套名叫ReflectWorld-MM的系统。这套系统的核心思路,可以用一个简单的比喻来理解:好的图书馆员不仅把书放在架子上,还会给每本书登记作者、主题、借阅历史,并且把相关的书放在一起。ReflectWorld-MM就是要做视频世界的"图书馆员",把摄像头看到的每一个人、每一件物体,都作为一个独立的"档案"来追踪、记录和管理。在六项权威的长视频理解与终身记忆基准测试中,这套系统的表现超过了所有已有的同类方法,甚至超过了一个当今顶级的前沿大模型。

一、为什么现有的AI"记性"这么差

要理解ReflectWorld-MM究竟做了什么突破,先得搞清楚之前的系统卡在哪里。

目前大多数能处理视频的AI系统,都有点像一个只能记住"最近几分钟"的人。它们把视频画面压缩成一些紧凑的数字符号存在自己的"脑子"里,但这个"脑子"的容量是固定的。视频越长,记忆就越模糊,就像一个人连续听了几个小时讲座之后,脑子里只剩一个大概印象,细节全丢了。这类系统在处理时长有限的视频时还算凑合,但一旦遇到"连续几天的生活记录"这种场景,就彻底失效了。

另一类方法是专门给语言AI设计的"外部记忆"系统,它们借鉴了心理学对人类记忆的分类——情节记忆(记住发生了什么事)、语义记忆(记住关于世界的知识)和程序记忆(记住怎么做某件事)。这类系统在文字聊天场景下表现不错,但它们完全不处理视频,也不认识"镜头里反复出现的那个人到底是谁"。

最接近ReflectWorld-MM的先行者有两个。一个叫M3-Agent,它用类似"关系图谱"的方式记录视频里的人和物,但它的记忆基本上是"只增不减"的,一旦写进去就很难修改或删除,哪怕后来有新证据表明之前记错了,系统也不会自动纠正。另一个叫WorldMM,它会在不同时间粒度上建立记忆,但每次用于不同数据集时都需要人工调整参数,而且它完全不追踪"这个人是谁",所以对于那些"这件事是谁做的"之类的问题,它根本没有能力回答。更重要的是,这两个系统都没有被做成可以对接真实摄像头、可以让其他AI助手随时调用的完整服务。

ReflectWorld-MM就是要填上这些空白。

二、用"图书馆员"的方式组织记忆

ReflectWorld-MM整个系统可以拆成三个紧密相连的部分,就像图书馆的"采购部"、"分类编目部"和"检索服务部"一起工作。

第一个部分叫做"感知前端",负责把摄像头拍到的原始视频变成有意义的结构化信息。它先把连续的视频流按照"活动场景"自然地切成一段一段,每段都带有同步的音频文字记录,如果有多个说话人还会区分是谁在说话。然后,它在每一段里检测画面中出现的人和物体,并且把它们和系统之前认识的"老朋友"进行比对——这个人是不是上次出现过的那位同事?桌上这个杯子是不是主人昨天找的那个?这个比对过程有一个很重要的设计:检测器只负责提出"候选答案",最终的身份确认权归属于一个专门的"仲裁者"模块,而不是让任何一个检测结果直接写进记忆里。这样设计的好处是,哪怕某次比对出了错,错误也被隔离在"候选"阶段,不会污染整个记忆库。

感知前端还有一个非常重要的特性:它在理解当前这段视频时,会主动把过去积累的上下文"喂"给AI模型。这就好比你给一个助手讲今天发生的事,如果这个助手记得上周你提到过某个人的名字,那他理解你今天故事的效率就会高很多。ReflectWorld-MM为每段视频准备了三层背景信息:第一层是"工作记忆",记录当前这个场景里最近几段发生了什么,让AI能把一个短暂离开画面的人认成同一个还在场的人;第二层是"场景语义背景",记录这个摄像头通常在什么地方、这里一般发生什么样的活动;第三层是"实体历史",一旦认出了某个人或物体,就把关于这个人或物体之前积累的所有知识都补充到当前的理解里。这种"让过去参与理解现在"的设计,是ReflectWorld-MM和之前系统最根本的区别之一——之前的系统都是先记录、后查询,而ReflectWorld-MM是在记录的时候就已经用上了历史信息。

此外,还有一个"高级调度员"角色全程监控着整个感知过程。它了解摄像头当前在看什么、什么事情对用户来说最重要,并把这些判断注入到感知模型的提示中,告诉模型"这段视频重点关注什么"。调度员还会决定每段视频值得花多少计算资源来分析:安静的、没什么变化的画面可以快速略过,信息丰富或者和用户规则相关的画面则会得到更仔细的分析。

三、三层记忆,像人一样分类存储

ReflectWorld-MM的第二个核心部分是它的"分级长期记忆库",设计灵感来自心理学对人类记忆的经典分类。

情节记忆负责记录"发生了什么",它被组织成三个层次。最细的层次叫"实体观测",记录每一段视频里每一个被识别的人或物体在那一刻的具体状态——他在做什么、他的外貌是什么、他跟谁有交互。每一条记录都以那个人或物体的永久标识符作为索引,就像图书馆里用书号索书一样。中间一层叫"追踪摘要",把同一段视频里发生的所有事情整合成一个段落描述,同时记录涉及了哪些人和物体,并把这些人和物体链接回各自的实体观测。这一层是系统默认回答问题时优先检索的层次。最粗的一层叫"图式层"(或者叫"章节"),把很多段视频合并成一个更大的故事概要。当一个活动场景结束后,系统会把那段时间里发生的事情汇总成一个章节,就像书的目录一样,让系统在面对"那件事大概是什么时候发生的"这类宏观问题时,不需要逐条翻阅所有细节记录。

语义记忆则负责记录"关于这个人或物体,我们长期积累的知识"。每当系统对某个实体积累了新的5次观测之后,一个专门的"整合器"就会把这些新观测和已有的知识放在一起审视,然后做出四种决策之一:新增一条事实、更新一条已有事实、删除一条不再成立的事实,或者保持不变。这个设计让ReflectWorld-MM的语义记忆是"活的",能随时间演化,而不是像之前的M3-Agent那样只会一直往里加东西。每条语义事实还带有一个"重要性分数",每次这条事实被新的观测再次印证,分数就会向上走一点,但永远不会到100%,始终留有被修改的余地——这非常像人类的直觉:你对一件事越确信,就越不容易被一条相反的消息轻易推翻,但也不是完全不可能被推翻。用数学语言描述就是:每次再确认,新的重要性分数等于旧分数加上"剩余空间"乘以一个增长率,这个公式保证分数永远朝1靠近但永远到不了1。

程序记忆储存的是用户设定的规则和偏好,比如"当我的狗跳上沙发时通知我"。这些规则会在感知阶段就被注入到分析提示里,让模型在看视频的过程中顺便检查规则是否被触发。当模型认为某个规则可能被满足时,它不是直接发出警报,而是产生一个"语义信号",然后由另一个独立的仲裁模块结合通知策略、最近是否已经发过类似通知等因素,最终决定要不要真的提醒用户。这样设计避免了同一件事反复触发警报的尴尬。

四、实验证明:记忆让AI回答变得更准确

研究团队在六个公开的权威评测基准上对ReflectWorld-MM进行了测试,覆盖了普通长视频理解、以自我为中心的生活记录理解以及以实体身份为核心的问答三类场景,全面检验这套系统在不同难度下的表现。

在覆盖普通长视频的三个基准上,ReflectWorld-MM分别取得了76.9%(VideoMME长视频版)、69.4%(LVBench)和80.9%(HippoVlog)的准确率,全面超过之前最强的WorldMM系统(分别为73.8%、61.9%和78.3%)。在视频越长、问题越难的LVBench上,ReflectWorld-MM比直接使用顶级前沿大模型GPT-5高出足足9个百分点,说明加上记忆系统的收益随着视频长度增加而越来越明显。

在以身份认知为核心的三个基准上,ReflectWorld-MM的优势更加突出。EgoLife-QA是一个基于一整周连续自拍视频的问答测试,很多问题本质上是"某某人上周三做了什么",需要持续追踪特定个人的行为。原始EgoLife论文报告,即使给AI提供了人工标注的身份信息,最高也只能达到45.5%的准确率,但ReflectWorld-MM用自动构建的记忆达到了46.8%,而且研究团队没有在这个测试上汇报WorldMM的表现——因为WorldMM根本不维护实体身份,无法回答依赖"这个人是谁"的问题,这直接印证了以实体为核心组织记忆的必要性。在M3-bench的机器人场景和网络视频场景上,ReflectWorld-MM分别比之前最强的M3-Agent高出9.1和10.4个百分点,尽管这两个场景的整体准确率对所有系统来说仍然偏低,说明这类需要多跳推理和跨模态理解的问题对AI来说依然是巨大挑战。

除了准确率,研究团队还专门测量了一个叫"回答效率"的指标,衡量系统回答问题时究竟是从记忆里直接找到了答案,还是不得不重新打开原始视频来查看。ReflectWorld-MM在EgoLife-QA上只有4.6%的问题需要回头看视频,在VideoMME-L上只有6.8%,说明绝大多数问题都能从提取好的记忆中直接解答。相比之下,WorldMM在VideoMME-L上有高达34%的问题需要重新看视频,说明WorldMM的记忆提取不够完整,经常需要依赖"回头翻原始材料"这个备选方案。而M3-Agent虽然几乎不需要回看视频(0%回看率),但代价是准确率大幅落后——说明它的记忆太过简略,丢失了太多答题所需的细节。

研究团队还做了消融实验,也就是"逐一拆掉某个功能,看准确率掉多少"。结果显示,去掉实体关联追踪、去掉图式层章节索引、去掉语义知识整合,这三项操作都会导致准确率不同程度下降,其中在M3-bench机器人场景上去掉图式层导致的下降最为明显(从37.4%掉到33.6%),印证了每个设计选择都在发挥实际作用。

五、三个真实场景,看记忆如何改变理解

研究团队还通过三个具体案例展示了ReflectWorld-MM记忆系统在真实内容上的运作方式。

第一个案例是一个持续一周的个人生活vlog。在这段视频里,同一个人在不同天出现了多次。因为系统始终追踪同一个人的同一个身份标识符,当他第一天去餐厅、第三天找咖啡馆写作、第四天去攀岩馆,这些分散在不同天的观测都汇聚在同一个人的档案里。语义整合器把这些观测合并后,得出了两条稳定的语义事实:这个人喜欢在咖啡馆工作或学习,以及这个人有固定的健身习惯。如果每次观测只是孤立地记在不同的"视频片段"里,就根本不可能得出这样的跨时间结论。

第二个案例是一段咖啡制作视频。在系统识别出这是一场手冲咖啡制作活动之后,这个场景理解就被注入到后续每一段视频的感知提示里。于是,同样的"一个人站在桌边调整一个容器"这个动作,在识别出场景是咖啡制作之后,被理解为"调整滤杯角度",而不是被误解成某个无意义的动作。场景背景信息改变了视频片段的解读方式,这正是"过去参与理解现在"这一原则在实践中的体现。

第三个案例是程序记忆触发主动通知。用户预先设置了规则"当狗在沙发上时通知我"。摄像头陆续拍到狗靠近沙发、跳上沙发、趴在沙发上的过程。系统并不是在看到狗靠近沙发时就立刻发通知,而是把这些视觉证据转化为语义信号,然后由仲裁模块结合规则、最近通知历史和用户策略综合判断,最终在狗确定已经趴上沙发时发出一条通知。整个过程干净利落,没有误报。

六、作为真实服务运行的系统

ReflectWorld-MM不只是一个实验室里的算法原型,研究团队把它实现成了一个完整的、可以对接真实世界的服务。

在接入方式上,它支持网络摄像头(RTSP/RTSPS协议)、本地视频文件、USB摄像头、HTTP流媒体以及智能手机摄像头。手机端通过浏览器WebRTC协议将摄像头画面传送到本地网关,再由网关统一处理,所以对接一种新的视频来源只需要增加一个"适配插头",整个记忆系统不需要任何改动。

在与其他AI助手的协作上,ReflectWorld-MM通过一套标准化的工具接口对外开放能力,包括开始/停止拍摄、查询当前正在发生什么、检索长期记忆、设置通知规则、管理场景背景信息等。任何支持工具调用的AI助手,只需要接入这套接口,就能使用ReflectWorld-MM积累的记忆来回答问题,而不需要了解底层的视频处理细节。论文中展示的"OpenClaw助手"就是通过这种方式工作的:用户问"我的水杯放哪里了",OpenClaw调用ReflectWorld-MM的记忆检索接口,得到"水杯在小厨房的吧台上,就在百事可乐罐旁边"这样的答案。

研究团队还为系统开发了一个可视化仪表板。仪表板左侧显示视频画面和对话面板,中间显示按时间排列的场景片段摘要,右侧显示每个被识别实体的完整档案,包括语义记忆的演化状态、历次出现记录和最近活动摘要。仪表板和基准测试评估的AI代理访问的是完全同一套记忆后端,而不是两个独立的系统。

研究团队已经把这套系统的代码开源,感兴趣的开发者可以通过论文编号arXiv:2607.09759查找完整资料。

说到底,ReflectWorld-MM回答了一个很朴素的问题:一个能帮你"记住一切"的AI助手,到底应该怎么记?答案不是把所有画面堆成一个大仓库,而是像一个认真的图书馆员那样,把每个人、每件物品都建立独立的档案,追踪它们的来龙去脉,把零散的观测整合成有意义的知识,并且随着时间推移不断修正和更新这些知识。这项研究的意义,不仅仅在于它在几个评测上得了高分,更在于它证明了"以实体为中心的记忆组织方式"这条路线是可行的,并且提供了一套可以真正部署的完整实现。随着可穿戴摄像头和家用机器人越来越普及,这类能长期陪伴、持续观察、真正记住"你的世界"的系统,或许会成为日常生活中不可或缺的一部分。当然,随之而来的隐私问题和如何确保记忆的准确性与可信度,也是这条路上不得不认真面对的挑战,值得研究者和使用者共同思考。

Q&A

Q1:ReflectWorld-MM是怎么识别同一个人在不同时间出现的?

A:ReflectWorld-MM用人脸和身体外貌两种特征同时比对。每个被识别的人都有一个专属的"图库",系统在新的视频段里检测到人物时,会把他的外貌特征和图库里的记录比对,得出相似度分数,然后由专门的"仲裁模块"决定是否认定为同一个人。这个仲裁模块是唯一有权写入身份结论的组件,避免单次误判污染整个记忆库。

Q2:ReflectWorld-MM的语义记忆可以删除错误信息吗?

A:可以。每当某个人或物体积累了新的5次观测,系统就会运行一次"整合"流程,把新观测和已有语义知识放在一起审查,可以做出新增、更新、删除或保持不变四种操作。所以如果之前记录了一条错误事实,后续的观测可以触发删除操作将其移除,记忆是动态可修改的,而不是只增不减。

Q3:普通用户怎么设置ReflectWorld-MM的提醒规则?

A:用户可以用自然语言设置规则,比如"当狗在沙发上时通知我"。这条规则会被存入程序记忆,并在每次感知视频时自动检查是否被触发。但触发不是立刻报警,而是经过仲裁模块结合通知策略和最近提醒记录综合判断后才发出通知,避免重复或误报。系统代码已开源,有技术能力的用户可以自行部署。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
即将双台风?最新路径公布→

即将双台风?最新路径公布→

金哥说新能源车
2026-08-03 00:31:35
惊天烟雾弹!特朗普!紧急认怂了!

惊天烟雾弹!特朗普!紧急认怂了!

大嘴说天下
2026-08-02 19:22:31
贵州省管干部任前公示

贵州省管干部任前公示

新浪财经
2026-08-02 19:12:36
毛主席问郭沫若当代谁的书法最好?为啥郭沫若列举了这三位?

毛主席问郭沫若当代谁的书法最好?为啥郭沫若列举了这三位?

零点历史说
2026-07-13 13:00:04
加纳乔完成维拉首秀:很高兴再次享受足球,每天进步1%

加纳乔完成维拉首秀:很高兴再次享受足球,每天进步1%

懂球帝
2026-08-02 22:37:02
詹姆斯在四队夺冠就会是GOAT?前NBA球员霍里:得了吧,76人没它更强

詹姆斯在四队夺冠就会是GOAT?前NBA球员霍里:得了吧,76人没它更强

小徐讲八卦
2026-08-02 16:53:27
全球这波“信任票”为什么投向中国。这两天,进展受到关注

全球这波“信任票”为什么投向中国。这两天,进展受到关注

吃货的分享
2026-08-03 00:35:26
洪晃讲出母亲章含之的人生两面性:对待丈夫前妻的子女分毫不让,自己幼时遭继母虐待险些被迫休学,前后遭遇对照异常讽刺

洪晃讲出母亲章含之的人生两面性:对待丈夫前妻的子女分毫不让,自己幼时遭继母虐待险些被迫休学,前后遭遇对照异常讽刺

磊子讲史
2026-07-27 15:24:28
大流量卡“大撤退”:从野蛮生长到全面收紧,谁在为“增量不增收”买单?

大流量卡“大撤退”:从野蛮生长到全面收紧,谁在为“增量不增收”买单?

每日经济新闻
2026-08-01 14:08:07
63岁关之琳现状:独居豪宅无子女,与狗为伴,富豪前夫69岁喜当爹

63岁关之琳现状:独居豪宅无子女,与狗为伴,富豪前夫69岁喜当爹

娱说瑜悦
2026-07-31 15:11:00
都是好吃惹的祸!一条60斤大鱼,被钓上来17次,老板气得扇它嘴巴子

都是好吃惹的祸!一条60斤大鱼,被钓上来17次,老板气得扇它嘴巴子

看晓天下事
2026-07-19 15:13:12
165cm张天爱穿制服像“焊死”:腿段+肩腰比,1cm身高差藏4个秘密

165cm张天爱穿制服像“焊死”:腿段+肩腰比,1cm身高差藏4个秘密

艺利森
2026-08-02 10:14:40
日本要慌了?中国首条100%自主可控的,高端光刻胶生产线投产

日本要慌了?中国首条100%自主可控的,高端光刻胶生产线投产

互联网.乱侃秀
2026-08-02 14:49:44
新婚夜妻子密会情夫,我当众打断了情夫双腿,转头自己报警自首

新婚夜妻子密会情夫,我当众打断了情夫双腿,转头自己报警自首

千秋文化
2026-06-27 19:55:14
通关仅需1h!性感八尺大人"温暖"新游可亲密大姐姐

通关仅需1h!性感八尺大人"温暖"新游可亲密大姐姐

游民星空
2026-08-02 19:12:29
无锡2个大型购物中心,太猛了!

无锡2个大型购物中心,太猛了!

无锡eTV全媒体
2026-08-02 19:48:11
压轴大魔王!小米新机官宣:7月31日,正式登场!

压轴大魔王!小米新机官宣:7月31日,正式登场!

科技堡垒
2026-07-31 08:50:47
西蒙斯:布朗不满塔图姆复出后重夺赛前压轴出场位置

西蒙斯:布朗不满塔图姆复出后重夺赛前压轴出场位置

北青网-北京青年报
2026-08-02 20:38:02
11.5万起+920km续航+1008km续航:比亚迪三款新车8月集中官宣定档

11.5万起+920km续航+1008km续航:比亚迪三款新车8月集中官宣定档

娱乐圈的笔娱君
2026-08-02 15:34:55
国家防总、应急管理部针对贵州启动防汛四级应急响应

国家防总、应急管理部针对贵州启动防汛四级应急响应

新京报
2026-08-02 18:10:05
2026-08-03 02:07:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9397文章数 567关注度
往期回顾 全部

科技要闻

零跑月销10万破纪录!比亚迪奇瑞海外卖爆

头条要闻

52岁中国登山家王钟确认遇难 遗体被雪崩冲到千米之下

头条要闻

52岁中国登山家王钟确认遇难 遗体被雪崩冲到千米之下

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

徐克和多位港星送别施南生

财经要闻

央行:继续实施好适度宽松的货币政策

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

旅游
游戏
房产
本地
公开课

旅游要闻

大栅栏最小的茶园同乐轩满满烟火气

LCK第三赛段:Kanavi连续掉点,KT拒绝让一追二击败HLE

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版