网易首页 > 网易号 > 正文 申请入驻

ECCV 2026 | 北大团队提出 AgentHOI:不用一张HOI标注图,大模型也能看懂「谁在对什么做什么」

0
分享至



该论文的第一作者和通讯作者均来自北京大学王选计算机研究所,共同第一作者为博士生雷廷和实习生刘佳林,通讯作者为博士生导师刘洋。团队近年来在 TPAMI、IJCV、CVPR、ICML 等顶会上有多项代表性成果发表,多次荣获国内外多模态理解与生成竞赛冠军,和国内外知名高校、科研机构广泛开展合作。

本文主要介绍来自该团队的最新论文 Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild。

该工作聚焦于开放世界中的人 — 物交互检测任务,提出了无需 HOI 专项训练的 AgentHOI 框架,将检测过程拆解为 “交互语义推理 — 人物与物体定位” 两个环节,并设计上下文感知多轮推理和多维度交互定位机制,使模型在无需 HOI 标注数据和参数更新的情况下,也能发现细粒度交互并准确定位相关实例,为开放词汇、低标注成本的人 — 物交互理解提供了新的研究思路。

目前该工作已被 ECCV 2026 正式接收,相关代码与模型已全部开源。



  • 论文标题:Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control
  • 作者:雷廷、刘佳林、徐铸、彭宇新、刘洋
  • 机构:北京大学王选计算机研究所
  • 项目主页:https://ltttpku.github.io/AgentHOI-Page
  • 论文链接:https://arxiv.org/abs/2607.13881
  • 代码地址:https://github.com/oceanflowlab/AgentHOI

传统 HOI 检测,为什么一到真实世界就容易失灵?

这里的 HOI,指 Human-Object Interaction,也就是人与物体交互检测。它要求模型输出类似 “人 - 骑 - 自行车”、“人 - 拿 - 杯子” 这样的结构化三元组,并同时框出对应的人和物体,这项能力是场景理解的重要基础,可用于机器人感知、智能驾驶、视频分析等任务。

如图 1 所示,现有 HOI 检测器大多采用监督学习范式:先规定动作与物体的类别词表,再用带有人框、物体框和交互标签的数据训练分类器。这种方法在封闭测试集里效果不错,却有两个天然短板。

一是标注成本高。复杂图像中可能同时出现多个人、多个物体和多种动作,穷举并标注所有交互十分费时。

二是泛化受限。现实中的动作组合、物体外观和图像风格几乎无法提前列完;一旦测试画面偏离训练分布,模型就容易 “见过词,却没见过这种组合”。



图 1 和现有方法的框架对比

近年的开放词汇 HOI 方法开始借助 CLIP 或多模态大模型,但很多方案仍把它们当作特征提取器、语义对齐器或提示词生成器,最后依然要训练任务专用分类器。

AgentHOI 则把问题重新拆解:HOI 检测不一定非要是一个固定词表上的分类任务,也可以是 “开放语义推理 + 精确空间定位” 的协作过程。

一个模型负责想,一个模型负责找

AgentHOI 的基础版本(AgentHOI-Base)由两个现成的视觉基础模块组成。

第一步,多模态大模型查看整张图像,根据场景推理可能存在的 “动作 - 物体” 组合。例如,它可以先判断画面中有人 “滑滑板”。

第二步,视觉定位模型接收相应的文字描述,分别找出执行动作的人和被交互的物体,输出两者的边界框。

论文实验采用 GPT-4o 承担多模态理解与推理,GroundingDINO 承担空间定位。整个流程不需要在 HOI 数据上重新训练,也没有引入 HOI 专项可学习参数。

不过,直接把两个基础模型串起来还不够。如图 2 所示,研究团队发现,复杂场景里主要有两类问题:



图 2 (a):上下文感知多轮推理提升交互识别准确率;(b):多维度交互定位提升复杂场景下的实体定位准确

其一,多模态大模型容易只说出最显眼的动作。如果一个人同时踩着滑板滑行、背着背包,首次回答可能只识别出前一种交互,遗漏 “背着背包” 这一关系。论文统计显示,相比只有一个 HOI 的图像,多 HOI 场景中的交互召回率会下降 14.92%。

其二,定位提示太笼统时,模型容易找错人或物。比如两个人同时骑摩托车,只输入 “一个正在骑摩托车的人”,定位模型很难知道具体指哪一个。

为此,如图 3 所示,完整版 AgentHOI 加入了两套关键机制:



图 3 (a):AgentHOI-Base 方法概览;(b):AgentHOI 完整的方法概览

上下文感知多轮推理(Context-aware Multi-round Reasoning,CMR)

如图所示,AgentHOI 并非通过一次提问直接生成全部交互,而是将识别过程拆分为三个相互衔接的推理阶段,利用前一轮结果持续补充和细化 HOI 预测。

第一轮是初始 HOI 识别。多模态大模型首先观察整幅图像,识别画面中较为显著的人 — 物交互。例如,模型可以发现左侧的人正在拿着一个瓶子。

第二轮是 HOI 再挖掘。系统将首轮结果作为上下文,进一步提示模型检查尚未识别的交互。在已有结果的帮助下,模型会把注意力转向其他人物和物体,例如继续发现右侧的女性拿着苹果,从而减少复杂场景中的交互遗漏。

第三轮是动作重分配。针对已经识别的人 — 物组合,系统结合该物体可能对应的动作类别,引导模型重新检查二者之间的关系。例如,对于人与瓶子的交互,除 “拿着” 之外,还可能同时存在 “握住” 等更细粒度的动作。经过这一轮复核,模型能够为同一组人物和物体补充更加完整的交互标签。

三个阶段分别负责发现主要交互、补充遗漏交互和细化动作类别,使模型在多人、多物体场景中获得更完整的 HOI 识别结果。

多维度交互定位(Multifaceted Interaction Localization,MIL)

获得交互类别后,AgentHOI 还需要在图像中准确定位每条交互对应的人和物体。基础方法通常将 HOI 三元组转换为简单描述,例如 “一个拿着瓶子的人”。但在多人、多物体同时出现的场景中,这类描述难以区分外观和动作相近的实例,容易导致定位错误。

为此,AgentHOI 设计了多维度交互定位机制。它利用多模态大模型为每个交互实例分别生成人物描述和物体描述,并在提示词中融入三类信息:

  • 语义信息:人物正在执行什么动作,以及与哪个物体发生交互;
  • 空间信息:人物或物体位于画面中的大致位置;
  • 外观信息:人物的服装、帽子以及物体的颜色、标签等可区分特征。

以图中的人物 — 瓶子交互为例,人物描述可由简单的 “拿着瓶子的人” 扩展为 “画面左侧穿黑色上衣、戴帽子、正在拿着或握住瓶子的人”;物体描述则可写为 “被人拿着或握住的、带红色标签的瓶子”。随后,视觉定位模型分别根据两条描述寻找对应的人和物体,并输出各自的边界框。

通过这种面向具体实例的消歧描述,MIL 能够综合利用动作、位置和外观信息,降低相似人物或物体之间的混淆,使识别出的 HOI 语义与图像中的具体实例准确对应。

开放世界交互检测性能分析

研究团队首先在 HICO-DET 上评估 AgentHOI。该测试集包含 9658 张图像、600 类 HOI 组合,涉及 118 种动作和 80 类物体。

如表 1 所示,在零样本评测中,AgentHOI 在未见动词(UV)和稀有优先未见组合(RF-UC)设置上分别取得 29.85 和 38.64 mAP,为论文表格中对比方法的最佳结果。

为了模拟真实世界中的分布变化,团队还对测试图像进行了风格迁移和画质退化,后者包括模糊、噪声与压缩等情况。在这些变化下,依赖源数据分布训练的监督方法普遍出现明显性能下降;AgentHOI 在 UV、UO 和 RF-UC 等多项设置上保持领先,显示出较强的跨风格和抗退化能力。



表 1 HICO-DET 数据集零样本设定下的定量实验结果

如表 2 所示,在默认 HOI 检测设置下,AgentHOI 整体达到 29.61 mAP,高于 OpenCat 的 25.82、Weakly-HOI 的 25.70 和 Align-Former 的 20.85。更明显的差距出现在 Rare 类别:AgentHOI 得到 40.33 mAP,而对比的弱监督方法中最高为 24.52。

这背后的原因是,弱监督方法即便减少了边界框标注,仍需从有限的任务数据中学习交互模式;当某些类别样本很少时,视觉规律难以学稳。AgentHOI 则直接调用基础模型在大规模预训练中获得的视觉 - 语言知识,再通过多轮推理发现长尾动作,因此不必依赖某一类交互在 HOI 训练集里出现多少次。



表 2 HICO-DET 数据集默认设定下的定量实验结果

如表 3 所示,在词表规模更大、类别更丰富的 SWIG-HOI 数据集上,AgentHOI 无需针对新数据集重新训练,整体取得 13.00 mAP,未见类别取得 11.61 mAP。后者超过全监督 CMD-SE 的 10.70 mAP,并接近 SGC-Net 的 12.46 mAP。



表 3 SWIG-HOI 数据集的定量实验结果

更值得关注的是,AgentHOI 不仅能识别数据集 “规定好的答案”,还能发现标注之外的真实交互。面对大规模 HOI 数据集中常见的漏标问题,它可通过多轮推理和上下文理解,补充识别 “遛狗” 等细微或重叠动作;即使不使用特定数据集预设的物体与动作词表,也能理解开放场景中的任意交互。例如,面对一张 “骑马” 图片,除了数据集标注的 “ride horse”,AgentHOI 还能进一步识别 “straddle”“hold” 和 “swing lasso” 等动作。这意味着,AgentHOI 正在推动 HOI 检测从 “在固定选项中做选择”,迈向开放、灵活的场景理解。



图 4 HICO-DET 数据集上的定性结果

总结与展望

AgentHOI 将 HOI 检测拆分为开放语义推理和空间定位两个环节,通过多模态大模型与视觉定位模型协作,在不使用 HOI 专项训练数据和不更新模型参数的情况下完成交互识别与定位。实验结果表明,这一框架在零样本、长尾类别和分布偏移等设置中具有一定的适应能力。

目前,该方法仍受到推理成本、基础模型能力和生成结果稳定性等因素的限制。未来可以进一步研究更轻量的推理流程、更可靠的交互验证机制,以及面向视频和动态场景的时序建模方法,在保留开放词汇能力的同时提高效率与稳定性。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
经常喝“山楂干”泡水,坚持一段时间后,身体会有5个好处!

经常喝“山楂干”泡水,坚持一段时间后,身体会有5个好处!

白米饭怎么吃
2026-07-18 12:26:23
乌克兰做梦没想到的危机:俄军导弹无人机不打,泽连斯基求助无门

乌克兰做梦没想到的危机:俄军导弹无人机不打,泽连斯基求助无门

坚果甜瓜
2026-07-31 13:41:26
大衣哥朱之文在景区演出,唱到一半突然停了,直接说:“我不演了”。不是设备出毛病,也不是台下有人闹事,其实是...

大衣哥朱之文在景区演出,唱到一半突然停了,直接说:“我不演了”。不是设备出毛病,也不是台下有人闹事,其实是...

背包旅行
2026-07-31 11:39:13
长鑫凭一己之力,把安徽抬进了GDP全国前十

长鑫凭一己之力,把安徽抬进了GDP全国前十

亚哥谈古论今
2026-07-29 23:18:19
贾静雯发文悼念

贾静雯发文悼念

背包旅行
2026-07-30 18:02:23
中央决定,黄志强履新职

中央决定,黄志强履新职

中国青年报
2026-07-30 14:44:37
勇士内部人士:库里不会申请交易 双方有意续约最高签2年1.367亿

勇士内部人士:库里不会申请交易 双方有意续约最高签2年1.367亿

醉卧浮生
2026-07-31 06:56:03
未来一周山东将出现持续性高温天气 局部地区可达40℃以上

未来一周山东将出现持续性高温天气 局部地区可达40℃以上

半岛官网
2026-07-31 09:47:23
TypeScript 2026年加速崛起,AI代码生成成最大推手

TypeScript 2026年加速崛起,AI代码生成成最大推手

我是一个养虾人
2026-07-30 10:49:45
属鸡人请留步!八月初,有件十万火急的事,你必须马上知晓!

属鸡人请留步!八月初,有件十万火急的事,你必须马上知晓!

普陀动物世界
2026-07-30 16:25:45
丢人丢到国外了!49岁中国奥运冠军严重违规被查,官方:他已辞职

丢人丢到国外了!49岁中国奥运冠军严重违规被查,官方:他已辞职

安海客
2026-07-31 00:16:43
水库清淤挖出一块奇石,放院子里做凳子5年,直到儿子的朋友上门

水库清淤挖出一块奇石,放院子里做凳子5年,直到儿子的朋友上门

白云故事
2026-03-18 14:40:05
为什么大获全胜的歼-10卖不出去,一败涂地的阵风却销量火爆?

为什么大获全胜的歼-10卖不出去,一败涂地的阵风却销量火爆?

基斯默默
2026-05-28 11:06:03
狄波拉抱着Quintus时,Lucas那个安静站着的样子更让人鼻酸

狄波拉抱着Quintus时,Lucas那个安静站着的样子更让人鼻酸

小椰的奶奶
2026-07-31 02:41:21
年薪40-100万元,优先入编,新建公立医院2026年招聘公告

年薪40-100万元,优先入编,新建公立医院2026年招聘公告

华医网
2026-07-31 05:41:21
银行存款大调整!下半年起,存款超20万的家庭,记住“3要2不要”

银行存款大调整!下半年起,存款超20万的家庭,记住“3要2不要”

小祁谈历史
2026-07-31 06:09:38
原来他是王虹父亲,为女儿放弃政府办工作,怪不得女儿拿国际大奖

原来他是王虹父亲,为女儿放弃政府办工作,怪不得女儿拿国际大奖

翰飞观事
2026-07-28 14:27:17
智驾“小蓝灯”迎来管控!灯光滥用易引发安全风险,新标准正在修订

智驾“小蓝灯”迎来管控!灯光滥用易引发安全风险,新标准正在修订

澎湃新闻
2026-07-30 11:36:28
前无古人!詹姆斯打破了大谷翔平保持的纪录,成功登顶全体育历史榜首

前无古人!詹姆斯打破了大谷翔平保持的纪录,成功登顶全体育历史榜首

小七说篮球
2026-07-30 11:31:20
哈马斯负责人证实就武器问题达成协议

哈马斯负责人证实就武器问题达成协议

参考消息
2026-07-31 14:12:39
2026-07-31 15:31:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13645文章数 142710关注度
往期回顾 全部

科技要闻

最多80%!GPT5.6官宣降价,中国厂商逼的?

头条要闻

为救患癌母亲 上海医生走危险"野路子":狗急了都跳墙

头条要闻

为救患癌母亲 上海医生走危险"野路子":狗急了都跳墙

体育要闻

欧足联掀桌!因凡蒂诺这次真玩大了?

娱乐要闻

李小璐澄清夜宿门,被网友质疑想洗白

财经要闻

打新日确认!宇树科技IPO冲刺“冰与火”

汽车要闻

MG 07将是上汽的逆转时刻

态度原创

数码
游戏
时尚
教育
艺术

数码要闻

苹果新任CEO操刀打造!MacBook Neo大获成功:成了苹果最畅销笔记本

索尼PS5出货量达到9530万台 数字版游戏占比超82%

拯救基础款,时髦入秋

教育要闻

高中英语show up用法详解:为何不是“展示上面”?历年真题解析+核心考点速记

艺术要闻

一位博士彻底关掉手机旅行4个月,险些陷入绝境

无障碍浏览 进入关怀版