网易首页 > 网易号 > 正文 申请入驻

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

0
分享至

OmniSearch团队 投稿
量子位 | 公众号 QbitAI

多模态检索增强生成(mRAG)也有o1思考推理那味儿了!

阿里通义实验室新研究推出自适应规划的多模态检索智能体。

名叫OmniSearch,它能模拟人类解决问题的思维方式,将复杂问题逐步拆解进行智能检索规划。

直接看效果:

随便上传一张图,询问任何问题,OmniSearch都会进行一段“思考过程”,不仅会将复杂问题拆解检索,而且会根据当前检索结果和问题情境动态调整下一步检索策略

相比传统mRAG受制于其静态的检索策略,这种设计不仅提高了检索效率,也显著增强了模型生成内容的准确性。

为评估OmniSearch,研究团队构建了全新Dyn-VQA数据集

在一系列基准数据集上的实验中,OmniSearch展现了显著的性能优势。特别是在处理需要多步推理、多模态知识和快速变化答案的问题时,OmniSearch相较于现有的mRAG方法表现更为优异。

目前OmniSearch在魔搭社区还有demo可玩。

动态检索规划框架,打破传统mRAG局限

传统mRAG方法遵循固定的检索流程,典型的步骤如下:

  • 输入转化:接收多模态输入(例如图像+文本问题),将图像转化为描述性文本(例如通过image caption模型)。
  • 单一模态检索:将问题或描述性文本作为检索查询,向知识库发送单一模态检索请求(通常是文本检索)。
  • 固定生成流程:将检索到的信息与原始问题结合,交由MLLM生成答案。

OmniSearch旨在解决传统mRAG方法的以下痛点:

  • 静态检索策略的局限:传统方法采用固定的两步检索流程,无法根据问题和检索内容动态调整检索路径,导致信息获取效率低下。
  • 检索查询过载:单一检索查询往往包含了多个查询意图,反而会引入大量无关信息,干扰模型的推理过程。

为克服上述局限,OmniSearch引入了一种动态检索规划框架。

OmniSearch的核心架构包括:

  • 规划智能体(Planning Agent):负责对原始问题进行逐步拆解,根据每个检索步骤的反馈决定下一步的子问题及检索策略。
  • 检索器(Retriever):执行实际的检索任务,支持图像检索、文本检索以及跨模态检索。
  • 子问题求解器(Sub-question Solver):对检索到的信息进行总结和解答,具备高度的可扩展性,可以与不同大小的多模态大语言模型集成。
  • 迭代推理与检索(Iterative Reasoning and Retrieval):通过递归式的检索与推理流程,逐步接近问题的最终答案。
  • 多模态特征的交互:有效处理文本、图像等多模态信息,灵活调整检索策略。
  • 反馈循环机制(Feedback Loop):在每一步检索和推理后,反思当前的检索结果并决定下一步行动,以提高检索的精确度和有效性。

构建新数据集进行实验评估

为了更好地评估OmniSearch和其它mRAG方法的性能,研究团队构建了全新的Dyn-VQA数据集。Dyn-VQA包含1452个动态问题,涵盖了以下三种类型:

  • 答案快速变化的问题:这类问题的背景知识不断更新,需要模型具备动态的再检索能力。例如,询问某位明星的最新电影票房,答案会随着时间的推移而发生变化。
  • 多模态知识需求的问题:问题需要同时从多模态信息(如图像、文本等)中获取知识。例如,识别一张图片中的球员,并回答他的球队图标是什么。
  • 多跳问题:问题需要多个推理步骤,要求模型在检索后进行多步推理。

这些类型的问题相比传统的VQA数据集需要更复杂的检索流程,更考验多模态检索方法对复杂检索的规划能力。

在Dyn-VQA数据集上的表现

  • 答案更新频率:对于答案快速变化的问题,OmniSearch的表现显著优于GPT-4V结合启发式mRAG方法,准确率提升了近88%。
  • 多模态知识需求:OmniSearch能够有效地结合图像和文本进行检索,其在需要额外视觉知识的复杂问题上的表现远超现有模型,准确率提高了35%以上。
  • 多跳推理问题:OmniSearch通过多次检索和动态规划,能够精确解决需要多步推理的问题,实验结果表明其在这类问题上的表现优于当前最先进的多模态模型,准确率提升了约35%。

在其它数据集上的表现

接近人类级别表现:

OmniSearch在大多数VQA任务上达到了接近人类水平的表现。例如,在VQAv2和A-OKVQA数据集中,OmniSearch的准确率分别达到了70.34和84.12,显著超越了传统mRAG方法。

复杂问题处理能力:

在更具挑战性的Dyn-VQA数据集上,OmniSearch通过多步检索策略显著提升了模型的表现,达到了50.03的F1-Recall评分,相比基于GPT-4V的传统两步检索方法提升了近14分。

模块化能力与可扩展性

OmniSearch可以灵活集成不同规模和类型的多模态大语言模型(MLLM)作为子问题求解器。

无论是开源模型(如Qwen-VL-Chat)还是闭源模型(如GPT-4V),OmniSearch都能通过动态规划与这些模型协作完成复杂问题的解决。

它的模块化设计允许根据任务需求选择最合适的模型,甚至在不同阶段调用不同大小的MLLM,以在性能和计算成本之间实现灵活平衡。

下面是OmniSearch和不同模型配合的实验结果:

Paper:https://arxiv.org/abs/2411.02937
Github:https://github.com/Alibaba-NLP/OmniSearch
ModelScope Demo: https://modelscope.cn/studios/iic/OmniSearch/summary?header=default&fullWidth=false

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
比赖清德还狂的人出现了,如果她当选台湾领导人,解放军必定收台

比赖清德还狂的人出现了,如果她当选台湾领导人,解放军必定收台

芳芳历史烩
2026-03-29 21:09:31
婆婆赶我出门,全家当没发生,我立刻挂失工资卡,他们急得团团转

婆婆赶我出门,全家当没发生,我立刻挂失工资卡,他们急得团团转

云端小院
2026-04-04 09:07:23
赖清德拒绝见面,郑丽文访陆前4句话锁定大局,两岸统一开始提速

赖清德拒绝见面,郑丽文访陆前4句话锁定大局,两岸统一开始提速

千羽解读
2026-04-03 19:21:29
没有力量,读一读伟人这10首诗词,力量马上来了

没有力量,读一读伟人这10首诗词,力量马上来了

长风文史
2026-04-01 12:38:12
国际油价大幅飙升!4月7日国内油价将迎调整

国际油价大幅飙升!4月7日国内油价将迎调整

爱看头条
2026-04-03 14:15:50
美国绕月飞船好消息:厕所修好了!坏消息:两个Outlook都坏了!

美国绕月飞船好消息:厕所修好了!坏消息:两个Outlook都坏了!

快科技
2026-04-03 14:31:38
突发!微软宣布全面退出中国!

突发!微软宣布全面退出中国!

大白聊IT
2025-04-07 13:26:38
浙创投领投9000万元两个月后张雪机车夺冠,商事律师:浙江国资将“长钱”导向硬科技,目前10.9亿元估值或仍偏低

浙创投领投9000万元两个月后张雪机车夺冠,商事律师:浙江国资将“长钱”导向硬科技,目前10.9亿元估值或仍偏低

极目新闻
2026-04-04 09:15:04
张志新的儿女今何在?背后的真相令人泪目

张志新的儿女今何在?背后的真相令人泪目

深度报
2026-03-01 23:48:59
上海市中心这幢楼,深陷“群租困局”!物业称“管不了”,相关部门回应

上海市中心这幢楼,深陷“群租困局”!物业称“管不了”,相关部门回应

新民晚报
2026-04-03 19:45:55
中国队力克卫冕冠军,双双小组第一出线

中国队力克卫冕冠军,双双小组第一出线

刺猬篮球
2026-04-04 10:10:21
想粗就粗?男人的新福音:“增粗贴片”问世,效果不止3个月

想粗就粗?男人的新福音:“增粗贴片”问世,效果不止3个月

科学认识论
2026-04-03 12:00:21
最高罚1万!事关深圳“电鸡”治理,两项重磅新规本月落地

最高罚1万!事关深圳“电鸡”治理,两项重磅新规本月落地

南方都市报
2026-04-03 18:54:17
浅野拓磨:日本队虽然赢球,但场面表现和强队差距还是很明显

浅野拓磨:日本队虽然赢球,但场面表现和强队差距还是很明显

懂球帝
2026-04-04 01:59:07
地球将在2026年8月12日“失重7秒”死4000万人?谣言!!!

地球将在2026年8月12日“失重7秒”死4000万人?谣言!!!

大道微言
2026-04-03 12:22:13
一场103-115让火箭很无奈,森林狼死守第六,完美避开雷霆、掘金

一场103-115让火箭很无奈,森林狼死守第六,完美避开雷霆、掘金

毒舌NBA
2026-04-04 10:35:58
这就是公开辱华的后果!取消冠军头衔只是开始,职业生涯也全毁了

这就是公开辱华的后果!取消冠军头衔只是开始,职业生涯也全毁了

阿凫爱吐槽
2025-12-17 17:24:39
广东男篮vs广厦:杜峰教练手握四大利好,有望稳稳拿下关键胜利

广东男篮vs广厦:杜峰教练手握四大利好,有望稳稳拿下关键胜利

范动舍长
2026-04-04 05:43:33
中方抛弃幻想,8500亿美债售卖困难,从1.3167万亿美元到6835亿…

中方抛弃幻想,8500亿美债售卖困难,从1.3167万亿美元到6835亿…

福建平子
2026-04-04 09:03:55
有人刻意躲湖人,有人主动挑湖人,两队上演极致博弈!

有人刻意躲湖人,有人主动挑湖人,两队上演极致博弈!

田先生篮球
2026-04-03 11:40:53
2026-04-04 11:52:50
量子位 incentive-icons
量子位
追踪人工智能动态
12412文章数 176439关注度
往期回顾 全部

科技要闻

内存一年涨四倍!国产手机厂商集体涨价

头条要闻

男子建了18个"5G基站"被政府叫停 发现红头文件为伪造

头条要闻

男子建了18个"5G基站"被政府叫停 发现红头文件为伪造

体育要闻

刹不住的泰格·伍兹,口袋里的两粒药丸

娱乐要闻

阚清子口碑赢了!全开麦跑调拒绝重唱

财经要闻

刘纪鹏:只盼长慢牛,巩固4000点是关键

汽车要闻

17万级海豹07EV 不仅续航长还有9分钟满电的快乐

态度原创

本地
教育
亲子
房产
军事航空

本地新闻

跟着歌声游安徽,听古村回响

教育要闻

3000余名师生凌晨出发祭英烈,5个多小时,徒步27公里步数破3万

亲子要闻

“不是!这对吗?”那些萌娃的顶级理解

房产要闻

小阳春全面启动!现房,才是这波行情里最稳的上车票

军事要闻

俄国防部:一架苏-30战机在克里米亚坠毁

无障碍浏览 进入关怀版