网易首页 > 网易号 > 正文 申请入驻

AdaResoner实现Agentic Vision的主动「视觉工具思考」

0
分享至



你见过 7B 模型在拼图推理上干翻 GPT-5 吗?

不是靠堆参数,不是靠更大的数据,而是靠一件事:学会「什么时候该用工具」。

大多数「工具增强」模型是这样的:遇到任务 X → 调用固定工具 Y → 祈祷结果正确。一旦场景稍微变化,模型就开始抽风——不知道什么工具该用、什么工具不该用。

AdaReasoner 解决的是更本质的问题:把 what / when / how(用什么、何时用、怎么用)当成推理能力来学。



  • 论文标题:AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
  • 论文(arXiv):https://arxiv.org/abs/2601.18631
  • 项目主页:https://adareasoner.github.io
  • 代码:https://github.com/ssmisya/AdaReasoner
  • 模型与数据:https://huggingface.co/collections/hitsmy/adareasoner
  • 视频(YouTube):https://www.youtube.com/watch?v=_SOyD-lomOM

先看 10 秒效果:


https://mp.weixin.qq.com/s/WH8kXeIsh97T7WjO0m2xRA?search_cli

AdaReasoner 工作流程示意

Google 近期宣布,为其轻量级模型 Gemini 3 Flash 引入一项名为「Agentic Vision」(代理视觉)的新能力。

这项更新标志着多模态 AI 处理图像的方式发生了根本性转变:从传统的静态识别,升级为具备「思考、行动、观察」循环的主动调查模式。

在此之前,包括 GPT 在内的大多数前沿多模态模型处理图像的方式类似于人类的「匆匆一瞥」:模型接收图像,进行一次性处理并输出结果。这种方式在面对需要细致观察的任务时,往往会因为细节丢失而产生幻觉或猜测。

Agentic Vision 的工作机制:Gemini 3 Flash 现在能够像人类调查员一样通过以下循环进行推理:

  • 思考(Think)——分析用户指令和图像初步内容,制定调查计划。
  • 行动(Act)——自动生成并执行 Python 代码来操作图像。例如,对图像进行缩放、裁剪特定区域、旋转视角或绘制辅助线。
  • 观察(Observe)——检查代码执行后的新视图或数据,获取更精确的视觉证据。

上述过程可以多次迭代,直到模型收集到足够的确凿证据来回答问题。

有意思的是:AdaReasoner 与 Agentic Vision 殊途同归。AdaReasoner 同样实现并验证了几乎相同的范式:



工业界与学术界同时押注「主动工具使用」,说明这个方向正在成为多模态推理的主流范式。

AdaReasoner 的独特价值在于:我们不只是验证了这套范式有效,更提出了一套让开源小模型也能习得这种能力的训练方法——这正是接下来要详细介绍的内容。

01 痛点:多模态推理为什么

总是「看起来很会,细节就开始猜」?

在多模态推理里,「看清细节」和「多步推理」经常互相卡脖子:

感知不够精确 → 证据不足 → 推理再漂亮也容易变成「guided guessing」;

反过来,如果能把关键证据用工具查出来、画出来、验证出来,模型就能把算力用在判断与规划上。

换句话说:工具不是外挂,而是把推理从「猜」拉回「查」的关键路径。

02 一句话介绍 AdaReasoner:

把工具使用当成「通用推理技能」

AdaReasoner 是一个训练范式:让模型不仅会「调用工具」,更会做三类决策:

  • 选择:该用哪个工具?要不要组合多个工具?
  • 时机:什么时候该用?什么时候不该用?
  • 鲁棒性:工具失败/无用怎么办?是否回退、是否换策略?



AdaReasoner 把「工具使用」当成推理技能来学习:会采纳有用工具、丢弃无关工具,并按任务调节调用频率。

03 三个关键设计:

让「会用工具」从口号变成能力

3.1 Tool Cold Start (TC):把「犯错-修正」写进数据里

我们不是只给模型看「完美路径」,而是刻意加入两类真实世界会发生的场景:

  • 反思与回溯:试一下 → 检查 → 不对就撤回/换方案。
  • 工具失败处理:工具返回错误/无效 → 及时止损 → 回退到模型自身能力。



定性案例:多轮工具规划 + 反思纠错 + 组合工具完成复杂视觉推理

3.2 Tool-GRPO (TG):优化「多轮工具编排」,而不是单次调用

多模态工具推理往往不是「一次调用结束」,而是多回合:

观察 → 调用 → 再观察 → 再调用 → 最终回答。

Tool-GRPO 针对 multi-turn 场景做了专门的强化学习优化,并用自适应奖励把工具使用变成「不确定时的可靠后备」,而不是强制流程。

3.3 Adaptive Learning (ADL):逼模型学「语义」,别背「名字」

为了避免模型死记硬背某个工具名(比如看到 "Point" 就条件反射),我们做了两件事:

  • 工具名/参数名随机化(去掉字面提示)。
  • 工具描述改写(同一语义、多种表达)。



随机化训练的直观示意



AdaReasoner 框架总览:Tool Cold Start → Tool-GRPO → Adaptive Learning

04 最硬的证据:

小模型为什么能「跨级打怪」?

先给结论:AdaReasoner-7B 相对 base 模型在多个基准上实现显著提升(在选取的 8 个 benchmark 上平均 +24.9%),并在结构化推理任务上接近满分。



主实验结果:在 VSP、Jigsaw、GUIQA 等任务上显著提升。

更重要的是:不是「工具越多越好」,而是训练配方决定工具是否真的帮得上忙。

例如在单任务设置下:

  • VSP: Base 28.09 → TC 64.91 → TG 73.18 → TC+TG 97.64
  • Jigsaw: Base 45.70 → TC 84.20 → TC+TG 96.60(超过 GPT-5 的 80.10)



瓶颈迁移示意:当工具规划足够好,性能瓶颈从「模型规模」部分迁移到「工具效用与工具规划能力」

05 最有意思的部分:模型真的

学出了「三种自适应工具行为」

这部分是 AdaReasoner 最像「智能体」的地方:我们没有写规则让它这么做,但它在 RL 过程中学会了。

行为 1:会「采纳」有用的新工具(Adopt)

把 A* 规划工具放进强化学习阶段(Cold Start 没见过),模型会逐步提高调用频率并稳定掌握:

VSP Navigation 从 44.83 → 96.33



Navigation 任务示意



A* 工具调用频率随 RL 训练演化

行为 2:会「丢弃」无关工具(Discard)

更关键的是:A* 对 Verify 任务没用,甚至是干扰项。

在「只在推理时提供 A*」的设置里,Verify 会出现 94.20 → 80.00 的下降。

而在 RL 训练后,模型会逐步压制无关调用,让 Verify 维持在接近满分(99.20)。

一句话:它不仅会用工具,还会学会「别乱用」。

行为 3:会「调节」调用频率(Modulate)

工具也不是开/关二选一。模型会根据子任务「调频」:

Point 工具在导航更关键(~3.2 calls/sample),在验证更克制(~1.0 call/sample)



Point 工具调用频率「调频」:Navigation 中更关键,Verification 中更克制

06 换工具说明书

也能用:泛化与稳健性

现实里最常见的崩溃方式是:工具定义、参数名、描述文案一变,模型就「不会用了」。

AdaReasoner 用 ADL(随机化 + 改写)把「工具规划」从文本表面形式里解耦出来。

一个很直观的证据来自工具使用统计:

  • 在 Jigsaw 上达到 3.54 CPS 且工具执行成功率 98.50%,最终准确率 88.60。
  • 在 VStar 这种更开放的 VQA 上仍能主动调用工具(1.47 CPS)并取得 70.68。



工具使用统计(CPS、成功率)与性能

此外,使用 ADL,模型能够更容易在新的任务上取得更好的表现。我们仅使用 Jigsaw 这一个任务的 SFT 数据,在三个任务上 RL,可以看到,使用 ADL 的版本能够在另外两个任务上给模型带来效果上的提升。



ADL 能将单个任务上学来的 agent planning 能力迁移到 SFT 没见过的任务上。

07 我们想强调的

学术结论(Takeaways)

多模态推理不只是 「think harder」。更关键的是:

actively seeing, verifying, and planning with tools.

当工具编排学得足够好,瓶颈会发生迁移:

model scale → tool utility + tool planning

这对小模型尤其重要:参数有限时,「会用工具」就是最直接的能力放大器。

从 Agentic Vision 看趋势:Google 用 Agentic Vision 把 Think-Act-Observe 内置到 Gemini,学术界用 AdaReasoner 验证这套范式在开源模型上的可行性——两条路线同时验证了「主动工具使用」的价值。对于希望在自己数据/场景上复现这种能力的研究者和开发者,AdaReasoner 提供了一套完整的开源方案。

Adaptive Learning 对提升模型的泛化性也有很大帮助,可以帮助将 agent planning 能力迁移到以前没见过的 agent 和新的任务上去。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全网笑炸!仇人夺冠、全场嘘声、蹭照被嫌,特朗普世界杯社死三连杀名场面封神

全网笑炸!仇人夺冠、全场嘘声、蹭照被嫌,特朗普世界杯社死三连杀名场面封神

浪子的烟火人间
2026-07-21 00:40:03
从4999跌到3700!荣耀Magic8这波降价,背后藏着什么猫腻?

从4999跌到3700!荣耀Magic8这波降价,背后藏着什么猫腻?

小柱解说游戏
2026-07-21 01:21:45
协议首度公开!威廉王子大学隐姓埋名4年,全校守口如瓶无人泄密

协议首度公开!威廉王子大学隐姓埋名4年,全校守口如瓶无人泄密

用冷眼洞悉世界
2026-07-20 19:41:01
阿圭罗谈39岁梅西错失金球奖:真正定义世界杯的人,不是奖杯能决定!

阿圭罗谈39岁梅西错失金球奖:真正定义世界杯的人,不是奖杯能决定!

体育闲话说
2026-07-20 16:12:02
伊朗称摧毁约旦20个美军藏身处,打死美军数十人,还对多架飞机造成严重损坏

伊朗称摧毁约旦20个美军藏身处,打死美军数十人,还对多架飞机造成严重损坏

都市快报橙柿互动
2026-07-20 11:01:03
逼走中企后,印尼最大秘密爆出,部长紧急访华,欢迎中国都来投资

逼走中企后,印尼最大秘密爆出,部长紧急访华,欢迎中国都来投资

泠泠说史
2026-07-20 11:56:04
湖南侦破特大非法盗采稀土案:团伙设瞭望哨、配对讲机通风报信,共盗采稀土矿50余吨,12人落网,9人当庭认罪

湖南侦破特大非法盗采稀土案:团伙设瞭望哨、配对讲机通风报信,共盗采稀土矿50余吨,12人落网,9人当庭认罪

极目新闻
2026-07-20 09:59:11
40岁梅根·福克斯晒内衣照被嘲“当妈了尴尬”,反问:这出自我哪个前男友之手?

40岁梅根·福克斯晒内衣照被嘲“当妈了尴尬”,反问:这出自我哪个前男友之手?

浅遇时光
2026-07-20 00:33:36
浙江省杭州市富阳区杨瑞福二十年鱼塘积案依旧悬置,曝光后监管部门为何集体失声?

浙江省杭州市富阳区杨瑞福二十年鱼塘积案依旧悬置,曝光后监管部门为何集体失声?

VVV说话
2026-07-20 18:34:50
青春飞扬!亚马尔绽放出朝阳的光芒

青春飞扬!亚马尔绽放出朝阳的光芒

澎湃新闻
2026-07-20 10:08:28
91岁作曲家陈钢去世,遗憾与32岁妻子陆凌的往事

91岁作曲家陈钢去世,遗憾与32岁妻子陆凌的往事

荒野老五
2026-07-20 18:30:07
我妈妈兄弟姐妹七个人,到死都没来往,亲人之间如同陌生人

我妈妈兄弟姐妹七个人,到死都没来往,亲人之间如同陌生人

千秋文化
2026-07-11 19:25:54
美股AI芯片板块走高

美股AI芯片板块走高

财联社
2026-07-20 21:56:05
ESPN曝意足协接触瓜迪奥拉,谈话仅持续不到1分钟

ESPN曝意足协接触瓜迪奥拉,谈话仅持续不到1分钟

篮坛第一线
2026-07-21 00:04:15
如果台湾提出回归条件:社会制度不变,军队保留,大陆会同意吗?

如果台湾提出回归条件:社会制度不变,军队保留,大陆会同意吗?

经纬戎韬
2026-07-18 01:14:54
中日韩最大财团比较,三菱21万亿,三星2.1万亿,中国第1是谁!

中日韩最大财团比较,三菱21万亿,三星2.1万亿,中国第1是谁!

抽象派大师
2026-07-15 02:03:18
探店宁波新式舞厅:全国各地美女齐聚,玩法新潮彻底颠覆老印象

探店宁波新式舞厅:全国各地美女齐聚,玩法新潮彻底颠覆老印象

成都人的故事
2026-07-20 21:05:07
官媒发文,高调官宣42岁文章一大好消息,他和姚笛已经拉开距离

官媒发文,高调官宣42岁文章一大好消息,他和姚笛已经拉开距离

枫尘余往逝
2026-07-18 09:20:04
日本防相小泉出轨已婚少妇,不想家中老婆更风流,曾与外国人拍片

日本防相小泉出轨已婚少妇,不想家中老婆更风流,曾与外国人拍片

往史过眼云烟
2026-07-09 21:59:41
霸车位舆情彻底发酵!湖南涉事女子后续三条去向,结局早已注定

霸车位舆情彻底发酵!湖南涉事女子后续三条去向,结局早已注定

坠入二次元的海洋
2026-07-20 15:21:32
2026-07-21 03:31:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13562文章数 142695关注度
往期回顾 全部

科技要闻

网易科技"未来大奖2026上半年AI榜单"揭晓

头条要闻

媒体:驱逐所有以色列人 马来西亚对以强硬几乎零成本

头条要闻

媒体:驱逐所有以色列人 马来西亚对以强硬几乎零成本

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

谢霆锋发文确认父亲谢贤去世 享年89岁

财经要闻

AI开始挤泡沫

汽车要闻

综合续航超1600km 2027款星途ES上市置换价16.99万起

态度原创

房产
教育
亲子
家居
数码

房产要闻

北师附、人大附、西侨、丘海…招生、划片最新变化来了!

教育要闻

大女儿一下治好了爸爸的哑巴!姐弟互动视频火了,爸爸偏心太明显

亲子要闻

父母给孩子的压力太大,最终导致孩子得了抽眼症!

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

曝谷歌正研发全新Frozen v2芯片,可大幅提升Gemini模型运行效率

无障碍浏览 进入关怀版