![]()
这项由高通AI研究院(Qualcomm AI Research)完成的研究,发表于2026年欧洲计算机视觉大会(ECCV 2026),论文编号为arXiv:2607.09061,有兴趣深入了解的读者可通过该编号查询完整论文。
你有没有想过,当你看一张复杂的图片时,你的眼睛并不是一瞬间把整张图"拍"进大脑的?事实上,你的眼睛每秒会进行好几次快速跳动,每次只聚焦在一个小区域——先扫左上角,再跳到中间,然后移到右下角……就这样一点一点把信息拼凑起来,最终形成对整张图的理解。这种行为叫做"视觉扫视",是人类视觉系统几百万年演化出来的核心机制。
然而,当今几乎所有主流的AI视觉模型,都是把整张图一口气"吞"进去处理的——就好像用一台广角相机把整个场景同时拍下来,再从这张大照片里提取所有信息。这和人类的方式截然不同。那么,这种"一口吞"的方式到底有什么隐患?高通AI研究院的研究团队决定深挖这个问题。
他们的发现令人深思:现有的AI视觉模型,包括当下最先进的大型视觉语言模型,在面对"比训练时见过的更复杂的图片"时,会出现明显的性能崩溃。而他们提出的解决方案,正是让AI模型"学会像人眼一样逐步扫视图像",并配合一种能够记住每一步状态的循环计算结构——这个组合,才是让模型真正理解视觉信息、并举一反三的关键所在。
一、为什么AI模型"看图"会失灵——从一道数学题说起
要理解这项研究在解决什么问题,先来看一个类比。假设老师教你学加法,从一位数加到十位数,你练习了很多次之后,能很熟练地算出37+58=95。但如果老师突然出了一道三位数加法,比如374+586,你还能做吗?当然可以,因为你掌握了加法的"规则本身",而不只是记住了每道题的答案。
这种"把规则本身学会、然后在更复杂的情况下也能用"的能力,研究者把它称为"长度泛化"——意思是模型在训练时只见过"短"的情况,但在测试时面对"长"的情况依然能正确作答。
在语言AI领域,研究者早就发现,像GPT这样的Transformer模型在面对比训练时更长的序列时会表现大幅下滑。高通团队的这项研究,则首次系统地把这个问题搬到了视觉领域:当一张图里需要处理的信息量,超过了模型训练时见过的复杂程度,会发生什么?
为了研究这个问题,团队设计了一套视觉推理测试题,这些题目的共同特点是:答案不在图片的某个角落,而是分散在整张图的多个位置,必须把所有位置的信息综合起来才能得出正确答案。任务的"长度",就是图中需要访问的信息点数量——信息点越多,任务越长越复杂。
他们把"训练时见过的复杂度"和"测试时面对更高复杂度"的表现做了对比,结果发现:当前最先进的视觉AI模型,在训练范围内表现优异,但一旦测试复杂度超过训练范围,性能会急剧下滑,几乎失效。这说明这些模型并没有真正学会"规则本身",而是记住了某种只在特定复杂度下有效的"捷径"。
二、研究者设计了哪些测试——四道题考验AI的"举一反三"
为了让研究结果更有说服力,研究团队设计了四种不同类型的视觉任务,每种任务从不同角度考验模型的泛化能力。
第一种任务叫"视觉奇偶性",灵感来自一道经典的数学题:给你一串由0和1组成的数字,判断其中1的个数是奇数还是偶数——这叫做"奇偶性判断"。在视觉版本里,图中随机分布着若干个圆形节点,每个节点中心写着0或1,模型需要找到所有节点,统计其中1的数量,最后判断奇偶性。关键在于,这些节点是随机散落在图像中的,不是整齐排成一排——模型必须自己"找到"它们,而不只是从左到右依次读取。
第二种任务叫"状态机",难度更高一些。这次图中的节点不仅有值,还通过箭头连接成一个有序的链条,模型必须按照箭头指示的顺序,从绿色的起始节点出发,经过一系列紫色的中间节点,到达红色的终止节点。每访问一个节点,就根据它的值更新一个"当前状态"——有点像走迷宫时,每经过一个房间就要按照房间里的规则改变自己的状态。顺序非常重要,换一种顺序走就会得到不同的结果。
第三种任务叫"视觉回忆",这是一个作为对照组设计的任务。图中有一堆红色T形字母、绿色L形字母,以及红色L形字母,模型需要回答:"红色L"在图中存在吗?这个任务不需要状态追踪,只需要在图中找到符合特定颜色和形状组合的目标,类似于在人群中找一个穿红衣服戴蓝帽子的人。
第四种任务叫"寻找函数零点",是一个更贴近现实应用的任务。图中显示的是一个数学函数图像,图里可能有多个子图、多条曲线。模型需要找到特定子图中特定函数与x轴(即y=0那条横线)的交叉点,也就是函数的"零点"。这模拟了科研人员分析实验图表、学生做数学题等真实场景,需要先在复杂图像中定位目标区域,再仔细分析曲线细节。
通过这四种任务,研究者希望揭示:哪些类型的视觉推理依赖于"逐步积累状态"的能力,哪些则不需要?
三、"一口吞"式AI为什么会学坏——捷径的诱惑
当研究者把当前最先进的视觉语言模型(包括Qwen2.5-VL、GPT-5.4、Claude Sonnet 4.6等)放在这些任务上测试时,结果印证了他们的担忧。
在训练范围内,也就是图中信息点数量较少时,这些模型都表现出色,准确率很高。然而随着信息点数量增加,超过训练时见过的最大数量,它们的表现开始快速下滑,从接近满分逐渐跌落到接近随机猜测的水平。
为什么会这样?研究者的解释类似于这样一个故事:假设老师出了很多道"在一排树中数苹果"的题,最多的一道题有10棵树。一个聪明的学生可能没有真正去数每棵树上的苹果,而是发现了一个规律:"如果树排成这样的形状,苹果总数大概是这么多"——他记住的是图形的整体外观与答案之间的统计关系,而不是数苹果的步骤本身。这种"走捷径"的策略在10棵树以内非常有效,但当老师突然出了一道20棵树的题,这个规律就完全失效了。
对于一口吞下整张图的AI模型来说,它很容易从整张图的全局视觉特征中归纳出这种捷径——因为它同时看到了图中所有的信息,完全可以用一种全局性的、并行的计算方式得出答案,而不需要一步一步地追踪信息。这种全局捷径在训练范围内有效,但在训练范围之外就失去了泛化能力。
研究者还发现,这些顶尖模型的失败不只是因为"没有算出正确答案",往往还伴随着更基础的失误——它们有时根本就没能从图中找全所有的信息节点,或者误读了箭头的方向。这说明信息收集本身就是一大难关,而"一口吞"的方式在信息点增多后对细节的感知力会明显下降。
四、"扫视机器人"是怎么工作的——像人眼一样一步一步看
针对上述问题,高通团队提出了他们的解决方案:一个叫做FoveAgent-LSTM的模型。这个名字来自两个概念——"Fovea"(中央凹,眼球中感知最清晰的区域)和"LSTM"(一种具有记忆能力的循环神经网络)。这个模型的核心思路,就是模拟人类视觉扫视的方式来处理图像。
每一步,FoveAgent-LSTM只观察图像中的一个局部区域,但它同时从两个尺度获取信息。一个是"中央凹视野",也就是当前注视点的高清局部图像,分辨率很高,能看清细节,比如节点里写的是0还是1,或者曲线是否经过了x轴;另一个是"外周视野",也就是以当前注视点为中心的更大范围的低分辨率图像,分辨率较低,看不清细节,但能感知大致的空间布局,知道周围还有哪些区域值得访问。
这个设计模仿了人眼的工作方式:人眼的中央凹(视野正中心的小区域)能看到极高清的细节,而视野边缘则模糊一些,但足够让你感知到"哪个方向有动静",引导下一次扫视的方向。
在每一步观察之后,模型会做三件事:第一,更新自己的"记忆状态"——这是LSTM网络的核心功能,它能把"到目前为止我看到了什么、当前状态是什么"存储下来,并在下一步继续使用;第二,输出一个"探针信号",也就是对当前这一步观察到的内容的判断,比如"这个节点的值是1",这类似于做题时的草稿步骤;第三,输出一个"行动指令",也就是下一步要把视线移到哪里——用角度和距离来表示移动方向,且下一步的中心点必须在当前外周视野的范围内,这保证了模型不会一步跳到图像的任意位置,而是像真正的视觉扫视一样,每次只移动有限的距离。
当模型认为已经收集到了足够的信息,它会输出一个"停止信号",并给出最终答案。
这个模型之所以有效,关键在于两点的结合。其一是"局部感知":因为每次只看图像的一个局部区域,模型无法一次性获得整张图的全局信息,也就无法走"全局捷径",必须老老实实地一步一步积累信息。其二是"循环记忆":LSTM网络能够在整个扫视过程中维护一个不断更新的"当前状态",把每一步的观察结果叠加进去,而不是每次都从零开始——这正是人类推理的方式,也是"规则本身"得以被学习的基础。
五、实验结果说明了什么——捷径vs规则的对决
研究者在上述四种任务上对FoveAgent-LSTM和各种全局模型进行了系统比较,结果清晰地展示了两种方法之间的本质差异。
在视觉奇偶性和状态机这两个需要"状态追踪"的任务上,FoveAgent-LSTM在超出训练范围的复杂度下依然保持了接近满分的准确率,而Qwen2.5-VL等全局模型在同样的情况下准确率急剧下滑,有时甚至接近随机猜测。这个对比几乎就是"学会了规则"与"记住了捷径"的直接对决。
研究者还做了一个精心设计的对照实验,把模型的"视觉输入方式"和"计算结构"分开来检验,以搞清楚到底是哪个因素在起关键作用。他们用同一个LSTM循环骨干网络,分别配上三种不同的视觉输入方式来做比较。第一种是"全局输入",也就是每次都把整张高清图传给模型;第二种是"局部+全局输入",既传局部高清图,也同时传整张高清图;第三种是FoveAgent-LSTM的方式,只传局部高清图和低分辨率外周图,从不让模型看到整张高清图。
结果发现,前两种方式在训练范围内表现良好,但在超出训练范围后同样出现了性能下滑,而只有第三种方式(完全局部的感知方式)实现了稳健的泛化。这说明,即使有了LSTM的循环计算能力,只要模型能接触到整张高清图,它就还是会学会利用全局捷径,从而丧失泛化能力。局部感知不是可选的辅助手段,而是防止捷径学习的必要条件。
接下来,研究者又固定了局部感知的视觉输入方式,换用不同的计算骨干网络来比较。他们测试了LSTM、GRU、普通RNN(这三种都是严格的循环网络),以及xLSTM、Mamba(这两种是线性循环网络),还有基于Transformer的Qwen2.5-VL模型。结果是,只有严格循环的网络(LSTM、GRU、RNN)实现了稳健的长度泛化,其他结构都在超出训练范围后出现了明显的下滑。这说明,真正的非线性循环计算是第二个不可或缺的条件。
换句话说,要实现视觉推理的长度泛化,必须同时具备两个条件:一是局部感知(不能一口吞整张图),二是严格的循环计算(而非Transformer或线性循环结构)。二者缺一不可,缺了任何一个,模型都会走捷径、不泛化。
六、外周视野的精妙设计——大与小的矛盾如何化解
研究者在实验中还发现了一个有趣的矛盾,并找到了优雅的解决方案,值得详细介绍。
一方面,为了泛化,局部视野应该尽量小——视野越小,模型每次能看到的信息越少,就越不可能一次性看到多个信息节点,从而被迫真正做到"一步一步积累"。但另一方面,视野太小会带来另一个问题:模型需要更多步骤才能把整张图都看一遍,而且很难从一个小小的局部窗口里知道"下一步该往哪走",导航变得困难。
这个矛盾用一个比喻来理解就很清楚:假设你在一个巨大的迷宫里寻找散落的金币。如果你戴着一个完全封闭的头盔,只有一个很小的观察窗,你每次只能看到脚边的一小块地面,你确实无法走捷径,但你也很容易迷路,不知道该往哪个方向走才能找到下一枚金币。而如果你能摘下头盔,一眼看遍整个迷宫,你当然能快速找到所有金币,但这样你就不再需要真正"探索"了,你的策略依赖于一览无余的全局视角。
FoveAgent-LSTM的解决方案,正是模仿人眼的"中央凹+外周视野"的双层结构。中央凹是高分辨率的小区域,用于细致观察当前位置的任务相关信息,比如节点上的数字;而外周视野是同心的更大区域,但以很低的分辨率呈现,足以感知空间布局、判断周围哪个方向有值得访问的目标,但无法清晰读取具体内容。
这样一来,高清局部视野保证了细节感知的准确性,而低分辨率的外周视野提供了导航所需的空间上下文,同时又因为分辨率太低而无法被用于"走捷径"——你看得到周围有几个模糊的圆形,但根本看不清它们上面写的是0还是1,所以你还是必须导航过去,一个个仔细读取。
研究者通过系统的实验,验证了外周视野的分辨率和大小存在一个最优组合。具体来说,外周视野的大小设为中央凹局部视野的4倍,分辨率统一缩小到80像素时,模型在准确性和探索效率之间达到了最佳平衡。分辨率再高或者范围再大,模型就会利用外周视野走捷径;分辨率太低或者范围太小,模型就无法有效导航。
七、没有路标也能找到路——主动搜索的挑战
在前面的任务中,图里的信息节点是通过箭头连接起来的,也就是说模型有明确的"路线图"可以跟随,只需要沿着箭头一步步走就行。但研究者随后提出了一个更难的问题:如果没有箭头,模型能不能自己决定搜索顺序?
这个版本的任务里,信息节点随机散布在画布上,没有任何路径指示,模型必须自己主动搜寻未访问的节点,读取它们的值,更新当前状态,然后继续寻找下一个未访问的节点,直到找完所有节点为止。
这带来了两个新挑战:第一,模型需要知道自己访问了哪些地方、哪些地方还没去过;第二,当当前的外周视野里没有未访问节点时,模型需要知道扩大搜索范围。为此,研究者给模型增加了两个辅助功能:一是"空间记忆"功能,每当模型访问一个节点后,该节点位置上会被标记一个黑点,之后所有的视野中都会看到这个黑点,相当于在地图上做标记;二是"缩放"功能,当外周视野里找不到未访问节点时,模型可以执行"缩小"动作,把外周视野的范围扩大一倍(但分辨率相应降低),从而搜索更大的区域,找到目标后再执行"放大"回到原始分辨率。
实验结果显示,配备了这些功能后,FoveAgent-LSTM在没有箭头路标的主动搜索模式下,依然实现了稳健的长度泛化。这说明局部+循环的方式不是依赖于"有路可循"才有效的,而是一种真正通用的信息收集策略。
八、视觉回忆任务——一个不需要循环的反例
在前面几个任务中,FoveAgent-LSTM全面碾压了全局模型。但研究者刻意设计了"视觉回忆"任务作为对照,结果出人意料:在这个任务上,全局模型Qwen2.5-VL反而大幅超越了FoveAgent-LSTM,即使测试时图中的干扰元素数量远超训练时,全局模型依然保持了很高的准确率。
为什么会这样?核心区别在于,这个任务根本不需要"状态追踪"。找红色L这件事,不需要你记住之前看过什么,也不需要把多个位置的信息综合起来,你只需要在图中的任意位置,判断眼前这个物体的颜色和形状的组合是否符合要求。这是一种"并行检测",类似于人脸识别——你不需要从左到右一个个检查,你的视觉系统可以同时处理整张图的所有区域,直接输出"有"或"没有"的判断。
全局模型恰好擅长这种并行处理方式,它可以一次性扫描整张图,找到所有符合"红色+L形"组合特征的目标,不需要一步步积累状态。而FoveAgent-LSTM的局部扫视方式在这里反而成了劣势——因为它每次只看一个小区域,在找目标这件事上效率较低,而且也没有用上局部扫视最大的优势(也就是防止走捷径)。
这个对比非常重要,它说明:局部扫视+循环计算的方式并非万能,而是有其最适合的场景——那就是需要"按顺序积累状态"的推理任务,也就是研究者所说的"状态追踪"。对于不需要状态追踪的"信息检索"类任务,全局并行处理反而是更合适的方式。这与语言模型领域的研究结论高度吻合:Transformer在序列奇偶性这类状态追踪任务上失败,但在键值对检索这类回忆任务上表现出色。
九、真实世界的测试——分析函数图表的挑战
最后,研究者把他们的方法应用于一个更贴近现实的任务:在包含多个子图和多条曲线的数学图表中,找到特定函数与x轴的所有交叉点。
这个任务之所以有趣,是因为它需要多个步骤的状态追踪:首先找到目标子图,然后在子图中识别目标函数曲线,然后沿着曲线寻找与x轴的交点,找到一个交点后记录下来,再继续找下一个,直到找完所有交点。这是一个典型的"状态积累"过程。
在这个任务上,研究者使用了一个更强大的模型FoveAgent-Qwen,也就是把局部扫视机制嫁接到Qwen2.5-VL大型视觉语言模型上——这样可以利用大模型对数学图表的理解能力,同时加入局部高清视野来提升细节识别。之所以没有完全换成LSTM骨干网络,是因为目前还没有基于循环网络的大型视觉语言模型具备理解数学图表所需的知识。
对比实验的结果显示,加入了局部高清视野后的FoveAgent-Qwen,在训练范围内的准确率从全局模型的57.24%提升到了82.26%,在超出训练范围的测试场景中也有显著提升——尤其是"函数零点数量超出训练范围"这一场景,准确率从32.63%大幅提升到了67.12%。
研究者还特别排除了"局部视野带来更多计算量"这一可能的干扰因素。他们发现,当全局模型被分配与FoveAgent-Qwen相同数量的计算资源(通过提高全局图像分辨率来实现)时,准确率的提升极为有限——把全局分辨率提高10倍,准确率只提升了不到4%;而同等计算量下FoveAgent-Qwen的优势约为29%。这说明,FoveAgent-Qwen的优势来自于信息获取方式的根本性改变,而非单纯的算力堆叠。
不过,研究者也坦诚地指出,由于这个任务用的是Qwen骨干(而非严格的循环网络),从技术上讲还不能算是完全意义上的"循环局部感知",因此在这个任务上的泛化提升,更多地体现了"局部高清视野帮助发现更多视觉细节"的作用,而非循环计算带来的深层泛化能力。真正强大的循环计算益处,需要等到未来出现循环骨干的大型视觉语言模型才能完全验证。
十、这项研究的意义——重新思考AI视觉的设计方向
归根结底,这项研究告诉我们:当前的AI视觉模型之所以在面对"比训练时更复杂"的图像时容易失败,根源在于它们的感知方式——一口吞下整张图——给了它们走捷径的机会,而走捷径的代价就是无法举一反三。
要解决这个问题,需要同时满足两个条件:一是把感知方式改成局部扫视,每次只看图像的一个区域,强制模型真正追踪每一步;二是使用严格的循环计算结构,让模型能在多步扫视中维护和更新一个连贯的"当前状态"。这两个条件都是必要的,任何一个都不够。
值得一提的是,这项研究也暗示了为什么人类视觉系统演化出了"中央凹+外周视野+眼球扫视"的精妙机制——这或许不只是生物学上的偶然,而是在演化压力下形成的一种解决"信息量远超计算能力"问题的最优策略。如果连人类都需要通过扫视来逐步积累信息、追踪状态,AI模型或许也应该走这条路。
这项发现对未来AI系统的设计有实际影响。当AI被用于分析复杂图表、在拥挤的视觉场景中追踪多个目标、或者处理需要多步骤视觉推理的任务时,简单地"一口吞整张图"的架构可能从根本上就不适合这些需求。不过,研究者也承认,目前他们训练模型时用的是预先设计好的最优路径(专业术语叫"模仿学习"),如何让模型自己学会更通用的探索策略,还是一个开放的研究问题,未来可能需要强化学习等技术来解决。
有兴趣深入了解这项工作细节的读者,可以通过论文编号arXiv:2607.09061查阅完整论文,论文包含详细的实验设置、模型架构说明和完整的实验数据。
Q&A
Q1:视觉语言模型(如GPT、Claude)在视觉推理中会遇到什么具体失败?
A:根据论文的实验,当图像中需要处理的信息点数量超过训练时见过的最大数量时,这些顶尖模型的准确率会急剧下滑。失败不只是最终答案错了,往往还伴随更基础的问题——模型有时会漏掉图中的部分节点,或者误读箭头方向,说明信息收集本身就已经出了问题,而不只是后续推理出错。
Q2:FoveAgent-LSTM模型和普通视觉模型的最本质区别是什么?
A:最核心的区别有两点。普通模型把整张图一次性"吞"进去处理,容易学到只在特定复杂度下有效的全局捷径;而FoveAgent-LSTM每次只观察图像的一个局部区域,同时用LSTM循环网络在多步观察中维护一个不断更新的状态。局部感知防止了捷径学习,循环计算保证了多步推理的连贯性,两者缺一不可。
Q3:局部扫视的AI方法是否在所有视觉任务上都更好?
A:不是。论文专门设计了"视觉回忆"任务作为对照,在那个任务中全局模型反而大幅超过了FoveAgent-LSTM。原因是视觉回忆不需要"按顺序积累状态",只需要在整张图中找到符合特定颜色和形状组合的目标,这种并行检测正是全局模型所擅长的。局部扫视+循环计算的优势,特别体现在需要状态追踪的推理任务上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.