网易首页 > 网易号 > 正文 申请入驻

给AI换装竟让推理力大增?DeepMind视觉提示有奇效

0
分享至

这项由Google DeepMind主导的研究于2026年7月28日以预印本形式发布,论文编号为arXiv:2607.25537v1,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。

说到提示词,大多数人脑海中浮现的画面大概是这样的:在聊天框里敲入一段精心措辞的文字,然后期待AI给出更好的答案。过去几年,围绕如何"好好跟AI说话"的研究已经发展成了一门独立的学问,甚至有人专门以此谋生。但Google DeepMind的研究团队最近提出了一个颇为新鲜的问题:如果说文字提示词可以被精心设计,那么图片提示词是不是也可以?

这个问题背后,藏着一个已经悄然发生的技术转变。过去一年多时间里,一类被称为"视频生成模型"的AI系统正在悄然升级为通用的视觉推理工具。这些模型不仅能生成好看的视频,还能通过"演示"来解决问题——给它一张迷宫的图片,它能生成一段小球走出迷宫的视频;给它一道物理题的示意图,它能用动画展示球会滚进哪个桶。这类模型接收两样东西作为输入:一段文字说明(描述接下来要发生什么),以及一张图片(作为视频的第一帧)。研究者们一直在努力优化前者,却几乎从未认真打量过后者。

Google DeepMind的团队决定填补这个空白。他们将这套方法命名为VIPE,也就是"视觉提示工程"(Visual Prompt Engineering)。核心思路其实并不复杂:在把图片喂给视频模型之前,先用图像编辑模型对这张图片动动手脚——不改变题目本身,只改变它的视觉呈现方式。一道原本用素描风格画出的物理题,可以被改造成摆满实木架子和台球的逼真场景;一组抽象符号,可以被渲染成立体的3D实物。

结论相当出人意料:仅仅改变图片的视觉风格,不改任何题目内容,视频模型的答题正确率就能大幅提升。在某些任务上,这种纯粹的"换衣服"操作带来的性能提升,甚至超过了让模型反复尝试同一道题二十次的效果。

一、为什么给AI"换一身行头"这件事有意义

在正式展开研究细节之前,有必要先理解这件事为什么值得做。

考虑这样一个场景:你想测试一条鱼的游泳速度,但你把它放在了一块旱地上。测试结果当然很糟糕,但这个糟糕的结果反映的不是鱼的真实游泳能力,而是测试环境的不匹配。这个听起来有些荒唐的比喻,恰恰是Google DeepMind研究团队在这项工作中的核心发现:视频生成模型在抽象、草图风格的图片上表现糟糕,并不一定意味着它们推理能力差,而可能只是因为它们被放在了"旱地上"。

视频生成模型是用海量真实世界视频训练出来的。它们最熟悉的是真实场景里的光影、质感、物理运动方式。当你给它们一张黑白线条草图,让它们预测一个白色圆圈会滚进哪个线条画的容器里,它们其实是在一种陌生的视觉语言下工作。结果自然不理想。

这个观察引出了研究的核心假设:如果把草图变成逼真的照片风格,让那个白色圆圈变成一颗真实的台球,让那些线条变成实木货架,视频模型会不会表现得更好?答案是肯定的。

这种现象被研究团队称为"现实主义偏好"——视频模型天然偏好在写实场景中推理,而这恰恰给视觉提示工程留出了可操作的空间。

二、实验是怎么做的

研究团队搭建了一套完整的流水线,分为三个步骤,各司其职。

第一步叫做"构想者"。这个角色的任务是想出如何修改图片。在自动化实验中,研究团队用一个大型语言模型(具体是Gemini 3.1 Pro)来担任这个角色。它会查看原始图片,然后用文字描述一种新的视觉风格——比如"把这张草图变成一个真实的台球滚落木制货架的场景"。关键约束是:题目的逻辑结构必须完整保留,障碍物的数量、位置、角度都不能变,只有视觉呈现方式可以改。

第二步叫做"编辑者"。它负责按照第一步的指令,真正动手改图片。研究团队在实验中使用了Nano Banana Pro(本质上是Gemini的图像生成模块)来完成这个工作。对于同一张图片,编辑者会生成多个候选版本,默认是五个。

第三步叫做"过滤器",是可选的。当编辑者产出了多个候选图片后,过滤器负责从中挑出质量最好、与原图逻辑最吻合的那一个。这个角色同样由Gemini 3.1 Pro担任,它会仔细比对编辑前后的图片,确保题目本身没有被意外改变。

完成这三步之后,改造好的图片才被送给视频模型,视频模型生成一段演示视频,最后由一个"裁判"(自动评分模块)判断答案是否正确。

整个流程的设计理念是:始终对题目的逻辑内容保持零干扰,只在视觉表现层面做文章。就像把同一道数学题从手写板书抄到打印稿上——题目没变,但读者的阅读体验变了。

三、用一道经典物理题检验效果

研究团队选择的第一个测试场景是一个叫做VPCT的数据集。这个数据集的设定很直观:屏幕上有一张草图,一个白色圆圈从顶端出发,沿着几条斜线(代表障碍物)往下滑落,最终落入底部三个容器之一。题目要求预测圆圈会落入哪个容器。

原始版本完全是抽象的线条画风格,黑色线条代表障碍物,白色圆圈代表球,没有任何质感、光影或真实物体的特征。经过视觉提示工程处理后,同样的场景被渲染成了逼真的照片:白色圆圈变成了红色台球,黑色线条变成了实木搁板,整个场景看起来就像一个真实存在的台球滚落展架的实验装置。

研究团队用多个视频模型测试了这个改变的效果,结果相当显著。以开源模型Wan2.2为例,在原始草图条件下,它的正确率接近随机猜测水平(随机猜测三选一的概率是33.3%),英文提示版本的正确率只有32.4%。换成逼真图片后,同一个模型的正确率稳定地超过了随机水平,达到40%以上。对于Google自家的Veo 3.1模型,改变更加明显:原始草图下正确率是41.3%,换成逼真图片后直接跳升到59.3%,提升了整整18个百分点。另一个模型Omni Flash则从56.3%上升到67.5%。

为了验证真正起作用的是"写实感"而非"立体感",研究团队还专门做了一组对照实验:他们制作了一批看起来有立体感但纹理完全不真实(比如棋盘格纹理、荧光色拼接)的图片。结果几乎所有模型在这种"假3D"条件下的表现,与原始草图相比没有显著差异。这说明让模型变聪明的不是3D效果本身,而是真实材质、真实光影带来的写实感。

四、让机器自动找到最好的"视觉外衣"

手动设计一套合适的图片改造方案是可行的,但这需要人对模型有一定的了解,也比较费时。更理想的情况是让整个过程自动完成。研究团队测试了两种不同的自动化策略。

第一种策略叫做"自由发挥构想"。简单说,就是让一个AI(Gemini 3.1 Pro)在没有任何预设框架的情况下,自由地为每个任务想出新的视觉呈现方案。为了保证多样性,每次生成新方案时,AI都能看到之前已经提出过的所有方案,从而避免重复。研究团队对六个不同的视觉推理任务各自生成了20种不同的图片变体,再用这些变体测试Veo 3.1的表现。

实验覆盖的任务包括:上文提到的物理滚球预测(VPCT)、四种不同难度的迷宫求解(从5×5的简单方格迷宫到形状不规则的复杂迷宫)、停车场解谜(RushHour,需要移动挡路的车辆让目标车辆出场)、视觉搜索(在一堆干扰物中找出两个符合特定颜色和形状条件的目标)、数字排序(让数字按从小到大的顺序逐一消失),以及连点成线(用线连接颜色相同的两个圆点)。

在这些任务上,自动生成的视觉变体带来的错误减少率非常可观。以数字排序任务为例,最好的一个图片变体让错误率降低了70%。停车场解谜的某些变体让错误率降低了75%。迷宫求解在某些难度级别上也取得了超过40%的错误减少率。不同的任务有不同的"最优视觉风格"——停车场解谜在被改造成"阳极氧化铝金属拼图盒"风格时表现最好,而迷宫在被渲染成"街机游戏屏幕截图"风格(画面有细微的像素纹理)时效果最佳。

第二种策略叫做"逐步概念编辑"(ACE)。与第一种策略的"整体换风格"不同,这种方法更像是一个外科医生:每次只改变图片中的一个元素,比如换掉背景颜色,或者给数字加上边框,然后观察效果,再决定下一步改什么。整个探索过程像一棵树:从原始图片出发,每一次编辑都是一个分支,效果好的分支继续延伸,效果差的分支剪掉。

ACE方法还有一个重要特点:它能从实验结果中总结出规律,形成所谓的"规程",然后用这套规程指导后续的搜索。比如对于数字排序任务,模型总结出了几条反复奏效的原则:高对比度的深色背景能帮助模型聚焦在前景元素上;给每个数字加上几何边框能增强视觉定位;把平面元素改成有质感的3D风格(比如黑板粉笔字)能提升物体在时间维度上的稳定性。研究团队特别指出,这些有效策略往往需要组合使用才能发挥最大效果,单独使用任何一个效果都更有限。

相比之下,被反复证明无效甚至有害的操作包括:给物体添加高反光的金属材质(因为这种材质会在视频帧之间引入不稳定的光影变化)、过度加粗字体(会让数字边界模糊)、以及把颜色调得过于鲜艳饱和(反而会分散模型的注意力)。

两种策略各有优劣。自由发挥构想更省计算资源,适合快速探索;逐步概念编辑更精细,在某些困难任务上能找到更好的单样本解决方案。数字排序任务在ACE方法下甚至达到了100%的错误减少率。

五、视觉提示工程与其他提升策略的横向比较

研究团队不仅测试了视觉提示工程本身的效果,还把它与另外两种常见的性能提升策略进行了直接比较:反复生成视频然后投票(也叫"自洽性"方法),以及直接改写文字提示词。

先看与反复生成的比较。这种策略的逻辑是:同一道题生成多个答案,然后用多数票决定最终答案,就像让多个陪审员独立投票一样。研究团队在VPCT任务上让Veo 3.1反复生成20次并投票,正确率从41.3%上升到50%,提升了大约8.7个百分点。而使用一次视觉提示工程处理过的图片,仅用单次生成就已经达到59.3%,比20次反复生成还高出将近10个百分点。

更有趣的是,这两种策略并不互斥,可以叠加使用。在改造过的逼真图片上再做20次投票,最终正确率达到了68%,比原始草图加20次投票(50%)高出18个百分点。

从成本角度看,这种比较更加鲜明。生成一段8秒的视频需要大约3.2美元,而完成一次视觉提示工程(包含5个候选图片的生成和过滤)只需要大约0.4美元,不到视频生成费用的八分之一。这意味着在相同的预算下,把钱花在探索更多视觉变体上,比把钱花在生成更多视频上效率更高。研究数据显示,对于同等预算,最优策略通常是尽可能多地探索不同的视觉变体,每个变体只生成一次视频,而不是针对同一个视觉变体反复生成。

再看与文字提示工程的比较。研究团队用同样的自动化框架,分别生成了20个图片变体和20个文字提示变体,在四个任务上进行了直接对比。结论是:两种策略都有效,但视觉提示工程在多数任务上表现更好。以视觉搜索任务为例,最好的图片变体让正确率从4%跳升到62%,而最好的文字变体只能达到12%。数字排序任务上,最好的图片变体达到76%,最好的文字变体达到86%,这是少数几个文字策略更优的案例之一。

值得一提的是,研究团队还尝试了同时修改图片和文字的联合优化,但结果没有比单独修改图片更好。研究者推测,这可能是因为联合优化增加了搜索难度,生成的方案反而不如专注于单一维度精雕细琢来得有效。

六、视频模型为什么喜欢真实感

现在回到最根本的问题:为什么视觉提示工程会有效?研究团队通过一个精心设计的实验给出了直观的解释。

他们创建了一个逐步递进的视觉改造序列,从一个纯粹抽象的合成场景出发,每次只往"真实"方向走一小步。起点是两个彩色圆点和两条虚线,代表两个物体沿各自路径移动到交汇点。第一步改造:把虚线换成铁路轨道,但圆点保持不变。第二步:把圆点换成火车车厢模型,但背景仍然是白色。第三步:加上真实的绿色草地背景,整个场景看起来就像一段真实的俯拍铁路视频。

在每个阶段,研究团队都让Veo 3.1生成100段视频,然后由真人评估员判断生成的视频是否"场景连贯"(即物体没有凭空消失、没有随机变形、没有莫名其妙地改变外观)。结果沿着这条改造路径单调递增:纯抽象场景的连贯性得分是0%,加上铁路轨道后是11%,换上火车车厢后是24%,加上真实草地背景后是59%。每一小步朝真实感迈进,都直接对应着视频模型生成质量的提升。

这个结果指向一个清晰的机制:在真实场景中,视频模型"知道"物体应该怎么运动,因为这类场景在训练数据里出现过无数次,物理规律是隐含在训练记忆里的。但在抽象场景中,模型没有足够的"记忆"可以依赖,只能靠"猜",而猜出来的结果往往是物体随机出现、消失或变形——这对任何需要追踪物体状态的推理任务都是致命的干扰。视觉提示工程的本质,就是把任务从模型陌生的视觉语言翻译到模型熟悉的视觉语言。

七、这套方法并非对所有AI模型都适用

研究团队还做了一组补充实验,测试视觉提示工程是否同样能提升图像生成模型的推理能力。他们选用了两个版本的Nano Banana(Gemini系列的图像生成模块),让这些模型直接从VPCT的图片预测球会落入哪个桶,答案可以是一张图片(画出球落入某个桶的场景),也可以是一段文字(直接说"左边"、"中间"或"右边")。

结果出现了一个有趣的分化。对于图像生成模型,视觉提示工程带来的提升要么微弱,要么甚至是负面的。Nano Banana Flash在图像输出模式下,换用逼真图片后正确率反而从37%下降到21%。但同一个模型切换到文字输出模式,在原始草图上的正确率就达到了58%。

这个结果揭示了一个重要的区别:图像生成模型在训练中接触过各种风格的图片,包括抽象风格和写实风格,因此对它们来说抽象草图并不陌生,视觉提示工程的"翻译价值"就要小得多。而视频模型的训练数据几乎清一色是真实世界的视频,抽象草图对它们而言是真正陌生的领域。视觉提示工程能发挥作用,正是因为它弥补了输入格式与模型训练分布之间的那道鸿沟。当那道鸿沟本来就不存在时,VIPE自然也就无用武之地。

此外,研究团队还发现了一个值得关注的现象:虽然Gemini 3.1 Pro作为纯文字视觉问答模型,在VPCT原始数据集上能达到96%的超高正确率,但当研究团队把桶翻转过来倒置时,正确率立刻崩溃到4%。更关键的是,这个模型能准确识别出桶是倒置的,但仍然会告诉你球会"落入"某个倒置的桶——它理解视觉信息,却无法把这个信息与物理常识正确结合。这说明当前的视觉语言模型在VPCT上的高分,很可能来自某种视觉统计捷径,而非真正的物理推理能力。

八、研究者留给整个领域的建议

基于上述发现,研究团队提出了一个在学术评估层面颇具实践意义的建议:在用视觉推理基准评测视频模型时,如果评测集本身是抽象的、非写实的,那么测出来的成绩往往只是模型真实能力的下限,而非真实水平。就像不能用让鱼在陆地上爬行的测试来评估鱼的运动能力一样,用抽象草图来评估视频模型的推理能力,本质上是在用错误的测试环境得出偏低的结论。

研究团队建议:只要技术条件允许,评测者应该主动用视觉提示工程把抽象测试场景转化为写实场景,然后再测试模型能力。这样得到的结果才能更真实地反映模型的内在推理潜力。当然,研究团队也坦承,模型对视觉风格如此敏感本身就是一个需要被修正的问题——理想中的模型应该能够在任何视觉风格下都表现稳定,不需要用户帮它"换衣服"才能正常工作。这与早期语言模型对措辞高度敏感的问题如出一辙,当年人们发现"Obama worked as a ___"和"Obama is a ___ by profession"会得到截然不同的填充结果,如今类似的敏感性正在视觉模态上重演。

归根结底,这项研究想传递的信息并不复杂:对于当前的视频生成模型,你给它看的图片长什么样,会极大地影响它能解出多少题。这个发现既是一个可以立即利用的实践技巧,也是一个提醒——在我们庆祝AI推理能力取得新高分之前,也许应该先问一句:这个高分是在"陆地上"测出来的,还是"水里"测出来的?

Q&A

Q1:视觉提示工程(VIPE)具体是怎么改变图片的,会不会改变题目本身?

A:VIPE的核心原则是只改视觉风格,不改题目逻辑。举个例子,原来的物理题里有一个白色圆圈和几条黑色斜线,VIPE会把圆圈改成真实的红色台球,把斜线改成实木货架,但障碍物的数量、角度、位置完全不变。题目依然是那道题,只是看起来更真实了。整个过程会有一个过滤步骤,由AI(Gemini 3.1 Pro)仔细核查改造前后是否有逻辑变化,确保题目没有被意外修改。

Q2:视觉提示工程和多次重复生成视频相比,哪种更划算?

A:视觉提示工程更划算。以VPCT物理推理任务为例,生成一段8秒视频约需3.2美元,而完成一次包含5个候选图片的视觉提示工程只需约0.4美元,不到视频生成费用的八分之一。实验数据显示,在相同预算下,把钱花在探索更多不同的视觉变体上,比反复生成同一张图片的视频效率更高。当然两种方法也可以叠加使用,效果会进一步提升。

Q3:视频模型为什么在写实图片上表现更好,在草图上表现更差?

A:视频模型是用海量真实世界视频训练出来的,它的"记忆"里充满了真实场景里物体的运动规律。当它面对写实图片时,能调用这些记忆预测物体怎么动;面对抽象草图时,它没有足够的参考,只能乱猜,结果就是视频里物体随机消失、变形,根本没法正确推理。研究团队通过实验证实,每向真实感迈进一小步,模型生成的视频连贯性就会明显提升,从0%一路升到59%。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
武侠剧,早该这样拍!

武侠剧,早该这样拍!

吐槽电影院
2026-08-17 14:05:47
巴萨官宣签下罗德里!转会费6000万欧元,西班牙中场王者归来

巴萨官宣签下罗德里!转会费6000万欧元,西班牙中场王者归来

带你逛体坛
2026-08-17 16:15:05
作死炫家世,把百年韩奸黑历史扒穿!韩国终于动手,清算吃了一百年的卖国红利

作死炫家世,把百年韩奸黑历史扒穿!韩国终于动手,清算吃了一百年的卖国红利

浪子说
2026-08-18 00:05:03
米兰今夏变“土豪”?5000万欧豪购莫雷拉背后的野心与隐忧

米兰今夏变“土豪”?5000万欧豪购莫雷拉背后的野心与隐忧

智道足球
2026-08-17 21:41:39
马卡报:亚马尔开始兑现世界杯夺冠留胡子承诺

马卡报:亚马尔开始兑现世界杯夺冠留胡子承诺

懂球帝
2026-08-17 03:40:10
缅北七年亲历者讲述:男女都会遭性侵,坐水牢放毒蛇,伤口撒辣椒

缅北七年亲历者讲述:男女都会遭性侵,坐水牢放毒蛇,伤口撒辣椒

今朝牛马
2026-02-06 17:57:17
陕西西乡“公公强奸儿媳案”二审维持原判:儿媳被鉴定为精神发育迟滞,公公被判4年,坚称儿媳系自愿,已申请再审请求改判无罪

陕西西乡“公公强奸儿媳案”二审维持原判:儿媳被鉴定为精神发育迟滞,公公被判4年,坚称儿媳系自愿,已申请再审请求改判无罪

扬子晚报
2026-07-31 11:05:16
没有导航的年代是怎么跑长途的?

没有导航的年代是怎么跑长途的?

康富贵碎碎念
2026-08-11 12:53:59
比亚迪秦MAX正式开卖!纯电续航达630km,售价9.99万元起

比亚迪秦MAX正式开卖!纯电续航达630km,售价9.99万元起

念寒车评
2026-08-17 22:54:15
中国股市:一份“不能买”的股票名单,献给1.5亿股民的真诚忠告

中国股市:一份“不能买”的股票名单,献给1.5亿股民的真诚忠告

股经纵横谈
2026-08-16 17:35:26
邹市明到现有两件事最难堪,一是2017年被日本选手KO,二是2个亿投资打水漂

邹市明到现有两件事最难堪,一是2017年被日本选手KO,二是2个亿投资打水漂

眼界纵横
2026-07-19 17:29:24
359元 小米米家制冰机今天正式众筹:透明子弹冰 6分钟速出

359元 小米米家制冰机今天正式众筹:透明子弹冰 6分钟速出

快科技
2026-08-17 08:08:21
杨有林狂贪22亿背后:举报者坠楼身亡,妻子女儿美国籍,保护伞被判死缓

杨有林狂贪22亿背后:举报者坠楼身亡,妻子女儿美国籍,保护伞被判死缓

追月数星
2026-08-16 19:57:22
重返核聚变战局:全球都在“造太阳”,中国到底排第几?

重返核聚变战局:全球都在“造太阳”,中国到底排第几?

普陀动物世界
2026-08-17 15:20:22
外媒:乌兹别克斯坦采购24架歼-10CE,中国生产完成已经交付?

外媒:乌兹别克斯坦采购24架歼-10CE,中国生产完成已经交付?

影孖看世界
2026-08-17 21:35:22
披荆斩棘的哥哥:180的男星都穿厚底鞋,只有曹骏穿双运动鞋就来了

披荆斩棘的哥哥:180的男星都穿厚底鞋,只有曹骏穿双运动鞋就来了

清川逐影
2026-08-16 21:15:52
来了,湖人队的卢卡·东契奇已经与125亿美元新老板们展开了对话

来了,湖人队的卢卡·东契奇已经与125亿美元新老板们展开了对话

好火子
2026-08-17 23:11:34
听劝!夫妻俩砌了一堵墙,结果救了自己的命

听劝!夫妻俩砌了一堵墙,结果救了自己的命

极目新闻
2026-08-17 07:36:27
万亿泡沫要浮出水面!特朗普心腹警告黄仁勋:当心GPU变成当年的暗光纤

万亿泡沫要浮出水面!特朗普心腹警告黄仁勋:当心GPU变成当年的暗光纤

快科技
2026-08-17 16:17:11
香港“第一好命少奶”三年抱三稳握继承权,百亿太子对其死心塌地

香港“第一好命少奶”三年抱三稳握继承权,百亿太子对其死心塌地

时间巡查
2026-08-17 12:09:12
2026-08-18 01:16:49
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
744文章数 9273关注度
往期回顾 全部

科技要闻

马斯克600亿美元买条近路

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

体育要闻

C罗:可能是生涯最后一年 未来都规划好了

娱乐要闻

立案风波席卷德云社多场巡演叫停!

财经要闻

爱丽家居跨界玩存储:溢价背后藏着机密案

汽车要闻

2027款艾瑞泽8 PRO 年轻人的务实之选

态度原创

旅游
本地
房产
公开课
军事航空

旅游要闻

8月19日至8月22日,忻州云中河温泉旅游度假区足球场暂时关闭

本地新闻

黄景藏用半刀泥刻瓷都魂

房产要闻

刚刚官宣!海口房价,又跌了!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

俄遭大规模袭击 24小时内击落1478架乌无人机刷新纪录

无障碍浏览 进入关怀版