网易首页 > 网易号 > 正文 申请入驻

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

0
分享至



导读:视觉问答模型的准确率不断提高,但高分未必来自视觉理解—— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。

一次人工标注之后,系统可在每轮评测中随机生成新的视觉关键线索,并自动构造对应的问题与答案 —— 不重新生成整张图,也不重建整套基准。



  • 论文:REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation
  • 论文链接:https://arxiv.org/abs/2606.20736
  • 项目主页:https://xxxxxsun.github.io/rekey-vstar/
  • 作者:Tengjie Lin、Yutao Sun、Jingwei Ni、Shuhan Ge、Hao-Xuan Ma、Yanting Miao、Wangyue Lu、Mingshuai Chen、Tiancheng Zhao、Jianwei Yin

不换图,只换问题:高分有多少来自记忆?

V*Bench 是评估细粒度视觉搜索能力的常用基准,包含 191 张高分辨率真实场景图像。它的难点在于,问题往往不指向画面主体,而指向远离图像中心、面积极小、容易被忽略的局部细节 —— 论文把这类真正决定答案的内容称为visual key(视觉关键线索)。正因为答案只取决于这一小块内容,一旦它长期固定不变,模型就有机会靠记忆而非观察答对。

为了检验这一点,研究者设计了诊断实验 Relabel V*:保留原始图像,只重写问题,让新问题指向图中另一个同样小、同样偏离中心的视觉线索。在全部 191 张图像上,8 个受测 VLM 准确率均下降,降幅 9.5–18.8 个百分点。



图像未改动,仅更换问题后,8 个模型的准确率全部落在原始成绩之下,降幅 9.5–18.8 个百分点。

既然图像未变,这一下降只能来自问题与答案组合的更新。它不足以单独证明训练数据污染,但与模型从静态基准中获得记忆收益的假设一致。不过这种做法有个明显的局限:每一轮都要人工重写全部问题,成本无法长期承担。ReKey 要回答的正是这个问题 —— 能否只做一次人工准备,之后让视觉线索自动持续更新?

怎么做到每轮评测都不一样?

ReKey 的思路是把人工投入压缩到一次性的准备工作上,之后交给自动流程反复产出新题。整个流程分四步:先由标注者在图上圈出可以被改动的小块区域(论文称为 edit slot),随后系统随机采样一组新的视觉内容,用图像编辑模型写入该区域,最后依据这次采样的记录直接生成对应的问题和答案。



人工标注只发生在最左侧一次,右侧的采样、编辑与问答构造在每轮评测中自动重复。

标注者需要圈出的区域有两类:Replace slot指向图中已有的目标,用于改变它的颜色;Add slot指向一处合理的空白位置,用于插入原图中不存在的小物体。两类区域都要求紧凑、位置合理,并且在图中具有唯一指代。每轮评测开始时,随机种子决定启用哪个 slot,并采样出新的颜色、物体或位置组合。采样记录既指导图像编辑,也直接确定新问题和标准答案。

这样一来,答案在图像生成之前就由采样过程确定,无需再让另一个模型检查生成结果并重新标注,每道题都能追溯到具体的 slot、随机种子和采样内容。图像编辑由 GPT-Image-2 完成,编辑后的局部区域合成回原图。改动区域只占整张图约 0.1%,且标注者选定的区域与 V*Bench 原始问题所问目标的尺度相当,从而锚定了与原基准接近的视觉搜索难度。



同一场景中只有决定答案的帽子颜色被替换,背景杂乱度与小目标尺度保持不变。

更新 visual key,记忆优势是否消失?

如果此前的差距确实源于记忆,那么更新 visual key 之后,成绩应当回落到人工重写问题的水平。研究者用 3 个随机种子各生成一套 ReKey 实例,在 8 个 VLM 上重复评测:原始 V*Bench 平均准确率 82.1%,ReKey 上降至 72.2%,平均下降 9.9 个百分点,所有模型均出现下降。降幅最大的集中在原始高分模型(Qwen3.6-Plus 下降 14.9 个百分点、Gemini 下降 13.0 个百分点),而原始成绩较低的 MiMo 和 Llama 各只下降 4.4 个百分点,与记忆收益越多、更新后失去也越多的预期一致。



ReKey 上 8 个模型成绩均低于原始 V*Bench,平均下降 9.9 个百分点,整体贴近 Relabel V* 的水平。

Relabel V*(66.9%)提供了另一个参照。Qwen 和 GPT-5.5 几乎正好落在这条基线上(分别高 1.4 和 1.2 个百分点),说明 ReKey 恢复出了与人工重写问题相当的难度;其余模型平均高出 5.3 个百分点,研究者归因于 Relabel 只有一套固定题目,而 ReKey 具备采样多样性。那么会不会只是再生的题目更难?研究者用 LLaVA-1.5-13B 做了校准 —— 它是 V*Bench 原始论文中最强的开源基线,锚定了该基准公布的难度,且污染风险较低,若成绩大幅下滑就意味着任务本身变了。结果它只下降 6.1 个百分点,低于多数前沿模型,位置类问题几乎未变,而空间关系恰是对编辑痕迹最敏感的维度。这些证据指向同一结论:准确率的下降来自记忆优势的消除,而非题目难度的变化。

为什么最关键的一步仍由人完成?

既然除标注之外的环节都已自动化,那能否把最后这步人工也交给模型?研究者试着让 GPT-5.5 自动选择 edit slot,结果并不理想:它给出的 Replace 区域只有 33.6% 能准确覆盖目标;Add 区域虽然多数可用,但面积普遍偏大,约为人工标注的 3 倍 —— 模型明显偏好宽敞、显眼、容易下笔的位置。用这些区域生成的题目系统性偏简单,8 个 VLM 的准确率比人工标注版本高出 8.4–18.5 个百分点。



VLM 选定的区域明显更宽敞显眼,面积约为人工标注的 3 倍,使自动标注版本的准确率高出 8.4–18.5 个百分点。

如果模型已能稳定定位最隐蔽的视觉线索,它可能已具备评测所要测量的感知能力;而让能力不足的模型选题,则容易将自身盲点带入基准。因此 ReKey 只将 slot 选择保留为一次性人工步骤,其余环节均可自动完成。

全部 191 张图像的 slot 标注约需 16 人时,而同一组标注可跨随机种子反复使用。ReKey 的意义不在于发布一次更大的静态数据集,而在于将高质量真实场景转化为可持续更新的评测协议:保留原有视觉搜索环境,只更新真正决定答案的那一小块 —— 只要 visual key 可以持续刷新,靠记忆答对就不再是稳定的策略。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
蒙古国爆发的动乱,大概率只是蒙古国崩溃的开始。

蒙古国爆发的动乱,大概率只是蒙古国崩溃的开始。

小马姨
2026-08-03 12:07:39
谢家出了一位“叛徒”,这可不是普通的叛徒,而是18岁的谢振轩

谢家出了一位“叛徒”,这可不是普通的叛徒,而是18岁的谢振轩

静若梨花
2026-08-04 11:09:31
韩国股市熔断

韩国股市熔断

鲁中晨报
2026-08-04 10:50:02
波什:今年1月我的肺栓塞又发作了,这回差点要了我的命

波什:今年1月我的肺栓塞又发作了,这回差点要了我的命

懂球帝
2026-08-04 02:00:08
陈璇撅腚采访仅冰山一角,上海多位主持人跑路,坦言经历最恶的人

陈璇撅腚采访仅冰山一角,上海多位主持人跑路,坦言经历最恶的人

星星没有你亮
2026-08-04 10:23:43
如果“竹知了”因为一个企业的投诉而彻底消失,那将是天大的讽刺

如果“竹知了”因为一个企业的投诉而彻底消失,那将是天大的讽刺

清书先生
2026-08-04 08:00:14
举办婚礼43天后将男友捅伤致死,山东一女子一审被判死缓

举办婚礼43天后将男友捅伤致死,山东一女子一审被判死缓

现代快报
2026-08-03 22:16:21
乾隆灭掉准噶尔,屠尽男丁灭族,对当时的世界造成了极大的震撼?

乾隆灭掉准噶尔,屠尽男丁灭族,对当时的世界造成了极大的震撼?

小豫讲故事
2026-08-04 06:00:12
笑抽了!丰田用华为产品,华为粉硬夸余承东没有吹牛,结果评论区一点面子都不给!

笑抽了!丰田用华为产品,华为粉硬夸余承东没有吹牛,结果评论区一点面子都不给!

谭谈社会
2026-08-04 09:03:28
竹知了被扣上“境外势力、颜色革命”的帽子,这场公关越来越魔幻

竹知了被扣上“境外势力、颜色革命”的帽子,这场公关越来越魔幻

历史总在押韵
2026-08-03 23:50:10
67岁英国大妈飞机上心脏病发,现场却同时出现15位心脏专家!死神:我不要脸的吗?

67岁英国大妈飞机上心脏病发,现场却同时出现15位心脏专家!死神:我不要脸的吗?

英国那些事儿
2026-08-04 00:10:18
沙俄妖僧28.5厘米!毒不死打不死,皇室贵妇全睡遍,最后咋死的?

沙俄妖僧28.5厘米!毒不死打不死,皇室贵妇全睡遍,最后咋死的?

小兰聊历史
2026-08-04 04:07:28
中美黄海空战细节曝光!歼16被锁定,歼36抢先首飞,川普美梦落空

中美黄海空战细节曝光!歼16被锁定,歼36抢先首飞,川普美梦落空

健身狂人
2026-08-04 11:31:27
CCTV5直播,中国男篮VS卡塔尔,日本豪华阵容赚翻中国,鹿死谁手

CCTV5直播,中国男篮VS卡塔尔,日本豪华阵容赚翻中国,鹿死谁手

体坛小快灵
2026-08-04 10:17:51
中方深夜通告全球,隔天准时派兵,菲方没想到,我军教10也来了

中方深夜通告全球,隔天准时派兵,菲方没想到,我军教10也来了

流史岁月
2026-08-04 10:22:43
很多人在用!知名纸巾品牌:涉事产品全渠道下架

很多人在用!知名纸巾品牌:涉事产品全渠道下架

南方都市报
2026-08-04 13:47:51
女主持人回应与蔡崇信合照,否认两人系情侣关系:一张正常清白的合照被曲解成不正常关系,非常诧异;此前蔡崇信与妻子官宣离婚

女主持人回应与蔡崇信合照,否认两人系情侣关系:一张正常清白的合照被曲解成不正常关系,非常诧异;此前蔡崇信与妻子官宣离婚

扬子晚报
2026-08-04 12:39:36
连云港事件仍在发酵!旁边三层有人想过去救人,被喊了回去,网友:不知为何消防员没从这个位置过去营救

连云港事件仍在发酵!旁边三层有人想过去救人,被喊了回去,网友:不知为何消防员没从这个位置过去营救

火山詩话
2026-08-04 06:38:34
59岁江珊现状:满头白发步履蹒跚,胖到160斤,无单位也无退休金

59岁江珊现状:满头白发步履蹒跚,胖到160斤,无单位也无退休金

漫婷侃娱乐
2026-08-04 10:06:02
瑙鲁正式更改国名

瑙鲁正式更改国名

政知新媒体
2026-08-04 00:00:36
2026-08-04 14:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13667文章数 142710关注度
往期回顾 全部

教育要闻

2026物理竞赛省队名额分配方案公布!江苏22人!

头条要闻

上海飞东京航班临降落时险些与检查飞机相撞 官方调查

头条要闻

上海飞东京航班临降落时险些与检查飞机相撞 官方调查

体育要闻

斯卢茨基告别申花:1座城市和14亿份难忘的回忆

娱乐要闻

93岁香港巨星葛兰离世

财经要闻

存储芯片超级周期走到十字路口?

科技要闻

Anthropic老板急了:挖来的人,可能只为钱

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

健康
房产
亲子
旅游
数码

干细胞和衰老有什么联系?

房产要闻

120亿注册资本,新巨头出现!崖州湾,真的要爆发了!

亲子要闻

和白衣天使的夏日之约——“我是健康小达人”儿童青少年健康科普暑期专场活动侧记

旅游要闻

海底看云南!昆明融创海世界“人鱼秀”惊艳上演

数码要闻

国产自研GPU从0到1破晓时刻!砺算首秀ChinaJoy:LX 7G100现场开跑黑神话

无障碍浏览 进入关怀版