网易首页 > 网易号 > 正文 申请入驻

仅0.2B就比GPT-4.1强?加州大学新指标:组合推理基准首次超越人类

0
分享至

新智元报道

编辑:LRST

【新智元导读】加州大学河滨分校团队发现,AI组合推理表现不佳部分源于评测指标过于苛刻。他们提出新指标GroupMatch和Test-Time Matching算法,挖掘模型潜力,使GPT-4.1在Winoground测试中首次超越人类,0.2B参数的SigLIP-B16在MMVP-VLM基准测试上超越GPT-4.1并刷新最优结果。这表明模型的组合推理能力早已存在,只需合适方法在测试阶段解锁。

前沿的人工智能模型虽然在众多任务上取得了显著进展,但研究发现,它们在组合推理 (compositional reasoning) 方面仍表现不佳,在多个经典基准测试上甚至低于随机猜测水平。

加州大学河滨分校Yinglun Zhu研究团队重新审视了这一问题,发现其根源之一在于评测指标本身——它系统性地低估了模型的真实能力。

博客链接:https://yinglunz.com/blogs/ttm.html

论文链接:https://arxiv.org/pdf/2510.07632

代码链接:https://github.com/yinglunz/test-time-matching

团队据此提出了新的GroupMatch指标,能够挖掘被现有评测掩盖的潜在能力,使GPT-4.1首次在Winoground基准测试上超越人类表现。

基于这一洞见,团队进一步提出一种无需外部监督、能够自我改进的迭代算法Test-Time Matching(TTM),可在模型推理阶段显著提升性能。

得益于TTM,仅0.2B参数的SigLIP-B16就在MMVP-VLM基准测试上超越了GPT-4.1,刷新了当前最优结果。

研究背景

组合推理(compositional reasoning)体现了AI是否具备「举一反三」的能力——能否将对象、属性和关系重新组合,去理解新的情境。

像Winoground这样的基准测试通过2×2群组设计来考察这种能力:其中两条文本用词相同但顺序不同,每条只对应其中一张图像。

尽管这些模型在多模态任务中表现出强大能力,但对比式视觉语言模型(VLMs)和多模态大语言模型(MLLMs)在这类基准测试中表现依然有限。

在Winoground基准测试上,即便是前沿模型的得分也远低于人类水平(约85.5分);

此前的最佳结果仅为58.75,且是通过对GPT-4V进行scaffolding和prompt tuning实现的。

重新审视评测指标

从随机猜测到群组匹配

加州大学河滨分校(UCR)研究团队发现,模型在组合推理任务中的低分,部分源自评测指标本身。

当前广泛使用的GroupScore指标过于严格:它要求每张图像都与正确的文本匹配、每段文本也与正确的图像匹配,但并不检查整个群组的全局一致性

只要有一次错配,整组得分就会被判为0。

假设每组包含k张图像和k条文本描述,GroupScore只逐一检查图像与文本之间的匹配情况,而忽略整体关系。

在随机匹配下,成功率仅为 (k−1)! / (2k−1)!;当k = 2时,这个概率只有六分之一。

为解决这一问题,团队提出了新的GroupMatch指标,用于评估群组内的整体最优匹配,而不是孤立的成对比较。

GroupMatch会考虑所有可能的匹配方式(共k!种),并选择最可能的那一个。

这样,在随机猜测下的成功率提升为1 / k!——当k = 2时为二分之一,比原来的六分之一大幅提高。

更关键的是,如果模型能在GroupMatch下找到正确匹配,只需在测试阶段对该匹配进行过拟合,就能在原始GroupScore下获得满分。

基于这一发现,团队提出了一个简单的SimpleMatch两步法:

1. 使用 GroupMatch 选择最可能的匹配;

2. 在测试阶段对该匹配进行过拟合。

如上图所示,SimpleMatch揭示了模型中大量「被隐藏」的潜力——它让仅有0.2B参数的SigLIP-B16超越了此前所有结果,并使GPT-4.1首次在Winoground上超过人类表现。

Test-Time Matching

在测试阶段自我迭代提升模型能力

为进一步提升模型表现,UCR研究团队提出了一种无需外部监督、能够自我改进的迭代算法Test-Time Matching (TTM)

每次迭代包括三个步骤:

1. 模型对所有群组进行匹配预测;

2. 仅保留置信度高的匹配(即得分差距超过阈值)作为伪标签,并在这些伪标签上自我微调;

3. 随着迭代进行,逐步放宽阈值,以纳入更多样本。

TTM的核心在于两点:

1. 基于GroupMatch的伪标签能更有效地利用群组结构,提供更强的监督信号;

2. 阈值的逐步衰减机制让模型先从高置信数据学习,再逐步扩展覆盖范围。

这一算法可以看作测试时训练 (test-time training) 的一种形式,结合了自训练 (self-training)、半监督学习 (semi-supervised learning) 和主动学习 (active learning) 的思想。

从实验结果来看,TTM在多个数据集和模型上都稳定优于 SimpleMatch:相对性能提升最高可达 10.5%,相对错误率下降54.8%

值得注意的是,TTM让SigLIP-L16在ColorSwap数据集上提升至GPT-4.1的水平,并使SigLIP-B16(仅0.2B参数)在MMVP-VLM上超越GPT-4.1,刷新了当前最优结果

TTM的广泛适用性

虽然前面的结果主要基于方形群组(k×k)的组合推理任务,但TTM同样适用于矩形群组,甚至是没有群组结构的数据集。

指标变化不带来提升的情况

在只有1×k结构的群组中,GroupMatch与GroupScore等价,因此单纯更换指标并不会改进结果。

即便如此,TTM在SugarCrepe和WhatsUp等数据集上依然带来了显著提升,其中在WhatsUp上的相对增幅高达85.7%,让原本困难的任务变得可解。

无群组结构的情况

TTM还能将整个数据集视为一个全局的「图像-文本匹配问题」(assignment problem),并在多项式时间内求解。

即使将Winoground、MMVP-VLM和ColorSwap等数据集全部「打平」为无群组结构,TTM依然能显著提升表现,最高可带来33.3%的相对错误率下降。

讨论与展望

UCR研究团队重新审视了多模态模型在组合推理上的长期难题,指出:许多被认为的「失败」,其实源自评测指标的局限。

团队提出的GroupMatch指标与Test-Time Matching (TTM) 算法表明,模型的组合推理能力早已存在——只需要在测试阶段,用合适的方法将其「解锁」。

在覆盖16个不同数据集变体的系统实验中,TTM在多种设置下都展现出稳定而显著的改进,推动了多模态推理研究的前沿进展。

展望未来,团队认为有两个方向值得进一步探索:

  • 重新思考模型评估:同一个模型在不同指标下可能表现出截然不同的能力,这提醒我们需要建立更稳健、更统一的评测框架。

  • 将TTM推广至组合推理之外:虽然TTM起源于组合推理,但它的核心思想——在测试阶段进行匹配式自训练——具有普适性。该思路有望在更广泛的多模态和语言任务中发挥作用,推动AI模型迈向真正的「自适应、自进化」。

参考资料:

https://arxiv.org/pdf/2510.07632

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

舒山有鹿
2026-07-25 09:57:20
全新生产的绿色99B坦克批量曝光!99B持续列装,为何100坦克依然不见踪影?

全新生产的绿色99B坦克批量曝光!99B持续列装,为何100坦克依然不见踪影?

军武速递
2026-09-18 20:09:27
珍爱生命,远离短剧!仅仅6年,6亿人“中毒”AI短剧

珍爱生命,远离短剧!仅仅6年,6亿人“中毒”AI短剧

东方不败然多多
2026-09-15 08:47:07
郭士强:我可以告诉你,我们团队很辛苦 媒体人反驳:南辕北辙更吓人

郭士强:我可以告诉你,我们团队很辛苦 媒体人反驳:南辕北辙更吓人

风过乡
2026-09-18 21:23:37
1947年杨家山监狱,特务按住杨虎城夫人谢葆真,当着众人的面,一根针头朝她大腿扎了下去

1947年杨家山监狱,特务按住杨虎城夫人谢葆真,当着众人的面,一根针头朝她大腿扎了下去

饭小妹说历史
2026-09-18 09:23:07
案例:湖北一女学生和82岁老人同吃同住,老人直接认其做干女儿

案例:湖北一女学生和82岁老人同吃同住,老人直接认其做干女儿

红豆讲堂
2025-01-27 09:30:03
国际金价坐上“过山车”

国际金价坐上“过山车”

上海证券报
2026-09-18 07:26:11
北京规划首提“两环”:钱开始往二环内投,新城的逻辑要变了

北京规划首提“两环”:钱开始往二环内投,新城的逻辑要变了

华庭讲美食
2026-09-17 11:45:55
雷军官宣:电池起火就赔新车!半个月过去了,为什么只有雷军敢“兜底”?

雷军官宣:电池起火就赔新车!半个月过去了,为什么只有雷军敢“兜底”?

DeepAuto车探
2026-09-18 11:25:57
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
王琳已任新疆维吾尔自治区党委副书记

王琳已任新疆维吾尔自治区党委副书记

极目新闻
2026-09-18 22:03:14
为什么说瓜帅三大弟子,阿尔特塔得其守,孔帕尼得其攻,唯有马雷斯卡攻守兼备还得其貌

为什么说瓜帅三大弟子,阿尔特塔得其守,孔帕尼得其攻,唯有马雷斯卡攻守兼备还得其貌

小齐说球
2026-09-18 20:36:13
两次临停都拦不住!发行价不到5元的新股,次日飙涨至82元

两次临停都拦不住!发行价不到5元的新股,次日飙涨至82元

21世纪经济报道
2026-09-18 15:42:28
贾跃亭的倒计时:距离纳斯达克“死刑判决”,只剩不到48小时

贾跃亭的倒计时:距离纳斯达克“死刑判决”,只剩不到48小时

放开他让wo来
2026-09-18 13:07:03
今夜,大逆转!再来一个利好,科技股集体猛涨

今夜,大逆转!再来一个利好,科技股集体猛涨

中国基金报
2026-09-18 01:13:01
老道士揭秘:家中这三样东西消失,一定是被人借运了!千万要小心

老道士揭秘:家中这三样东西消失,一定是被人借运了!千万要小心

古怪奇谈录
2026-01-05 11:32:51
苹果新品官宣,9月18日,正式发售

苹果新品官宣,9月18日,正式发售

科技堡垒
2026-09-17 11:07:17
史诗级血亏!巴萨 2500 万嫌贵放弃神锋,如今成穆帅绝杀神器

史诗级血亏!巴萨 2500 万嫌贵放弃神锋,如今成穆帅绝杀神器

奶盖熊本熊
2026-09-18 07:34:16
2800枚核弹24小时待命,张召忠曾发出警告:一旦开战,无处可逃

2800枚核弹24小时待命,张召忠曾发出警告:一旦开战,无处可逃

究竟谁主沉浮
2026-09-18 15:58:54
谢典霖曾忧司法追杀阻姐姐参选,如今全家遭声押,谢寒冰犀利点评

谢典霖曾忧司法追杀阻姐姐参选,如今全家遭声押,谢寒冰犀利点评

oo烛光透影
2026-09-17 20:26:13
2026-09-19 02:48:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16218文章数 67075关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

教育
数码
健康
家居
公开课

教育要闻

家委会气爆了!一小学班委会集资买打印机,被家长投诉,被迫解散,而此后上演的才是大戏

数码要闻

Realforce静电容键盘GX1 Plus皮卡丘版亮相TGS2026

脑动脉瘤的治疗方法,该选哪一种?

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版