来源:市场资讯
(来源:计算机视觉研究院)
计算机视觉研究院
![]()
公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC12611773/pdf/41586_2025_Article_9631.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文提出AligNet框架,首次实现机器与人类跨抽象层级的视觉表征对齐,让 AI 既拥有人类的语义认知逻辑,又兼具超强泛化与鲁棒性。
PART/1
痛点
人类的视觉概念是分层级、多抽象度的认知体系:从细粒度的「贵宾犬 / 哈士奇」,到粗粒度的「动物 / 物品」,再到「有生命 / 无生命」,层级清晰且全局关联。但主流视觉大模型仅擅长捕捉局部视觉相似性(纹理、颜色、轮廓),完全缺失人类的全局语义层级认知:
模型看蜥蜴,会因纹理、背景将其归为植物 / 水果类;
人类看蜥蜴,第一时间归类为「动物」,与花鸟鱼虫同属一类。
这一核心错位,直接导致 AI 三大致命缺陷:
泛化能力弱,数据分布偏移就大幅失效;
过度自信,错误预测仍给出高置信度;
无法理解抽象语义概念,偏离人类判断逻辑。
PART/2
破局方案:AligNet—— 人类认知蒸馏框架
研究团队打造AligNet 三步蒸馏法,用少量人类行为数据,低成本将「人类式认知结构」注入视觉大模型:
基于 THINGS 人类相似性判断数据集,通过仿射变换 + 不确定性蒸馏,训练 SigLIP 模型精准模仿人类视觉判断,逼近人类行为上限;
用教师模型对 ImageNet 做聚类采样,生成海量人类对齐三元组数据,无需大量人工标注;
通过 KL 散度损失,将教师的人类认知结构,蒸馏到 ViT、DINOv2、CapPa 等各类预训练视觉模型。
![]()
【AligNet 框架总览、三元组任务示例与效果对比图】
PART/3
实验
实证效果:既像人思考,又比传统 AI 更强
团队自研Levels 多抽象级评测数据集,从粗粒度语义、细粒度语义、类别边界三层验证,实现认知对齐与性能升级双丰收:
1. 认知对齐:全方位贴合人类判断
粗粒度判断:ViT-B 从 36.09% 飙升至 65.70%,超越人类间一致性水平;
细粒度区分:最高相对提升 46.03%;
类别边界:全部模型逼近 / 超越人类噪声上限;
不确定性匹配:模型置信度与人类反应时间强相关,彻底告别盲目自信。
![]()
【人类对齐任务结果图(Odd-one-out 准确率、相关性、不确定性匹配)】
2. 表征重构:真正学会人类语义层级
对齐后,模型表征严格遵循人类概念层级重组:
同从属类别→表征距离更近;
同基本类别→表征适度靠近;
同上层类别→表征轻微靠近;
不同上层类别→表征距离拉远。蜥蜴不再与植物聚类,而是归入动物大类,完全符合人类认知逻辑。
![]()
【模型表征按语义层级重构的距离变化图】
3. 性能升级:泛化 + 鲁棒性全面提升
对齐并非「妥协像人」,而是AI 能力本质升级:
小样本学习:10 个数据集 32/40 显著提升,Pets 数据集提升 2.7 倍;
分布偏移:BREEDS 基准全任务稳定上涨;
对抗鲁棒:ImageNet-A 最高提升 9.5 个百分点,媲美专用鲁棒算法。
![]()
【小样本学习、分布偏移、鲁棒性评测结果图】
PART/4
核心价值
价值展望:迈向更懂人的可信视觉 AI
这项研究证实核心结论:将人类先验知识注入 AI,是双向升级而非妥协。AligNet 让视觉模型既贴合人类认知,又提升泛化、鲁棒性与可解释性,为可信 AI、人机协同提供全新路径。未来该方法可拓展至 NLP、多模态领域,让 AI 从「特征匹配工具」,进化为理解人类思维、符合人类直觉的智能系统。
有相关需求的你可以联系我们!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.