网易首页 > 网易号 > 正文 申请入驻

当雕像被当成了人,AI该相信眼睛还是相信常识?

0
分享至


你有没有想过,一台机器要认出"这是个人"到底有多难?

按理说这应该是最简单的任务。人脸、四肢、肤色纹理,这些特征放在今天的AI眼里几乎是送分题。可西班牙一家叫SperidLabs的团队,在给教堂做3D重建的时候,撞上了一个哭笑不得的问题:他们最新最强的分割模型,一个叫SAM 3的顶尖AI,把教堂里那些栩栩如生的宗教雕像,全都当成了活人。

不是偶尔看错一两次。

是几乎每一尊雕像都被打上了"人"的标签。团队后来做了个统计,这个所谓的最先进模型,精确率只有11.1%,意味着每识别出一个"人",大概有八个是误判的雕像。这不是模型能力不够,恰恰相反,这是模型太擅长"看"了,以至于完全不会"想"。

这就是这篇论文要解决的问题。团队给自己的方法起名ENEAS,出自希腊神话里那位在特洛伊战火中背着老父亲逃出城的英雄埃涅阿斯,取"在混乱中辨认出真正重要之物"的意思。

视觉正确,不等于语义正确

先说清楚这个问题到底难在哪。

现在做"文本指定分割"(用一句话描述目标,让AI自动在图像或视频里画出它的轮廓,业内管这叫text-promptable segmentation)的模型已经很成熟了,从最早的SAM,到支持视频追踪的SAM 2,再到最新能理解"概念"的SAM 3,一代比一代强。

但论文作者发现,这些模型都栽在两类特别具体的坑里。

第一类坑是"人不见了但AI装作没看见"。你让AI追踪视频里的某个特定物体,一旦这个物体离开画面或者被挡住,很多模型不会老实承认"看不见了",而是硬着头皮在附近随便找个长得像的东西继续标注。论文里管这个现象叫**temporal hallucination**(时间维度上的幻觉,指模型在目标消失时依然编造出虚假的检测结果,而不是诚实地报告"目前找不到")。

第二类坑更微妙。当摄像机怼近拍一幅画的局部细节时,AI有时候会把画面里某个笔触、某个色块当成独立的目标去分割,而不是把整幅画当作一个完整对象。这叫空间碎片化,本该是一整块的东西被拆得七零八落。

第三类坑,也是最要命的,就是开头说的雕像事件。AI只认得"看起来像什么",不认得"本质上是什么"。一幅逼真的人物油画、一尊写实雕塑、镜子里的倒影,这些东西视觉特征和真人极其相似,但ontology(哲学术语,这里指"事物真正所属的类别本质",比如一尊雕像的本质是石头,不是人)完全不同。AI分不清这个区别。

这三类问题合起来,指向一个核心矛盾:现在的AI感知能力很强,验证能力很弱。它能精确画出每一个像素的边界,却不会停下来问一句"这真的是我要找的东西吗"。

让AI学会说"我不确定"

ENEAS解决问题的思路挺有意思,它把整个系统拆成了两套并行的机制,分别对付"追踪特定目标"和"发现所有同类目标"这两种不同的任务。

先说追踪特定目标。

比如你想在一堆照片或一段视频里,始终锁定"那幅蓝色的画",不管镜头怎么转、画面怎么被遮挡,你要的都是同一幅画,不是别的蓝色物体。

ENEAS的做法是在一个叫**SeC**(全称SeC tracker,一种基于视觉语言模型构建"概念级记忆"的视频目标追踪架构,此前只支持用鼠标点选目标,不支持文字描述)的架构基础上,加了一层文字理解的能力。原来SeC只能靠你在画面上点一下来告诉它"就是这个",现在你可以直接打字告诉它"蓝色的画",系统会先用一个叫Florence-2的定位工具在参考帧里把这幅画框出来,然后把这个框交给SeC去持续追踪。

关键在于SeC维持的不是简单的"长得像"记忆,而是一种更高层的"这是什么"的概念记忆。哪怕画面剧烈变化,只要这个物体的本质没变,追踪器就不会跟丢。

这就好比你在机场接一个多年未见的朋友。如果你的大脑只靠"记住他今天穿的衣服颜色"来找人,那对方一旦换了件外套,或者被人群挡住一小会儿,你可能就认错人了。但如果你记住的是"他走路的姿态、他的轮廓比例、他整体给你的感觉",这种更高层的印象反而更抗干扰。SeC干的就是后一种事,它不靠低级的像素匹配,而是靠一个视觉语言模型不断给目标建立"概念画像"。如果不这样设计,退回到纯粹的逐帧检测重新识别,实验里那个叫Grounded SAM的对照组模型就会在目标离开画面时,把窗帘、把人的头发都当成目标继续标注,因为它没有"记忆"这个概念,每一帧都是重新猜一次。

再说发现所有同类目标的场景。

这种情况和追踪不一样,你不是要盯着一个固定目标,而是要在每一帧里反复问"这个类别的东西都在哪",因为新的目标随时可能进入画面。比如你想把一段视频里所有的人都找出来去掉,方便做3D重建时清场。

这时候ENEAS用的是一套三级筛选流程,速度越来越慢,但越来越谨慎。

第一级是区域提议,还是用Florence-2这个工具,在每一帧里把所有"可能是目标"的候选区域都框出来。这一步故意设计得很宽松,宁可错抓一百,不可放过一个,因为漏掉的东西后面没有机会补救了。

第二级是嵌入验证,用一个叫**SigLIP 2**(一种视觉语言嵌入模型,能把图片和文字都转换成向量,然后计算两者的匹配程度,得到一个0到1之间的分数)的模型给每个候选区域打分。这里有个特别值得展开的技术细节。团队最早尝试用softmax给候选区域打分,结果发现一个很反直觉的问题:如果画面里有个人拿着话筒,softmax会因为"话筒"这个特征太抢眼,把"人"这个类别的得分硬生生压下去,因为softmax的机制是所有类别互相竞争、概率总和必须是1。换成SigLIP 2之后,每个候选区域和每个文字描述是独立打分的,"是不是人"和"是不是话筒"互不干扰,这才解决了得分被压制的问题。

第三级才是真正的杀手锏,也就是那道能分清雕像和真人的关卡:语义验证。

只有第二级里得分落在"不上不下"的候选区域,才会被送到这一步,交给一个叫**Qwen3VL**(一种能看图回答问题的视觉语言模型,论文里用它扮演"裁判"角色,专门判断某个候选区域是不是真的属于目标类别,而不是长得像的赝品)的模型做最终裁决。这个模型会被明确问一句"这真的是一个活人吗,还是雕像、人体模型或者画像",并且只给出是或否的答案,不允许它生成长篇大论的推理过程,这样能省下不少计算时间。

这套三级机制背后的设计哲学,其实很像医院看病的分诊制度。绝大多数病人症状明显,分诊护士扫一眼就能判断该挂哪个科,这一步对应嵌入验证,快且便宜。但少数症状模糊的病人,比如"发烧但查不出细菌感染",就得转诊给专科医生做进一步检查,这才是真正昂贵的资源。如果让每个病人都直接看专家门诊,医院会被挤爆,成本高到无法承受,这正是论文里提到的"VLM-Only"配置的问题:让语言模型审查所有候选,精度反而从82.8%掉到79.1%,团队管这个现象叫"过度推理",模型在审查那些本来一眼就能判断的简单样本时,反而因为想得太多而出了错。

数据不会说谎:11.1%对94.7%

光讲道理有点空,看数字更直接。

团队专门拍了一批教堂内部的照片,里面既有真人游客,也有大量高度写实的宗教雕塑,故意制造出最极端的语义混淆场景。这个数据集被称为"Church Statues"(教堂雕像数据集)。在这个数据集上,用"person"这个提示词测试各家模型的表现,结果如下:

| 模型 | 精确率 | 召回率 | F1分数 |

| SAM 3 | 11.1% | 83.7% | 19.5% |

| ENEAS-2B(团队方案) | 94.7% | 73.5% | 82.8% |

| ENEAS-4B(团队方案) | **97.5%** | 79.6% | **87.6%** |

这里插一句解释,**精确率**(precision,指模型标记为"是人"的结果里,有多少真的是人,衡量的是"宁缺毋滥"的能力)和**召回率**(recall,指所有真正的人里,模型找出了多少,衡量的是"不放过任何一个"的能力)是一对天然矛盾的指标。SAM 3几乎把所有可能是人的东西都标出来了,召回率高达83.7%,堪称"宁可错杀不可放过",但代价是精确率只有可怜的11.1%。ENEAS反过来,宁可漏掉一些边缘案例,也要保证标出来的基本都是对的。

这组数字换算成生活场景是什么感觉。

想象一个安检口,一百个真正携带违禁品的人里,SAM 3能拦下八十四个,听起来很厉害,可它同时会拦住将近九百个完全无辜的普通乘客,因为它对"像不像"太敏感,对"是不是"毫无判断力。ENEAS拦下的违禁品少一点,七十多个,但它几乎不冤枉任何一个无辜乘客。哪种安检系统更适合真实世界,答案不言而喻,尤其是在论文提到的应用场景里,也就是三维重建这种领域,一个误判的后果远比一个漏判严重得多。团队在论文里专门强调了这种不对称性:如果把一尊珍贵的雕像误判为"人"而抠掉,这尊雕像的三维模型就被永久性地毁掉了;但如果漏掉一个真人游客没抠干净,最多是重建结果里多个瑕疵,还有补救的机会。

这也是为什么整个系统的设计哲学是"精确优先",宁可少做,不可做错。

四次推翻重来的设计史

这篇论文有个特别难得的地方,团队老老实实交代了他们是怎么一步步试错走到今天这个方案的,一共经历了四个阶段,每个阶段都有具体的失败原因。

第一阶段,他们想得挺美,让AI给画面里所有物体都生成详细的文字描述,再拼成一张带编号的合成大图,一次性丢给语言模型去逐个核对。结果发现两个大问题:一是描述生成模型会瞎编专有名词,比如把一尊雕像标注成"圣克里斯蒂安"这种听起来煞有介事的名字,直接绕过了后面的语义过滤;二是这种"一张图审查所有目标"的任务对语言模型的认知负荷太大,逼得模型必须开启深度推理模式才能不出错,代价是每帧处理时间长达十五秒起步,对视频处理来说完全不现实。

第二阶段换了思路,先用文字提示直接让检测器找目标,再用softmax给结果打分过滤,结果就是前面提到的"话筒压制人"的问题,softmax的互相竞争机制让得分变得不稳定,没法定出一个可靠的判断门槛。

第三阶段换成SigLIP 2的独立打分机制,解决了压制问题,但又冒出新麻烦:SigLIP 2是在完整图片上训练的,现在却要拿去给裁剪出来的局部小图打分,这种"训练场景"和"实际使用场景"不匹配的问题(术语叫domain shift,领域偏移,指模型训练时见过的数据分布和实际部署时遇到的数据分布不一致,导致性能打折扣)导致打分不够准。团队的解决办法是用多种不同措辞的提示语给同一张图打分,取平均值,硬是把这个偏差给磨平了。

第四阶段是优化语言裁判本身。最早让Qwen3VL开启深度推理模式,判断准是准,但每次都要生成一大堆思考过程的文字,慢得离谱。而且模型还老受旁边其他物体的干扰,比如一尊雕像旁边站着真人游客,模型容易把两者的特征搞混。团队想了个挺直接的办法,把候选区域周围的像素直接涂黑,只留下要判断的那个物体,逼着模型专心致志看一个东西,同时关掉深度推理,改用固定格式的简单问答,把单次判断的耗时压到了大约一秒。

这段试错史其实特别有启发性。它说明"一步到位设计出正确架构"这种事在真实的研究工作里几乎不存在,真正管用的方案往往是在一次次撞南墙之后,靠着对失败原因的精确诊断,一点点修出来的。

快和准之间,有一个可以调的旋钮

ENEAS还有个挺实用的设计,就是那两个阈值τrej和τacc(分别代表拒绝阈值和接受阈值,是嵌入验证阶段用来划分"直接通过""直接淘汰""需要人工复核"三档的两条分界线)是可以根据场景复杂度调整的。

在教堂这种语义高度模糊的场景里,团队用的是"Robust"(稳健模式)配置,把这两个阈值设得很宽,0.10到0.90之间的候选区域都得送去语言模型复核,语言模型的激活率高达78.1%,每帧处理要3.29秒,但换来的是82.8%的F1分数。

而在另一个叫"Moving Boxes"(搬箱子场景,一段人们搬运和堆叠纸箱的室内视频)的普通场景里,因为不存在什么雕像和人的本质混淆,团队把阈值收紧成"Fast"(快速模式),语言模型激活率骤降到27.0%,每帧只要1.14秒,速度提升了三倍,而且F1分数依然高达98.0%,零误报。

这说明这套系统是"内容自适应"的,遇到简单场景就走捷径,遇到真正棘手的情况才动用最贵的资源。这跟前面说的分诊制度是同一个逻辑,只不过这次是系统自己根据环境的"病情严重程度",自动决定要不要转诊专家。

光靠眼睛看,AI学不会"这是什么"

论文最后有一段讨论挺值得单独拿出来说。

作者认为,SAM 3之所以会把雕像当人,根源在于它整个训练过程只优化了一件事,让分割的边界尽可能精确、让召回率尽可能高。这个优化目标教会了模型识别"脸的对称性、四肢的结构、皮肤般的纹理"这些视觉特征,却从来没教过它去思考"这个东西的材质是什么、它有没有生命"。

换句话说,模型解决了"划出边界"这个几何问题,却从没被要求去解决"判断本质"这个语义问题。这两件事在人类看来理所应当应该绑在一起,可对一个只靠像素学习的模型来说,它们其实是完全独立的两码事。

ENEAS的做法是把这两件事从架构层面拆开,用SigLIP 2和快速视觉线索做粗筛,负责几何层面的"这个形状对不对",再用语言模型去做真正需要综合判断材质、场景、上下文的语义层面的"这个东西到底是不是活的"。团队原文的说法是,语言模型分析的是"crop的全局上下文和材质属性,比如识别出波普艺术画作的平面感,或者石质雕像的颗粒质感"。

不过这套系统也不是万能的。论文自己承认了几个局限,比如当镜头怼得特别近,画面里完全没有周围场景可供参考时,语言裁判也会和纯视觉模型一样判断失误,因为它同样失去了做判断所需要的上下文线索。还有一点,整个系统的召回率上限被最初那个区域提议阶段锁死了,如果Florence-2一开始就没框出某个太小、太远或者被严重遮挡的目标,后面所有环节都没机会把它救回来。

写在后面

读完这篇论文,我一直在想一个问题:我们平时说"AI越来越聪明",到底指的是哪种聪明。

ENEAS这个案例特别有意思的地方在于,它面对的不是一个"AI做不到"的问题,而是一个"AI做得太好但用错了力气"的问题。SAM 3的视觉能力毫无疑问是顶尖的,它能精确勾勒出雕像的每一根衣褶,这种精度本身没有任何问题。问题出在,精确勾勒边界和正确理解本质,是两种完全不同的能力,而后者恰恰是人类几乎不假思索就会做的事,你走进教堂,绝对不会把一尊雕像误认成一个真人静静站在那里,哪怕它再逼真。

这让我联想到一件事,人类判断"这是不是活人"的时候,用到的信息远比视觉丰富得多,包括呼吸的节奏、眼神的游移、环境给的暗示,教堂里雕像通常在特定的位置、有特定的姿态。而一个纯视觉模型,天然就被剥夺了这些线索,它能用的信息永远只有像素。ENEAS没有解决这个根本限制,它只是聪明地绕开了这个限制,用一个能"看图说话"的语言模型去补全那些像素本身给不出的语义信息。

这大概是这篇论文留给我最深的印象:很多时候我们以为的"AI理解力不够",其实是"AI获取信息的渠道太窄"。把渠道打开一点,哪怕只是加一层能问"这真的是活人吗"的裁判,效果就能从11.1%的精确率跳到97.5%。这中间的差距,与其说是算法进步,不如说是我们终于想起来该问AI一句"你确定吗"。

Q&A

Q1:ENEAS是什么?

A:ENEAS是SperidLabs团队提出的一种文本指定的分割方法,能同时完成特定目标追踪和同类目标发现两项任务,核心是加了一层语义验证机制,专门用来分辨视觉相似但本质不同的物体,比如真人和雕像。

Q2:ENEAS和SAM 3相比效果怎么样?

A:在教堂雕像这个极端测试场景里,SAM 3的精确率只有11.1%,会把大量雕像误判成真人;ENEAS的精确率达到94.7%到97.5%,几乎不会犯这种本质性的判断错误,同时召回率也保持在合理水平。

Q3:ENEAS为什么要用语言模型做二次判断?

A:因为纯视觉模型只能识别"长得像什么",无法判断"本质是什么"。团队设计了三级筛选流程,只有那些视觉打分模糊不清的候选区域才会被送去语言模型复核,这样既保证了判断的准确性,又不会拖慢整体速度。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全网刷屏!南京一小学生舍不得班主任被调走,鼓起勇气拨通了校长的电话……

全网刷屏!南京一小学生舍不得班主任被调走,鼓起勇气拨通了校长的电话……

上游新闻
2026-08-26 15:43:22
重磅加盟!拉塞尔+麦基!CBA最新银河战舰强队

重磅加盟!拉塞尔+麦基!CBA最新银河战舰强队

篮球实战宝典
2026-09-30 16:29:32
沃齐尼亚跌落神坛?

沃齐尼亚跌落神坛?

五星体育
2026-09-30 09:35:56
金鹰颁奖晚会,最大赢家不是于和伟,不是宋佳,而是切胃减肥的她

金鹰颁奖晚会,最大赢家不是于和伟,不是宋佳,而是切胃减肥的她

娱圈办事处
2026-09-30 17:59:45
丰田合并,产销分离,生产端归广汽,车型将统一!

丰田合并,产销分离,生产端归广汽,车型将统一!

电动内参
2026-09-30 21:04:36
罗马官宣迪巴拉加盟,莫利纳留守特里戈里亚

罗马官宣迪巴拉加盟,莫利纳留守特里戈里亚

灰度测试中
2026-09-30 07:04:19
杨瀚森训练营惊艳教练!开拓者新帅盛赞小杨:篮板出色,进攻高效

杨瀚森训练营惊艳教练!开拓者新帅盛赞小杨:篮板出色,进攻高效

期盼美好明天
2026-09-30 10:57:23
外挂相机?华为这步棋,把整个行业都打懵了,是进步还是倒退?

外挂相机?华为这步棋,把整个行业都打懵了,是进步还是倒退?

大卫聊科技
2026-09-30 13:18:16
网红"富婆"人设崩了,镜头前的钻石是塑料的,她承认剧本是编的

网红"富婆"人设崩了,镜头前的钻石是塑料的,她承认剧本是编的

一盅情怀
2026-09-29 12:55:43
美媒:中国研究提出搭载电磁轨道炮的核动力坦克方案,理论最大射程 450 公里

美媒:中国研究提出搭载电磁轨道炮的核动力坦克方案,理论最大射程 450 公里

爱迷彩的老虎
2026-09-30 10:36:03
山东24岁小伙晒高颜值女友,颜值差距巨大,网友纷纷劝他赶紧分手

山东24岁小伙晒高颜值女友,颜值差距巨大,网友纷纷劝他赶紧分手

小蜜情感说
2026-10-01 01:47:33
控方首揭蔡天凤案杀人动机,前公公拒卖豪宅并试图打人,被蔡天凤骂“老狐狸”“黄鼠狼”

控方首揭蔡天凤案杀人动机,前公公拒卖豪宅并试图打人,被蔡天凤骂“老狐狸”“黄鼠狼”

八卦宝宝
2026-09-30 19:28:26
中日在联合国激烈过招,朝鲜代表突然下场参战,战局瞬间一边倒

中日在联合国激烈过招,朝鲜代表突然下场参战,战局瞬间一边倒

知法而形
2026-09-30 13:35:59
一碗水没端平啊!山东女子哭诉,丈夫悄悄网购中秋美食寄给父母,瞒着她不提岳父母,网友吵翻

一碗水没端平啊!山东女子哭诉,丈夫悄悄网购中秋美食寄给父母,瞒着她不提岳父母,网友吵翻

火山詩话
2026-09-30 09:54:03
武汉24岁高职生寝室卖鞋起家,如今营收破1800万元,本人:一开始只想赚点零花钱,结果不到一个月就赚了2万多

武汉24岁高职生寝室卖鞋起家,如今营收破1800万元,本人:一开始只想赚点零花钱,结果不到一个月就赚了2万多

上观新闻
2026-09-27 19:00:45
卡塔尔首相:内塔尼亚胡是战争犯

卡塔尔首相:内塔尼亚胡是战争犯

澎湃新闻
2026-09-30 12:09:02
突发!王楚钦林诗栋因伤退出WTT中国大满贯,主场之战遗憾缺席

突发!王楚钦林诗栋因伤退出WTT中国大满贯,主场之战遗憾缺席

失我者永失qq
2026-10-01 07:01:31
20名“双一流”大学生、研究生"翻墙"被处分 ,网传被举报:“一个姐们差一名保研,拿翻墙这事把前面所有人全举报了”

20名“双一流”大学生、研究生"翻墙"被处分 ,网传被举报:“一个姐们差一名保研,拿翻墙这事把前面所有人全举报了”

双一流高校
2026-09-28 00:09:38
互联网惊现AI鬼城,上万AI发帖聊天,人类禁止入内,这天终于来了

互联网惊现AI鬼城,上万AI发帖聊天,人类禁止入内,这天终于来了

小莜读史
2026-09-29 21:41:01
曾受北斗无偿援助,如今带头反华不念旧情?该国比越南还可恨!

曾受北斗无偿援助,如今带头反华不念旧情?该国比越南还可恨!

李健政观察
2026-09-20 18:29:22
2026-10-01 07:43:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10022文章数 569关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

迪拜客机事件被指是"未遂恐袭" 大选前以色列如临大敌

头条要闻

迪拜客机事件被指是"未遂恐袭" 大选前以色列如临大敌

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

艺术
手机
旅游
房产
数码

艺术要闻

不服来辩!这些山水画,才是中国画的真正巅峰!

手机要闻

玩了几天iQOO 16,雷科技想说光追比跑分更有意思

旅游要闻

国庆假期 上新多条旅游线路

房产要闻

利好频发!国庆置业窗口期,收好这份优惠攻略!

数码要闻

罗技推出Zone Vibe Pro头戴式耳机 支持自适应降噪与蓝牙6.0 电池和头梁均可更换

无障碍浏览 进入关怀版