网易首页 > 网易号 > 正文 申请入驻

当AI视觉系统"眼中只有背景"时,工程师们是怎么解决这个麻烦的?

0
分享至


这项由CamCom Technologies Private Limited团队完成的研究,以arXiv预印本形式于2026年7月10日公开发布,编号为arXiv:2607.09082,感兴趣的读者可通过该编号查阅完整论文。

现代视觉AI系统正在面对一个极其实际的难题:当你要它识别并标注一张新图片里的目标物体时,它根本不知道"新"是什么意思。传统做法是每次遇到一个新物体类别,就要重新对模型进行训练——就像你每次遇到一种新蔬菜,都要从头上一遍烹饪课一样。这个过程既费时、费钱,又需要存储大量数据,还得等训练完成才能上线使用。在医院里突然出现一种罕见结构需要检测,或者工厂里新来了一种零件需要识别,这种"等待重新训练"的机制实在太笨拙了。

CamCom Technologies的研究团队为此提出了一个名为REBASE的框架,全称是"Reference-Background Subspace Elimination",可以直译为"参考图背景子空间消除"。这个框架的核心思路是:只需要给它看一张标注过的参考图片,它就能在全新的查询图片里找到同类目标,整个过程完全不需要重新训练模型,也不需要更新任何参数。更关键的是,这个框架解决了一个此前被研究者们普遍忽视的根本性问题——"背景污染"。

一、当AI的眼睛被背景"迷惑"

有一个非常直观的方式来理解REBASE要解决的问题。设想你是一个从未见过猫的外星人,正在学习识别猫。你的老师给你看了一张参考图:一只猫坐在沙发上。然后你被要求在一张新图里找到同类的动物。问题是,新图里也有沙发。你的大脑会不会因为看到沙发就觉得"这附近肯定有猫"?对于当前大多数AI视觉系统来说,答案是肯定的——它们会被共同的背景元素误导。

这种现象在专业上叫做"背景相关性污染"。猫经常和沙发一起出现,所以模型学到的"猫的特征"里,实际上混进了大量沙发的特征。当它去新图片里找猫时,沙发区域会获得虚高的匹配分数,让系统以为那里也藏着目标。对于医学图像来说,这个问题更严重:所有胸部X光片都有相似的背景结构,所有皮肤镜图像都有相似的皮肤纹理。这些共同的"场景上下文"方向会系统性地抬高非目标区域的相似度,让AI的判断产生系统性偏差。

现有的主流方法,比如PerSAM、Matcher、GF-SAM,以及基于层次聚类的INSID3,尽管设计思路各有不同,但都绕不开这个共同的短板:它们的表现上限被跨图像相似度图的质量所限制。只要这张相似度图是"被污染"的,后续的一切操作都是在错误的基础上修修补补。

REBASE的出发点就是:与其在污染之后想办法补救,不如在一开始就把污染源头消除掉。

二、从背景里提炼"噪音指纹"

理解REBASE的工作原理,可以借用一个音频处理的比喻。录音师在录制人声时,会先在完全安静的环境下录一段"底噪",然后用专业软件把这段底噪的"声纹"从整个录音里减掉,这样人声就变得干净了。REBASE做的事情本质上是一样的:先从参考图的背景区域里提炼出"背景噪音的指纹",然后把这个指纹从参考图和查询图的特征里同时消除掉。

具体来说,整个流程是这样运作的。首先,研究团队使用一个叫做DINOv2的预训练视觉特征提取器,对参考图和查询图分别进行处理。DINOv2是一种自监督训练的视觉变换器,它能够把图像中每一个小区域(称为"图像块"或patch)转换成一个高维的数字向量,这个向量捕捉了该区域的视觉语义信息。

接着,系统识别出参考图中属于背景的那些图像块。参考图有一个二值化的标注掩码(前景是白色,背景是黑色),背景图像块就是那些掩码覆盖度低于某个阈值的区域。把这些背景图像块的特征向量堆叠成一个矩阵,然后对这个矩阵做"奇异值分解"——这是线性代数中的一种经典操作,可以理解为把这个矩阵分解成若干个"主方向",这些主方向按重要性排列,前几个方向代表了背景特征中最主要的变化模式。

只取前几个最重要的主方向,组成一个"背景子空间基底",记为B。然后构造一个投影算符,它的作用是把任何向量里平行于B的分量彻底清除掉,只保留垂直于B的分量。用数学语言表达就是:新特征 = 原特征 × (单位矩阵 - B × B的转置)。把这个操作同时应用到参考图和查询图的所有图像块特征上,就完成了"背景子空间消除"。

这里有一个关键的设计决策值得细说:背景子空间是从当前这一对图像(也就是当前这个"episode")的参考图背景里实时估计的,而不是事先从一大堆图像里统计好的。这意味着,对于每一次新的分割任务,系统都会根据眼前这张参考图的具体背景来定制消除策略。如果今天参考图的背景是草地,就消除草地方向的特征干扰;如果明天参考图的背景是医疗设备,就消除医疗设备方向的干扰。这种"按需定制"的策略,比事先固定一个通用噪音模板要精准得多。

还有一个超参数需要确定:到底保留多少个背景主方向来构成子空间基底?研究团队提出了一种自适应方案:基底的秩(也就是保留的主方向数量)与参考图中背景图像块的数量成正比,比例系数r = 0.005。这意味着背景区域越大,消除的维度就越多,反之则越少,让方法能够自适应地处理不同构图的图像。

从实验结果来看,这个设计非常稳健。研究团队在FSS-1000和PASCAL-Part两个数据集上系统地测试了不同r值的影响,发现在极低秩的范围内(r从0.005到0.01),性能几乎不变,变化幅度在0.7个百分点以内。随着r继续增大,性能逐渐下降,当r超过0.5时下降尤为明显——这说明保留太多背景方向会开始把目标物体自己的特征也消掉。r = 0.005在所有测试数据集上都接近最优,体现了这个参数跨数据集的良好泛化性。

三、从"相似度地图"到精准提示

背景噪音被清除之后,系统会计算一张更干净的相似度图。具体方法是:把参考图中所有前景区域的图像块特征,按照各自在标注掩码中的覆盖面积做加权平均,得到一个前景原型。然后计算查询图中每个图像块与这个前景原型的余弦相似度,就得到了一张覆盖整个查询图的相似度图——颜色越"热"(越亮)的地方,越有可能是目标物体所在的位置。

这张相似度图随后需要被转化为能驱动SAM(Segment Anything Model,一个通用分割网络)工作的提示信号。SAM是由Meta AI开发的通用图像分割模型,它接受点、框或粗略掩码作为输入,然后输出高质量的精细分割结果。它不理解语义,但它的"手"非常稳、非常精准——只要给它指对地方。

如何从相似度图里选出"指点"的位置,是一个颇有技巧的问题。最朴素的做法是取相似度最高的那个点作为正提示。PerSAM就是这么做的,再加上相似度最低的点作为负提示。这种方法对于简单、紧凑的目标勉强够用,但对于细长的、关节化的或者精细的部件目标来说远远不够——SAM收到一个点之后,只能"猜"这个点附近的整个物体是什么形状,一个点提供的空间信息太少了。

另一种容易想到的改进是取前K个相似度最高的点作为多个正提示。但这个方法有一个致命的问题:相似度最高的那些点往往扎堆在同一个高响应区域里,K个点全部挤在一起,等于还是只提供了一个位置的信息,覆盖面积没有任何改善。

研究团队提出的解决方案叫做"相似度加权最远点采样"(SW-FPS)。这个名字听起来复杂,但思路非常直观:在选点时,同时考虑两件事——这个点的相似度有多高(要尽量选相似度大的点),以及这个点距离已经选过的点有多远(要尽量让点分散开来)。具体来说,第一个点选相似度全局最高的那个;从第二个点开始,每次都选一个综合得分最高的点,综合得分是"归一化相似度"和"到最近已选点的归一化距离"的加权和,权重系数α控制二者的平衡,α = 0时退化为纯粹的Top-K选法,α = 1时退化为纯粹的最远点采样,α = 0.5在两者之间取得平衡。整个系统固定使用K = 8个正提示点,α = 0.5,在所有数据集上保持一致。

除了点提示,研究团队还充分利用了SAM的另一个输入接口:掩码提示通道。SAM有一个辅助输入端口,可以接受一张低分辨率的逻辑图(logit map)作为稠密的空间先验。然而,此前几乎所有训练无关的方法都完全忽略了这个接口,只依赖点提示来驱动SAM。研究团队认为这是一种信息浪费,于是把清洁后的相似度图直接注入这个接口。注入之前,相似度图先做标准化(均值为零、方差为一),再以图像均值为阈值区分前景和背景,前景区域保留相似度值,背景区域统一赋值为-2(一个代表"这里是背景"的常数),最后再做3×3的椭圆形态学腐蚀来去除边缘上的细小噪点,然后双线性插值到SAM要求的256×256输入尺寸。这样,SAM在收到离散点提示的同时,还接收到了一张粗粒度的"热力图",相当于同时给了它"哪几个点是目标"和"目标大致在哪个区域"两种信息,分割精度自然更高。

四、实验数据说明了什么

研究团队在五个风格迥异的基准数据集上对REBASE进行了全面评估,覆盖了自然图像分割、精细部件分割和医学图像分割三类场景。FSS-1000包含1000个细粒度物体类别,用标准的240类测试集评估。PASCAL-Part包含15个类别的56种物体部件。PACO-Part包含75个类别的303种物体部件。ISIC 2018是皮肤病变分割数据集。胸部X光肺部数据集用于肺部分割。所有结果都以mIoU(平均交并比,越高越好)报告。

在医学图像领域,REBASE取得了最为显著的提升。在ISIC皮肤病变数据集上,它达到了63.8%的mIoU,比此前最好的训练无关方法INSID3高出9.4个百分点,比GF-SAM高出15.1个百分点,甚至超过了需要训练的SegIC和DiffewS等方法。在胸部X光数据集上,REBASE达到了86.3%的mIoU,比INSID3高出7.5个百分点,仅比需要完整训练的SegGPT低1.2个百分点。这两项医学图像上的大幅提升,与REBASE的设计逻辑高度吻合:医学图像里的背景极其结构化——皮肤镜图片的背景几乎都是均匀的皮肤纹理,X光片的背景几乎都是相同的放射学底色。这类高度一致的背景,恰恰是背景子空间消除最能发挥威力的场景。

在通用自然图像数据集FSS-1000上,REBASE达到88.2%,比GF-SAM高0.2个百分点,比INSID3高4.5个百分点,并且超越了SegGPT(85.6%)和SegIC(86.8%)这两个需要训练的方法——这对于一个完全不需要训练的系统来说相当难得。

在精细部件分割领域,REBASE在PACO-Part上达到39.3%,比INSID3高0.6个百分点,比GF-SAM高3.0个百分点。在PASCAL-Part上,REBASE达到46.6%,排名第二,与第一名INSID3的50.5%存在3.9个百分点的差距。研究团队分析,这个差距可能部分来自于INSID3使用了更新版本的DINOv3-L特征提取器,而REBASE主要使用的是DINOv2-L。

消融实验清晰地揭示了每个模块的独立贡献。从最基础的"只取相似度最高点作为提示"的基线出发,仅仅替换为SW-FPS多点采样,在PACO-Part上提升3.69个百分点,在ISIC上提升9.07个百分点。在此基础上加入稠密掩码先验,在PACO-Part上再提升1.64个百分点,在ISIC上再提升12.37个百分点。最后加入背景子空间消除(REBASE核心模块),在PACO-Part上再提升4.41个百分点,在ISIC上再提升3.93个百分点。每个模块都有实质性贡献,且模块之间存在协同效应。

研究团队还测试了背景子空间消除是否应该同时应用于参考图和查询图(对称)还是只应用于参考图(非对称)。结果显示,对称应用略优于非对称应用,在ISIC上分别为63.77%对63.73%,在PASCAL-Part上分别为46.64%对46.40%。差距很小,但一致,因此采用对称方式作为默认设置。

五、换个零件还好用吗——对不同模型组件的兼容性测试

一个方法如果只在某一种特定的模型组合下有效,它的实用性就要大打折扣。研究团队专门测试了REBASE在不同组件下的表现,结果相当令人放心。

当把DINOv2-L换成更新的DINOv3-L时,REBASE在七个数据集中的六个上依然带来正向提升。X光数据集上提升幅度最大,达到19.70个百分点;LVIS-92i(一个更复杂的语义分割数据集)提升8.20个百分点;COCO-20i提升7.10个百分点;PASCAL-Part提升6.35个百分点;PACO-Part提升4.33个百分点;ISIC提升1.34个百分点。唯一的例外是FSS-1000,DINOv3-L的基线已经达到89.52%,几乎没有提升空间,REBASE带来的变化为-0.27个百分点,可以视为统计噪声。

当把SAM ViT-H换成SAM 2时,REBASE在COCO-20i、PASCAL-Part和ISIC三个数据集上分别带来6.25、5.82和3.22个百分点的提升,与使用原版SAM的结果非常接近,说明方法对SAM的迭代升级具有良好的适应性。换成SAM 3之后,提升幅度缩小到1.09、1.18和0.21个百分点,整体基线性能也偏低。研究团队认为这是因为SAM 3的设计主要针对自然语言和概念提示,与稀疏点提示和稠密先验的交互模式不够匹配,这是未来可以继续探索的方向。

研究团队还考察了REBASE与INSID3的位置偏差消除(positional debiasing)之间的关系。INSID3通过从一张合成噪声图像里估计全局的位置特征方向,并将其从DINOv3特征里消除,来改善分割性能。REBASE则是从每张参考图的背景里估计语义噪声方向。两者都是正交投影,但消除的对象不同。

实验结果显示,在INSID3的推理框架内,用REBASE替换位置去偏操作,在PASCAL-Part和COCO-20i等自然图像数据集上会造成明显性能下降,降幅分别为13.19和5.94个百分点。这说明REBASE不是位置去偏的替代品——在这些场景下,位置偏差是更主要的干扰源。当把REBASE叠加在位置去偏之后使用时,在自然图像数据集上几乎没有额外收益,但在ISIC医学图像数据集上提升了1.66个百分点,且叠加优于仅用REBASE替换(1.24个百分点的差距)。由此可见,对于医学图像,参考图特定的背景偏差和全局位置偏差是两种相互补充的独立噪声来源,同时消除两者才能获得最佳效果;而对于自然图像,两种方法消除的方向高度重叠,叠加收益有限。

六、计算开销:281毫秒一张图,值不值

在单张NVIDIA A100 GPU上,整个REBASE流水线处理一对参考-查询图像的总时间约为281毫秒。其中,DINOv2-L对两张图的特征提取合计37.6毫秒;SVD计算和特征投影(也就是REBASE的核心操作)耗时84.5毫秒;相似度图计算和SW-FPS采样耗时16.3毫秒;SAM ViT-H的图像编码耗时135.9毫秒;SAM的掩码解码耗时6.6毫秒。可以看出,REBASE本身(SVD和投影)占总时间约30%,是流水线中第二大耗时步骤,主要代价在于奇异值分解。整体而言,对于一个不需要训练、能够处理任意新类别的系统来说,每张图不到300毫秒的推理时间是完全可以接受的工业级指标。

说到底,REBASE做的事情用一句话可以概括:在让AI"看"新图之前,先教它"忽略"两张图共有的背景干扰。这个思路听起来朴素,但从实验结果来看,它对提升跨图像语义匹配质量有着实实在在的效果,尤其在背景结构高度一致的医学图像领域,提升幅度尤为突出。对于希望将AI视觉能力快速部署到新领域(比如特定产品检测、新型医学结构标注)而不想承受大量训练开销的团队来说,这套框架提供了一个值得认真考虑的技术路径。当然,在PASCAL-Part等精细部件分割数据集上与INSID3(使用DINOv3-L)之间仍有差距,背景子空间消除对于短促、细密的目标边界的效果也仍有提升空间。随着DINOv3等更强大特征提取器的成熟,以及更精细的提示策略的演进,训练无关分割方法的天花板可能还远没到。

Q&A

Q1:REBASE和INSID3的背景去偏方法有什么本质区别?

A:INSID3的位置去偏是从一张合成噪声图估计全局的位置特征方向,提前固定好,对所有图像用同一个偏差方向来消除。REBASE则是在每一次分割任务中,实时从当前参考图的背景区域估计该场景特有的语义噪声方向,针对每对参考-查询图像定制消除策略。前者消除的是空间位置偏差,后者消除的是场景语义背景偏差,两者方向不同,在医学图像场景里叠加使用效果更好。

Q2:REBASE为什么在医学图像上提升特别大?

A:因为医学图像(如皮肤镜、X光)的背景极度结构化,不同图片之间的背景几乎一模一样。这种高度一致的背景正好形成了一个低秩的特征子空间,非常适合用SVD来捕捉并消除。消除之后,目标区域(病变、肺部)和背景区域的特征区分度大幅提升,相似度图更干净,SAM收到的提示质量也随之提高。

Q3:SW-FPS相比直接取Top-K点提示有什么优势?

A:直接取Top-K点时,相似度最高的K个点往往全都集中在同一个高响应区域,覆盖面积非常有限,SAM只能从一个局部区域推断整个目标形状。SW-FPS在选点时同时考虑相似度大小和与已选点的空间距离,让K个点均匀散布在目标区域的不同部位,SAM因此能获得目标多个位置的空间信息,对于细长、关节化或精细部件目标的分割效果明显更好。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
女飞行员年薪三百万要求分房,刚拒绝她补仨条件,听完拉她领证

女飞行员年薪三百万要求分房,刚拒绝她补仨条件,听完拉她领证

墨染尘香
2026-07-25 15:37:07
皇马被曝借奥利塞当“烟雾弹”,私下1.3亿欧截胡巴黎敲定迪奥曼德

皇马被曝借奥利塞当“烟雾弹”,私下1.3亿欧截胡巴黎敲定迪奥曼德

快乐加载中21
2026-07-30 00:29:25
方媛带娃回安徽,两个小公主甜美又乖巧,站在土路上都像拍大片

方媛带娃回安徽,两个小公主甜美又乖巧,站在土路上都像拍大片

生命之泉的奥秘
2026-07-30 21:14:01
北平起义前夕,蒋介石紧急致电傅作义:念及共事多年的情分,特地求你办件事!傅作义的回应竟格外干脆!

北平起义前夕,蒋介石紧急致电傅作义:念及共事多年的情分,特地求你办件事!傅作义的回应竟格外干脆!

磊子讲史
2026-07-30 13:41:18
真是毁三观!释永信21年前与刘立明在郑州发生关系的笔录曝光

真是毁三观!释永信21年前与刘立明在郑州发生关系的笔录曝光

魔都姐姐杂谈
2025-07-28 14:35:36
比伯公开吐槽后苹果终于改了:iOS 27允许关掉那个总误触的按钮

比伯公开吐槽后苹果终于改了:iOS 27允许关掉那个总误触的按钮

摸鱼算法
2026-07-30 00:27:53
午后炸板!MLCC大牛股全天巨量换手,录得历史单日成交额第二

午后炸板!MLCC大牛股全天巨量换手,录得历史单日成交额第二

21世纪经济报道
2026-07-30 16:37:08
8月1日正式落地!燃油车全面整改,买车卖车年检全部更新!

8月1日正式落地!燃油车全面整改,买车卖车年检全部更新!

阿振观点
2026-07-29 17:17:30
2000%,机器人之王,利润狂飙!

2000%,机器人之王,利润狂飙!

新浪财经
2026-07-30 09:41:33
出大事了,14吨巨弹就位?伊朗核堡深藏百米,白宫:很快就炸他们

出大事了,14吨巨弹就位?伊朗核堡深藏百米,白宫:很快就炸他们

青青衫书生
2026-07-29 14:07:27
热巴现身珠宝展,穿无袖裙腋下副乳吸睛,被细腰露肩的奚梦瑶惊艳

热巴现身珠宝展,穿无袖裙腋下副乳吸睛,被细腰露肩的奚梦瑶惊艳

小嵩
2026-07-31 00:38:15
柯洁王者归来!逆转胜党毅飞再夺1冠 有博主调侃这不是火腿肠赛事

柯洁王者归来!逆转胜党毅飞再夺1冠 有博主调侃这不是火腿肠赛事

劲爆体坛
2026-07-30 17:27:22
中央批准!985大学,换帅!

中央批准!985大学,换帅!

双一流高校
2026-07-31 01:08:31
股价重挫65%,上演反向14天7板之后,A股“总熊头”德明利午后突然异动,股价直线涨停!封单一度超过10万手,一个月内超过70亿元杠杆资...

股价重挫65%,上演反向14天7板之后,A股“总熊头”德明利午后突然异动,股价直线涨停!封单一度超过10万手,一个月内超过70亿元杠杆资...

金融界
2026-07-30 14:23:37
中国这十大“硬菜”,我猜全吃过的不多

中国这十大“硬菜”,我猜全吃过的不多

风烟食录
2026-07-30 06:22:34
343斤网红硬闯峨眉山!全程竹竿托腹,晕倒被抬下山,私生活混乱

343斤网红硬闯峨眉山!全程竹竿托腹,晕倒被抬下山,私生活混乱

刘蕳爱下厨
2026-07-29 16:38:42
大数据曝光:女性出轨率最高的6大职业,排第一的让人意外

大数据曝光:女性出轨率最高的6大职业,排第一的让人意外

三农老历
2026-07-30 15:39:49
中国女子泰国被群殴全面失控!泰网民持续辱华,旅游局也下场拱火

中国女子泰国被群殴全面失控!泰网民持续辱华,旅游局也下场拱火

纪中百大事
2026-07-29 14:21:08
赵露思真不拿网友当外人,穿比基尼又唱又跳,舞台上直接脱掉裙子

赵露思真不拿网友当外人,穿比基尼又唱又跳,舞台上直接脱掉裙子

无处不风景love
2026-07-13 11:24:03
全新广汽丰田凯美瑞换新升级,售价17.18万起

全新广汽丰田凯美瑞换新升级,售价17.18万起

沙雕小琳琳
2026-07-30 16:47:17
2026-07-31 01:44:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9379文章数 567关注度
往期回顾 全部

科技要闻

小米澎程N90 Max预售价29.99万

头条要闻

陕西"公公强奸儿媳案"维持原判 女方精神鉴定结果公布

头条要闻

陕西"公公强奸儿媳案"维持原判 女方精神鉴定结果公布

体育要闻

曝皇马将签罗德里!转会费6000万签约4年

娱乐要闻

周星驰用态度打破快餐式宣发

财经要闻

中共中央政治局:提升资本市场韧性和信心

汽车要闻

FREELANDER神行者8下线 8月10日开启预售/海外版同步推进

态度原创

本地
健康
亲子
房产
艺术

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

最近总忘事,我是要中风了吗?

亲子要闻

你们知道叶子变异后会变什么颜色吗?

房产要闻

这个大平层,彻底打破了海口核心资产认知!

艺术要闻

她眼里藏着一整片海,看一眼就让人溺死:摄影大师镜头下的"迷离",是这世上最贵的奢侈品

无障碍浏览 进入关怀版