Feyn Labs 的研究人员 Hafedh Hichri 与 Shreyash Nigam 在7月21日发表了一篇技术笔记,正式推出了一款名为 FeyNoBg 的背景移除模型。与此同步开源的,还有用于训练该模型的 NoBg 库。
团队宣称,在涵盖通用显著目标检测与伪装目标检测的八项基准测试中,FeyNoBg 在其中四项测试上取得了目前已公布的最佳 S-measure 值。在其余四项测试中,该模型的成绩与领先者的差距均在2%以内。S-measure 是一种常用于评估前景分割质量的指标,数值接近1代表性能更好。
![]()
具体到应用场景,这款模型专门针对超高分辨率图像的显著目标掩码进行了测试,包括 4K 甚至 8K 级别的画面。研究人员已将模型权重上传至 Hugging Face,开发者可直接下载使用。而 NoBg 训练库的代码则托管在 GitHub 上,任何人都能基于该框架训练自己的背景移除模型。
![]()
背景移除算法在计算机内部的运作原理并不复杂。图像以像素网格的形式存储,算法需要为每一个像素预测一个不透明度值:背景像素变为透明,前景像素保持不透明,而处于边缘的像素则呈现半透明状态。一张精准的不透明度图,依赖于模型的两项硬核能力。
第一项能力是区分前景与背景。当拍摄对象站在纯色背景前时,通过比对颜色就能轻松完成分离。但在低对比度、人群拥挤或是物体与背景融为一体的画面中,模型就必须借助形状、纹理以及上下文信息来识别哪些像素构成了主体。
第二项能力是勾勒前景边界。在简单图像里,颜色或纹理的突变能提供强烈的边缘信号。但真实世界的边界远比这棘手:头发丝、动物皮毛、细电线以及运动模糊,都会让前景与背景元素交织在一起。模型需要判断一个边缘像素有多少比例属于主体,并据此设定它的透明度,这便是业界常说的图像抠图技术。
![]()
传统训练思路通常用不同类型的数据来分别训练这两项技能。但这种做法埋下了一个隐患:糟糕的训练配比会制造出失衡的模型——前景识别能力提升的同时,边界精度反而会下降。最终产出的结果要么漏掉了主体的某些部分,要么边缘缺乏干净利落的观感。
FeyNoBg 训练过程中的核心洞察力就在于,真实的图像足够复杂,因此模型需要同时具备熟练的前景识别能力与边界精度。团队选择了 BiRefNet 作为基础架构,因为它的设计天然契合这一目标。BiRefNet 将模型的两部分赋予互补的职责:其定位模块负责发现前景,而重建模块则负责勾勒主体的轮廓。
在具体的工作流中,输入图像首先要通过一个四阶段的特征提取器。早期阶段捕捉局部细节,后续阶段则将收集到的细节整合为更宏观的图像表征,即特征图。定位模块利用这些特征图来搜寻主体,重建模块则利用它们来恢复主体的边界。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.