图像推理分割任务里,模型通常靠一个特殊的 token同时完成"理解语义"和"定位目标"两件事。ACL2026上提出的AnchorSeg却认为,一个token扛两件事,是性能瓶颈的根源。
它的解法很直接:把单个token扩展成一个K个隐推理token加一个锚点token的库。前者专门负责语义推理,后者专注空间定位,两者各司其职,不再互相干扰。
![]()
为什么拆分比合并更有效?
传统方法把"知道要分割什么"和"知道目标在哪"压缩进同一个表征,训练时容易顾此失彼。AnchorSeg让K个隐token并行推理语义,锚点token则锁定坐标,相当于把一道混合题拆成两道专项题,每道都更容易做对。
这种设计在ReasonSeg基准上拿到了当前最优成绩(SOTA)。对做多模态理解或视觉定位的开发者来说,这个思路提示了一个通用方向:当任务包含多个子目标时,显式解耦往往比隐式混合更稳。
论文的细节值得细读,但核心逻辑一句话就能说清:让每个token只干一件事,并把它们干的事明确分开。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.