网易首页 > 网易号 > 正文 申请入驻

英伟达开源LocateAnything,最强3B目标检测大模型,视觉定位新范式!(附论文及源码)

0
分享至

来源:市场资讯

(来源:OpenCV与AI深度学习)

作者:小源

链接:https://mp.weixin.qq.com/s/yo76-mLuyrsW6Z7UqNZUBQ?scene=1

本文仅用于学术分享,如有侵权,请联系后台作删文处理

导读

当多数VLM还在逐token生成检测框时,LocateAnything用“并行框解码”改写了生成式目标定位范式:一次性输出完整几何框,在显著提升推理速度的同时进一步提高定位精度。配合1.38亿规模训练数据,重新刷新了视觉定位的速度与精度边界。

前两天英伟达发布了最新的开源目标检测大模型「LocateAnything」,经过昨天和今天的测试,从我的个人的在常用的行业场景的使用感觉上来说,在没有经过微调的情况下,在3B这个参数规模下,可以私有化部署的,LocateAnything是我目前用过的「最好」的目标检测大模型,相对于同级别的大模型,可以说是又「快」又「准」,没有之一,如果你的场景是可以使用大模型来进行目标检测的,可以优先考虑「LocateAnything」。

为了进行测试,我使用了落地的行业巡检中常见的一些目标场景,并使用LocateAnything直接进行目标目标检测的效果,但是提示词我都转成英文了,因为有些模型原生对英文支持的好一些。

论文链接:https://arxiv.org/pdf/2605.27365

代码链接:https://research.nvidia.com/labs/lpr/locate-anything/

一、耕地保护(圈地占存)


二、耕地保护(推堆动土)


三、城市治理(铁皮加盖)


四、城市交通基础设施(道路护栏坏损)


五、城市治理(占道经营)


六、城市交通基础设施(桥梁病害)


七、城市治理(河道漂浮物)


八、城市治理(河道瓶子)


九、林业管理(森林烟火点)


为什么LocateAnything可以做到又快又准:

一、快:LocateAnything 速度快的核心源于并行框解码 PBD范式革新。传统 VLM 把 2D 检测框拆成多个坐标 Token,采用逐 Token 自回归串行解码,需要十几步才能完成一个框预测,存在严重推理瓶颈;而本文 PBD 将整个检测框视为一个原子单元,单步前向即可一次性输出全套坐标,把解码步数从十余步压缩至 2 步。


实测单 H100 上吞吐量达 12.7 BPS,比传统 Qwen3-VL 快 10 倍,且目标数量越多,并行加速优势越明显,我自己在48G显存的vGPU上也是取得了不错的运行速度。

二、准:LocateAnything 精度高来自结构对齐解码 + 超大专业数据集两大支撑。

1,传统串行解码和通用 MTP 随意分块,破坏检测框四个坐标间天然几何耦合关系,易产生虚假关联与误差传播;而 PBD 按检测框天然边界做块划分,训练时采用块内双向注意力、块间因果注意力,配合 NTP+MTP 双流联合训练,精准学习坐标内在关联,显著提升高 IoU 精细定位能力。

2,自建LocateAnything-Data 大规模数据集,一个庞大且多样化的训练语料库,包含 1.38 亿个语言查询和 7.85 亿个边界框,涵盖一般 OD、GUI 定位、指称理解、文本本地化和基于点的任务,还专门设计两阶段训练强化密集小目标检测,并加入海量负样本抑制幻觉。

接下来对该方法的论文进行详细解读

LocateAnything:用并行框解码实现高速高精度视觉语言定位

论文信息:LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding | arXiv:2605.27365 | 香港理工大学、普林斯顿大学、南京大学、UIUC & NVIDIA


图1:LocateAnything的多样化任务与并行框解码。上图:LocateAnything在统一的视觉语言模型下支持多种定位任务。下图:文本数字解码逐位拼写坐标,量化坐标解码顺序预测坐标token。相比之下,并行框解码在单次前向传播中预测每个几何单元(如边界框)。

引言

视觉语言模型(VLMs)正逐渐成为交互式和具身系统的通用骨干,因其具备比传统专用模型更广泛的知识和更强的指令遵循能力。然而,要在真实世界中行动,VLMs必须紧密扎根于感知——特别是以高质量和低延迟从自然语言意图中定位任务相关实体。现有方法通常将目标检测和定位表述为坐标token生成问题,将每个2D框序列化为多个1D token,这种逐token解码与框几何的耦合结构不匹配,造成实际推理瓶颈。如何突破这一瓶颈,实现高速且高精度的视觉定位,成为关键挑战。

简介

本文提出了LocateAnything,一个基于并行框解码(Parallel Box Decoding, PBD)的统一生成式定位与检测框架。通过将边界框和点等几何元素作为原子单元在单步中解码,LocateAnything保持了框内几何一致性并释放了大量并行性。研究表明,PBD同时提升了解码吞吐量和定位精度。本文进一步开发了可扩展的数据引擎,构建了LocateAnything-Data大规模数据集,包含超过1.38亿训练样本,显著增加了高精度定位的数据多样性。大量评估表明,LocateAnything推进了速度-精度前沿,在实现显著更高解码吞吐量的同时,提升了跨多样基准的高IoU定位质量。结果凸显了并行框解码与大规模训练数据在实现高效精确统一视觉定位与检测中的互补优势。

方法

模型架构与表述

LocateAnything建立在原生分辨率VLM基础上,采用Moon-ViT视觉编码器和Qwen2.5语言解码器,通过MLP投影器连接。给定输入图像 ,视觉编码器以原生分辨率提取视觉token ,保留高精度定位所需的细粒度空间细节。

基于块的输出表述。 为支持PBD,本文放弃了标准NTP坐标生成。连续坐标被归一化到 ,离散化为token,并重组为块序列 。联合概率表述为:

每个块 为固定长度 的原子单元,容纳一个边界框和两个结构token(如 和 )。未占用位置用 token填充。定义四种功能块类型:(1) 语义块:编码语言身份;(2) 框块:使用四个量化坐标表示边界框;(3) 负块:明确表示查询对象不存在;(4) 结束块:信号生成终止。


图2:Token解码方法对比。NTP逐个生成坐标值。标准MTP方法产生不规则分布和非连贯、无结构模式。本文提出的PBD在并行步骤中生成单个原子框(或点)单元,确保框对齐和结构化输出。


图3:架构与基于块的输出表示。LocateAnything将定位表述为生成固定长度、框对齐原子块序列。定义四种功能块类型——语义块、框块、负块和结束块——共同指定预测实体或终止状态。

训练设计

本文采用双形式训练策略,联合优化NTP序列(保留因果推理能力)和块级MTP表述(用于框对齐预测)。构造拼接输入序列:,其中 和 为共享上下文, 为标准NTP输入序列, 为块级MTP输入序列。

通过从左到右遍历 构建,按块规则分割和填充。每个块中保留第一个token作为预测上下文,后续token替换为 [mask] token,提示模型在单一步骤中同时预测块内所有被掩码的token。

注意力掩码设计。 核心挑战是隔离NTP和MTP流同时允许两者利用共享上下文。通过专用注意力掩码实现三种行为:


图4:联合NTP-MTP训练的注意力掩码。共享上下文和NTP流使用因果注意力,MTP块在块间遵循块因果模式,同一块内token共享双向注意力。两流被隔离以防止泄漏,同时共同关注共享上下文。

  • NTP的因果注意力: 共享上下文和NTP序列采用因果注意力掩码,token只能关注前面token,且被限制关注 以防止数据泄漏

  • 跨块的因果流: 中不同块间注意力严格因果,活动块可关注共享上下文和所有先前提交的块

  • 块内双向注意力: 同一块内token共享双向注意力,捕获复杂内部关系(如坐标间的几何依赖)

目标函数为联合最小化两序列的交叉熵损失:

按需推理模式

PBD显著加速推理,但在复杂场景面临探索-利用困境。本文识别两种失败模式:格式不规则性(多实例跨类别时块内语法畸形)和空间模糊性(密集网格排列时边界模糊)。NTP回退机制可有效解决这些问题。


图5:修正的NTP重解码。当并行解码遇到格式不规则或空间模糊时,模型丢弃错误块并回退到标准NTP以确保稳健预测。

提出三种按需推理模式:

  • 快速模式(MTP): 并行预测完整框,最大化吞吐量,适合延迟受限场景

  • 慢速模式(NTP): 自回归解码坐标token,最大化稳定性,适合高精度标注

  • 混合模式: 默认使用快速模式,当并行输出不可靠时回退到慢速模式,兼顾速度与精度

推理时注意力掩码。 每个MTP解码步骤的注意力掩码与训练时块因果模式一致。KV缓存中的已提交token遵循标准因果注意力,当前MTP块中的 个token相互双向关注。每步MTP后,KV缓存截断为仅保留已提交token。

LocateAnything-Data

为训练通用视觉检测和定位模型,本文构建了LocateAnything-Data大规模多域数据集。


图6:LocateAnything-Data数据集概览。饼图展示自然语言查询、边界框和唯一图像的任务分布。下图提供语言查询的详细分解,显示每个任务类别的绝对数量和百分比。

数据集包含1200万唯一图像、1.38亿自然语言查询、7.85亿标注边界框,分为六个任务类别:

  • 通用目标检测(66.9%查询,83.1%边界框)

  • UI元素定位(16.5%查询)

  • 自然语言指代表达理解(7.3%查询)

  • 文本定位(3.6%查询)

  • 文档和场景布局定位(3.5%查询)

  • 基于点的定位任务(2.2%查询)

实验与结果

主要结果

高质量多目标检测。 在COCO和LVIS基准上,LocateAnything相比同规模的Rex-Omni,在LVIS上提升mean F1 +3.8%,在COCO上提升+1.8%。在密集检测基准Dense200和VisDrone上,分别取得58.7和39.9的mean F1,显著优于Rex-Omni的58.3和35.8。

方法

吞吐量(BPS)

COCO Zero-Shot F1@IoU 0.5/0.95/Mean

LVIS Zero-Shot F1@IoU 0.5/0.95/Mean

Qwen3-VL-4B

1.1

59.8/20.0/43.5

63.0/14.2/46.1

Qwen3-VL-8B

1.0

61.5/20.2/44.8

62.8/14.0/45.7

Rex-Omni-3B

5.0

64.3/20.7/46.9

72.0/15.9/52.9

LocateAnything-3B12.762.3/31.1/50.770.1/19.3/54.7

表1:COCO和LVIS上的结果。BPS(每秒框数)衡量解码吞吐量。

精确开放世界定位能力。 在ScreenSpot-Pro GUI定位任务上取得SOTA mean F1 60.3,超越Qwen3-VL-30B-A3B和GUI-Owl-32B等专业模型。在DocLayNet和M6Doc文档理解任务上分别达到76.8和70.1 mean F1。在HumanRef指代任务上取得78.7 mean F1。

方法

ScreenSpot-Pro Avg

DocLayNet F1@mIoU

M6Doc F1@mIoU

Rex-Omni-3B

36.8

70.7

55.6

GUI-Owl-32B

58.0

Qwen3-VL-30B-A3B

53.7

LocateAnything-3B60.376.870.1

表2-4:GUI定位、文档布局定位和OCR任务结果(精选)

卓越解码速度。 默认混合模式下达到12.7 BPS,比基于文本的Qwen3-VL(1.1 BPS)快10倍以上,比基于量化的Rex-Omni(5.0 BPS)快2.5倍。

消融实验

坐标表示。 在NTP范式下,文本和量化表示分别取得49.1和50.1 mean F1。PBD(慢速模式)达到最高52.1 F1,证明框对齐表述提供更强的空间推理监督。

表示方法

吞吐量

R

P

F1

Textual

1.3

45.7

52.3

49.1

Quantized

3.9

48.2

52.2

50.1

PBD (Slow)3.949.455.252.1

表6(a):坐标表示对比

MTP表述。 与现有结构无关的MTP方法(SDLM、Block Diffusion)相比,PBD在吞吐量(16.9 BPS)和精度(49.6 F1)上均显著更优。结构无关方法存在严格的速度-精度权衡,增大块尺寸仅带来边际吞吐量提升却持续降低F1。

方法

吞吐量

R

P

F1

SDLM-B4

5.2

45.4

48.1

46.5

SDLM-B6

5.5

45.1

47.5

46.1

SDLM-B8

6.7

44.7

47.2

45.8

Block Diff-B6

4.7

45.1

44.3

44.8

PBD (Fast)16.945.654.649.6

表6(b):MTP表述对比

解码模式。 联合训练()将慢速模式上限从50.1提升至52.1 F1。快速模式最大化吞吐量(16.9 BPS)但在复杂场景精度下降。混合模式保留大部分速度增益(13.2 BPS)同时实现稳健高精度定位(51.6 F1)。

模式

吞吐量

R

P

F1

Slow

3.9

48.2

52.2

50.1

Slow

3.9

49.4

55.2

52.1

Fast

16.9

45.6

54.6

49.6

Hybrid13.248.754.851.6

表6(c):解码模式与损失设计消融

框输出顺序。 四种空间排序策略中,X-Y角点顺序(按左上角x坐标排序,再按y坐标)取得最高F1分数,作为数据集构建的默认设置。


图7:框排序与解码速度的消融研究。左:不同框排序策略对F1分数的影响。右:Textual、Quantized和并行框解码在预测框数变化时的生成时间(柱状)和吞吐量(折线)对比。

吞吐量。 随着目标框从20增加到300,NTP方法遭受严重延迟瓶颈,而并行方法生成时间增长甚微,在密集场景中吞吐量从12 BPS提升至约25 BPS,实现2-6倍加速。

定性结果


图8:定性结果。每行展示目标数量变化和多样框尺度的测试用例。不同颜色表示不同查询类别,包括属性、部件、推理和空间查询。模型在多样场景域、任意图像分辨率、自由形式文本查询和任意数量目标上持续定位目标,展现强大稳健性。

观察三种一致行为:(i) 组合定位:处理属性/部件/空间/推理风格查询,空间对齐一致;(ii) 大实例数量稳健性:从稀疏到拥挤设置,预测框保持结构化和准确性;(iii) 杂乱中可靠定位:在遮挡、重复纹理和网格状密集布局下,框保持紧凑且分离良好。


图9:多目标定位数据引擎。上图:对于有gt框的检测数据集,使用每个框类别作为提示让Qwen3-VL合成详细以对象为中心的查询,包括属性、空间关系和推理线索。这些查询输入Molmo预测候选点,保留落在对应gt框内的点作为可靠监督。下图:对于大量高质量无标签图像,Qwen3-VL直接从图像生成多样查询,用于提示Molmo进行点预测,再通过SAM 3生成框,或直接提示Rex-Omni生成框。所有生成框最终由Qwen3-VL后验证。


图10:各域每查询目标数量分布。x轴显示与查询关联的目标数量,y轴(对数刻度)表示查询数量。


图11:各域查询长度分布。x轴表示目标描述中的词数(排除模板文本),y轴(对数刻度)显示查询数量。


图12:指代表达理解(REC)定性对比。与Qwen3-VL和Rex-Omni相比,LocateAnything展现更优的组合定位能力,准确将细微、自由形式的人类意图(如空间或基于属性的查询)与正确视觉区域对齐。


图13:密集目标检测(DOD)定性对比。图示在高度密集和严重重叠环境(如堆叠原木和算盘珠)中的性能。传统逐token生成模型(Qwen3-VL)和基于点的模型(Rex-Omni)遭受严重遗漏或空间模糊(相邻对象边界模糊),而LocateAnything保持紧凑、分离良好且高度准确的边界框,验证了块级内部注意力和密集感知Stage-2训练的有效性。


图14:光学字符识别(OCR)定性对比。对于场景文本(如杂志封面)和结构化文档(如表格),LocateAnything产生围绕文本元素的紧密边界框。基线模型频繁出现格式不规则或合并不同文本块。本文的并行解码结合混合模式回退机制,确保高精度定位而不牺牲结构连贯性。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
【美股盘前】英伟达财报明早公布,华尔街:Q3营收指引突破1050亿美元才算惊喜;美银:半导体股短期承压或创造买入机会;Anthropic拟向投资者披露超30万亿美元市场潜力,...

【美股盘前】英伟达财报明早公布,华尔街:Q3营收指引突破1050亿美元才算惊喜;美银:半导体股短期承压或创造买入机会;Anthropic拟向投资者披露超30万亿美元市场潜力,...

每日经济新闻
2026-08-26 17:15:06
世界上最危险的5个国家:全民吸毒、黑帮比警察多,出国最好避开

世界上最危险的5个国家:全民吸毒、黑帮比警察多,出国最好避开

万物知识圈
2026-08-26 09:50:39
丈夫无奈曝光!砸瓜女被拘后续:在家就这脾气,什么事都得占上风

丈夫无奈曝光!砸瓜女被拘后续:在家就这脾气,什么事都得占上风

社会日日鲜
2026-08-26 09:48:04
山姆北京第6家门店将于8月31日开业

山姆北京第6家门店将于8月31日开业

新京报
2026-08-26 19:22:11
宇树机器人比赛倒数第一,全网炸锅

宇树机器人比赛倒数第一,全网炸锅

科技头版Pro
2026-08-25 14:45:15
低密度脂蛋白从5.3降到1.8,其实并不难,做好这4点就够了

低密度脂蛋白从5.3降到1.8,其实并不难,做好这4点就够了

九哥聊军事
2026-08-26 10:08:50
澳洲海关开始查手机, 多名华人刚落地就被遣返, 签证直接取消!

澳洲海关开始查手机, 多名华人刚落地就被遣返, 签证直接取消!

澳微Daily
2026-08-24 15:57:47
8月25日俄乌最新:50国发表反俄宣言

8月25日俄乌最新:50国发表反俄宣言

西楼饮月
2026-08-25 20:54:42
心理学上说:接触的人越多越发现,吃饭慢、走路稳、脾气好、内向话少的人,往往办事细心,特别可靠

心理学上说:接触的人越多越发现,吃饭慢、走路稳、脾气好、内向话少的人,往往办事细心,特别可靠

心理观察局
2026-08-26 06:19:08
这6个指标正常,证明你的心脏基本没啥大问题,不要再乱检查了

这6个指标正常,证明你的心脏基本没啥大问题,不要再乱检查了

白宸侃片
2026-08-25 12:20:08
陈震:6.4万元白花了!特斯拉FSD不入华了,数据中心已人去楼空

陈震:6.4万元白花了!特斯拉FSD不入华了,数据中心已人去楼空

泡泡网
2026-08-25 14:58:16
曝国科大博士“豆豆姐”出轨,北理男小三删光动态,同学曝其霸凌

曝国科大博士“豆豆姐”出轨,北理男小三删光动态,同学曝其霸凌

180视角
2026-08-25 13:12:08
帕公主以金棺下葬,泰王赐予最高规格葬礼

帕公主以金棺下葬,泰王赐予最高规格葬礼

红袖说事
2026-08-26 08:07:57
纵观历史,美苏两极格局其实就是苏联自以为是的臆想而已!

纵观历史,美苏两极格局其实就是苏联自以为是的臆想而已!

梦归秋辰
2026-08-25 16:37:37
快讯!俄罗斯传来消息了!

快讯!俄罗斯传来消息了!

故事终将光明磊落
2026-08-26 09:49:34
蔡振华这辈子最看好的国乒人曝光!马龙樊振东都不是他心中的第一

蔡振华这辈子最看好的国乒人曝光!马龙樊振东都不是他心中的第一

悠悠说世界
2026-08-26 08:32:35
美国妹子$2淘到发黄旧婚纱,清洗店开价$500!她回家泡了两遍,成品全网看傻

美国妹子$2淘到发黄旧婚纱,清洗店开价$500!她回家泡了两遍,成品全网看傻

北美省钱快报
2026-08-26 05:30:13
台湾最新民调出炉,赖清德、郑丽文满意度惊人,韩国瑜被逼到墙角

台湾最新民调出炉,赖清德、郑丽文满意度惊人,韩国瑜被逼到墙角

徐云流浪中国
2026-08-26 13:55:46
2亿60后集体退场,为何说中国再也不会有这代人?

2亿60后集体退场,为何说中国再也不会有这代人?

小怪吃美食
2026-08-25 04:44:10
浙江省湖州市副市长、公安局局长张宏亮,拟提名为副省级城市副市长人选

浙江省湖州市副市长、公安局局长张宏亮,拟提名为副省级城市副市长人选

中国青年报
2026-08-26 17:00:15
2026-08-26 22:47:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4557895文章数 9359关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

祖孙骑车被撞孙子死亡 女司机仅买交强险:想着省点是点

头条要闻

祖孙骑车被撞孙子死亡 女司机仅买交强险:想着省点是点

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

北京现代吴周涛:艾尼氪V,中国定义专为年轻人打造

态度原创

手机
游戏
家居
旅游
亲子

手机要闻

国产旗舰排名大洗牌!Mate80 领跑国产,小米 vivoOPPO 差距太真实了

《星球大战》新作荣获IGN 9分!素质出色 剧情新颖

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

你为何总盯着终点?达尔文徒步教会我的事

亲子要闻

当哥哥第一次烧汤

无障碍浏览 进入关怀版