![]()
仅附加一个轻量级深度预测头,就可以让标准 VLM 成为同时输出稠密深度图与自然语言响应的统一多模态基础模型。
作者丨DepthVLM团队
一句话概括:我们提出DepthVLM,首次让 VLM 以 (1) 的推理成本原生输出像素级稠密深度图,并在室内外深度估计上取得平均 δ₁=0.876 的成绩,全面超越 GPT-5.5、DepthLM、Youtu-VL 等现有 VLM,甚至力压纯视觉顶流 DepthAnythingV3。
![]()
论文标题:Unlocking Dense Metric Depth Estimation in VLMs
作者团队:Zhejiang University, Tencent Hunyuan LLM, HKUST, SLAI
论文链接:https://arxiv.org/abs/2605.15876
主页链接:https://depthvlm.github.io/
代码链接:https://github.com/hanxunyu/DepthVLM
![]()
你是否想过,一个已经能识别万物、回答问题,甚至完成复杂图文推理的多模态大模型,为什么在看一眼照片后,依然说不清眼前的桌子离相机究竟是一米还是两米?当前的顶尖 VLM 在二维图像理解和文本生成上已经非常强大,但一碰到三维空间中的“距离感”,往往就会变得含糊。换句话说,它们或许已经能很好地“看懂画面”,却未必真正“看见距离”。
这并非模型“不想”理解三维信息,而是现有训练范式本身缺少足够强的几何约束。主流 VLM 通常主要接受文本监督:视觉信号被编码进模型,却很少作为输出目标参与训练;模型虽然学会了用语言描述世界,却很少被要求恢复像素背后的度量几何。因此,当面对距离、遮挡与空间关系等问题时,VLM 往往只能依赖语义和常识进行推测,而缺少稠密几何提供的硬约束。。
于是,一个关键问题自然浮现:能否在不损失原有多模态能力的前提下,让 VLM 原生具备三维几何感知能力?DepthVLM 给出的答案是肯定的:我们不依赖外部深度模型,不进行知识蒸馏,也不采用逐像素查询,而是仅附加一个轻量级深度预测头,就可以让标准 VLM 成为同时输出稠密深度图与自然语言响应的统一多模态基础模型。
![]()
图1:DepthVLM 将低层次稠密几何预测与高层次多模态理解统一到同一个 VLM 中。
01
为什么 VLM 需要“深度感”?
传统 VLM 的局限,本质上源于以文本为主导的监督范式,缺少对视觉几何的直接约束。在标准自回归训练中,模型主要学习预测文本 Token,而非恢复像素背后的三维结构。因此,它们能够识别“这是一把椅子”,却难以真正理解物体之间的距离、遮挡与深度关系。当问题从“图中有什么”变成“谁离相机更近、谁遮挡了谁”时,传统 VLM 往往只能依赖语义与常识进行猜测,而缺少几何监督带来的硬约束。
现有方法大致分为两类。第一类通过外部深度模型先生成深度图或点云,再输入 VLM 补充空间信息,但几何能力本质上来自外部模型,误差也会沿管线累积。第二类尝试让 VLM 直接预测深度,但仍存在明显局限。例如,DepthLM 需要逐像素查询,生成完整深度图需要 (H×W)次前向传播;Youtu-VL 虽然能够一次输出全图深度,但仍停留在粗粒度 patch-level 表示,细节依赖后处理恢复。
DepthVLM 则选择了一条更直接的路径:进一步释放 VLM 内部已有的多尺度视觉表征。标准 VLM 天然包含从浅层边缘、纹理与局部几何,到深层语义与跨模态上下文的层级特征,这些本身就是稠密预测所需的基础表示。DepthVLM 通过一个轻量级 DPT-style 深度头,将这些隐藏特征组织为可解码的几何表示,从而让 VLM 原生输出像素级稠密深度图。
![]()
图2:现有 VLM 与 DepthVLM 的监督范式对比。
02
方法概览:从 VLM 隐藏特征中解码稠密深度
DepthVLM 的设计目标很明确:尽量少改动标准 VLM 架构,同时让模型具备原生的稠密度量深度预测能力。为此,我们保留原有视觉编码器、LLM 骨干和文本生成路径,只在多尺度视觉表示之上接入一个轻量级 DPT-style 深度预测头。这样,模型既可以像普通 VLM 一样生成自然语言响应,也可以在同一次前向传播中输出像素级稠密深度图。
具体来说,DepthVLM 从视觉编码器中抽取三个中间层 ViT 特征,并从 LLM 最终隐藏状态中取出图像 Token 表示,形成四级特征。随后,模型采用自底向上的上采样融合结构,让浅层特征提供更高空间分辨率,深层特征提供更强语义,再通过 RefineNet 逐级融合,兼顾边缘细节和语义一致性。
融合后的特征经轻量级 DPT-style 深度预测头和 Softplus 激活,输出稠密度量深度图;语言模型则沿原路径生成文本响应。两条输出路径共享视觉编码器和 LLM 表征,但彼此独立,因此 DepthVLM 不需要重写 VLM 的生成机制,也能自然接入现有指令微调流程。
![]()
图3:DepthVLM 整体框架。
03
两阶段训练:先稳定“看见”,再联合“理解”
直接给一个预训练 VLM 接上随机初始化的深度预测头并端到端训练,很容易破坏模型原本的多模态能力。为此,我们采用了两阶段训练策略。
阶段一:冻结整个 VLM,只训练深度预测头。让模型先学会如何从已有隐藏特征中稳定解码深度。监督信号采用尺度不变对数损失(SILog Loss):
阶段二:解冻 LLM 骨干,进行端到端联合微调。此时总损失由文本生成损失和深度损失加权组合,使几何预测和语言理解能够在同一个模型内进一步对齐:

消融实验显示,这个训练策略非常关键。只做第二阶段会损害通用 VQA 能力;第二阶段连 ViT 一起解冻虽然能带来一定的深度精度提升,但会明显伤害 OCRBench、MMStar 等通用多模态基准。最终采用“冻结 ViT、联合微调 LLM 与深度预测头”的方案,在几何精度和原有 VLM 能力之间取得了更好的平衡。
04
数据与训练:少即是多
为了系统训练和评估 VLM 的度量深度能力,我们构建了 DepthVLM-Bench,聚合 8 个室内外训练数据源,并在 9 个未见过的数据集上评测。相比许多纯视觉深度模型依赖 20 多个数据集和大量合成数据,DepthVLM 仅使用数量级更少的真实数据,就取得了卓越性能,说明 VLM 预训练表征中蕴含着丰富的场景结构和空间关系先验。
跨数据集训练还会受到相机内参差异影响。DepthVLM 采用焦距归一化,将输入图像统一到共享虚拟焦距下,缓解尺度歧义,使模型更容易学习稳定的像素到深度映射。
05
实验结果:深度预测与通用能力兼得
在 DepthVLM-Bench 上,普通 VLM 很难可靠回答度量深度问题。GPT-5.5 在 9 个数据集上的平均 δ₁ 约为 0.407,Qwen3-VL、InternVL3.5 等通用 VLM 也存在明显差距。相比之下,DepthVLM-4B 平均 δ₁ 达到 0.868,DepthVLM-8B 进一步达到 0.876,明显超过 DepthLM-12B 的 0.730 和 Youtu-VL-4B 的 0.603。
面对 DepthAnythingV3、UniDepthV2、Metric3Dv2 等专门为深度估计设计的纯视觉模型,DepthVLM-8B 在选定室内外基准上取得平均 δ₁=0.890,超过 DepthAnythingV3 的 0.877。这说明稠密几何预测并不一定只能依赖专用视觉模型完成,保留语言交互能力的 VLM 同样可以成为强大的度量深度预测器。
DepthVLM 也没有因为引入稠密深度预测而牺牲原有多模态理解能力。在 MMBench、MMStar、ScienceQA、OCRBench 等通用基准上,DepthVLM 基本保持原始 VLM 骨干能力,部分任务略有提升。相比之下,DepthLM 容易过拟合到“输入一个点、输出一个深度值”的格式,破坏常规 VQA 能力。
效率上,DepthLM 需要对每个像素单独查询,生成完整深度图耗时可达小时级;Youtu-VL 需要对稀疏深度进行后处理。DepthVLM 直接输出稠密像素级深度图,在相同输入尺寸下端到端耗时约 0.42 秒。
![]()
表1:DepthVLM 与现有 VLM 在室内外度量深度估计上的结果对比。
![]()
表2:DepthVLM 与纯视觉模型的结果对比。
![]()
表3:通用多模态能力评测。
06
不止于深度:几何能力反哺空间推理
从定性结果看,DepthVLM 的预测不仅数值更准,也能在复杂室内外场景中保留更精细的边界、物体轮廓和结构关系。这对 3D 重建、具身导航、机器人操作和 AR/VR 空间理解等任务都非常重要。
当 VLM 具备原生稠密几何预测能力后,高层 3D 空间推理也会受益。很多空间问题表面上是在问“谁在谁前面”“哪个物体更近”,本质上却依赖深度、遮挡和三维布局。DepthVLM 内部拥有更可靠的稠密几何表示,因此在遮挡关系、深度排序和相对距离判断上更稳定。
![]()
图4:与其他方法的定性对比。
![]()
图5:复杂 3D 空间推理任务示例。
07
结语:迈向统一的多模态基础模型
DepthVLM 的意义不只是刷新深度估计指标,更重要的是展示了一条通向统一多模态基础模型的路径:低层几何感知和高层语言理解不必被拆成两个系统。DepthVLM 表明,一个标准 VLM 骨干内部已经包含可用于稠密预测的多尺度表示;只要采用合适的轻量级结构和训练策略,就能把这些表示自然转化为可用的度量几何输出。未来,这一路线也有望扩展到表面法向估计、3D 目标检测、姿态估计和更复杂的具身空间推理任务。
08
作者简介
第一作者:于瀚勋,浙江大学计算机学院博士生,研究方向为多模态大模型、空间智能等,在 CVPR、ICLR、ACM MM、TPAMI等国际顶级期刊/会议发表多篇论文。
共同通讯作者:朱建科,浙江大学计算机学院教授,研究方向为计算机视觉与机器学习,在TPAMI、IJCV、CVPR、ICCV等国际顶级期刊/会议发表多篇论文;柯磊,腾讯混元大模型高级研究科学家,研究方向为多模态基础模型,担任 NeurIPS、ICLR 领域主席。
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.