网易首页 > 网易号 > 正文 申请入驻

腾讯混元&浙大:VLM 不只会聊天对话,还能原生输出像素级深度图

0
分享至


仅附加一个轻量级深度预测头,就可以让标准 VLM 成为同时输出稠密深度图与自然语言响应的统一多模态基础模型。

作者丨DepthVLM团队

一句话概括:我们提出DepthVLM,首次让 VLM 以 (1) 的推理成本原生输出像素级稠密深度图,并在室内外深度估计上取得平均 δ₁=0.876 的成绩,全面超越 GPT-5.5、DepthLM、Youtu-VL 等现有 VLM,甚至力压纯视觉顶流 DepthAnythingV3。


论文标题:Unlocking Dense Metric Depth Estimation in VLMs

作者团队:Zhejiang University, Tencent Hunyuan LLM, HKUST, SLAI

论文链接:https://arxiv.org/abs/2605.15876

主页链接:https://depthvlm.github.io/

代码链接:https://github.com/hanxunyu/DepthVLM


你是否想过,一个已经能识别万物、回答问题,甚至完成复杂图文推理的多模态大模型,为什么在看一眼照片后,依然说不清眼前的桌子离相机究竟是一米还是两米?当前的顶尖 VLM 在二维图像理解和文本生成上已经非常强大,但一碰到三维空间中的“距离感”,往往就会变得含糊。换句话说,它们或许已经能很好地“看懂画面”,却未必真正“看见距离”。

这并非模型“不想”理解三维信息,而是现有训练范式本身缺少足够强的几何约束。主流 VLM 通常主要接受文本监督:视觉信号被编码进模型,却很少作为输出目标参与训练;模型虽然学会了用语言描述世界,却很少被要求恢复像素背后的度量几何。因此,当面对距离、遮挡与空间关系等问题时,VLM 往往只能依赖语义和常识进行推测,而缺少稠密几何提供的硬约束。。

于是,一个关键问题自然浮现:能否在不损失原有多模态能力的前提下,让 VLM 原生具备三维几何感知能力?DepthVLM 给出的答案是肯定的:我们不依赖外部深度模型,不进行知识蒸馏,也不采用逐像素查询,而是仅附加一个轻量级深度预测头,就可以让标准 VLM 成为同时输出稠密深度图与自然语言响应的统一多模态基础模型。


图1:DepthVLM 将低层次稠密几何预测与高层次多模态理解统一到同一个 VLM 中。

01


为什么 VLM 需要“深度感”?

传统 VLM 的局限,本质上源于以文本为主导的监督范式,缺少对视觉几何的直接约束。在标准自回归训练中,模型主要学习预测文本 Token,而非恢复像素背后的三维结构。因此,它们能够识别“这是一把椅子”,却难以真正理解物体之间的距离、遮挡与深度关系。当问题从“图中有什么”变成“谁离相机更近、谁遮挡了谁”时,传统 VLM 往往只能依赖语义与常识进行猜测,而缺少几何监督带来的硬约束。

现有方法大致分为两类。第一类通过外部深度模型先生成深度图或点云,再输入 VLM 补充空间信息,但几何能力本质上来自外部模型,误差也会沿管线累积。第二类尝试让 VLM 直接预测深度,但仍存在明显局限。例如,DepthLM 需要逐像素查询,生成完整深度图需要 (H×W)次前向传播;Youtu-VL 虽然能够一次输出全图深度,但仍停留在粗粒度 patch-level 表示,细节依赖后处理恢复。

DepthVLM 则选择了一条更直接的路径:进一步释放 VLM 内部已有的多尺度视觉表征。标准 VLM 天然包含从浅层边缘、纹理与局部几何,到深层语义与跨模态上下文的层级特征,这些本身就是稠密预测所需的基础表示。DepthVLM 通过一个轻量级 DPT-style 深度头,将这些隐藏特征组织为可解码的几何表示,从而让 VLM 原生输出像素级稠密深度图。


图2:现有 VLM 与 DepthVLM 的监督范式对比。

02


方法概览:从 VLM 隐藏特征中解码稠密深度

DepthVLM 的设计目标很明确:尽量少改动标准 VLM 架构,同时让模型具备原生的稠密度量深度预测能力。为此,我们保留原有视觉编码器、LLM 骨干和文本生成路径,只在多尺度视觉表示之上接入一个轻量级 DPT-style 深度预测头。这样,模型既可以像普通 VLM 一样生成自然语言响应,也可以在同一次前向传播中输出像素级稠密深度图。

具体来说,DepthVLM 从视觉编码器中抽取三个中间层 ViT 特征,并从 LLM 最终隐藏状态中取出图像 Token 表示,形成四级特征。随后,模型采用自底向上的上采样融合结构,让浅层特征提供更高空间分辨率,深层特征提供更强语义,再通过 RefineNet 逐级融合,兼顾边缘细节和语义一致性。

融合后的特征经轻量级 DPT-style 深度预测头和 Softplus 激活,输出稠密度量深度图;语言模型则沿原路径生成文本响应。两条输出路径共享视觉编码器和 LLM 表征,但彼此独立,因此 DepthVLM 不需要重写 VLM 的生成机制,也能自然接入现有指令微调流程。


图3:DepthVLM 整体框架。

03


两阶段训练:先稳定“看见”,再联合“理解”

直接给一个预训练 VLM 接上随机初始化的深度预测头并端到端训练,很容易破坏模型原本的多模态能力。为此,我们采用了两阶段训练策略。

  • 阶段一:冻结整个 VLM,只训练深度预测头。让模型先学会如何从已有隐藏特征中稳定解码深度。监督信号采用尺度不变对数损失(SILog Loss):

  • 阶段二:解冻 LLM 骨干,进行端到端联合微调。此时总损失由文本生成损失和深度损失加权组合,使几何预测和语言理解能够在同一个模型内进一步对齐:


消融实验显示,这个训练策略非常关键。只做第二阶段会损害通用 VQA 能力;第二阶段连 ViT 一起解冻虽然能带来一定的深度精度提升,但会明显伤害 OCRBench、MMStar 等通用多模态基准。最终采用“冻结 ViT、联合微调 LLM 与深度预测头”的方案,在几何精度和原有 VLM 能力之间取得了更好的平衡。

04


数据与训练:少即是多

为了系统训练和评估 VLM 的度量深度能力,我们构建了 DepthVLM-Bench,聚合 8 个室内外训练数据源,并在 9 个未见过的数据集上评测。相比许多纯视觉深度模型依赖 20 多个数据集和大量合成数据,DepthVLM 仅使用数量级更少的真实数据,就取得了卓越性能,说明 VLM 预训练表征中蕴含着丰富的场景结构和空间关系先验。

跨数据集训练还会受到相机内参差异影响。DepthVLM 采用焦距归一化,将输入图像统一到共享虚拟焦距下,缓解尺度歧义,使模型更容易学习稳定的像素到深度映射。

05


实验结果:深度预测与通用能力兼得

在 DepthVLM-Bench 上,普通 VLM 很难可靠回答度量深度问题。GPT-5.5 在 9 个数据集上的平均 δ₁ 约为 0.407,Qwen3-VL、InternVL3.5 等通用 VLM 也存在明显差距。相比之下,DepthVLM-4B 平均 δ₁ 达到 0.868,DepthVLM-8B 进一步达到 0.876,明显超过 DepthLM-12B 的 0.730 和 Youtu-VL-4B 的 0.603。

面对 DepthAnythingV3、UniDepthV2、Metric3Dv2 等专门为深度估计设计的纯视觉模型,DepthVLM-8B 在选定室内外基准上取得平均 δ₁=0.890,超过 DepthAnythingV3 的 0.877。这说明稠密几何预测并不一定只能依赖专用视觉模型完成,保留语言交互能力的 VLM 同样可以成为强大的度量深度预测器。

DepthVLM 也没有因为引入稠密深度预测而牺牲原有多模态理解能力。在 MMBench、MMStar、ScienceQA、OCRBench 等通用基准上,DepthVLM 基本保持原始 VLM 骨干能力,部分任务略有提升。相比之下,DepthLM 容易过拟合到“输入一个点、输出一个深度值”的格式,破坏常规 VQA 能力。

效率上,DepthLM 需要对每个像素单独查询,生成完整深度图耗时可达小时级;Youtu-VL 需要对稀疏深度进行后处理。DepthVLM 直接输出稠密像素级深度图,在相同输入尺寸下端到端耗时约 0.42 秒。


表1:DepthVLM 与现有 VLM 在室内外度量深度估计上的结果对比。


表2:DepthVLM 与纯视觉模型的结果对比。


表3:通用多模态能力评测。

06


不止于深度:几何能力反哺空间推理

从定性结果看,DepthVLM 的预测不仅数值更准,也能在复杂室内外场景中保留更精细的边界、物体轮廓和结构关系。这对 3D 重建、具身导航、机器人操作和 AR/VR 空间理解等任务都非常重要。

当 VLM 具备原生稠密几何预测能力后,高层 3D 空间推理也会受益。很多空间问题表面上是在问“谁在谁前面”“哪个物体更近”,本质上却依赖深度、遮挡和三维布局。DepthVLM 内部拥有更可靠的稠密几何表示,因此在遮挡关系、深度排序和相对距离判断上更稳定。


图4:与其他方法的定性对比。


图5:复杂 3D 空间推理任务示例。

07


结语:迈向统一的多模态基础模型

DepthVLM 的意义不只是刷新深度估计指标,更重要的是展示了一条通向统一多模态基础模型的路径:低层几何感知和高层语言理解不必被拆成两个系统。DepthVLM 表明,一个标准 VLM 骨干内部已经包含可用于稠密预测的多尺度表示;只要采用合适的轻量级结构和训练策略,就能把这些表示自然转化为可用的度量几何输出。未来,这一路线也有望扩展到表面法向估计、3D 目标检测、姿态估计和更复杂的具身空间推理任务。

08


作者简介

第一作者:于瀚勋,浙江大学计算机学院博士生,研究方向为多模态大模型、空间智能等,在 CVPR、ICLR、ACM MM、TPAMI等国际顶级期刊/会议发表多篇论文。

共同通讯作者:朱建科,浙江大学计算机学院教授,研究方向为计算机视觉与机器学习,在TPAMI、IJCV、CVPR、ICCV等国际顶级期刊/会议发表多篇论文;柯磊,腾讯混元大模型高级研究科学家,研究方向为多模态基础模型,担任 NeurIPS、ICLR 领域主席。

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
43岁香港男星在西班牙海滩被当地男人搭讪多次,太受欢迎!

43岁香港男星在西班牙海滩被当地男人搭讪多次,太受欢迎!

下水道男孩
2026-07-31 00:50:14
梅德韦杰夫:拯救俄罗斯只有一条路,打赢这场特别军事行动

梅德韦杰夫:拯救俄罗斯只有一条路,打赢这场特别军事行动

鲁中晨报
2026-07-30 20:26:06
上海海港0-1十人山东泰山,诞生3大不可思议,以及2个不争事实

上海海港0-1十人山东泰山,诞生3大不可思议,以及2个不争事实

球场新视角1号
2026-08-01 21:44:15
头痛10天一直硬扛,英国34岁男子被妻子逼去医院,查出晚期脑癌

头痛10天一直硬扛,英国34岁男子被妻子逼去医院,查出晚期脑癌

新欧洲
2026-07-31 19:08:57
长鑫科技大涨超14%,市值超4万亿元

长鑫科技大涨超14%,市值超4万亿元

澎湃新闻
2026-07-31 09:48:30
秦海璐变卖房产,清空全部资产,凑出近亿身家,绝境兜底救下刘涛

秦海璐变卖房产,清空全部资产,凑出近亿身家,绝境兜底救下刘涛

秋别离
2026-06-13 15:50:00
新“三鹿”出现?婴儿奶粉暴雷!检出铅超标9倍,孩童大脑危险!

新“三鹿”出现?婴儿奶粉暴雷!检出铅超标9倍,孩童大脑危险!

阿晪美食
2026-07-31 14:58:00
184:57强行通过!日本天皇一家,被麻生太郎和高市联手逼到绝境

184:57强行通过!日本天皇一家,被麻生太郎和高市联手逼到绝境

时尚的弄潮
2026-07-31 09:26:53
国足归化目标+1!“航体之王”公开喊话:梦想代表中国队出战!

国足归化目标+1!“航体之王”公开喊话:梦想代表中国队出战!

绿茵舞着
2026-08-01 21:44:56
万万没想到,她直接给了孩子一巴掌!男子乘高铁遭后座“小孩哥”连环踢座椅,向其父母投诉后瞬间愣住

万万没想到,她直接给了孩子一巴掌!男子乘高铁遭后座“小孩哥”连环踢座椅,向其父母投诉后瞬间愣住

环球网资讯
2026-07-30 19:19:22
22岁女孩失联后续:家属曝内幕,失联原因令人不解

22岁女孩失联后续:家属曝内幕,失联原因令人不解

麦芽是个小趴菜
2026-08-01 12:53:15
为何只有中国在“逐步电动化”,国外却以油车为主,问题出在哪?

为何只有中国在“逐步电动化”,国外却以油车为主,问题出在哪?

历史的烟火
2026-08-01 03:10:54
猛犸象将归入中国资本麾下,户外三神兽均与中国资本完成深度绑定

猛犸象将归入中国资本麾下,户外三神兽均与中国资本完成深度绑定

政知新媒体
2026-08-01 23:55:13
杨瀚森训练单挑湖人旧将!美媒建议3换2交易:加盟雄鹿可获稳定时间

杨瀚森训练单挑湖人旧将!美媒建议3换2交易:加盟雄鹿可获稳定时间

罗说NBA
2026-08-01 09:29:00
日本举国备战,47个县签收尸协议,实弹演习覆盖中国东南沿海

日本举国备战,47个县签收尸协议,实弹演习覆盖中国东南沿海

兵卒史
2026-07-29 20:14:36
大火烧穿俄远东!符拉迪沃斯托克巨型仓库彻底焚毁,损失惨不忍睹

大火烧穿俄远东!符拉迪沃斯托克巨型仓库彻底焚毁,损失惨不忍睹

老马拉车莫少装
2026-07-31 14:22:51
当庭认罪、婚内出轨,索赔504万,一天3大瓜!汪小菲最令人意外

当庭认罪、婚内出轨,索赔504万,一天3大瓜!汪小菲最令人意外

做一个合格的吃瓜群众
2026-08-01 17:04:28
90后男子明知对方是军嫂仍与其同居,破坏军婚被判刑六个月

90后男子明知对方是军嫂仍与其同居,破坏军婚被判刑六个月

环球网资讯
2026-07-31 16:31:06
汪曼熙和醒醒同在北京音乐厅演出!汪峰对曼熙不予理睬对醒醒大赞

汪曼熙和醒醒同在北京音乐厅演出!汪峰对曼熙不予理睬对醒醒大赞

萧佉影视解说
2026-07-31 16:38:22
南部战区黄岩岛海域演训,专家:立体两栖战力震慑侵权挑衅

南部战区黄岩岛海域演训,专家:立体两栖战力震慑侵权挑衅

环球网资讯
2026-08-01 16:20:35
2026-08-02 00:36:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7517文章数 20772关注度
往期回顾 全部

科技要闻

特斯拉拆不掉中国制造

头条要闻

德意等22国领导人紧急签联名信 西班牙首相反怼:自私

头条要闻

德意等22国领导人紧急签联名信 西班牙首相反怼:自私

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

韩路批董宇辉“又当又立”?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

亲子
家居
健康
时尚
房产

亲子要闻

逆天,网友送外卖媳妇是服务员,生了三个娃,直言:以后三个娃长大接着送外卖当服务员!

家居要闻

2026建博会(广州) 公装联探展交流活动

中风易复发!谈中风康复与二级预防

云边波萨:允许自己做一朵无用的云

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

无障碍浏览 进入关怀版