网易首页 > 网易号 > 正文 申请入驻

颜水成团队等联合发布PaDT多模态大模型:实现真正多模态表征输出

0
分享至

近年来,多模态大语言模型(Multimodal Large Language Models, MLLMs)在图文理解、视觉问答等任务上取得了令人瞩目的进展。然而,当面对需要精细空间感知的任务 —— 比如目标检测、实例分割或指代表达理解时,现有模型却常常「力不从心」。其根本原因在于:当前主流 MLLMs 仍依赖将视觉目标「翻译」成文本坐标(如 [x1, y1, x2, y2] )的方式进行输出。

这种方式不仅存在格式混乱、解析困难,还容易因数字被拆分成多个独立文本 token(如 489 -> 4, 8, 9),导致语义丢失、图文脱节,从而出现重复生成甚至「幻觉」现象。

针对这一核心瓶颈,新加坡工程院院士、AAAI/ACM/IEEE/IAPR Fellow 颜水成带队,携同华南理工大学、新加坡科技研究局(A*STAR)I2R 研究所、腾讯 WeChat Vision 等机构的研究团队,提出了一种全新的统一范式 —— Patch-as-Decodable Token(PaDT)。

PaDT 的核心思想很简单但颠覆性:

  1. 把图像划分成多个视觉小块(patch),并让模型可以直接生成这些小块对应的视觉令牌(Visual Reference Tokens, VRTs)。
  2. 在 MLLMs 的输入和输出端中,实现文本令牌与视觉令牌的无缝交替出现,让模型「说」图像内容就像「说」文字一样自然。
  3. 从而使模型不再「猜坐标」,而能在生成句子中直接指出图像目标。

凭借这一设计,PaDT 在检测、分割、指代表达等任务上全面刷新 SOTA,甚至以仅 3B 参数的小模型超越了 78B 的 InternVL3!

  • 论文链接:https://huggingface.co/papers/2510.01954
  • 代码地址:https://github.com/Gorilla-Lab-SCUT/PaDT
  • 模型权重:https://huggingface.co/PaDT-MLLM
  • PaperScope 解读:https://www.paperscope.ai/hf/2510.01954

PaDT 的核心思想:从「说坐标」到「指图像」

传统 MLLMs(如 Qwen2.5-VL、InternVL3)在处理视觉任务时,通常将检测框的坐标以字符串形式输出。例如,模型可能会生成 「 [489, 120, 600, 300] 」。然而,这种做法存在三大痛点:

  1. 格式不一致:同一 Prompt 作为输入,不同样本可能生成绝对坐标、归一化坐标、甚至非结构化文本格式,极大地增加目标解析难度;
  2. 语义断裂:数字「489」会被拆成「4」「8」「9」三个独立 token,破坏了空间连续性;
  3. 图文关联弱:坐标数字 token 本身不含语义,难以与图像内容建立深层关联,从而容易导致重复或幻觉生成。

图 1:(a) 传统方法输出格式混乱;(b) Qwen2.5-VL 的 Token Activation Map 显示坐标 token 与图像区域关联弱;(c) PaDT 的 VRTs 与目标区域高度对齐;(d) 单个 VRT 的热力图显示其预测具有空间连续性。

PaDT 的突破在于:不再让模型「描述」位置,而是让它「指向」图像中的具体区域。

具体而言,PaDT 引入了Visual Reference Tokens(VRTs)—— 这些令牌直接来源于输入图像的视觉 patch 嵌入。在每次前向传播中,模型会动态地将当前图像的 patch 特征扩展进文本词表,形成一个「图文一体」的动态嵌入表。这样,模型在生成过程中,既可以输出文字(如类别名),也可以插入 VRT(如

),后者直接对应图像中的某个局部区域。

图 2:PaDT 实现了文本 token 与视觉 patch token 的统一预测,使 MLLM 能同时输出语义描述与空间定位。

这种设计巧妙地避开了传统方法依赖全局视觉码本(如 ClawMachine)的缺陷 —— 后者容易混淆相似物体,且可能生成图像中根本不存在的 patch。而 PaDT 的 VRTs仅来自当前图像,天然具备唯一性和空间一致性。

轻量解码器 + 鲁棒训练:让 VRTs 真正「生效」

仅有 VRTs 还不够,如何将其转化为具体的检测框或分割掩码?PaDT 设计了一个轻量级的 PaDT Decoder,仅由三个双向注意力块组成。该解码器接收 LLM 输出的 VRT 隐藏状态,通过注入任务特定的可学习 token(如 box token、mask token 和 score token),即可统一解码出 bounding box、segmentation mask 和置信度分数。

更关键的是,PaDT 提出了一套鲁棒的训练策略。传统方法往往要求模型预测目标区域内的所有前景 patch,但这会导致训练偏差和过拟合。PaDT 则在每次训练时随机采样少量(如 5 个)前景 VRTs 作为监督信号,并通过一种掩码交叉熵损失,动态屏蔽未选中的 VRT logits,从而鼓励模型探索多样化的有效视觉参考。

这种「少而精」的监督方式,不仅提升了模型泛化能力,还显著降低了推理时的 token 消耗 —— 每个目标仅需 5 个 VRTs,远少于逐字符生成坐标的开销。

图 3:PaDT 整体框架。图像 patch 特征经动态嵌入模块扩展为 VRTs,与文本 token 一同输入 LLM;输出序列中的 VRTs 被轻量解码器转换为结构化视觉结果。

性能炸裂:3B 模型干翻 78B 巨无霸

PaDT 的实验结果堪称惊艳。在RefCOCO/+/g的指代表达理解(REC)任务上,PaDT Pro(3B)以 93.6 的平均准确率,超越了参数量高达 78B 的 InternVL3(91.4)。而在指代表达分割(RES)任务中,PaDT 同样大幅领先,即便对比使用 SAM 等强大分割基础模型的方法(如 Text4Seg+SAM),依然保持优势。

更令人震撼的是在COCO 开放词汇检测任务上的表现。传统 MLLMs 在此任务上 mAP 普遍低于 20,而PaDT Pro(3B)一举将 mAP 推高至 38.2,几乎翻倍! 7B 版本更是达到 39.0 mAP,展现出极强的可扩展性。

图 4:PaDT 在 RefCOCO/+/g 的指代表达理解(REC)任务结果。PaDT Pro (3B) 以 93.6 的平均准确率,超越了参数量高达 78B 的 InternVL3(91.4)。

图 5:PaDT 在 RefCOCO/+/g 的指代表达分割(RES)任务结果。PaDT 依靠自带的轻量 decoder 轻松超越借助 SAM 强大分割基础模型的方法。

图 6:PaDT 在 COCO 开放词汇检测上的结果。PaDT Pro (3B) 一举将 mAP 推高至 38.2。

此外,团队还构建了一个新的Referring Image Captioning(RIC)数据集,要求模型在生成描述时显式关联对象 ID。PaDT 在此任务上同样大幅领先,CIDEr-D 分数从基线的 0.386 提升至 1.450,同时检测指标(GreedyPrecision 达 82.3%)也证明其生成的 caption 具备极强的视觉 grounding 能力。

图 7:Referring Image Captioning (RIC) 数据集。

为什么 PaDT 如此有效?

PaDT 的成功,源于其对 MLLM 视觉能力瓶颈的深刻洞察。它没有试图在文本空间内「拟合」视觉信息,而是将视觉 patch 本身作为可生成的 token,实现了模态间的原生对齐。

首先,动态嵌入机制确保了 VRTs 与当前图像的强绑定,避免了跨图像混淆;其次,统一的 token 空间让 LLM 能以相同的方式处理语言和视觉信息,简化了训练;最后,轻量解码器将复杂的 dense prediction 任务从 LLM 中解耦,既保留了 LLM 的语义推理能力,又赋予了其精准的空间输出能力。

值得一提的是,PaDT 还展现出强大的多任务泛化能力。通过联合训练 REC、RES、OVD 和 RIC 任务得到的PaDT Pro模型,仅通过切换 prompt 即可无缝切换任务,且性能普遍优于单任务模型,证明了该范式的通用性。

结语:迈向真正的通用多模态智能

PaDT 的提出,标志着 MLLMs 在细粒度视觉理解上迈出了关键一步。它不再满足于「看图说话」,而是能够「指图说话」—— 精准地指出图像中的每一个相关区域,并生成对应的结构化输出。

这项工作不仅在技术上实现了突破,更在理念上启发我们:未来的通用人工智能,或许不应强行将一切信息压缩到文本空间,而应允许不同模态以其最自然的形式共存与交互。

目前,PaDT 的代码和 checkpoints(模型权重)已开源。对于关注多模态、计算机视觉与大模型融合的研究者和工程师而言,这无疑是一个值得关注和尝试的新范式。

作者信息

苏永怡 (第一作者)

华南理工大学博四研究生,A*STAR I2R 访问学者,主要研究多模态大语言模型、基础视觉模型、测试时领域适应课题。

  • 作者个人主页:https://yysu.site/

张浩杰 (共同一作)

华南理工大学三年级研究生,微信视觉团队实习生。主要研究多模态大模型、视频生成模型、基础视觉模型。

  • 作者个人主页:https://zhang-haojie.github.io/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
苹果9月发布会倒计时!iPhone 18 Pro三箭齐发,首款折叠屏Ultra压轴炸场?

苹果9月发布会倒计时!iPhone 18 Pro三箭齐发,首款折叠屏Ultra压轴炸场?

泡泡网
2026-08-05 12:09:04
重庆渝中区一隧道口有车辆卡在半空 当地称司机无大碍,相关情况仍在处理中

重庆渝中区一隧道口有车辆卡在半空 当地称司机无大碍,相关情况仍在处理中

红星新闻
2026-08-05 13:18:45
最卑劣、最虚伪、最自私!皇马传奇球星呼吁:因凡蒂诺必须下台

最卑劣、最虚伪、最自私!皇马传奇球星呼吁:因凡蒂诺必须下台

全景体育V
2026-08-05 20:56:15
731当天,郑丽文给日本捐100万!这一刀,“砍”在中国人的伤口上

731当天,郑丽文给日本捐100万!这一刀,“砍”在中国人的伤口上

阅微札记
2026-08-05 21:11:06
太行山失联女孩最新细节:朋友真约了只是没来,哥哥还在山上找

太行山失联女孩最新细节:朋友真约了只是没来,哥哥还在山上找

智慧生活笔记
2026-08-05 11:55:53
《欢迎来龙餐馆》定档8.11 周末将开点映

《欢迎来龙餐馆》定档8.11 周末将开点映

万达电影
2026-08-05 19:02:24
真人秀明星儿子大婚,准婆婆一条浅蓝裙子让网友气炸:还让不让新娘活?

真人秀明星儿子大婚,准婆婆一条浅蓝裙子让网友气炸:还让不让新娘活?

热搜摘要官
2026-08-04 00:29:12
39 岁女演员朱锐自曝破产:炒股赔光 70 万积蓄,退圈失业,伸手跟妈妈要 2000 生活费

39 岁女演员朱锐自曝破产:炒股赔光 70 万积蓄,退圈失业,伸手跟妈妈要 2000 生活费

一盅情怀
2026-08-05 08:57:26
韩红风波后露面:暴瘦到认不出,无华表只挂大金链,多位领导簇拥

韩红风波后露面:暴瘦到认不出,无华表只挂大金链,多位领导簇拥

橙星文娱
2026-08-05 00:15:26
邯郸丛台执行局长录音曝光:司法的最后一公里,绝不能烂在手里

邯郸丛台执行局长录音曝光:司法的最后一公里,绝不能烂在手里

十为先生
2026-08-04 18:53:45
CBA3消息:广东签下NBA前锋,超级外援示好北京男篮,张庆鹏落选

CBA3消息:广东签下NBA前锋,超级外援示好北京男篮,张庆鹏落选

林子说事
2026-08-05 12:39:10
1950年,一名韩国维修工撞死美第8集团军司令,李承晚:枪毙司机

1950年,一名韩国维修工撞死美第8集团军司令,李承晚:枪毙司机

芊芊子吟
2026-08-05 08:00:25
威斯康星州民主党候选人Francesca Hong种族言论被扒,批评者怒斥“怪异的种族主义”

威斯康星州民主党候选人Francesca Hong种族言论被扒,批评者怒斥“怪异的种族主义”

爬虫饲养员
2026-08-04 22:52:57
越扒越有!婚外胚胎案再爆猛料:唐某坐拥亿万资产,小三继续叫嚣

越扒越有!婚外胚胎案再爆猛料:唐某坐拥亿万资产,小三继续叫嚣

鲸探所长
2026-08-03 14:22:31
六位米兰名宿为巴雷西抬棺,数千球迷送别传奇队长

六位米兰名宿为巴雷西抬棺,数千球迷送别传奇队长

北青网-北京青年报
2026-08-05 10:34:06
华为员工:我的人生很失败,赚了1000多万,买房赔了;孩子成绩全班倒数;媳妇每天不停的抱怨……

华为员工:我的人生很失败,赚了1000多万,买房赔了;孩子成绩全班倒数;媳妇每天不停的抱怨……

LULU生活家
2026-07-21 21:01:36
朱女士丈夫彻底妥协!销毁胚胎实锤存疑,“三方律师”身份成当前舆论焦点

朱女士丈夫彻底妥协!销毁胚胎实锤存疑,“三方律师”身份成当前舆论焦点

火山詩话
2026-08-05 19:08:37
万茜,算是平胸吗

万茜,算是平胸吗

东方不败然多多
2026-07-10 07:16:22
光大银行股息6%就敢长期拿?我3.8元拿了3年,踩过的坑比你赚的多

光大银行股息6%就敢长期拿?我3.8元拿了3年,踩过的坑比你赚的多

亿通电子游戏
2026-08-05 11:49:24
黄宗泽新欢是TVB咪神!24岁身材火辣到喷血,45岁不婚主义破功?

黄宗泽新欢是TVB咪神!24岁身材火辣到喷血,45岁不婚主义破功?

橙星文娱
2026-08-04 15:36:33
2026-08-06 00:39:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13681文章数 142710关注度
往期回顾 全部

科技要闻

SpaceX首份财报:营收暴涨92%,AI狂烧千亿

头条要闻

美国解除了与伊朗相关的制裁

头条要闻

美国解除了与伊朗相关的制裁

体育要闻

41岁C罗观看热身赛晒豪车:我的玩具

娱乐要闻

卓伟爆料天王巨星有私生子,真假难辨

财经要闻

猎奇智能IPO 在中际旭创的账上越陷越深

汽车要闻

给你一份专属的奢华与舒享 体验仰望U8L鼎藏版

态度原创

旅游
本地
房产
手机
公开课

旅游要闻

河北一景区餐厅张贴“不收取现金”提示,景区:已第一时间责令其撕除提示,并承诺会加强巡查;律师表示拒收现金属违法行为

本地新闻

课本里的童年,绍兴正上演

房产要闻

1-7月,海南楼市最新榜单出炉!

手机要闻

OPPO中端机线下上手:抛开续航,到底还剩下什么!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版