网易首页 > 网易号 > 正文 申请入驻

上海创智学院×上海交大提出MINT:让VLA从模仿轨迹走向理解意图

0
分享至



机器人视觉语言动作(Vision-Language-Action, VLA)模型越来越多地开始展示叠衣服、倒茶、做咖啡等复杂操作。但是,今天的大多数 VLA 更像 “展台机器人”。它们在固定场景、固定布局、固定光照下表现惊艳,可一旦真正进入开放环境,就立刻暴露其泛化性问题:物体位置变一点、背景换一下、光照改变一些,VLA 的成功率就会暴跌。对于新任务,往往需要重新收集大量示教轨迹(demonstration),才能让 VLA 学会。

但这些其实只是表面困境。真正困难的,也是 VLA 走向实际应用场景真正需要的,其实是:

  • 组合泛化(Compositional Generalization):VLA 学会 A、B、C 技能之后,能否自动组合出 A→B、B→C、C→A 等技能?即能否通过组合串联技能,执行长程、复杂的任务?
  • 小样本迁移(Few-shot / One-shot Transfer):学习新任务是否需要成百上千条演示?能不能像人类一样,看几次示教、甚至只看一次示教,就掌握一个新技能?

主流范式往往过度对齐原始轨迹本身,却缺少对 “轨迹背后意图” 的显式表征与推理,从而在泛化与迁移上受限。

针对上述问题,上海创智学院 × 上海交通大学x 智动未来提出:



  • 项目主页:https://renming-huang.github.io/MINT/
  • Github 链接:https://github.com/RenMing-Huang/MINT
  • 论文链接:https://arxiv.org/abs/2602.08602

MINT 是一种面向强泛化、强迁移的 VLA 架构与训练范式。它的核心思想是:机器人不应该只模仿 “动作轨迹”,而应该分层次地理解:

  • 「在什么情形应当触发什么抽象行为 “意图”」
  • 「如何根据当前场景,动态地 “执行” 行为意图」

一旦 VLA 能显式理解和表征抽象的行为意图,长期困扰 VLA 的泛化性和迁移性问题,就可以打开新的解法。

频谱分解动作词元化(Spectrally Disentangled Action Tokenization)



MINT 的关键技术来自一个信号处理视角:动作轨迹可以被看作时间信号,天然具备频谱结构。

SDAT 把动作表征映射到多个尺度的词元:

  • 最粗粒度词元(S1 尺度):主要表征低频信号,对应全局行为意图,论文称做 “Intent token”
  • 更细粒度的词元(S2-SK 尺度):逐步补充高频执行细节,论文称做”Execution tokens”

S1-SK 尺度的词元数逐步增多,形成金字塔形状的词元表征体系。

那么,不同尺度的词元是如何与低频和高频信号建立对应关系的呢?

MINT 应用了如下技术:

  • 残差学习(residual learning):细尺度的词元只学习未被粗尺度词元捕捉的残差信息
  • 由粗到细多尺度重建(coarse-to-fine multi-scale reconstruction):各个尺度的前缀(prefix)词元集合,都会分别被用来进行轨迹重建,保障尽可能完整地表征轨迹信息。
  • 频域重建(frequency-domain reconstruction):MINT 在「频域空间」中计算轨迹重建损失,这使得低频、高频信号能被显式地拆解开来,按需融入到不同尺度的词元内。

如此,使得粗尺度词元专注于学习轨迹的大体形态,而细尺度词元则专注于补充轨迹细节。

策略学习:“意图→执行” 的逐步推理



在策略层面,MINT 采用 “Intent → Execution” 的分层生成:

先预测 Intent Token-> 再逐层生成 Execution Tokens-> 最后将多尺度词元解码为连续控制轨迹

这个由粗到细的过程相当于在词元空间里进行分步推理:先确定要执行的行为意图,再补上达到该意图所需的控制细节。这种方式可以提升学习效率,并在长程任务中带来更稳定的执行表现。

策略迁移:通过一次示教学会新任务



MINT 最有意思的部分来了:Intent Token 可以直接用于策略迁移。

既然 Intent Token 表示的是抽象 “行为意图”,那它就可以直接替代语言,作为「任务表达(task specification)」。

这意味着,对于一个全新任务,模型不需要重新训练:只要提供一条示教轨迹,提取其 Intent Token,并将该 Token 注入到策略的生成过程中,模型就能在相同的推理框架下生成对应的执行细节并完成任务。

由于注入的是更抽象的意图而不是整段轨迹细节,这种迁移方式在跨任务、跨场景时更容易保持稳定。论文将这一能力称为:「One-shot Transfer via Intent Token Injection」 而这也是 MINT 最重要的创新之一。

实验结果

一、基准任务性能:全面超越 SOTA 方法





在 LIBERO、CALVIN 和 MetaWorld 三个基准上,MINT 的性能全面超越了当前的 SOTA 方法:

  • 在 LIBERO 上,30M 参数的 MINT-30M(不包含预训练 VLM)平均任务成功率达到 97.1%,大幅超越 SmolVLA 的 88.8%;4B 参数的 MINT-4B(有预训练 VLM)平均成功率达到 98.3%,超越了 π₀.₅ 的 96.9%;
  • 在 CALVIN 上,MINT-4B 在长序列任务中表现尤其出色,性能显著超过 SOTA,验证了其长程执行稳定性;
  • 在 MetaWorld 的 “极难” 类任务上,MINT-4B 的成功率接近 π₀ 的三倍,展现出在复杂长程任务中的显著优势。

二、泛化性:对抗分布外强扰动



在更强调分布外鲁棒性的测试中,作者在 LIBERO 上训练、并在分布更广的 LIBERO-Plus 上评估,考察相机视角、初始姿态、光照、背景纹理与视觉噪声等多类强扰动。

  • 面对相机视角变化时,MINT 的性能损失远小于 OpenVLA、π₀.₅ 等主流方法。
  • 面对背景、布局、光照、视觉噪声等强干扰时,MINT 依然维持了 84.6%-96.6% 的高任务完成率。

这些结果都印证了:“行为意图认知” 对于提升 VLA 泛化性的关键作用。

三、技能迁移:只需要演示一次





现有的迁移方法无论是通过微调(fine-tuning)还是重扩散(re-diffusion),在只有单条示教轨迹的条件下,都很难完成迁移。而 MINT 通过 Intent Token Injection,能稳定完成新任务迁移、新场景迁移:

  • 对于新任务,MINT 用一条示教轨迹,就能达到90% 的任务成功率,而通过微调迁移的成功率只有 42%。
  • MINT 展现出组合泛化(Compositional Generalization)的潜力。例如,训练中只见过 A 和 B 两个技能,但通过一次演示,MINT 能直接完成 A→B 这样的组合任务。这也是当前 VLA 极少展示出的能力。

四、真机验证:物理世界的高效落地

研究团队进一步在真实的 Piper-X 6DoF 机械臂上进行了真机实验。训练任务包括抓放香蕉、堆叠积木、插马克笔等,各提供了仅 20 条示教轨迹供模型后训练。测试任务还包含了从未见过的叠杯子任务,用以测试零样本泛化。





结果显示:

  • MINT-4B 的整体成功率相比 π₀.₅ 等主流 VLA 模型提升了 29%;
  • MINT-4B 在叠积木、插马克笔等任务中表现出更强的精确操作能力;
  • MINT 能够把 “堆叠” 这一抽象意图,从叠积木任务迁移到从未见过的叠杯子任务上。而 π₀ 等方法则几乎无法完成该未见任务。

这些真机结果进一步证明:MINT 学到的,已经不是单纯的轨迹,而是真正可迁移的行为结构。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
闹大了!知名男星坐高铁霸座,1743元票价不掏,官方怒批后果发酵

闹大了!知名男星坐高铁霸座,1743元票价不掏,官方怒批后果发酵

寒士之言本尊
2026-07-27 15:14:31
没想到,邓煜勇夺菲尔兹奖仅6天,41岁张靓颖竟意外火出圈

没想到,邓煜勇夺菲尔兹奖仅6天,41岁张靓颖竟意外火出圈

趣味八卦
2026-07-29 13:21:40
穆里尼奥硬保也没用!皇马强行送走主帅爱将!伯纳乌天才惨遭放逐

穆里尼奥硬保也没用!皇马强行送走主帅爱将!伯纳乌天才惨遭放逐

澜归序
2026-07-30 07:37:01
过气艺人多心酸?40度高温景点拉车,交不起电费一家6口脱衣降温

过气艺人多心酸?40度高温景点拉车,交不起电费一家6口脱衣降温

墨策史
2026-07-29 20:08:16
地铁安检到底在防谁?国外多年没有照样过,国内为何层层设防?

地铁安检到底在防谁?国外多年没有照样过,国内为何层层设防?

抽象派大师
2026-07-20 02:07:32
最新消息!宏远吸金能力CBA第一,周鹏抵达广州,多队报价萨姆纳!

最新消息!宏远吸金能力CBA第一,周鹏抵达广州,多队报价萨姆纳!

体坛卡卡说
2026-07-30 09:34:47
午休情人悄然流行,隐蔽出轨套路多,配偶全被蒙在鼓里

午休情人悄然流行,隐蔽出轨套路多,配偶全被蒙在鼓里

游戏收藏指南
2026-07-30 09:57:30
特朗普最大的“贡献”,是亲手摧毁了中国人以往对美国的那种幻想

特朗普最大的“贡献”,是亲手摧毁了中国人以往对美国的那种幻想

阿纂看事
2026-07-30 08:16:19
张柏芝阿娇为何同意陈冠希拍摄?18年过去,终于可以换个角度看了

张柏芝阿娇为何同意陈冠希拍摄?18年过去,终于可以换个角度看了

正直小墨
2026-07-28 22:53:27
外媒:美国本来在芯片上领先中国20年,但现在只剩下3年微弱优势

外媒:美国本来在芯片上领先中国20年,但现在只剩下3年微弱优势

逍遥漠
2026-07-30 10:03:03
雷军预热小米澎程N90 Max 后车门90度开合可塞两辆公路车

雷军预热小米澎程N90 Max 后车门90度开合可塞两辆公路车

泡泡网
2026-07-29 11:45:21
隔夜肉、隔夜菜、隔夜水、隔夜蛋,唯独这个真不能吃,赶紧扔

隔夜肉、隔夜菜、隔夜水、隔夜蛋,唯独这个真不能吃,赶紧扔

荷兰豆爱健康
2026-07-27 02:59:14
华为员工:我的人生很失败,赚了1000多万,买房赔了;孩子成绩全班倒数;媳妇每天不停的抱怨……

华为员工:我的人生很失败,赚了1000多万,买房赔了;孩子成绩全班倒数;媳妇每天不停的抱怨……

LULU生活家
2026-07-21 21:01:36
菲律宾防长:一旦台海生战,绝不袖手旁观,绝对站在中国对立面!

菲律宾防长:一旦台海生战,绝不袖手旁观,绝对站在中国对立面!

阿龙聊军事
2026-07-29 13:20:34
上海一名年仅37岁男性,在持续高温下坚持户外晨跑,回家后倒地

上海一名年仅37岁男性,在持续高温下坚持户外晨跑,回家后倒地

健身狂人
2026-07-30 05:42:50
7月29日俄乌:泽连斯基说服美国相信乌克兰能赢,“野莓”仓库再遭袭击

7月29日俄乌:泽连斯基说服美国相信乌克兰能赢,“野莓”仓库再遭袭击

山河路口
2026-07-29 18:57:38
美记:勇士决定不交易巴特勒得到浓眉 因其伤病史和续约诉求

美记:勇士决定不交易巴特勒得到浓眉 因其伤病史和续约诉求

北青网-北京青年报
2026-07-30 10:03:03
73%!伟哥再显神效?研究发现:常吃它,老年痴呆风险骤降

73%!伟哥再显神效?研究发现:常吃它,老年痴呆风险骤降

白梦日记
2026-07-29 21:49:12
高市早苗11月访华,中方公事公办不特别重视日本

高市早苗11月访华,中方公事公办不特别重视日本

暮雨咋歇着
2026-07-29 22:42:56
NBA巨星杜兰特,被一个1米97的土耳其女排姑娘迷得神魂颠倒,整日在社交平台上追着点赞

NBA巨星杜兰特,被一个1米97的土耳其女排姑娘迷得神魂颠倒,整日在社交平台上追着点赞

语妍视频剪辑
2026-07-29 11:23:12
2026-07-30 10:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13633文章数 142708关注度
往期回顾 全部

科技要闻

为什么国产替代越深入,反而越难赚钱?

头条要闻

牛弹琴:伊朗战斗模式发生显著变化 特朗普很愤怒

头条要闻

牛弹琴:伊朗战斗模式发生显著变化 特朗普很愤怒

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

5个瓜!公开道歉、影帝出轨,个个离谱

财经要闻

美联储维持利率不变 三位委员投下加息票

汽车要闻

C级混动该有的样子 试驾全新一代红旗H7

态度原创

旅游
房产
数码
艺术
教育

旅游要闻

在日照邂逅三秦风光!渭南文旅展演亮相东夷小镇

房产要闻

来了!广州首个现房销售项目,将落地南沙!

数码要闻

深绿色谷歌Pixel Buds Pro 2耳机曝光

艺术要闻

伊朗“神级”摩天楼,它没建成,反而是最幸运的事!

教育要闻

从mama到hip-hop,藏在英语叠词里的语言巧思

无障碍浏览 进入关怀版