✨导读: 无人机正在从专用任务控制迈向通用具身智能!本篇综述提出5+5分析框架,区分能力集合与实体系统,完整梳理形态、感知、世界模型、规划导航协同,指明四大核心挑战,提出物理‑数字AI智能体系统实现新思路。
作者:Yonglin Tian , Weiyi Wang , Houhua Lu , Xinyi Li , Yihao Wu , Jingyang Chen , Jianli Sun , Chengxiang Li , Yinuo Chen , Fei Lin , Tengchao Zhang , Jing Yang , Deyi Ji , Jian Di , Naiqi Wu , Yisheng Lv
单位: 中国科学院自动化研究所, 北京航空航天大学, 山西大同大学, 约翰斯·霍普金斯大学, 三亚学院, 温州肯恩大学, 澳门科技大学, 中国人民公安大学, 魔芯科技KOKONI 3D, 中国科学技术大学
论文标题:UAVs Meet Embodied Intelligence: Bridging Human Intents and Flying Dynamics Via Harnessing Physical‑Digital AI Agents
论文链接:https://arxiv.org/abs/2609.18326v1
项目主页:https://hub-tian.github.io/UAVs_Meet_Embodied-Intelligence/
github链接:https://github.com/Hub-Tian/UAVs_Meet_Embodied-Intelligence
无人机将机器人智能从二维地面拓展到连续的三维空间。无人机可以灵活改变位置、高度、姿态、观测视角,抵达很多地面机器人无法到达的位置。无人机自身的运动不只是改变飞行位置,还会直接改变传感器看到的画面,这也让无人机成为一类非常典型的具身智能载体。
过去传统无人机自主方案,大多为特定任务定制开发❗。研究重心集中在飞行稳控、轨迹跟踪、定点导航。系统高度依赖预定义目标、闭集观测、固定任务接口。 在这类体系下:无人机本体、环境变化、任务需求,都被当成预先给定的外部条件,而不是智能行为里互相耦合的一部分。
因此传统系统很难做到:理解开放式的人类自然语言指令、主动采集任务所需要的信息、任务发生变化时灵活调整整套行为策略。
随着基础大模型、世界模型、AI智能体快速发展,带来新的可能性✨。自然语言可以承载高层语义目标和隐含约束;多模态基础模型提升跨场景理解迁移能力;记忆、推理、世界模型、智能体规划,支持长时序任务拆解、主动获取信息、预判动作后果、自适应决策。
重点:这些技术的价值,不只是单独优化某一个算法模块,而是把人类意图、无人机本体状态、环境理解、任务推理、物理飞行行为形成完整闭环耦合。
本文引出核心概念无人机具身智能(UAV‑EI):智能需要持续锚定无人机的具身属性——无人机能看到什么、可以如何运动交互、物理世界会如何响应它的动作。 对应的物理‑数字AI智能体(PD‑AI Agents)就是这套范式的载体:
数字智能体:负责语义理解、记忆、世界建模、任务组织推理
物理智能体:负责感知采集、飞行控制、真实物理交互 物理端执行产生的真实结果持续反馈给数字端,再接入人类指令,共同构成人‑机‑环境的信息‑物理‑社会系统(CPSS)。
目前该领域研究分散在各个子方向,缺少一套统一的分析框架,这就是本篇综述的写作动机。
主要贡献
提出5+5分析框架,清晰区分「无人机具身智能UAV‑EI(需要具备的能力集合)」与「具身智能无人机EI‑UAV(软硬件实体系统)」,一套讲能力,一套讲系统落地架构。
依托5+5框架,系统性梳理完整技术栈:具身形态、具身感知、世界模型、具身规划、具身导航与空中操作、多机具身协同;着重强调感知‑推理‑动作闭环耦合的重要性。
提出物理‑数字AI智能体(PD‑AI Agents),作为实现无人机具身智能的系统级实现思路。
⚠️归纳四大根本性开放挑战:长时序空中自主、飞行锚定物理推理、动态飞行条件自适应、经验驱动的能力演进,指明未来研究方向。
UAV‑EI:定义“系统应该具备哪些能力”,属于能力集合;
EI‑UAV:定义“系统如何实现这些能力”,属于实体软硬件架构。
五大能力需要联合生效,不是互相独立的模块。
人类意图理解️:解析自然语言指令、语义目标、偏好与约束,转化为可执行的任务表达。用户只需要描述“要做什么”,不需要一步步规定机器人怎么执行。
具身自我认知:决策必须贴合无人机真实物理状态与硬件极限。包含机体形态、位姿、运动状态、传感器配置、载荷、电量、执行器上限,搞清楚自己“能做什么、不能做什么”。
通用环境理解:跳出任务专用识别,追求可迁移的语义、空间、几何、动态事件理解。属于主动感知:无人机可以主动调整位置、视角、传感器配置,主动搜集任务需要的信息。
复杂任务规划:把高层大目标,拆解为物理上可执行的感知+动作序列。同时综合任务需求、环境状态、本体约束、动作带来的后果、现有资源;任务发生变化时,中间目标、策略也可以动态调整。
闭环执行:将高层决策锚定在真实物理观测与执行反馈。利用环境反馈更新内部状态,迭代后续动作。打通感知、推理、规划、具身执行,而不是仅仅局限底层飞控小回路。
⚠️五层架构不是串行流水线,是高度互相耦合!
具身层️:物理硬件底座。无人机机体、传感器、控制器、执行器、机载计算单元、载荷、操作臂。机体形态、传感几何、飞行动力学、能量、执行机构决定整套系统物理边界与约束。
大脑层:通用语义、预测、审慎推理。核心组件:多模态大模型MLLM、世界模型。负责语义接地、任务推理、状态表征、预测未来行为后果,为具身感知、规划提供认知支撑。
小脑层:把高层抽象决策,翻译为无人机专属具身技能,以导航、物理交互操作为主。在几何、动力学、控制、时间约束下,完成空中移动与物理接触交互。
交互层:实现与人、其他无人机、地面机器人等异构智能体协同。互相交换观测、任务意图、任务状态、规划、动作,把单机能力拓展到分布式协同作业。
调度层⚙️(Harness Layer):运行时核心基础设施。负责协调模型、记忆、知识、工具、技能、上下文与物理资源。包含智能体运行编排、上下文维护、执行监控、安全护栏;处理反馈与故障恢复,把分散模块整合为一套完整可运行系统。
具身形态直接决定无人机如何感知、移动、和现实世界交互。论文把形态体系划分为四大模块:机体本体、空中机械臂(手臂)、末端执行器(手部)、本体‑臂‑手协同设计。形态不只是硬件选型,硬件本身就会约束感知边界、可交互行为,进一步向上影响算法设计。
1|空中机体本体
基础机体:多旋翼、固定翼、垂直起降VTOL、扑翼飞行器,在悬停能力、续航、机动性、载荷之间做取舍。
可重构机体:可以动态改变几何、驱动结构。典型如Dodecacopter、ATMO、MorphQuad;可以适配多种任务,但会改变质量分布,动力学特性随之变化。
多模态移动机体:不止会飞,还可以地面爬行、滚动。例如M4、FlyOrb、RAVEN。
仿生机体:借鉴自然界飞行动物设计。亚克级微型扑翼、鸟型变形尾翼、槭树种子被动自转无人机。
软体机体:碰撞时结构发生形变,提升狭窄环境生存能力,但动力学更加复杂,控制难度提升。
空中机械臂一动,就会改变无人机质心、转动惯量,直接扰动飞行稳定性。
主要分为串联机械臂、耦合连杆臂、连续体柔性臂;代表作品Flying Hand、Aerial Elephant Trunk。
3|空中末端执行器(手部)
无人机与物体、载荷、工具交互的物理接口。受浮基动力学、载荷上限限制,需要同时平衡抓取可靠性、稳定性、对不确定性的容忍度。
包含:刚性夹爪、柔顺夹爪、包裹承载机构、锚固驻停足、工具对接耦合器。
4|本体‑臂‑手协同设计
机体、机械臂、末端执行器强耦合,载荷摆放、臂运动、接触力都会改变飞行器动力学。
分为本体‑手一体化、臂‑手一体化、飞行‑抓取‑驻停一体化、多无人机本体‑手‑工具协同。
️无人机具身感知![]()
❗具身感知≠传统被动感知。
传统感知:拿到图像再做识别;
具身感知:无人机可以主动改变位置、视角、传感器配置,主动运动去拿到任务需要的信息。
本章节分为主动感知、具身视觉跟踪两大方向,同时梳理对应的数据集与仿真基准。
1|主动感知
通过选择合适的传感动作获取任务信息,分为三类目标:
环境与本体状态理解:自适应信息路径规划,优化相机朝向与机体运动,提升环境覆盖、定位可靠性。
目标搜索获取:在有限观测、运动约束条件下,搜寻未知目标。代表工作:GOMAA‑Geo、UAST。
观测质量调控:主动调整视角、距离,规避糟糕观测角度;条件允许时引入接触传感弥补视觉缺陷。代表工作:ATRNet‑LUDO、CityEQA、ScoutVLA。
无人机一边飞,一边调整自身运动,持续维持对动态目标的有效观测。闭环融合目标识别、时序估计、运动预测、飞行控制。分为三类实现路线:
任务专用策略:观测直接映射跟踪动作,例如D‑VAT、GC‑VAT、CEL。
视觉‑语言‑动作(VLA)方法:复用预训练多模态表征,同时理解目标描述,输出飞行动作,例如UAV‑Track VLA、CosFly‑VLA。
大模型增强模块化流水线:感知推理、控制保留显式接口;大模型提供迁移理解能力,专用规划控制器负责执行。代表OA‑VAT。
注意:离线轨迹数据集只能评测推理能力,不能验证感知‑运动闭环交互效果。
仿真平台:Gym‑UnrealCV、CARLA‑Air
跟踪类基准:EVT‑Bench、DeTrack
搜索与视角优化基准:ATRNet‑LUDO、ActiveFly‑Bench
离线轨迹数据集:CosFly‑Track
评测不能只看识别精度,还要评估无人机能不能靠自身运动改善观测质量。
无人机世界模型![]()
无人机如果只依靠原始图像直接输出动作,容易做出短视、反应式行为。
世界模型+多模态大模型,可以赋予无人机推演时空演化、仿真飞行动力学后果、开展复杂任务推理的能力。论文划分五大研究方向。
多模态大模型时空智能:通用大模型普遍存在地面视角偏见,低空无人机场景性能会明显下滑。解决方案:
使用AeroVerse、AirZoo、UAVIT‑1M这类面向无人机的几何专项数据集微调;
架构层面增加光流运动编码器(SIS‑Motion);
分层智能体(PMA)构建以物体为中心的认知地图,缓解空间歧义。
预测式空间表征️:不去直接预测原始像素画面,改用占据栅格、可见性网格、3D几何表征。
MAD:使用占据与可见性网格;
Aerial World Model:引入未来帧投影,注入3D先验;
WorldVLN:用真实观测截断想象隐状态,缓解长时序语义漂移。
生成式仿真与数据合成️:真实动态无人机数据获取难度很高,受物理风险、空域法规限制。世界模型可以生成物理可行的交互数据。
FlyMirage:结合大模型+3D高斯溅射,自动生成可导航仿真环境;
Motionscape数据集:揭示现有生成模型普遍存在时序退化问题。
基于世界模型的强化学习(MBRL)用于飞行控制✈️:在想象的隐空间环境优化敏捷飞行策略,降低真实真机交互样本消耗。
Dream to Fly:从原始图像端到端学习飞行;
AirDreamer:依靠世界模型空间记忆实现稀疏奖励导航,达成仿真到真实环境零迁移。
世界‑动作模型与视觉‑语言‑动作系统:把环境预测与动作生成耦合在一起,打通语义指令、环境预测、可执行飞行轨迹。
FlowPilot、WorldFly、ImagineUAV,可以在边缘机载设备完成低时延推演,直接输出控制器可跟踪的飞行参考轨迹。
⚠️现实痛点:无人机6自由度高速运动,对世界模型的推理时延、几何一致性、动力学保真度提出非常严苛的约束。无人机具身规划
具身规划,就是在持续和环境交互的过程中,把观测、任务条件、平台状态转化为可执行动作。
无人机规划的现实约束:观测信息不完备、飞行动力学动态变化、机载算力有限、执行反馈持续改变环境。
各类规划范式之间不是互斥关系,真实工程系统经常会组合多种范式。
显式基于模型规划:直接对几何、动力学、约束做搜索优化,生成动力学可行轨迹。属于经典方案,但要求把观测、高层意图转化为结构化地图、代价函数。
以策略为中心规划:把大部分计算前置放在训练阶段;运行时直接从观测输出决策、航点、速度指令;依靠演示、奖励、训练分布编码规划知识。
结构化混合规划:学习模块处理感知、语义、难以解析的部分;几何规划、轨迹执行、安全过滤器保留显式物理结构。大模型输出语义引导,下游模块做几何轨迹求精校验。
世界模型规划:引入内部预测表征,推演不同动作带来的未来状态变化。不只基于当前观测选动作,同时思考多种未来可能性。
基础大模型规划:规划输入从固定几何目标,拓展到开放式视觉、语言意图;大模型负责语义推理,交由几何模块校验方案可行性。
智能体规划、角色专业化多智能体规划:依靠智能体循环完成任务拆解、可行性校验、反思协商;为不同智能体分配专门子任务角色,并处理执行反馈。
典型任务:无人机竞速飞行、障碍规避、意图引导飞行。选型需要权衡:规划时延、显式物理结构、接近飞行极限条件下系统鲁棒性。
无人机具身导航![]()
无人机具身导航,将人类或者任务意图,转化为面向目标的三维飞行运动。导航紧密耦合感知、空间记忆、飞行动力学。分为任务形式、实现方法、基准数据集、空中抓取与无人机操作四大部分。
1|任务形式
航路跟随导航:依靠语言描述地标、空间关系、视角变化,代表AerialVLN。难点:高度、姿态变化会剧烈改变地标外观。
对话辅助导航:多轮交互消除指令模糊、信息缺失,代表AVDN。
语义目标导航:只描述要找的物体、区域、抽象概念,不给坐标,需要主动探索搜索。代表UAV‑ON。
地理条件导航️:利用卫星图、地理坐标、俯视鸟瞰图做跨视角对齐,代表UAV‑VLA、CityNav。
任务专用策略:针对固定任务接口,学习观测‑动作映射;泛化能力受训练词汇、训练环境限制。
分层方法:高层处理长距离任务、语义记忆、子目标规划;底层负责局部运动,响应观测变化。代表APEX、CityNavAgent。
AI智能体方法:大模型在推理循环调用记忆、工具,输出中间导航决策,再转化为飞行动作。代表See, Point, Fly。
VLA方法:多模态预训练模型直接输出航点、速度、飞行指令。代表AutoFly。
世界模型方法:利用预测表征做前瞻导航,预判未来观测与任务结果。代表WorldFly、ImagineUAV。
✅重要原则:闭环评测(每一步动作都会改变观测)优先级高于离线轨迹评测。评估不只看终点是否抵达,还要综合任务完成度、路径效率、碰撞情况、任务进度。
代表性资源:AerialVLN、AVDN、UAV‑ON、HUGE‑Bench、LinkS2Bench、OpenFly、UnrealZoo、CARLA‑Air。
4|空中抓取与无人机操作![]()
浮基无人机操作和地面机械臂差异巨大:飞行器与机械臂动力学强耦合。分为4条技术路线:
VLA基础模型迁移:解决载荷变化、高度跌落、惯量改变带来的干扰。代表AIR‑VLA、AirVLA。
运动动力学建模与一体化规划:AERMANI‑Diffusion、全身一体化运动规划;处理自由飞行、抓取、投放多阶段动力学切换。
学习式自适应控制交互:强化学习应对接触带来的力矩扰动、质心突变。
面向任务的专用执行与高速抓取:面向农业采摘、高速动态物体捕捉。代表Flying Hand、Swooper。
现实难点:真实世界空中交互高质量数据稀缺,仿真‑真机迁移鸿沟显著。无人机具身协同
无人机具身协同,把能力从单机拓展到多智能体协同感知、推理、物理执行。
利用不同平台差异化的视角、传感器、运动能力,完成单架无人机难以实现的复杂任务。领域已经从简单信息共享,走向异构机具身团队协同作业。
协同任务分类
协同感知:多机融合观测,缓解遮挡,做大场景感知。代表CoCa3D、OpenCOOD‑Air、VLUniTrack。不只是简单拼接图像,更要主动采集互补信息。
协同导航:多机分工承担视角采集、搜索、引导任务。代表AeroDuo、CoNav‑UAV、AGC‑VLN空地协同导航。
协同任务规划:异构智能体开展任务拆解、能力评估、任务分配。代表COHERENT、EMOS;充分考虑每台机器人硬件能力与执行反馈。
协同运动协调:在空间、动力学、通信约束下生成群体运动。代表Swarm‑GPT、FlockGPT、DGPPO;支持集群运动、线缆载荷运输这类物理强耦合场景。
协同空中操作:多机对接、工具交换、协同建造。代表Aerial‑AM、Flying Toolbox,涉及实体物理接触耦合。
当前主流实现中,大模型主要承担高层认知推理;底层物理执行依旧依赖专用规划器、控制器。
信息共享两条路线:特征空间对齐 / 统一表征两种路线,权衡通信开销、信息损失;
安全保障:安全机制必须嵌入协同架构内部,不能后置作为独立过滤模块。
协同感知数据集:AirCopBench、V2U4Real;
任务级协同基准:COHERENT‑Bench、AGOS‑Bench;
仿真平台:AirSim‑AG、CARLA‑Air、HERCULES。
评测趋势:从单独模块测试走向完整感知‑推理‑动作闭环任务评测。
论文总结四大根本性挑战,同时提出物理‑数字AI智能体(PD‑AI Agents)作为系统级解决思路。
四大核心挑战
长时序空中自主⏳:无人机运行空间范围大、时间跨度长,视角、尺度持续变化。并不是仅仅依靠单纯扩大大模型上下文窗口来解决;需要选择性保留关键信息,跨时空关联历史观测,建立当前决策和历史任务状态的联系;亟需高效记忆与时序推理机制。
飞行锚定的物理推理⚙️:不光要理解外部环境,还要理解无人机本体、动力学、载荷、物理交互之间耦合。动作会改变观测和物理状态,扰动和物体属性约束可行行为。需要面向空中系统的物理AI,超越纯语义理解,实现对交互后果的预测。
变化飞行条件下自适应能力️:真实世界非稳态:光照、天气、传感器质量、载荷、电池、机体配置持续变化。需要在有限经验下快速在线自适应,同时保证稳定性、安全性、物理可行性,不能重度依赖重新训练。
经验驱动的能力演进:不止于适配现有行为;希望无人机从长期运行积累经验,自动提炼可复用技能、工作流、决策策略;在获取新知识同时保留旧能力,实现能力持续迭代。
整体由数字无人机智能体、调度层Harness、物理无人机智能体组成,形成两大闭环:
行动闭环:调度层运行时编排工具、技能、记忆;生成候选动作经过沙盒校验下发物理端;收集真实反馈,更新任务状态。
演进闭环♻️:把成功、失败交互经验沉淀到记忆、技能库,后续任务可以复用、迭代优化。
调度层Harness是关键中间层,负责打通高层推理和真实物理执行,支撑持续交互与能力演进。总结
无人机具身智能,正在从任务专用感知控制,向着语义理解、记忆、物理推理、规划、闭环执行一体化系统演进。
本文使用5+5框架区分能力定义(UAV‑EI五大能力维度)与系统实现(EI‑UAV五大架构层),系统梳理具身形态、具身感知、无人机世界模型、具身规划、导航操作、多机协同全链路技术。
未来的通用空中自主,不能只依靠单独改进某一个算法模块。物理‑数字AI智能体提供一套系统级路径:把数字侧推理记忆,和物理侧传感、动力学、控制、真实反馈持续耦合,支撑自适应、可以持续演进的无人机自主能力。
未来研究重点:应当更加关注物理‑数字耦合下的闭环物理执行性能,而不是仅仅停留在仿真环境内的语义推演。
Mbot具身智能实验室
让尖端科技触手可及,人人皆可探索未来
![]()
Mbot基础交流群等你加入,下方扫码联系
具身-杰西
Mbot具身-小助手
Mbot-视频号
Mbot-公众号
复制
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.