网易首页 > 网易号 > 正文 申请入驻

特约文章丨从视觉感知到行为作用力的转化:具身智能中的关键问题与统一框架

0
分享至

文 /王晓,席治远,吕钊,孙长银,王飞跃

1 研究背景与核心问题

在具身认知与智能的研究中,有一个问题始终吸引着神经科学、心理学和人工智能领域的共同关注:人类究竟如何将高维、连续、充满噪声的视觉感知流,实时、在线地转化为精准、安全且合乎社会情境的行为作用力?这个问题之所以重要,不仅因为它关乎我们对自身智能的理解,也因为它直接影响到我们能否设计出真正类人的具身智能体。

从日常经验来看,每个人的身体状态、认知能力和决策偏好都不尽相同,这导致了“相同的视觉信息可能驱动出不同的行为”。例如,面对同一辆突然切入车道的车辆,有的驾驶员会选择紧急制动,有的则会轻微转向避让。这种差异提示我们,视觉感知到行为作用力的转化并不是一个简单的“刺激—反应”过程,而是一个受个体身体、目标和社会情境多重调制的复杂认知过程,这也是人类具身性(在文本中,指的是:智能体的行为决策与其身体形态、感知能力和环境紧密耦合的特性。)的体现。因此,我们试图追问:是否存在一个统一的计算框架,能够解释这种转化背后的共性机理?本文正是对这一问题的初步探索。

我们从生物本能的“趋利避害”角度出发来分析。在认知层面,这一本能主要通过最大化可预测性和最小化不确定性来实现。原因在于,可预测的环境通常意味着安全与资源可得,而不可预测的环境则常常伴随着威胁与风险。例如,人类在追捕猎物时会优先选择运动轨迹更易预测的个体,以最大程度保证命中率;在驾驶过程中,驾驶员会依赖对行人意图的预测来预防突发事故,并通过眼神、手势等社会交互信号消除彼此意图的不确定性,从而保障行车安全。

然而,这一认知原则如何转化为计算机制?一个被广泛接受的观点是:大脑是一个持续的“预测机器”,它通过最小化预测误差来减少不确定性。当预测与实际不符时,便产生“意外”信号。在无人驾驶场景中,这类“意外”事件在数据层面往往对应于长尾分布——发生频率低但风险高。值得注意的是,预测误差本身不仅是一种损失,更是潜在风险的预警信号。在自由能理论框架下,可以看作系统偏离预期状态的度量。例如,行人突然起步所产生的预测误差,就像烟雾报警器一样提示碰撞风险,促使我们紧急制动。因此,最小化预测误差等价于最小化潜在损失。这或许可以解释人类为何普遍具有“损失厌恶”的决策偏好。

基于上述讨论,我们将感知—行动转化过程分解为三个递进的子问题,如图1所示。

问题一信息到意义的转化。视网膜上的亿级像素如何被实时压缩成离散的物体和关系?这对应着从原始感知数据到结构化场景理解的能力。

问题二意义到价值的转化。这些符号如何被瞬间赋予“威胁”或“机会”的量化标尺?这要求系统将语义理解转化为可比较、可权衡的代价评估。

问题三价值到作用力转化。抽象的价值判断如何转化为具体的肌肉收缩力或电机扭矩?这涉及到从决策到执行的运动生成与控制。


图 1 视觉感知到行动转化的三重挑战:多模态信息→多重意义/语义→综合作用力

本文从具身智能的核心问题出发,探讨了人类如何将高维视觉感知流实时转化为精准、安全且合乎社会情境的行为作用力。通过分析生物本能的“趋利避害”机制,指出该本能可等价于最大化可预测性和最小化不确定性。大脑作为持续的“预测机器”,通过最小化预测误差来减少不确定性,而预测误差本身既是损失也是潜在风险的预警信号。在此基础上,将感知到行动的转化过程分解为三个递进的子问题:信息到意义的转化、意义到价值的转化、价值到作用力的转化。这三个挑战构成了具身智能系统必须面对的核心难题,为后续统一理论框架的构建奠定了基础。

2 统一理论框架

当前具身智能研究多侧重于智能体与物理世界的交互,将智能体视为物理环境下的“理性优化器”,忽略了生物根植于社会文化中的直觉与约束。物理学中,费马原理告诉我们,光在折射时会选择一条耗时最短的路径。那么,智能体在复杂的交通流中平滑避障,是否也在实时求解某种“代价”的最小化?

受此启发,我们尝试提出一个统一框架:将感知到作用力的转化归结为在物理‑社会统一价值势场中的梯度下降过程。根据自由能原理 ,适应性自组织系统通过最小化变分自由能来抵抗熵增。感知改变内部模型以优化预测,行动改变外部世界以使观察符合预测,二者共同服务于预测误差最小化。将自由能原理与价值梯度下降结合,可以形成一种统一机制:沿负梯度方向行动可使价值势场下降最快,而价值势场的构建本身就是为了最小化预期自由能。实际上,预期自由能可分解为“预期损失”(即价值势场)与“信息增益”两项之和。在任务导向明确、探索需求较弱的场景中,信息增益项可忽略,此时梯度下降可视为主动推理在确定性环境下的高效近似。

统一价值势场由物理势能和社会势能加权构成。视觉感知提取的物体位置、速度、类别等作为输入参数。物理势能编码碰撞动能等为物理损失;社会势能编码信任损失、规则违反等为社会损失。智能体的每一步行动,都像是在高维势场中“向下滚动”,以最快速度趋向代价最小的状态。这一机制赋予了行为两个关键特性:局部最优性(只需感知当前局部梯度即可做出即时决策)和物理可解释性(作用力的大小和方向直接对应势场变化的陡峭程度)。

2.1 从局部梯度到全局优化:主动推理的引入

然而,梯度下降机制本质上是局部的、即时性的。它能够回答“此刻向哪个方向移动能最快降低当前代价”,却无法回答一个更深层的问题:“为什么要选择这个具体的动作,来最小化从当前到未来的总代价?” 之所以必须回答这个问题,是因为:①代价的积累具有时间延展性,一个局部最优的动作可能导致未来陷入高代价状态;②环境充满不确定性,智能体必须预估不同动作的预期后果;③行为受动力学约束,一旦施加作用力就会沿轨迹持续运动,无法每时每刻重新计算。因此,真正的决策需要前瞻性。

一个常见的思路是:让智能体在内部构建一个环境的动力学模型,能够模拟“如果我执行动作A,接下来世界会怎样演变”;然后,智能体可以利用这个模型在想象中“试运行”多条候选动作序列,估算每条序列在未来一段时间内可能产生的总预测误差(即预期自由能);最后选择使累积预期自由能最小的动作。这一思路与近年来人工智能中蓬勃发展的“世界模型”不谋而合,如图2所示。


图2主动推理与世界模型:面向未来的模拟与决策

基于内部模型进行前瞻模拟与代价评估的机制,在计算神经科学中被称为主动推理。它与价值梯度下降并非对立,而是同一原则在不同条件下的自然延伸:当环境变化平滑、响应时间紧迫时,主动推理可以退化为简单的梯度下降;当环境复杂、存在远视需求或强不确定性时,主动推理则调用世界模型进行多步前瞻。我们认为,这三者共同构成了从感知到作用力转化的递进决策架构:梯度下降保证瞬时响应效率,世界模型提供想象与推演能力,主动推理整合两者赋予长远视野。

2.2 支撑实时作用力转化的三大机制

即使有了上述框架,一个根本性的计算瓶颈依然存在:高维视觉感知信息海量输入,而智能体的计算资源(无论是生物大脑还是硅基芯片)都是有限的。那么,生物智能是如何在有限资源下完成实时转化的?我们从神经科学与认知心理学中找到了三条可能的重要线索。

(1)注意力机制:信息瓶颈的自适应调节

人类不会同时关注视野中的每一个细节。研究发现,注意力的分配由两个因素共同决定:意外性(与大脑预测的偏差程度)和价值相关性(对个体生存或目标的重要性)。据此,我们可以将注意力分配刻画为,注意力被投向那些“既出乎意料、又事关重大”的区域。这一模型与视觉显著性地图的计算一致。如果移除注意力机制,智能体均匀处理所有信息,计算能耗将急剧上升,关键信息可能被淹没,导致响应延迟或失效。

(2)双通路并行:梯度计算的快速与精细分工

关于大脑如何快速将视觉信息转化为作用力,神经科学揭示了一个重要机制:视觉信息在初级视皮层之后沿着两条功能分化的通路并行处理。背侧通路(where/how)负责处理空间位置、运动方向、深度和速度,能够快速估算物理势能梯度,直接触发反射式运动指令。腹侧通路(what)负责物体识别、语义理解和社会意图推断,能够精细评估社会势能,调控策略性行为。两者通过显著性网络(上丘-顶叶网络)协同工作。当两条通路产生的梯度方向冲突时,由动态权重决定最终方向:当碰撞时间(time to collision,TTC)趋近于0时,物理梯度主导;当TTC充足时,社会势能起主要作用。

(3)具身自由能:身体状态作为决策的硬约束

如图 3 所示,注意力和双通路解决了“看哪里”和“如何快速转化”的问题,但还有一个更根本的约束:智能体的行为必须在其身体能力的边界内执行。我们将身体约束分解为三个相互耦合的维度:形态灵活性(物理结构允许做什么)、算法适应性(计算能力允许做什么)、能量可负担性(剩余能量允许做什么)。这三者相互耦合,例如能量不足可能导致计算策略降级,并限制形态可变性。我们将其整体建模为耦合能量,并纳入总优化目标。环境通过改变智能体的身体状态动态塑造决策。例如,雨天轮胎抓地力下降,视线受阻导致感知延迟增加,耦合能量增大,系统必须选择更保守、更安全的策略。这便是我们称之为“以身为尺”的决策逻辑:智能体对世界的认知和理解,始终以其自身能力为度量衡。


图3 支撑实施作用力转化的三大生物机制

上述三大机制相互补充,层层递进:注意力解决“看哪里”,双通路解决“如何快速而精准地转化”,具身自由能解决“是否可行”。它们共同构成了从视觉感知到作用力实时转化的支撑体系。

3 实验验证:理论机制的可计算实现

我们在一系列已发表的工作中对上述框架进行了初步验证。这些实验覆盖了城市道路无人驾驶、多类交通参与者轨迹预测等典型具身智能场景。

注意力筛选机制:在Toward Safety-First Human-Like Decision Making工作中,我们设计了空间‑时间注意力模块使智能体聚焦于高意外性 × 高价值区域。该模块检验:当有限计算资源被导向最可能产生重大预测误差的感知区域时,能否显著提升决策的安全性与效率。实验基于 CARLA 仿真平台,在三种交通密度场景中各进行数百轮独立测试,使用 5 个随机种子确保统计稳定性。消融实验显示,一旦移除注意力模块,智能体均匀处理所有感知信息,训练收敛所需迭代次数增加约 60%,高密度交通场景中的碰撞率上升 67%,路权违反次数从1.8次增至5.6次,同时计算能耗增加3.2倍。这一结果验证了注意力机制作为信息瓶颈策略的必要性:没有它,有限的认知资源将被无关信息淹没,关键风险信号反而被稀释。

双通路并行:在Embodied Cognition-Driven Traje-ctory Prediction与 SafeCrossNet工作中,通过构建社会影响力图(位置、速度、方向三图融合),分别模拟背侧通路(物理空间感知)与腹侧通路(社会语义推理)的功能分工。模型在 ETH/UCY 数据集上将平均位移误差降低42%,近碰撞率从2.67%降至0.895%。进一步的消融实验表明:仅保留物理位置信息(模拟背侧通路功能缺失,即空间定位与运动感知能力受损)导致无保护左转等场景中违规率上升3倍;仅保留社会推理信息(模拟腹侧通路功能缺失,即物体识别与语义理解能力受损)导致对紧急切入车辆的响应延迟增加约0.4s,碰撞率上升52%。只有双通路协同工作时,模型才能在紧急避障与社会礼让之间取得最优平衡。这印证了第2.2节的判断——速度与精度在生物视觉通路中是通过并行分工而非串行折中来实现的。

具身时空认知:为验证具身自由能约束对决策的根本性影响,即“智能体的行为必须在身体能力的边界内执行”,我们提出了本体能力动态度量(MAE)框架,从硬件可变性、软件适应性和能源可承担性三个维度实时量化智能体的身体‑环境耦合状态。在此基础上,进一步构建了七维任务认知机制,将任务可行性评估从依赖绝对坐标的静态预设转变为以自身能力为尺度的具身化动态解算。实验以四架无人机为对象,在Gazebo仿真环境中通过ROS实现节点通信与数据交互。当主攻机UAV-A1在50s处被击毁时,系统基于MAE框架持续感知剩余单元的能力状态,并在约30s内完成重构(对照组超过120s),生成“UAV-A2接替主攻、UAV-C 转为辅助侦察”的集群功能拓扑重组方案,任务完成率显著优于对照组。这一过程验证了身体三重约束的耦合能量U_coupling 对决策的决定性影响——当身体状态发生变化时,决策空间必须随之重新评估,这正是“以身为尺”在集群层面的体现。

统一价值势场:在 S4TP工作中,我们将物理碰撞风险与社会协调成本统一编码为社会感知动态风险场(SADRF),并在该势场中进行梯度下降优化。该方法的核心假设是:当物理势能与社会势能被编码到同一标量场中时,智能体可以通过沿负梯度方向施加作用力,在安全性与社会适宜性之间实现自然平衡。实验在 SMARTS 仿真平台上进行,包含无保护左转、并道、巡航和超车四个典型场景,每场景500轮测试。在全部四个场景中,统一势场规划器实现了100%的安全通过率,远优于纯物理势场(89.75%)或纯社会规则(94.75%)的基线方法,同时人类相似度(Humanness)指标最优,生成的行为轨迹最接近人类驾驶员。这一结果直接支持了第2章的核心论断——物理与社会的双重约束可以在同一势场中被统一优化,而不需要在两者之间进行显式的优先级切换。

这些研究工作及其实验从不同维度初步支持了本文提出的核心框架,但我们也意识到,仍有大量细节需要进一步验证和优化。

4 结束语

回顾本文的探索,我们从人类“趋利避害”的生存本能出发,提出其中一个核心机制是减少环境不确定性,而减少不确定性的高效计算实现方法是最小化预测误差。基于自由能原理,我们尝试构建了物理‑社会统一价值势场,并将感知到作用力的转化归结为价值梯度下降。面对局部梯度无法回答“为何选择此动作以最小化未来总代价”的局限,我们引入了主动推理与世界模型。针对高维视觉感知与有限计算资源的根本矛盾,我们注意到生物演化提供了注意力筛选、双通路并行、具身自由能这三大互补机制。如图4所示,这三者构成了从视觉感知到作用力实时转化的可能支撑体系。


图4基于“相互可预测”的人机信任共建:信任建立在行为可预测性上

基于这一框架,我们进一步提出了“双向预测误差最小化”原则:机器人应构建内部生成模型持续预测人类,同时通过自身行为的可预测性主动减小人类对其的预测误差。信任的本质或许就是相互可预测性,而双向预测误差最小化可能为人机通过行为交互形成共识提供计算基础。换言之,当人机双方都能较准确地预测对方行为时,信任更容易建立。“相互可预测性”隐含了共同的社会规范背景,一个恶意但可预测的智能体仍会造成危害预期——这种预期本身就是巨大的预测误差,因为人类的内部模型默认对方遵循合作与理性原则。因此,双向预测误差最小化实质上等价于要求智能体与人类的价值倾向对齐。

以上是我们对这一问题的初步探索与思考,希望能为相关研究的学者提供一些参考。当然,本文的探索只是初步的,许多问题仍有待深入。例如,注意力与双通路之间的具体交互时序,具身自由能中耦合矩阵的在线学习方法,框架在极端环境下的鲁棒性等,都是未来需要进一步研究的方向。

(参考文献略)


王晓

安徽大学具身智能研究院执行院长/教授;国家级青年人才,中国人工智能学会社会计算与社会智能专委会秘书长。长期围绕“具身智能体如何将视觉感知实时转化为行为作用力”这一核心问题,开展从认知计算理论到无人驾驶应用的系统性研究。主持国家自然科学基金面上项目、安徽省高校杰出青年科研项目及多个企业委托研发项目,研究方向涵盖无人驾驶、具身智能与认知计算。代表性工作发表于 Science Robotics、Proceedings of the IEEE、Nature Communications、Research 等顶级期刊,相关成果获 IEEE 智能交通系统学会杰出应用奖、中国自动化学会科技进步一等奖等。

选自《中国人工智能学会通讯》

2026年第16卷第8期

人工智能安全与治理


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
恶有恶报!“摸臀姐”,再遭重锤,更大麻烦浮出水面,这事儿没完

恶有恶报!“摸臀姐”,再遭重锤,更大麻烦浮出水面,这事儿没完

春之韵
2026-09-19 21:34:07
真相披露!20年多前报道:计划生育的目标是2022年实现人口零增长

真相披露!20年多前报道:计划生育的目标是2022年实现人口零增长

孤城落叶
2026-09-18 22:41:00
华为刚退,鼻子比狗灵的二手车商就兴风作浪:问界二手车价崩了?

华为刚退,鼻子比狗灵的二手车商就兴风作浪:问界二手车价崩了?

侃故事的阿庆
2026-09-19 10:08:12
亚运男足B组末轮形势:中国打平即出线,存在4队同分情况

亚运男足B组末轮形势:中国打平即出线,存在4队同分情况

懂球帝
2026-09-20 20:13:16
美媒:F35座舱盖意外运抵中国,担心隐身镀膜外泄,歼20没有吗?

美媒:F35座舱盖意外运抵中国,担心隐身镀膜外泄,歼20没有吗?

巅峰高地
2026-09-19 19:15:25
徐彬不成功的留洋,会带给王钰栋什么样的思考

徐彬不成功的留洋,会带给王钰栋什么样的思考

米奇兔
2026-09-20 16:40:24
失业正在成为中国年轻人的一种生活常态。

失业正在成为中国年轻人的一种生活常态。

流苏晚晴
2026-09-20 14:14:26
经济数据一片向好,民调却说川普支持率创新低:问题其实出在民调本身

经济数据一片向好,民调却说川普支持率创新低:问题其实出在民调本身

斌闻天下
2026-09-20 06:50:03
出乎意料的信号,房地产这次是真闹大了

出乎意料的信号,房地产这次是真闹大了

重远投资观
2026-09-20 17:23:21
家里有猪油的要留心,现在清楚为时不晚,快点叮嘱身边人

家里有猪油的要留心,现在清楚为时不晚,快点叮嘱身边人

三农老历
2026-09-20 13:37:27
胡塞刚揍下沙特F-15,美国就甩狠话:不拆中国设备,休想摸到F-35

胡塞刚揍下沙特F-15,美国就甩狠话:不拆中国设备,休想摸到F-35

墨印斋
2026-09-18 10:11:02
四川大学党委书记甘霖为2026级新生讲授开学第一课

四川大学党委书记甘霖为2026级新生讲授开学第一课

小e教育
2026-09-20 14:53:01
国防动员全面大升级!外媒震惊之余都在猜,中国到底准备干什么?

国防动员全面大升级!外媒震惊之余都在猜,中国到底准备干什么?

青青衫书生
2026-09-19 20:25:31
底薪签火箭队4年,三分命中率超4成!休城新援被低估?持球型射手太稀缺

底薪签火箭队4年,三分命中率超4成!休城新援被低估?持球型射手太稀缺

熊哥爱篮球
2026-09-20 12:27:17
国乒3-1中国澳门,球员评分:孙颖莎9.5分,蒯曼8分,王曼昱6.5分

国乒3-1中国澳门,球员评分:孙颖莎9.5分,蒯曼8分,王曼昱6.5分

老垯科普
2026-09-20 17:09:36
越南没想到,朝鲜也没想到,如今的中国甘肃省,已成全球焦点

越南没想到,朝鲜也没想到,如今的中国甘肃省,已成全球焦点

离离言几许
2026-09-20 15:59:18
郭士强真犟!中国男篮70-79伊朗无缘铜牌,两处用人不当失利主因

郭士强真犟!中国男篮70-79伊朗无缘铜牌,两处用人不当失利主因

阿衃体育
2026-09-20 18:01:01
底层的戾气越来越重了

底层的戾气越来越重了

知肇分子
2026-09-07 20:40:32
10 月开始迎来转运黄金期,事业上扬财星高照!3 生肖苦日子到头,富贵可期

10 月开始迎来转运黄金期,事业上扬财星高照!3 生肖苦日子到头,富贵可期

情感事聊
2026-09-20 15:51:25
死刑前夕糯康吐露惊人真相,金三角毒枭从不畏惧云南武警的枪械,真正令他们敬畏退缩的,是那条坚守三十年无人敢触犯的绝密指令

死刑前夕糯康吐露惊人真相,金三角毒枭从不畏惧云南武警的枪械,真正令他们敬畏退缩的,是那条坚守三十年无人敢触犯的绝密指令

唠叨说历史
2026-09-16 13:52:50
2026-09-20 20:56:49
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4299文章数 1492关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

微博大V"理记"称西贝已起诉罗永浩:就要开庭了

头条要闻

微博大V"理记"称西贝已起诉罗永浩:就要开庭了

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

旅游
艺术
教育
房产
军事航空

旅游要闻

环乐高欢乐跑、海上焰火、水乡婚典、草原赏月…沪郊金山邀请市民“乐享金秋”

艺术要闻

米芾写出 800 年来最美行书!字字精彩绝伦,外行看了都说美!

教育要闻

让更多的学生能够走上台来被看见,让更多的孩子在鼓励中成为他们想要的那个样子

房产要闻

荒了18年!海口豪宅,要重启了!

军事要闻

伊朗称已向美政府传达7项谈判条件

无障碍浏览 进入关怀版