来源:市场资讯
(来源:新证财经)
人工智能的发展目标是使机器像人类一样思维和行动,不仅能求解复杂问题,更重要的是能在一个复杂、动态、不确定的物理世界中进行交互。
走不出屏幕。过去几年,我们看到的AI——ChatGPT写文章、DeepSeek做推理、SORA生成视频——本质上都是在数字世界里"想问题"。它们很强,但有一个根本局限:走不出屏幕。
具身智能要解决的,正是这个问题。具身智能打破了传统AI将"智能"局限于大脑内部处理的范式,具身智能体能够通过与环境的持续交互,实现信息采集、认知重构与策略演化的闭环过程。智能体通过物理载体与环境的动态交互,在感知、决策与行动中不断学习和进化,从而突破传统静态数据训练模型的局限,展现出更强的环境适应性与泛化能力,已成为实现人工智能发展目标的关键路径之一。未来,具身智能有望在多场景、多任务、多智能体协同中释放出更强的泛化能力和进化潜力,推动AI迈入真正"类人"认知的新阶段。
这不是一个概念炒作。2024年我国具身智能市场规模已超过8000亿元,并有望在2026年突破万亿规模。
一个万亿级赛道正在打开,但它到底在"具"什么?怎么实现的?中国站在什么位置?这篇文章把核心问题讲清楚。
一、什么是具身智能
传统智能系统主要依赖封闭场景、仿真场景或者互联网收集的数据进行模型训练,这种数据训练方式无法构建与现实世界动态交互的闭环学习机制,导致智能系统往往难以适应真实的物理世界。
具身智能是一种基于物理实体对环境进行感知与适应性交互,进而理解问题、产生智能行为的智能系统,可以突破传统智能系统依赖静态数据表征的局限,是实现AI发展目标的关键路径之一。
一个关键区分:"具身"的含义并非单纯指代物理实体,而是与环境交互以及在环境中执行的整体需求和功能。具身智能强调智能体在物理环境中身体与智能的相互依赖,主张智能不仅仅是大脑的产物,还包括身体与环境的互动。其核心观点是,智能行为不仅依赖于内部的信息处理能力,还取决于智能体的感知和行动能力,即通过感知环境并采取适当的行动来解决问题。
从生物进化来看,所有生物的智力活动都依赖于自身身体与环境的交互,通过积累具身经验,不断适应外部环境,从而在行为或行为潜能上产生积极且持久的变化,这一过程被称为具身学习。换言之,智能的演化并非单纯依赖"算法"的优化,而是"身体"与认知过程协同进化的结果。
和非具身智能相比,具身智能方法可以通过在虚拟环境中训练大模型,以获取常识表征,并在具体应用场景中结合机器学习方法进行模型优化与进化。非具身智能只能在约束条件紧、工作对象少的简单环境下工作,遇到超出训练范围的新目标就"认不出来"。而具身智能不仅能够基于交互行为不断调整自身的识别策略,还能通过持续的环境感知和经验积累,动态适应新的目标和场景。
具身智能的概念并非新事物——AI先驱艾伦·图灵在20世纪50年代就首次提出,控制论创立者诺伯特·维纳也提出了类似的行为智能。但直到近年,随着AI计算模型不断涌现、算力极大提升和数据易获性增强,人类长期以来追求的具身智能,即通过物理实体(智能体)与环境的交互,使智能系统具有环境适应性及其智能行为的进化,才真正成为可能。
一句话概括:非具身智能是"看图说话",具身智能是"动手做事"。
![]()
二、怎么实现的:四大技术支柱
具身智能正迈向多技术融合的发展阶段,它的实现依赖于世界模型、表征学习、因果推理和生成式AI等AI理论。世界模型提供环境模拟的结构基座,表征学习提升对信息的抽象与表达,因果推理实现从经验到理解的跃升,而生成式AI则构建起智能体与人类意图及动态环境的统一交互接口。
1. 世界模型:构建认知框架
世界模型用于模拟和预测真实世界的运行规律,通过对物理、社会等环境特征与要素关系的抽象建模,构建出可表征环境动态变化的虚拟系统。无论是视觉场景、物理规则,还是人类行为逻辑,都能被编码进模型中,使其具备对未来状态的预测能力,这为具身智能提供了对环境的理解和预测基础。
2. 表征学习:感知信息的语义化处理
表征学习是将原始数据转换为机器可计算的结构化、语义化数据的过程,其目标是通过自动发现和学习数据的有效特征或表示,降低数据复杂度,提升特征区分度,更好地支持后续的分类、预测、决策等机器学习任务。具身智能在与环境交互过程中产生海量原始数据,例如传感器信号、视觉图像等,经表征学习能转化为可理解的语义特征,助力智能体快速认知环境、识别物体。同时,学习到的表征可优化智能体的决策和行动规划,而智能体的交互反馈又能不断调整表征学习策略,二者相互作用,推动具身智能高效感知与行动。
3. 因果推理:支撑高阶认知能力
因果推理是基于观测数据或实验干预,在复杂系统中剖析变量之间的因果逻辑,确定指定因素对目标现象产生实际、独立影响的分析过程,实现从"关联认知"到"因果理解"的跨越。在具身智能中,因果推理是智能体理解世界的关键能力。智能体分析自身动作与环境反馈之间的因果联系,预判行为后果以优化决策。基于因果推理构建的认知框架,助力智能体快速适应新环境、迁移知识,提升泛化能力。
4. 生成式AI:人机与环境交互的统一接口
生成式AI是一种基于海量数据和大规模参数的AI技术,能够模拟人类的创造性思维,生成具有一定逻辑性和连贯性的语言、文本、图像、音视频、程序等内容。生成式AI具有强大的理解能力和生成能力。
基于生成式AI的具身智能可分为两大部分,即人机交互和系统与环境的交互。在人机交互部分,人以自然语言或图文信息的形式将任务需求输入到多模态大模型中,模型对不同形式的输入进行特征嵌入后,完成任务理解和概念推理,并生成知识和决策,最后由机器人生成面向任务指令的相应行为。在系统与环境交互部分,机器人首先利用自身传感器完成对情境的具身感知,然后根据大模型的学习结果,对情境产生行为,最终完成行为输出。需要指出的是,系统在将情境感知信息输入大模型之前,需要构建一个内部预测模型,在行动之前就能预测到结果。
![]()
特别指出,生成式人工智能,尤其是大语言模型、多模态大模型以及正在演进的"信息‒物理‒认知"三域融合大模型等技术在加速具身智能演进中发挥着关键作用。
三、系统实现:四大核心要素
具身智能的系统实现是一个高度协同的工程体系,其包含本体、智能体、数据与学习框架四大核心要素。其中,本体保障执行力,智能体赋予认知力,数据提供驱动力,学习框架实现持续进化。随着模型能力跃升和任务复杂度上升,这一系统正朝向更高效、更泛化、更稳健的方向演进,未来在智慧工业、城市治理、人机协作等领域具备广泛应用前景。
本体——智能落地的物理承载。具身智能的本体指代实际执行物理实体,承担在物理或虚拟环境中进行感知与任务执行的职能,例如四足机器人、复合机器人或人形机器人等。作为连接虚拟世界与物理世界的桥梁,本体需具备环境感知、运动控制与操作执行等基本能力,其能力边界直接制约了智能体任务完成的范围与水平。
智能体——系统的决策与推理中枢。智能体作为物理本体的智慧核心,承担感知、解析、决策与操控等关键职能,理解复杂的环境结构及其语义内容,并与环境动态交互。当代智能体大多数由深度神经网络模型驱动,特别是语言大模型、多模态大模型等为智能体提供了更强的环境理解与推理能力。
数据——驱动智能进化的"燃料"。对于具身智能来说,场景的复杂性和多样性使得所需处理的环境和任务更加多变,这些模型对于数据的渴求也愈发强烈。特别是,针对特定行业场景的高质量数据,将成为具身智能在未来成功应用和实施的关键支柱。
学习进化框架——实现适应与迁移的机制。利用虚拟仿真环境进行高效学习是一种行之有效的策略,但现实世界的复杂性远超仿真环境。如何实现虚拟与现实环境之间的高效知识迁移,已成为智能体架构设计中不可或缺的一环,该问题的解决将直接影响智能体在真实世界中的表现与适应能力。
四、发展到哪了:现状与趋势
发展现状
具身智能正处于基础研究与产业应用双轮驱动的快速发展阶段。在各个关键环节上,核心算法与模型不断突破,智能体感知理解与执行能力持续增强;在机器人形态、仿真平台与典型场景中,多元化的落地探索逐步实现从"能动"向"高效"演进。随着大模型能力下沉、硬件平台成熟和应用需求扩大,具身智能将加速走出实验室,成为引领下一代AI变革的关键力量。
基础研究方面,具身智能的基础研究围绕"感知‒交互‒规划‒仿真‒训练‒加速"体系积累了一系列重要成果,其中多模态大模型与世界模型起到关键作用。人形机器人已逐渐成为具身智能的理想载体。
在训练层面,构建可复现、可扩展的人形机器人训练场是实现规模化具身智能的关键。其多模态数据类型包括:高精度运动捕捉(动作/步态数据)、力/触觉序列(抓取/接触数据)、同步多摄像头与深度感测、触觉与皮肤式传感器数据以及语音与语言交互日志。
产业落地方面,具身智能在工业制造、自动驾驶、物流运输、家庭服务、医疗康养等领域都实现了产业落地。根据国际机器人联合会(IFR)的数据,2025年全球工业机器人市场规模预计将突破500亿美元,全球人形机器人市场规模预计也将突破500亿美元。国内外科技企业纷纷布局,从谷歌、特斯拉的人形机器人,到Waymo、百度的自动驾驶,再到ABB、新松的工业机器人,赛道已经非常拥挤。
六大发展趋势
具身智能正在经历从技术整合到系统落地的关键跃迁期。具体表现在六个方向:
趋势一:单域大模型向"信息‒物理‒认知"三域融合大模型进化。当前的语言大模型、视觉大模型等专注于单一信息域,难以在真实世界中实现感知‒认知‒执行闭环的动态协同。三域融合大模型整合信息域、认知域和物理域知识,能够克服单域大模型的局限性,实现复杂开放环境的建模与动态交互。
趋势二:生成式AI加速与具身智能深度融合。语言大模型、多模态大模型、三域融合大模型等生成式AI技术与具身智能的融合是迈向通用AI的有效途径之一。大模型的特点是强大的理解能力和生成能力,因此可以利用大模型的理解能力为具身智能的环境感知提供支撑,同时为具身智能的行动提供决策帮助。二者融合有助于提升机器人在复杂、动态、开放环境中的泛化能力,同时增强具身智能体行为的可解释性与可控性。
趋势三:仿真环境与世界模型不断完善。如何在仿真环境与真实世界之间建立有效衔接,实现高效的知识迁移,是具身智能架构设计中不可或缺的一环。通过不断完善仿真环境与世界模型,具身智能将能够更高效地学习复杂任务并实现在真实场景的泛化。
趋势四:基础模型架构朝轻量化演进。模型轻量化对具身智能发展带来的益处是多方面的:一方面,它能够显著提升系统的响应速度,让智能体对环境变化做出更及时的反应;另一方面,轻量化有效降低了具身智能大规模部署的成本,使相关技术更易于推广应用。
趋势五:产业链上下游协同构筑技术生态。上游芯片、传感器、材料供应,中游算法优化与系统集成,下游定制化应用落地,整条链路正在加速整合。
趋势六:多元场景推动实际应用落地。在工业制造领域,具身智能的应用将从简单的搬运、巡检等任务,向更复杂、精细的环节拓展。在医疗与康复领域,具身智能应用有望替代机械式的、普适式的工具,提供更加精准的定制化服务。在康复治疗中,智能设备可针对患者的康复进度,定制个性化训练方案并实时调整。在养老、陪护与服务场景中,能够通过自然语言交互、情绪识别与自适应行为提供安全、私密且具情感计算能力的陪护服务。在公共安全与灾害响应中,四足机器人、人形机器人与无人机可协同执行灾区侦查和物资投送。在城市基础设施与巡检领域,通过结合无人机与地面机器人,实现桥梁、管线、输电塔等的高频巡检与主动维护预警。在家庭、教育与娱乐方面,低成本、多功能家庭及教育机器人将承担家务、陪伴老人小孩等多项任务,成为家庭生活的得力助手。
五、四大挑战
当前,具身智能面临的核心问题集中在4个方面:模型不可解释性、算力资源对立性、数据资源稀缺性与生态系统不健全性。
第一,大模型"黑箱"制约可控发展。大模型缺乏对感知、知识与行为之间因果关系的理解机制,容易导致策略偏差、行为异常,增加在复杂真实环境中运行的不确定性与风险。
第二,云端训练与边缘部署形成双重技术压力。训练端需要超大规模计算资源,部署端需要在资源受限的嵌入式平台上实现高效低延迟推理,两端的技术要求方向相反。
第三,高质量多模态数据资源严重匮乏。现有开源数据集规模较小,缺乏统一采集与标注规范,且多为单一模态。国内不同机构与企业间数据封闭,缺乏共享机制。
第四,产业生态尚未成熟。当前软硬件成本较高,受限于核心技术尚未突破与规模化生产能力不足,难以有效降低产品成本,限制了大规模落地应用。市场接受度仍需时间积累,加之实际应用场景、商业模式尚不成熟,进一步影响用户信任与消费意愿。
要推动具身智能迈向成熟,必须强化因果推理机制研究、打通云边协同路径、建立高质量数据标准体系、推动产业生态协作机制建设。只有攻克这些基础瓶颈,才能真正释放具身智能的应用潜能,为工业、医疗、服务等领域注入持续创新动力。
六、中国站在什么位置
已形成的优势
我国在具身智能领域已形成"政策引导、技术突破、数据支撑、人才集聚、市场牵引"五位一体的发展格局。
政策层面,2025年国务院政府工作报告和《"十四五"机器人产业发展规划》明确提出培育具身智能等未来产业,将具身智能纳入国家战略部署。
技术层面,DeepSeek-V3在多项评测中性能优于ChatGPT,R1模型训练成本仅约600万美元却比肩OpenAI的o1模型;杭州宇树科技在四足机器人和人形机器人领域领先全球;清华大学"天工"具身智能系统达到国际先进水平;上海智元新创2024年起量产双足类人机器人;深圳众擎机器人的PM01实现了类人前空翻特技。
数据层面,我国在智能制造、自动驾驶、智慧城市、医疗健康等领域的传感器和智能设备部署规模庞大,持续产生海量、多样化、实时更新的数据。
人才层面,我国过去10年在AI领域的论文数量达2.54万篇,研究型人才1.74万人,均仅次于美国位居全球第二。AI相关企业数量超过4500家且快速增长。
市场层面,2024年我国具身智能市场规模已超过8000亿元,并有望在2026年突破万亿规模。大量传统行业对自动化、智能化的升级需求形成了巨大的市场牵引力。
面临的风险
但同时要清醒认识到,我国在基础模型和新兴计算架构方面缺少重大原创成果,在基础理论、核心算法、集成系统、开源平台等方面差距较大,缺乏战略性超前布局,尖端人才远不能满足需求。具体表现在:
基础研究与系统集成创新能力乏力。在新型神经网络结构设计、基础模型学习理论与方法探索等方面缺乏长期、持续的研究经费支持。系统能力上还没有达到"整体大于部分之和"的集成效果。
开源平台建设仍处于起步阶段。数据集、运动控制训练框架等关键资源的开源仍需完善,尚未形成跨学科、跨领域、跨行业的高效协同创新机制。
产业发展长期战略规划仍需完善。一些产业化项目投资少、周期短,要求见效快、效益高,难以适应具身智能发展的复杂性和不确定性。在算法性能、硬件接口、安全规范等方面缺乏统一标准。
人才培养与考核机制对技术发展形成制约。现有考核机制往往忽视具身智能研究的复杂性和长期性,导致科研人员聚焦短期目标,跨学科合作存在障碍。
我国具身智能发展已初具规模,但要实现全球引领仍面临诸多挑战。必须从基础研究、开源生态、系统集成、产业战略和人才机制等多维度发力,推动多学科协同创新和长期战略部署,加快补齐短板,夯实底座,才能真正释放具身智能对未来科技与产业的引领潜力。
面对全球人工智能竞争日益加剧的态势,亟需加快具身智能核心技术的自主攻关与体系化战略布局,推动AI实现跨越式发展,抢占新一轮科技革命和产业变革的制高点。
具身智能有望在智能制造、智慧城市、人机协作等关键应用场景中实现技术突破与示范引领,其产业发展将带来显著的经济和社会效益,大大提升生产效率,推动社会全面进步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.