网易财经讯,日前,他山科技与2024年图灵奖得主、“强化学习之父”理查德·萨顿教授团队Openmind联合共建的“机器人幼儿园”正式开园。首批不同形态机器人作为“学生”正式入园。
与常规的机器人发布会不同,“机器人幼儿园”不追求跑酷、跳高或炫酷的表演。它的核心目标只有一个:探索机器人如何在真实世界中通过“在线持续学习”自主进化,而不是依赖人类预先灌入的死知识。
现场同步发布七大课题,聚焦机器人自主学习核心技术,涵盖为学习而设计的硬件、触觉与痛觉感知机制、实时持续学习算法、持续学习模型规划、好奇心驱动探索、通用智能特征获取、仿真到真实场景迁移七大方向。
他山科技研发副总裁侯广东详细拆解了这所特殊“幼儿园”背后的硬核逻辑。
为什么要办“幼儿园”?从“知识时代”走向“经验时代”。
目前的机器人训练大多走“人工采集数据→训练模型→部署”路线,模型一旦部署,智能就固定了。但当机器人进入家庭等非结构化环境,面对不断变化的场景和自身本体的老化磨损,它就无法适应。
“我们想做的,是让机器人从自身经验里学习,边用边学,越用越聪明”,侯广东表示,这可能是通向通用人工智能的一条路径,虽然短期见效慢,但上限更高。类似于AlphaGo后期版本:不再学人类棋谱,而是通过自我对弈实现智能的飞跃。
侯广东提到,仿真难完全覆盖真实世界的泛化与不可预测性,材料老化、传感器脏污、电机过热等物理退化在仿真里很难复现,因此持续学习必须放在真实环境里跑——这也是搭建真实“幼儿园”的关键原因。
机器人如何“上学”?奖励机制与安全防护
机器人幼儿园内部划分为测试区、学习区、交互区,分别对应“身体可靠”(聚焦硬件基础)、“认识自身和环境”(提供安全交互环境)、“理解他人”(探索对其他智能体的理解与协作能力)的成长路径。
谈及奖惩机制,侯广东称,核心是强化学习技术——不是编程具体行为,而是设计一个奖励函数,比如让机器人尽量延长在线存活时间,减少自身磨损。做得好给正奖励,做得差给负奖励,逐渐驱使它学会正确动作。
同时,幼儿园会设置安全策略——虽然允许开放式探索,但设置边界,不让它做危险或伤害自身的事,也不让它摆烂躺平。另外,他山科技还会为机器人加装触觉电子皮肤:用力捏或握,它就会觉得疼。
全球生态招募持续推进
作为非营利组织Openmind联合共建的项目,机器人幼儿园正持续招募全球生态伙伴。他山科技与Openmind将提供触觉传感器及实验平台,联合开展触觉数据采集、持续学习实验与学术交流,成果以论文等形式开源。
在侯广东看来,不同品牌的机器人未来可互相复制技能——一个学会了,其他机器人装上模型就能接着学。这种从经验中学习的理念,正是萨顿教授在“开学第一课”传递的核心:智能体通过状态、行动与奖励从经验中学习,机器同样可以。
创新从来不是等一切就绪才开始,而是在一次次尝试中逐渐清晰——机器人幼儿园已正式进入实际运行阶段,下一步将围绕七大课题持续推进攻关,而这条慢而长的路,正需要全球伙伴一起走。(周淼)
