训练AI智能体,通常需要人类精心设计环境和任务。但一个名为SPADE的新框架,试图把这件事也交给智能体自己。
SPADE的全称是“自适应合成可执行环境中的自对弈”(Self-Play in Adaptive Synthetic Executable Environments)。核心思路很直接:环境和任务都由智能体自己生成,并且不断自我改进。这意味着智能体不再只是在一个固定环境里学习,而是能主动创造新的挑战来训练自己。
环境与任务,都由智能体自己说了算
传统强化学习流程里,环境是固定的,智能体只能在给定的规则里找最优解。SPADE把这一层也打开了——智能体在训练过程中,会持续生成新的环境与任务,相当于自己给自己出题、自己解题。
这种做法的价值在于,它让训练数据不再依赖人工标注或预设场景。智能体可以在探索中不断发现自己的薄弱环节,然后针对性地生成更难的训练环境来补足。训练什么、怎么训练,这些决策逐渐从人类手里移交给了智能体本身。
用遗憾值训练环境生成器
环境生成器怎么知道该生成什么样的环境?SPADE采用了一种基于“遗憾值”(regret)的机制。简单说,如果智能体在某个任务上表现不佳,这个任务就会被标记为“遗憾”较高的样本,环境生成器会据此调整,生成更能暴露智能体短板的新任务。
研究团队还引入了带提示(hints)和不带提示两种训练模式。带提示的模式下,环境生成器会获得额外的引导信息,帮助它更高效地找到有价值的训练任务;不带提示的模式则更考验生成器自身的探索能力。两种模式结合,让环境生成器既能快速收敛,又不会过早陷入局部最优。
迈向递归自我改进的关键一步
这项工作的背景是“递归自我改进”(Recursive Self-Improvement,RSI)——即AI系统能自己改进自己的算法、数据和训练策略,形成持续进化的闭环。研究团队在发布时特别强调:“随着我们迈向RSI,决定学什么将成为最重要的问题。”
这句话点出了SPADE的定位:在RSI的路径上,数据选择和环境设计的自动化是绕不开的关卡。SPADE提供了一个具体的技术方案,让智能体在“学什么”这件事上拥有更多自主权。
通用智能体的自对弈
SPADE被定位为“通用智能体”(general agents)的自对弈框架,不局限于特定领域。理论上,无论是游戏、机器人控制还是其他决策任务,只要环境可以被形式化描述,SPADE就能让智能体在自我生成的环境中持续迭代。
当然,这套框架目前仍处于早期发布阶段,实际效果还需要更多实验验证。但它指向的方向很明确:未来的智能体训练,可能不再需要人类事无巨细地设计每一个训练场景——智能体自己就能找到最需要练习的地方。
当“学什么”这个问题被交给智能体自己回答,AI进化的速度可能会超出我们的预期。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.