ClawGym II 框架带来一种新思路:把 OpenClaw 或 Claude Code 当作黑盒,直接纳入强化学习(RL)训练循环,无需访问其内部机制。
在 ClawGym-Bench Pass@1 基准上,该方法效果显著。经 OpenClaw 训练,分数提升 9.98 分;经 Claude Code 训练,提升达到 14.81 分。
![]()
混合训练同样有效
除了单一模型训练,混合训练方式也被验证可行。框架能力还扩展到了 JobBench 和 OfficeQA 等更多评测场景。
这套方案的核心价值在于,不依赖模型内部结构,仅通过外部反馈就能持续优化智能体表现,为黑盒场景下的智能体训练提供了可复用的路径。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.