ClawGym II 框架把 OpenClaw 或 Claude Code 当作黑盒,直接纳入强化学习(RL)训练循环,无需访问其内部机制。这意味着开发者可以在不修改底层代码的前提下,通过外部反馈优化智能体行为。
基准测试成绩显著提升
![]()
在 ClawGym-Bench Pass@1 评测中,该方法经 OpenClaw 提升 9.98 分,经 Claude Code 提升 14.81 分。混合训练同样有效,且框架已扩展至 JobBench 和 OfficeQA 等更多场景。
黑盒思路降低门槛
传统 RL 训练常需访问模型内部结构,而 ClawGym II 绕开了这一限制。对使用闭源工具链的团队来说,这种"只看输入输出"的训练方式,可能更容易落地到实际工作流中。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.