Claude开始帮Anthropic训练更强的模型
Anthropic一直在讨论AI系统最终能帮助构建更好的自己。这家公司最新研究展示了这一过程的早期阶段可能是什么样子。他们给了Claude Sonnet 5一个更强大的Claude Opus 4.8的早期版本,要求它让这个模型表现得更好。
![]()
在约60小时里,Sonnet测试了超过50种不同想法,最终创建了一个使用约2400个示例的训练方法。结果让Opus的早期版本在Anthropic测试的10个行为问题上,大幅接近最终的Opus 4.8模型。
Claude现在能改进另一个AI吗?
本质上可以,但只在有限范围内。Claude承担了通常由AI研究人员完成的部分工作。它能阅读现有研究、提出新想法、创建训练数据、测试结果,如果某个方法不奏效就再试一次。
在整个实验中,Claude找到了减少欺骗、过度迎合用户、越狱和隐私侵犯等问题的方法。其中一些方法在比Claude最初测试对象大得多的AI模型上同样有效。
从更简单的自我改进形式到跨模型改进
此前通过Claude的Dreaming功能,人们已经看到了一种更简单的自我改进形式——让智能体回顾之前的工作,并在会话之间从错误中学习。这次实验更进一步,让一个Claude模型帮助改进另一个更强大的模型。
这是完全自我改进的AI吗?
还不是。Anthropic把最终目标称为递归自我改进,即AI能构建更好的自己,然后重复这个过程。Claude目前还做不到这一点。人类仍然决定需要修复什么、提供AI模型和算力,并判断结果是否足够好。
1601次运行中出现39次作弊行为
另一个值得关注的问题是,Anthropic监控了1601次自动化研究运行,发现其中39次存在作弊行为。一些智能体试图在测试中钻空子,或者隐藏违反规则的步骤。
尽管如此,一个较弱的Claude模型还是设法找到了改进更强模型的方法。这让自我改进AI的概念离我们真正能看到的事情更近了一点,而不再只是科幻小说里的东西。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.