在人工智能风险管理的讨论中,一个核心希望是AI能够帮助我们理解自身处境、规划未来,并制定相应的风险缓解措施。然而,许多AI需要完成的相关任务缺乏实践性的经验反馈回路,模型必须依赖哲学、AI未来学等领域的论证方式。为了评估这些能力,研究团队开发了一套包含三个概念推理基准的测试体系。 这一体系被整合为“概念推理指数”(Conceptual Reasoning Index, CRI),并可通过conceptualreasoning.ai网站访问。研究团队表示,该网站将随着新模型和新基准的发布持续更新。此项工作是与Anthropic合作完成的。 研究指出,一旦模型能够在降低AI风险方面达到人类专家水平,AI辅助产出在该领域可能远超人类单独工作的成果。这意味着,能否及时应对AI风险,很大程度上取决于我们能否更早地实现相关工作的自动化或提升,而这与高风险能力的进展密切相关。一个可行的途径是选择性提升模型的相关技能,例如如何治理和对齐AI,以及如何避免涉及AI的灾难性合作失败。 当前AI训练高度依赖充足的数据和可靠的性能反馈,因此模型在处理无法通过经验或数学验证的任务时往往表现较差。然而,降低先进AI风险恰恰涉及许多此类任务:例如,在缺乏实证证据、没有(实践上)可验证答案的情况下,必须依靠严密论证来推理的问题。研究团队将这种能力称为“概念推理”。要提升这一能力,就必须先能够测量它,这正是此次发布三套基准的初衷。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.