OpenAI最新发布的第三方评估指引,试图厘清一个长期被低估的问题:基准测试的分数,并不等于模型的原始能力。该公司指出,测试中使用的运行框架(harness)、分配给模型的资源预算、可用工具,以及模型对上下文记忆的管理方式,都会实质影响最终跑出来的成绩,特别是在那些需要多步、长周期执行的任务里。
这份指引的核心观点相当直接:当模型因为更多算力、更好的工具访问权限、或者更强的代理框架而表现提升时,这个结果描述的就应该是“在特定框架和预算下的性能”,而非模型一成不变的能力天花板。OpenAI呼吁,报告基准分数时,必须更清楚地交代分数背后的运行条件。
![]()
这一区分在当下尤为重要。前沿AI系统越来越多地被视为“代理”(agent)而非单轮对话系统来评测。一个代理可能需要在整个任务过程中记住有用信息、自主选择并调用工具、从失败的步骤中恢复、并管理不断增长的上下文。在这些场景下,评测方案本身不再是微小的实现细节,它本身就是决定结果的核心变量。
所谓框架,就是运行评测的操作性配置。在实际操作中,它决定了模型如何接收任务指令、能使用哪些工具、有多少次尝试机会、能否跨步骤保持状态、以及输出结果如何被评判。OpenAI把框架、资源和工具并列为评测者必须公开的核心变量。
这并不意味着基准分数就没用了。恰恰相反,只要条件透明,分数反而会变得更容易解读。一个分数可以为模型在特定设定下的性能提供有力证据。但如果两个模型是由截然不同的提示策略、时间与算力配额、记忆行为或安全约束条件测试出来的,它们之间的横向比较就不那么可靠了。
为了理清这团乱麻,OpenAI提出了一套评测声明的分类法。它将评估分为三类:极限能力激发、受控对比和安全鲁棒性检验。每一类声明需要不同的证据支撑。一项为激发单个系统最强性能而设计的评测,无法自动等同于不同系统之间的受控对比。同样的,考察防护措施在对抗条件下是否依然稳健的结果,回答的也完全是另一个维度的问题,不能和单纯的能力跑分混为一谈。
这种分类带来的实际影响很明确:基准报告的形态需要超越单纯的排行榜分数。阅读报告的人,应该获得足够的信息去理解到底测了什么、性能是如何被激发出来的、以及这个评测数值究竟能支撑什么样的结论。
OpenAI将GPT-5.5在靶场安全评测中的表现作为一个具体案例。该公司称,当评测框架启用了压缩机制,跨轮次地保留与任务相关的上下文时,模型的表现得到了显著改善。对于一个长周期任务来说,这种能力可以帮助代理利用它在前期已经收集到的信息继续推进,而不至于在过程中丢失关键记忆。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.