推理等级调到最高,成本反而更低。GPT-6.1 Sol 在 ARC-AGI-3 上跑出了一个反直觉的结果:更高推理等级带来更优决策,完成关卡所需动作更少,总推理成本随之下降。
以 sk48 为例,使用保留不透明推理状态并支持自动压缩的 provider adapter 时,max 推理仅用 463 个动作通关,而 low 推理用了 1,078 个。
![]()
动作数才是成本变量
动作数从 1,078 降到 463,减少的不只是交互轮次。每一步动作都对应一次推理开销,动作越少,累计消耗越低。高推理等级在单步上花得更多,却把总步数压了下来。
这个结果成立的前提,是 provider adapter 保留不透明推理状态并支持自动压缩。推理状态不被丢弃,模型不必反复重建上下文,自动压缩则控制住状态膨胀带来的额外开销。
ARC-AGI-3 的评测方式把决策质量和成本绑在了同一个指标上:通关动作数。同样的关卡,动作更少意味着路径更短、无效尝试更少,这既是能力表现,也是账单表现。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.