Grok 4.7 的推理 token 用量,和它在 ARC-AGI-2 上的公开得分挂上了钩。@SpaceXAI 给出的数据很直接:low 档平均每次测试对尝试只用 10k token,得分 25%。
而 medium 到 xhigh 档,token 用量跳到 86k 到 120k,得分也跟着抬到 57.5% 到 60%。同一套测试,用量差了一个数量级,分数差了三十多个百分点。
![]()
低用量可能拖了后腿
按 @SpaceXAI 的说法,low 档更低的 token 用量,可能有助于解释它更低的得分。这句话没有把因果说死,但把两个数字摆在了同一张表上。
换句话说,Grok 4.7 在 ARC-AGI-2 上能拿多少分,和它愿意花多少推理 token 高度相关。省 token 的档位,分数也省了。
对使用者来说,这是一个取舍:要低成本快速出结果,还是堆 token 换更高的准确率。Grok 4.7 把这条曲线公开了出来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.