开发者打开终端,面对着推理强度选项时一定会犹豫:是为了更好的代码质量把预算拉满,还是留在常规档位把成本压住?OpenAI 为 GPT-5.6 给出的 Sol Max 就摆在那个最高档,价格明显跳了一大截,但带来的提升到底落在哪里,答案并不总像跑分图那样直观。
Tura 维护者完整解剖了公开的测试工件和自身工作记录后,给出了一个近乎分岔路口的判断:High 修得好 bug,Max 建得起工程。这句话拆解开就是,高推理预算在需要从零探索路径的大改动中能持续创造增量,但落到一个边界已定、有失效测试的小缺陷上,多花的算力常常不再划算。
![]()
核心差别来自任务本身留给模型的不确定性。一个重写、迁移或全新项目,有大量的行为说明和兼容性工作要自行发现,Max 多出来的搜索、修订和代理轮次正好填上这些空白。反之,一个被 failing test 牢牢框住的 bug,留给推理的模糊地带已经所剩无几,再追加推理强度反而更像用大炮打蚊子。
分清这两类场景的,首先是两个来源的数据:公开的 DeepSWE v1.1 任务和 Tura 记录下的 eza Rust-to-Python 重写。两者都显示,Max 在每个任务类别上的总花销都更高,但分数的回报几乎只出现在重写一侧。
DeepSWE 的分类方式刻意偏机械:三次验证超时按排除规则处理,七项修复任务尚不足以得出 Max 普遍对修复有害的结论,但已经足够推翻“Max 永远有帮助”的假设。而 eza 的数据相当生动——High 模式下沿两个 harness 取平均,Direct 和 Codex 两类检查通过率从大约五分之四提升到十分之九以上。当代码被整体搬到另一种语言,残留的行为差异和多出来的兼容适配,恰恰给了 Max 施展的空间。
要比较消耗,DeepSWE 是目前最干净的横向数据。它锁定 113 项任务和 mini-swe-agent 编程 harness,在两种推理强度下各打出四轮完整跑分,让平均数尽量不受单次波动干扰。结果出来,Max 的解决率高出 3.3 个百分点,可每一种测量到的资源用量都攀升得更快。粗算下来,Max 每多产出一次通过,大约需要额外进行 31 次尝试。单看单次通过成本,从 High 档的约 5 美元,直接翻到 Max 档的 11.54 美元。
而且在达到 Max 之前,收益曲线已经明显走平。OpenAI 在档位间提供了一个中间强度,Deepswe 在该设置下的消融实验显示,继续往上投入所产生的边际提高正在快速衰减,Max 更多的是一种顶部溢价。
需特别注意,DeepSWE 不是一个纯 bug 补丁基准。它自己的报告承认,缺陷定位和重构这两类任务在样本中代表性不足。它给出的是一幅长周期平均画面,而不是对每一个 bug 单次修复的裁决。把聚合数字当作路由建议,可能让团队把小 bug 看成该加预算的信号。
换个角度,OpenAI 对 Sol Max 的亮相报告清楚证明,这是一套顶级编码配置没错。跨模型对比中,Sol Max 在 Coding Agent Index 上超过 Fable 5 达 2.8 分,且功耗控制得很漂亮:输出量不到对方一半、耗时不到一半、估计成本大约只花了三分之一。但这里必须看清口径——这是拿 GPT-5.6 的 Max 去比别家模型,证明的是强劲的模型能力,而非在同一个 GPT-5.6 体内把强度从 High 升到 Max 的经济性。
官方 API 价格也在推着大家精打细算。每一千 token 的单价在 Max 下大幅跳升,输出的纪律因此直接关系到一次调用是否还能控制在项目可接受的预算内。当跨模型的光环退去,留下的是自己和自己的比较:用 2.42 倍开销换来 3.3 个百分点的提升。
独立评测机构 Artificial Analysis 给过一个同样值得留意的面向延迟的视角。他们发现在他们覆盖的任务集上,提升一个指数点有时确实能影响评测排名,但起步冷启动也付出了代价——延迟中位数可以拉到 High 档的 3.27 倍。这意味着 Max 不光是更贵,还更慢,而且慢得相当显著。
如果把视野拉得更广,看第三方完全不搭边的数据集,风向还会继续分化。FutureSearch 选择公布完整的操作点而不仅是获胜分数,这种透明做法恰好暴露了一个现象:在不同模型上,拔高推理强度的效果完全不同。在他们的设定里,推高推理帮到了 Claude 4.6,却拖累了 GPT-5 和 Gemini。
这其实回到了整场讨论的出发点:每个团队都要在自己的任务模板和 harness 上评估推理强度的真实回报,否则通用建议很可能是笔糊涂账。DeepSWE 给的是一个平均值,eza 给的是一个结构性洞察,而那位在终端前犹豫的开发者真正需要的是一个自身的剖面——在今天的迭代里,是否还有足够多的“未知行为”等待模型去破拆。
答案并不耸动。重写、迁移,或者从零启动的项目,Max 能扛住不确定性的工作,让成品跑通更多隐含的兼容性路径;一旦缺陷被测试框死,不确定性基本出清,High 足够了,Max 甚至可能因为额外的探索倾向而让修复走向不必要的变更。更直白一点:不是越强越好,而是不确定越多时,多买的推理轮次才真有机会还回来。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.