大多数AI实验室会把模型跑偏的失败轨迹当作垃圾丢掉,SpaceXAI却反其道而行之,把这类数据用在了Grok 4.6的训练上。这个选择背后,是编程模型竞赛思路的变化:首次写出正确答案仍然重要,但能发现错误、修复错误并继续朝原始目标推进,同样关键。 Grok 4.6接受了比前代更长的补充训练。团队将模型生成的推理过程、技术资料与工程数据混合,并调整了优化器和权重更新方案。随后,他们用Grok 4.5重新生成覆盖不同推理设置、智能体框架和STEM、软件工程、知识工作等领域的监督微调轨迹,再用基于模型的检查剔除有问题的轨迹。 强化学习阶段则延伸到通用编程、内核优化、Web开发和计算机辅助设计。模型得到的奖励不是“写出一段像样的代码”,而是“完成更大的任务”。SpaceXAI称,Grok 4.6在长时间任务中更倾向于暂停,先检查自己的产出是否真的站得住脚,再继续推进。它生成的视觉应用和交互应用早期版本也更强,能在工作过程中发现并纠正自身错误。 不过,基准测试展示的图景比宣传更复杂。Grok 4.6在CursorBench v3.2上拿到69.9%,高于Grok 4.5的66.7%,也超过OpenAI GPT-5.6 Sol Max的67.2%,但仍落后于Anthropic Fable 5 Max的70.5%。在DeepSWE v1.1上,Grok 4.6从54%大幅升至65.9%,不过GPT-5.6 Sol Max的73%和Fable 5 Max的70%依然领先。整体来看,与其说它是“最强编程模型”,不如说它相比Grok 4.5确实取得了明显进步。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.