随手先关注,不错过每日AI热讯速递
8 月 12 日,马斯克旗下 SpaceXAI 发布新一代大模型Grok 4.6。官方博客开宗明义:这一代“专注于长程智能体,以及更具野心的交互与视觉工作”[1]。
距离 Grok 4.5 发布仅两周,xAI 再次刷新迭代速度。
①
在智能体与知识工作基准上,Grok 4.6 直接冲进第一梯队。它在 GDPVal-AA v2 取得1753 Elo,超过 Claude Fable 5 Max 的 1741 和 GPT-5.6 Sol Max 的 1728[1]。
Elo 分(通过两两盲测对比得出的相对实力评分,越高越强)在真实专业任务评测里更能反映实际能力。
![]()
图:xAI 官方 Grok 4.6 发布页(来源:xAI 官方博客)
在 Artificial Analysis Intelligence Index 上,Grok 4.6 拿下 61 分,与 GPT-5.6 Sol Max 持平[1]。
CursorBench v3.2 拿到 69.9%,DeepSWE v1.1 拿到 65.9%,均比上一代 Grok 4.5 High 大幅提升[1]。
②
定价是这次发布的一大看点。Grok 4.6 起步价 2 美元/百万输入 Token、6 美元/百万输出 Token,另有一个价格为标准变体两倍的“快速变体”[1]。
横向对比,这明显低于 Claude Fable 5 Max 与 GPT-5.6 Sol Max 的主流定价。
但低价不等于低成本。独立评测者 Techsy.io 在发布当天做了 80 次 API 实测,发现 Grok 4.6 在相同 prompt 下,输出 Token 中位数是 Grok 4.5 的 1.90 倍[2]。
算下来,实际账单约比 4.5 高出 1.38 倍[2]。
开发者接入前,得把真实 Token 消耗一并算进去。
③
Grok 4.6 的核心卖点是“长程智能体”。官方披露,它的训练涵盖知识工作、通用编码,以及内核优化、Web 开发、计算机辅助设计等领域环境,让模型在多步骤真实任务里学会自我测试与修正[1]。
这一代在视觉与交互项目上的一次成型能力也明显增强,能在一次生成中为应用建立结构和视觉语言[1]。当天,Grok 4.6 在 Cursor 与 Grok Build 上线,首周提供 2 倍包含用量(订阅套餐内含的免费调用额度翻倍)[1]。
![]()
图:Grok 4.6 官方发布视觉卡(来源:xAI 官方)
有从业者提醒,榜单追平不等于百轮 Agent 循环里的复合错误控制能力也追平。但就 leaderboard 而言,Grok 4.6 已经把这个差距拉到了零[1]。
你看好 xAI 这种“两周一个版本”的迭代节奏吗?还是更担心长程智能体在真实场景下的稳定性?欢迎分享你的看法。
参考来源:
[1] Introducing Grok 4.6
https://x.ai/news/grok-4-6
[2] Grok 4.6 vs 4.5: 80 Calls, Same Answers, 1.38x Cost
https://techsy.io/en/blog/grok-4-6
欢迎分享、点赞、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.