美东时间8月12日周三,马斯克旗下SpaceXAI正式发布新一代大模型Grok 4.6。SpaceXAI称,新模型相比Grok 4.5实现显著提升,重点强化长时间运行的智能体(Agent)、复杂编程、知识工作以及交互式和视觉任务能力。
此次发布最受关注的并非单纯的模型迭代,而是Grok 4.6在SpaceXAI公布的多项前沿模型测试中已经跻身第一梯队,同时API起售价仅为2美元/百万输入Token、6美元/百万输出Token。SpaceXAI称,其定价约为其他前沿模型的一半;该模型上线首周在Cursor和Grok Build中还提供2倍包含用量。
SpaceXAI公布的测试数据显示,Grok 4.6在Artificial Analysis Intelligence Index中取得61分,与OpenAI前沿模型GPT-5.6 Sol Max持平;在GDPVal-AA v2中则取得1753 Elo,超过GPT-5.6 Sol Max的1728分和Anthropic前沿模型Claude Fable 5的1741分。
马斯克随后在社交媒体转发有关Grok 4.6是巨大升级、在所有基准测试中得分均超过Grok 4.5 High的帖子,强调Grok 4.6评分达到1753 Elo,并自夸新模型太牛了。
从知识工作到编程,Grok 4.6全面强化复杂任务能力
Grok 4.6此次升级的核心,不再只是回答问题,而是让模型能够持续完成需要多步骤执行的复杂任务。
SpaceXAI表示,Grok 4.6重点针对长时间运行的智能体进行训练,可以连续完成研究主题、分析信息、处理代码库,以及把一个模糊的产品想法转化为可运行的应用或工作成果。公司还称,新模型在更长的任务轨迹中开始表现出更多自主测试和验证能力,会在继续执行之前检查此前的工作。
在训练方面,Grok 4.6经历了比Grok 4.5更长的补充训练,加入经过筛选的模型生成推理数据、高质量工程数据,并改进优化器和训练方案。随后,SpaceXAI利用Grok 4.5生成覆盖不同推理强度、智能体框架以及STEM、软件工程和知识工作的SFT轨迹,并进一步通过强化学习训练模型完成通用编程、知识工作、内核优化、网页开发和计算机辅助设计等任务。
SpaceXAI特别强调,Grok 4.6在把“想法”变成“产品”方面有所提升。对于一个具体的产品构想,模型可以先研究陌生领域、设计应用结构、实现核心交互,再根据反馈进行多轮迭代;在视觉和交互式项目中,新模型也能够更快形成较为完整的第一版成果。
低价策略直指开发者市场,首周Cursor等产品加倍放量
相比模型能力本身,Grok 4.6的定价策略可能更加值得AI产业链关注。
SpaceXAI公布的API价格从每百万输入Token 2美元、每百万输出Token 6美元起,另有速度更快、价格翻倍的版本。公司同时宣布,Grok 4.6已经接入Cursor、Grok Build,并通过OpenRouter、Vercel和Cloudflare等合作伙伴提供。
作为对比,SpaceXAI在公告中将Grok 4.6定位为“其他前沿模型的一半价格”。而投资机构Atreides Management首席投资官Gavin Baker的评价更为激进:他认为,Grok 4.6的性能大致相当于Fable 5 Max,但输入Token价格低80%、输出Token价格低88%,因此在性能与成本的组合上具有明显优势。
科技业分析师、Superintelligence Newsletter主编Kim Monnis也指出,Grok 4.6不仅比Opus 5和GPT-5.6 Sol便宜,甚至低于Sonnet 5,同时性能至少处于顶级模型水平。在他看来,这种“前沿性能+低成本”的组合才是Grok真正的护城河。
需要指出的是,API单价并不能完全等同于实际使用成本。不同模型的Token消耗、推理强度和任务完成路径存在差异,因此“便宜一半”主要是对公布API价格的比较,而不是意味着所有具体任务的最终成本都恰好低50%。
首周促销也进一步强化了这一低价策略:SpaceXAI表示,Cursor和Grok Build用户在首周可以获得2倍包含用量,让开发者可以低成本试用Grok 4.6。
强化长程执行能力,模型可自主测试并持续修正
从测试结果看,Grok 4.6的提升尤其集中在智能体执行真实工作这一正在成为AI模型竞争核心的领域。
SpaceXAI重点展示了Artificial Analysis推出的GDPVal-AA v2。该测试基于OpenAI的GDPval数据集,考察模型在真实世界、具有经济价值的专业任务中的表现,覆盖44个职业和9个主要行业;模型需要在智能体环境中使用Shell和网页浏览等工具完成任务,并通过盲测两两比较最终产出的文件,由此形成Elo评分。
在SpaceXAI此次公布的对比数据中,Grok 4.6在GDPVal-AA v2取得1753 Elo,排名高于GPT-5.6 Sol Max的1728分和Claude Fable 5 Max的1741分,较上一代Grok 4.5 High的1526分大幅提高。
与此同时,Grok 4.6在Artificial Analysis Intelligence Index中获得61分,与GPT-5.6 Sol Max持平;该指数是由9项测试综合而成,用于衡量模型在数学、科学、编程和推理等多个维度的综合能力。
在SpaceXAI公布的其他测试中,Grok 4.6同样较上一代有明显进步:
- CursorBench v3.2:69.9%,Grok 4.5 High为66.7%;
- FrontierCode v1.1:61.3%,Grok 4.5 High为56.6%;
- APEX-Agents:57.5%,Grok 4.5 High为47.1%;
- APEX-SWE:56.4%,Grok 4.5 High为53.6%;
- AA-Briefcase:1577分,Grok 4.5 High为1313分;
- Harvey LAB:15.8%,Grok 4.5 High为12.9%。
但Grok 4.6并非在所有测试中都占据第一。例如在DeepSWE 1.1和Terminal-Bench v3.0中,SpaceXAI公布的GPT-5.6 Sol Max成绩仍高于Grok 4.6。因此,更准确的说法是,Grok 4.6已经在多项智能体和知识工作测试中进入前沿模型第一梯队,而不是全面击败所有竞争对手。
值得注意的是,Artificial Analysis的GDPVal-AA v2排行榜本身会随着模型新增和评测更新而变化,因此本文标题所称的“力压”特指SpaceXAI此次发布时公布的横向测试结果,而非宣称Grok 4.6在所有时间、所有评测体系中均排名第一。
从模型到生态,SpaceXAI加速抢占AI开发入口
Grok 4.6的发布还显示,SpaceXAI正在把竞争从单纯的模型性能比拼,进一步延伸到开发者入口和应用生态。
目前Grok 4.6已经同时进入Cursor、Grok Build和API,并接入OpenRouter、Vercel、Cloudflare等渠道。SpaceXAI希望借助这些平台,让开发者可以直接把Grok 4.6嵌入编程、网页开发和智能体工作流,而不只是通过Grok聊天产品使用模型。
马斯克本人也在X上密集为新模型站台。他先是宣布“Grok 4.6 is now out”,随后转发有关1753 Elo排名的报道,并强调Grok 4.6在GDPVal-AA v2中取得第一;在另一条转发中,他列出了Grok 4.6在AA-Briefcase、Harvey LAB、CursorBench、FrontierCode、APEX-Agents和APEX-SWE等测试中的排名,最后评价称:“Grok 4.6 is a banger”。
而Atreides Management的Gavin Baker则进一步把市场注意力引向下一代产品。他预计,Grok 4.7将是规模明显更大的模型,并可能将Cursor和SpaceX数据纳入预训练。这一说法目前属于投资人士的判断,并非SpaceXAI此次发布公告确认的产品路线。
如果Grok 4.6能够在保持前沿模型级别能力的同时持续维持较低的Token价格,那么其意义可能不仅是一代模型的性能升级,更可能成为AI大模型价格战向智能体时代延伸的一个新信号:当不同厂商的模型能力差距逐渐缩小时,性能与推理成本之间的平衡,可能越来越成为开发者和企业选择模型的关键。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.