文 | AIX财经,作者 | 陈丹,编辑 | 魏佳
这听起来像一个典型的马斯克式Flag:用AI挑战诺兰、好莱坞和2.5亿美元制作预算。但真正值得关注的,并不是Grok能不能在五个月里生成几千个镜头,而是它是否已经拥有把一项复杂任务从头做到尾的能力。
![]()
Grok 4.6发布后,这个问题有了更具体的答案。
在最新一轮模型竞争中,它已经挤进美国大模型的第一梯队:能力接近OpenAI和Anthropic的旗舰模型,编程成绩甚至在部分榜单领先,API价格却明显更低。与此同时,它在长链条Agent任务上的短板依然存在——会理解问题、会搭框架、会快速启动,却还不够稳定地收尾。
这恰好也是眼下大模型竞争的缩影。
当能力差距缩小、Token越来越便宜,真正决定商业价值的,已经不只是“模型有多聪明”,还要看一次任务能否稳定完成,以及完成一次到底要花多少钱。
对于一年向AI投入上百亿美元资本开支的马斯克来说,Grok也不能只是偶尔冲上一次榜单。它必须持续留在第一牌桌,并把算力、数据和分发真正变成收入。
01.Grok 4.6上了牌桌,但还拍不了《奥德赛》
诺兰的《奥德赛》上映前,马斯克已经骂了这部电影好几轮。骂选角,骂改编,骂诺兰为了奥斯卡“亵渎荷马”。电影上映后,他干脆在X上立了一个Flag,今年年底前,Grok Imagine要做出一部“符合历史、忠于荷马艺术”的完整《奥德赛》。
马斯克转发的三分钟《奥德赛》短片确实不错。盔甲、海岸、人物特写都有电影预告片的质感,但三分钟精修短片和九十分钟长片之间,还隔着几千个镜头,以及一群AI演员。
趁着Grok 4.6发布,我们没有再测试视频,而是给它出了两道更适合语言模型的题。第一道,看它能不能读懂荷马。第二道,看它能不能搭出一套把三分钟样片扩展成九十分钟长片的制片系统。
第一题,Grok答得比马斯克本人靠谱。
“符合历史”和“忠于荷马”听起来不难,真翻开《奥德赛》就会发现,这两个维度很难同时实现。《奥德赛》经过数百年口述传播,青铜时代的武器、铁器时代的习俗和诗人的神话想象全叠在一起。你可以考证奥德修斯该用什么剑、坐什么船,却没法从遗址里挖出独眼巨人、女神和冥界。
Grok把问题拆成了四层,青铜时代考古、荷马史诗里的混合时间层、作品本身的诗学,以及诺兰的现代改编。
它给出的办法是,考古负责约束器物、服装和地理,荷马负责约束人物、叙事和诗学。它还顺手纠正了一个流传很广的错误,「让千艘战船起航的面孔」出自马洛,不是荷马。
![]()
这题说明Grok 4.6不仅会查资料,还能拆开一个内部冲突的命题,替争议双方构造最强论证。
第二题更接近真正的制片工作。
Grok搭了一个《奥德赛》制片计算器,把成片时长、平均镜头长度、首轮可用率、复杂镜头占比、并发任务数、人工审核时间、成本和工期全部做成可调参数。
![]()
Grok4.6生成的电影制片系统
按照默认参数,它估算一部90分钟长片需要约208个工作日。Grok自己算完都觉得有点悬,最后给出了一条“识时务”的建议:做一部12到20分钟的荷马选篇。
当然,208天不能当作实测结果。首轮可用率、连续性失败率、每个可用镜头需要生成几次,都是模型设定的假设。计算器证明Grok会拆解工程、建立公式和搭建生产系统,没有证明这套系统真的能在208天内交片。
而且,它点出了AI电影最难的部分。现在生成一个漂亮镜头已经不稀奇。难的是让几千个镜头中的脸、衣服、船只、空间和叙事保持一致,同时把废片、重做和人工审核压到制片方能承受的范围。
外部榜单给出的结论差不多。
在Artificial Analysis的榜单上,Grok 4.6的综合智能指数是61分,与GPT-5.6 Sol同分,距离Claude Fable 5只有1分。CursorBench 3.2上,Grok 4.6 High拿到69.9%,超过Sol的67.2%。它完成一次任务的成本约2.34美元,Sol约5.69美元。Grok 4.6的API的起价在每百万输入Token 2美元、输出6美元——价格确实有杀伤力。
![]()
图源 / SpaceX
但到了DeepSWE和TerminalBench这类长链条任务,Grok分别拿到65.9%和26%。Sol是73%和34.6%,Fable 5是70%和34.1%。
Grok已经很会理解问题、启动项目和搭建框架,到了需要连续执行、处理意外和稳定收尾的阶段,仍然会掉链子。
综合来看,Grok 4.6已经坐上美国大模型的第一桌,而且在OpenAI和Anthropic旗舰模型面前,打出了一张很凶的性价比牌。
它会读荷马,会写分镜,会算工期,也会搭制片系统。只是奥德修斯漂了十年才回到伊萨卡,想让Grok在年底前带着几千个连续镜头顺利“返乡”,现在看还很难。
02.35天一代,马斯克先要确保Grok别掉队
从7月8日Grok 4.5开始对外推送,到8月12日Grok 4.6发布,中间只隔了35天。马斯克还预告,拥有2.1万亿参数的Grok 4.7将在几周后到来,能力更强,Token效率更高,只是推理稍慢。
4.7还没发布,参数和能力也只有马斯克一家的说法,但4.5到4.6至少完成了一次有效的月度升级。如果4.7按时落地,SpaceXAI就更显示出自己能够停留在第一梯队的能力。
这件事放在两年前,还有点难以想象。
2023年11月,Grok-1发布时,OpenAI已经拿出GPT-4,Anthropic已经发布Claude,Google背后则有TPU、搜索和云。那时候,Grok更像X Premium附赠的聊天机器人,企业客户、开发者生态和模型透明度都没建立起来,B端的市场占有率也很低。今年4月,在Ramp客户的企业付费样本里,xAI的采用率只有1.9%,而Anthropic和OpenAI的这一数字分别是34.4%和32.3%。
在很多从业者的眼中,和Meta一样,SpaceXAI的大模型也长期困于第二梯队。
但现在Grok端着凳子挤过来了。它能追上来,主要是大力出奇迹,靠算力、数据和工程速度一起硬堆。
xAI用122天建成了首期10万张Hopper GPU的Colossus,随后又用92天扩到20万张。服务器到场19天后,集群已经开始跑训练任务。黄仁勋把这段部署速度称为“超人级”。X给Grok提供实时信息、用户和分发入口。Cursor则提供真实的编程任务和开发者与Agent的交互数据。Cursor称,Grok 4.5的训练使用了数万亿Token的Cursor数据。
模型也不必每个月从头练一遍。Grok 4.6建立在4.5的基础上,主要升级监督微调、强化学习和Agent训练环境。Colossus负责把训练规模堆上去,X和Cursor负责不断喂回真实任务,SpaceXAI再用后训练把这些任务压进下一版模型。
这套流水线跑顺以后,版本号就能按月往前拱。
Grok也必须跑这么快,因为SpaceX已经把太多钱押在AI上了。
SpaceX招股书显示,2025年AI分部收入32亿美元,经营亏损64亿美元,资本开支127亿美元,占公司总资本开支约61%。2026年一季度,SpaceX又向AI分部投入77亿美元,占全公司资本开支的76%。到了2026年二季度,AI分部资本开支进一步升至158.28亿美元,占三大分部资本开支的约86%,单季已经超过2025年全年;上半年累计达到236亿美元。
SpaceX给投资者讲的故事已经很明确。公司把AI和Space、Connectivity并列为三大业务分部,并把AI称为未来垂直整合的基础平台。在SpaceX自己测算的28.5万亿美元可量化市场中,AI占26.5万亿美元,火箭和卫星连接业务加起来只有约2万亿美元。马斯克预计AI收入可能在2026年9月超过SpaceX其他业务收入之和,四五年后,AI可能贡献SpaceX 99%的公司价值。
Grok是这笔重投入能否获得更高回报的关键变量。AI分部可以直接把算力卖给第三方,但只有自有模型稳定留在第一梯队,SpaceX才有机会把同一套基础设施向上延伸到API、订阅和Agent等更高附加值的业务。
如果Grok保持第一梯队,SpaceX可以同时赚模型、应用和算力的钱,还能用自己的模型给Colossus乃至未来的轨道算力制造需求。如果Grok掉队,Colossus照样可以把GPU租给Anthropic和Google,但SpaceX会从全栈AI公司退回成重资产算力房东,负责建机房、买芯片和交电费。
而且236亿美元资本开支,如果最后只训练出一个二流模型,这个故事恐怕马斯克自己都不好意思讲。
03.从比Token单价,到比“一次交付”
过去几个月,大模型竞争堪称惨烈。
Anthropic依靠Claude Code和Fable 5在编程场景建立优势,OpenAI随后用Codex和新模型追赶,Grok又在一个多月内连续更新两代。
榜单前排的保鲜期,已经从几个月缩短到几周。当头部模型之间的能力差距只剩几个百分点,另一个数字就会变得格外显眼——价格。
来自中国的模型,把这种压力进一步往前推。
7月,月之暗面发布拥有2.8万亿参数和100万Token上下文的Kimi K3。它的价格虽不算便宜,但开放权重本身就在削弱头部模型厂商对推理价格的控制力。
DeepSeek走得更彻底。截至8月13日,DeepSeek V4 Flash每百万输入和输出Token的价格分别只有0.14美元和0.28美元。在DeepSeek公布的结果中,它的推理能力已经接近V4 Pro,简单Agent任务也能做到相近水平。当天,DeepSeek虽然宣布从北京时间8月17日0点起改用峰谷定价,但即便按高峰价计算,仍明显低于Grok 4.6的2美元和6美元。
OpenAI也开始重新算这笔账。
7月30日,在GPT-5.6发布仅三周后,OpenAI将Luna价格下调80%,Terra下调20%。目前,Luna每百万输入和输出Token分别为0.2美元和1.2美元,Terra则为2美元和12美元。
OpenAI的打法非常清晰:Sol处理最复杂的判断和规划,Terra承担日常工作,Luna执行大量边界清晰、重复度高的任务。它争夺的是通过模型分工,把整条工作流的平均成本压下来。
![]()
图源 / Artificial Analysis
大模型竞争由此进入了一套更复杂的计分规则。
模型能力决定能不能上桌,长任务可靠性决定客户敢不敢把活交给你,单位任务成本决定客户能够用多少次。再往后,还要比较算力、分发、企业客户,以及持续烧钱的耐力。
Token单价只是其中最容易看到的数字。
一个模型即使每百万Token便宜一半,如果执行任务需要更多步骤、更频繁重试,或者总是在最后20%失败,节省下来的推理费用很快就会被返工和人工审核吃掉。客户真正购买的,其实是一次成功交付。
这也是为什么Grok 4.6眼下最值得关注的指标,并不只是2美元输入、6美元输出。如果它能以更低成本完成同样的任务,它就是更便宜的模型;但如果它在TerminalBench这类长任务里更容易失败,那么“便宜”就可能只是停留在价目表上。
拿这把尺子再看硅谷,各家手里的牌并不相同。
Anthropic握着Claude Code、长任务能力和企业客户信任,但它必须不断证明,这些优势值得更高的价格。OpenAI拥有ChatGPT、Codex和覆盖不同价位的模型矩阵,可以在能力、速度和价格之间灵活调兵。Google手里则有TPU、Google Cloud、搜索、Workspace和Android,可能是所有玩家中基础设施和分发最完整的一家。Meta走的是另一条路,通过开放权重和社交平台分发,不断压低通用模型能力的稀缺性,只是如何把这种影响力真正转化成收入,始终是另一道题。
SpaceXAI的特殊之处在于,它没有哪一张牌绝对领先,但几张牌已经开始互相喂养。Colossus提供算力,X提供实时信息、用户和分发,Cursor提供真实编程任务、工具调用轨迹和开发者反馈,Grok再把这些资源转化成API、订阅和Agent产品。模型进入X和Cursor之后产生的新反馈,又可以继续回到下一轮后训练。
随着Grok重新挤进第一牌桌,黄仁勋2025年的一段评价也被重新翻了出来。他当时认为,马斯克同时押注基础模型、自动驾驶和人形机器人,进入了AI最重要的三个方向,并因为掌握大量真实世界数据而处在“绝佳位置”。这个判断现在更容易理解了。
但拥有版图,不等于已经形成闭环。
特斯拉仍然是一家独立公司。自动驾驶、机器人、X和Grok之间究竟能够共享多少数据、模型和客户,还受到组织边界、隐私与监管的约束。SpaceXAI也没有Google Cloud、Microsoft Azure或者企业办公软件那样成熟的销售和交付渠道。
更现实的问题是,Grok在TerminalBench等长链条Agent测试中仍然落后。企业客户对于安全、稳定性、透明度以及品牌风险的顾虑,也没有因为一次榜单上升就自动消失。
从“最有性价比的第一梯队模型”到“最大的商业赢家”之间,仍然隔着可靠性、企业信任、渠道和真实采用率。
就像马斯克想让Grok拍完《奥德赛》一样,生成短片已经不是最难的事。真正难的是,别在返乡路上翻船。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.