网易首页 > 网易号 > 正文 申请入驻

Grok 4.6上了牌桌,马斯克还差一部《奥德赛》

0
分享至



Grok4.6,追平第一梯队。

AIX财经(AIXcaijing)原创

作者 | 陈丹

编辑 | 魏佳

马斯克想让Grok在今年年底前拍完一部《奥德赛》。

这听起来像一个典型的马斯克式Flag:用AI挑战诺兰、好莱坞和2.5亿美元制作预算。但真正值得关注的,并不是Grok能不能在五个月里生成几千个镜头,而是它是否已经拥有把一项复杂任务从头做到尾的能力。



Grok 4.6发布后,这个问题有了更具体的答案。

在最新一轮模型竞争中,它已经挤进美国大模型的第一梯队:能力接近OpenAI和Anthropic的旗舰模型,编程成绩甚至在部分榜单领先,API价格却明显更低。与此同时,它在长链条Agent任务上的短板依然存在——会理解问题、会搭框架、会快速启动,却还不够稳定地收尾。

这恰好也是眼下大模型竞争的缩影。

当能力差距缩小、Token越来越便宜,真正决定商业价值的,已经不只是“模型有多聪明”,还要看一次任务能否稳定完成,以及完成一次到底要花多少钱。

对于一年向AI投入上百亿美元资本开支的马斯克来说,Grok也不能只是偶尔冲上一次榜单。它必须持续留在第一牌桌,并把算力、数据和分发真正变成收入。

01.Grok 4.6上了牌桌,但还拍不了《奥德赛》

诺兰的《奥德赛》上映前,马斯克已经骂了这部电影好几轮。骂选角,骂改编,骂诺兰为了奥斯卡“亵渎荷马”。电影上映后,他干脆在X上立了一个Flag,今年年底前,Grok Imagine要做出一部“符合历史、忠于荷马艺术”的完整《奥德赛》。

马斯克转发的三分钟《奥德赛》短片确实不错。盔甲、海岸、人物特写都有电影预告片的质感,但三分钟精修短片和九十分钟长片之间,还隔着几千个镜头,以及一群AI演员。

趁着Grok 4.6发布,我们没有再测试视频,而是给它出了两道更适合语言模型的题。第一道,看它能不能读懂荷马。第二道,看它能不能搭出一套把三分钟样片扩展成九十分钟长片的制片系统。

第一题,Grok答得比马斯克本人靠谱。

“符合历史”和“忠于荷马”听起来不难,真翻开《奥德赛》就会发现,这两个维度很难同时实现。《奥德赛》经过数百年口述传播,青铜时代的武器、铁器时代的习俗和诗人的神话想象全叠在一起。你可以考证奥德修斯该用什么剑、坐什么船,却没法从遗址里挖出独眼巨人、女神和冥界。

Grok把问题拆成了四层,青铜时代考古、荷马史诗里的混合时间层、作品本身的诗学,以及诺兰的现代改编。

它给出的办法是,考古负责约束器物、服装和地理,荷马负责约束人物、叙事和诗学。它还顺手纠正了一个流传很广的错误,「让千艘战船起航的面孔」出自马洛,不是荷马。



这题说明Grok 4.6不仅会查资料,还能拆开一个内部冲突的命题,替争议双方构造最强论证。

第二题更接近真正的制片工作。

Grok搭了一个《奥德赛》制片计算器,把成片时长、平均镜头长度、首轮可用率、复杂镜头占比、并发任务数、人工审核时间、成本和工期全部做成可调参数。



Grok4.6生成的电影制片系统

按照默认参数,它估算一部90分钟长片需要约208个工作日。Grok自己算完都觉得有点悬,最后给出了一条“识时务”的建议:做一部12到20分钟的荷马选篇。

当然,208天不能当作实测结果。首轮可用率、连续性失败率、每个可用镜头需要生成几次,都是模型设定的假设。计算器证明Grok会拆解工程、建立公式和搭建生产系统,没有证明这套系统真的能在208天内交片。

而且,它点出了AI电影最难的部分。现在生成一个漂亮镜头已经不稀奇。难的是让几千个镜头中的脸、衣服、船只、空间和叙事保持一致,同时把废片、重做和人工审核压到制片方能承受的范围。

外部榜单给出的结论差不多。

在Artificial Analysis的榜单上,Grok 4.6的综合智能指数是61分,与GPT-5.6 Sol同分,距离Claude Fable 5只有1分。CursorBench 3.2上,Grok 4.6 High拿到69.9%,超过Sol的67.2%。它完成一次任务的成本约2.34美元,Sol约5.69美元。Grok 4.6的API的起价在每百万输入Token 2美元、输出6美元——价格确实有杀伤力。



图源 / SpaceX

但到了DeepSWE和TerminalBench这类长链条任务,Grok分别拿到65.9%和26%。Sol是73%和34.6%,Fable 5是70%和34.1%。

Grok已经很会理解问题、启动项目和搭建框架,到了需要连续执行、处理意外和稳定收尾的阶段,仍然会掉链子。

综合来看,Grok 4.6已经坐上美国大模型的第一桌,而且在OpenAI和Anthropic旗舰模型面前,打出了一张很凶的性价比牌。

它会读荷马,会写分镜,会算工期,也会搭制片系统。只是奥德修斯漂了十年才回到伊萨卡,想让Grok在年底前带着几千个连续镜头顺利“返乡”,现在看还很难。

02.35天一代,马斯克先要确保Grok别掉队

从7月8日Grok 4.5开始对外推送,到8月12日Grok 4.6发布,中间只隔了35天。马斯克还预告,拥有2.1万亿参数的Grok 4.7将在几周后到来,能力更强,Token效率更高,只是推理稍慢。

4.7还没发布,参数和能力也只有马斯克一家的说法,但4.5到4.6至少完成了一次有效的月度升级。如果4.7按时落地,SpaceXAI就更显示出自己能够停留在第一梯队的能力。

这件事放在两年前,还有点难以想象。

2023年11月,Grok-1发布时,OpenAI已经拿出GPT-4,Anthropic已经发布Claude,Google背后则有TPU、搜索和云。那时候,Grok更像X Premium附赠的聊天机器人,企业客户、开发者生态和模型透明度都没建立起来,B端的市场占有率也很低。今年4月,在Ramp客户的企业付费样本里,xAI的采用率只有1.9%,而Anthropic和OpenAI的这一数字分别是34.4%和32.3%。

在很多从业者的眼中,和Meta一样,SpaceXAI的大模型也长期困于第二梯队。

但现在Grok端着凳子挤过来了。它能追上来,主要是大力出奇迹,靠算力、数据和工程速度一起硬堆。

xAI用122天建成了首期10万张Hopper GPU的Colossus,随后又用92天扩到20万张。服务器到场19天后,集群已经开始跑训练任务。黄仁勋把这段部署速度称为“超人级”。X给Grok提供实时信息、用户和分发入口。Cursor则提供真实的编程任务和开发者与Agent的交互数据。Cursor称,Grok 4.5的训练使用了数万亿Token的Cursor数据。

模型也不必每个月从头练一遍。Grok 4.6建立在4.5的基础上,主要升级监督微调、强化学习和Agent训练环境。Colossus负责把训练规模堆上去,X和Cursor负责不断喂回真实任务,SpaceXAI再用后训练把这些任务压进下一版模型。

这套流水线跑顺以后,版本号就能按月往前拱。

Grok也必须跑这么快,因为SpaceX已经把太多钱押在AI上了。



图源 / pixabay

SpaceX招股书显示,2025年AI分部收入32亿美元,经营亏损64亿美元,资本开支127亿美元,占公司总资本开支约61%。2026年一季度,SpaceX又向AI分部投入77亿美元,占全公司资本开支的76%。到了2026年二季度,AI分部资本开支进一步升至158.28亿美元,占三大分部资本开支的约86%,单季已经超过2025年全年;上半年累计达到236亿美元。

SpaceX给投资者讲的故事已经很明确。公司把AI和Space、Connectivity并列为三大业务分部,并把AI称为未来垂直整合的基础平台。在SpaceX自己测算的28.5万亿美元可量化市场中,AI占26.5万亿美元,火箭和卫星连接业务加起来只有约2万亿美元。马斯克预计AI收入可能在2026年9月超过SpaceX其他业务收入之和,四五年后,AI可能贡献SpaceX 99%的公司价值。

Grok是这笔重投入能否获得更高回报的关键变量。AI分部可以直接把算力卖给第三方,但只有自有模型稳定留在第一梯队,SpaceX才有机会把同一套基础设施向上延伸到API、订阅和Agent等更高附加值的业务。

如果Grok保持第一梯队,SpaceX可以同时赚模型、应用和算力的钱,还能用自己的模型给Colossus乃至未来的轨道算力制造需求。如果Grok掉队,Colossus照样可以把GPU租给Anthropic和Google,但SpaceX会从全栈AI公司退回成重资产算力房东,负责建机房、买芯片和交电费。

而且236亿美元资本开支,如果最后只训练出一个二流模型,这个故事恐怕马斯克自己都不好意思讲。

03.从比Token单价,到比“一次交付”

过去几个月,大模型竞争堪称惨烈。

Anthropic依靠Claude Code和Fable 5在编程场景建立优势,OpenAI随后用Codex和新模型追赶,Grok又在一个多月内连续更新两代。

榜单前排的保鲜期,已经从几个月缩短到几周。当头部模型之间的能力差距只剩几个百分点,另一个数字就会变得格外显眼——价格。

来自中国的模型,把这种压力进一步往前推。

7月,月之暗面发布拥有2.8万亿参数和100万Token上下文的Kimi K3。它的价格虽不算便宜,但开放权重本身就在削弱头部模型厂商对推理价格的控制力。

DeepSeek走得更彻底。截至8月13日,DeepSeek V4 Flash每百万输入和输出Token的价格分别只有0.14美元和0.28美元。在DeepSeek公布的结果中,它的推理能力已经接近V4 Pro,简单Agent任务也能做到相近水平。当天,DeepSeek虽然宣布从北京时间8月17日0点起改用峰谷定价,但即便按高峰价计算,仍明显低于Grok 4.6的2美元和6美元。

OpenAI也开始重新算这笔账。

7月30日,在GPT-5.6发布仅三周后,OpenAI将Luna价格下调80%,Terra下调20%。目前,Luna每百万输入和输出Token分别为0.2美元和1.2美元,Terra则为2美元和12美元。

OpenAI的打法非常清晰:Sol处理最复杂的判断和规划,Terra承担日常工作,Luna执行大量边界清晰、重复度高的任务。它争夺的是通过模型分工,把整条工作流的平均成本压下来。



图源 / Artificial Analysis

大模型竞争由此进入了一套更复杂的计分规则。

模型能力决定能不能上桌,长任务可靠性决定客户敢不敢把活交给你,单位任务成本决定客户能够用多少次。再往后,还要比较算力、分发、企业客户,以及持续烧钱的耐力。

Token单价只是其中最容易看到的数字。

一个模型即使每百万Token便宜一半,如果执行任务需要更多步骤、更频繁重试,或者总是在最后20%失败,节省下来的推理费用很快就会被返工和人工审核吃掉。客户真正购买的,其实是一次成功交付。

这也是为什么Grok 4.6眼下最值得关注的指标,并不只是2美元输入、6美元输出。如果它能以更低成本完成同样的任务,它就是更便宜的模型;但如果它在TerminalBench这类长任务里更容易失败,那么“便宜”就可能只是停留在价目表上。

拿这把尺子再看硅谷,各家手里的牌并不相同。

Anthropic握着Claude Code、长任务能力和企业客户信任,但它必须不断证明,这些优势值得更高的价格。OpenAI拥有ChatGPT、Codex和覆盖不同价位的模型矩阵,可以在能力、速度和价格之间灵活调兵。Google手里则有TPU、Google Cloud、搜索、Workspace和Android,可能是所有玩家中基础设施和分发最完整的一家。Meta走的是另一条路,通过开放权重和社交平台分发,不断压低通用模型能力的稀缺性,只是如何把这种影响力真正转化成收入,始终是另一道题。

SpaceXAI的特殊之处在于,它没有哪一张牌绝对领先,但几张牌已经开始互相喂养。Colossus提供算力,X提供实时信息、用户和分发,Cursor提供真实编程任务、工具调用轨迹和开发者反馈,Grok再把这些资源转化成API、订阅和Agent产品。模型进入X和Cursor之后产生的新反馈,又可以继续回到下一轮后训练。

随着Grok重新挤进第一牌桌,黄仁勋2025年的一段评价也被重新翻了出来。他当时认为,马斯克同时押注基础模型、自动驾驶和人形机器人,进入了AI最重要的三个方向,并因为掌握大量真实世界数据而处在“绝佳位置”。这个判断现在更容易理解了。

但拥有版图,不等于已经形成闭环。

特斯拉仍然是一家独立公司。自动驾驶、机器人、X和Grok之间究竟能够共享多少数据、模型和客户,还受到组织边界、隐私与监管的约束。SpaceXAI也没有Google Cloud、Microsoft Azure或者企业办公软件那样成熟的销售和交付渠道。

更现实的问题是,Grok在TerminalBench等长链条Agent测试中仍然落后。企业客户对于安全、稳定性、透明度以及品牌风险的顾虑,也没有因为一次榜单上升就自动消失。

从“最有性价比的第一梯队模型”到“最大的商业赢家”之间,仍然隔着可靠性、企业信任、渠道和真实采用率。

就像马斯克想让Grok拍完《奥德赛》一样,生成短片已经不是最难的事。真正难的是,别在返乡路上翻船。

*题图由AI生成。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杭州地产圈曝大瓜,疑招商区域总经理被抓,强奸未遂致女方脾脏破裂

杭州地产圈曝大瓜,疑招商区域总经理被抓,强奸未遂致女方脾脏破裂

180视角
2026-08-14 15:43:43
女子睡过很多男人,认为会影响运势,2024年和男人开房后,被杀死并抛尸

女子睡过很多男人,认为会影响运势,2024年和男人开房后,被杀死并抛尸

汉史趣闻
2026-08-14 11:06:43
伊朗换人后第一件事:找中国要账!4000亿协议翻出来:老账该清了

伊朗换人后第一件事:找中国要账!4000亿协议翻出来:老账该清了

落雪听梅a
2026-08-13 13:46:50
8月14日,人社部关于2026年调整退休人员养老金通知公布了吗?

8月14日,人社部关于2026年调整退休人员养老金通知公布了吗?

小彬说事
2026-08-14 11:21:38
国乒惨烈一夜!男单仅剩2人 男双止步8强 女单王牌被爆冷 女双止步8强

国乒惨烈一夜!男单仅剩2人 男双止步8强 女单王牌被爆冷 女双止步8强

颜小白的篮球梦
2026-08-14 06:58:50
《功夫女足》票务操作失误,公司致歉

《功夫女足》票务操作失误,公司致歉

界面新闻
2026-08-14 16:40:21
著名学前教育学者、华东师范大学教授刘晓东因病逝世

著名学前教育学者、华东师范大学教授刘晓东因病逝世

澎湃新闻
2026-08-14 10:04:26
李铁签字用的“监狱专用笔”有多特殊?看完终于懂了

李铁签字用的“监狱专用笔”有多特殊?看完终于懂了

铁窗家书
2026-08-09 14:15:34
麻烦大了!仅24小时,郭德纲再迎3大噩耗,被立案调查仅"开胃菜"

麻烦大了!仅24小时,郭德纲再迎3大噩耗,被立案调查仅"开胃菜"

社会日日鲜
2026-08-14 07:00:02
“穷加上美貌,就是灾难”,农村小学女生相貌惊艳,网友却不看好

“穷加上美貌,就是灾难”,农村小学女生相貌惊艳,网友却不看好

泽泽先生
2026-08-13 14:41:42
朱同志怒斥胖局长:你的肚子应该小一点!

朱同志怒斥胖局长:你的肚子应该小一点!

仕道
2026-08-14 12:21:03
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
儿科医生杨国辉去世,年仅40岁,曝骑行中突发心梗,履历非常优秀

儿科医生杨国辉去世,年仅40岁,曝骑行中突发心梗,履历非常优秀

180视角
2026-08-14 15:12:05
把门诊画成漫画,这位骨科医生成了医学界的“混子哥”

把门诊画成漫画,这位骨科医生成了医学界的“混子哥”

上海嘉定
2026-08-14 17:03:51
终于知道今年为啥又扫黑除恶了

终于知道今年为啥又扫黑除恶了

小鹿姐姐情感说
2026-08-14 01:50:59
德国下,印度上,法国主导的这个项目到底行不行?

德国下,印度上,法国主导的这个项目到底行不行?

新民周刊
2026-08-14 09:10:13
真的太过分!王水牛约会“马不停蹄”,女生哭诉:一夜过后,让她自行离开要约下一个

真的太过分!王水牛约会“马不停蹄”,女生哭诉:一夜过后,让她自行离开要约下一个

火山詩话
2026-08-14 07:35:53
内部人士揭秘:莱维特辞去白宫新闻秘书的真实原因,特朗普曾挽留

内部人士揭秘:莱维特辞去白宫新闻秘书的真实原因,特朗普曾挽留

全球直击
2026-08-14 08:50:33
一名美国王牌间谍在中国隐匿了30年,因在汶川地震中捐款百万,引来无数人争相为他赠送锦旗

一名美国王牌间谍在中国隐匿了30年,因在汶川地震中捐款百万,引来无数人争相为他赠送锦旗

人生录
2026-08-13 00:05:10
武汉“00后”女生和室友拼单请做饭阿姨:每月人均1000元,包括上门做饭和基础打扫,既省钱又健康;此前两个人点外卖一月花2700元

武汉“00后”女生和室友拼单请做饭阿姨:每月人均1000元,包括上门做饭和基础打扫,既省钱又健康;此前两个人点外卖一月花2700元

三湘都市报
2026-08-14 00:15:10
2026-08-14 17:19:00
AIX财经 incentive-icons
AIX财经
AI新时代,财经新观察。
102文章数 23225关注度
往期回顾 全部

科技要闻

苹果为中国训练自有大模型,阿里提供支持

头条要闻

老人被撞身亡肇事车仅有交强险 司机当庭称没能力赔偿

头条要闻

老人被撞身亡肇事车仅有交强险 司机当庭称没能力赔偿

体育要闻

离开雷霆后,威少再也没成为威少

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

黄仁勋正在加速AI泡沫破裂!

汽车要闻

越野/新能源/豪华全覆盖 成都车展重磅新车前瞻

态度原创

时尚
健康
家居
公开课
军事航空

这4种版型的牛仔裤,真的很好穿!

孩子高低肩,是不是脊柱侧弯了?!

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普下令美海军弃用电磁弹射系统 改回蒸汽弹射

无障碍浏览 进入关怀版