网易首页 > 网易号 > 正文 申请入驻

4比0横扫Grok 4,o3强势夺冠,首届大模型对抗赛结果出炉

0
分享至

机器之心报道

编辑:杜伟

GPT-5 问世的同时,o3 也在最后一战中封王了。

备受 AI 圈关注的首届谷歌 Kaggle AI Chess 大赛(也即大模型国际象棋对抗赛)迎来了最终赢家。

就在昨天,Grok 4 携手 OpenAI o3 进入了决赛。在机器之心的投票中,大家更倾向于 o3 战胜 Grok 4。

决赛结果如大家预期的一样,o3 以 4-0 横扫 Grok 4 夺得冠军

另外,在季军争夺战中,Gemini 2.5 Pro 以 3.5-0.5(三胜一和)强势击败了 o4-mini

下图为整个赛事所有选手的对阵表以及冠亚季军得主。

评论区很有意思,「Grok 4 很强,直到它遇上了 o3。」

随着今晨 GPT-5 的发布,大家很好奇它会有怎样的表现呢。

冠亚军争夺

o3 横扫 Grok 4

一直到半决赛,Grok 4 的势头都很猛,被认为是夺冠热门。就连马斯克都「装」了起来,称 Grok 4 玩国际象棋大材小用,它本身就没有针对象棋游戏进行优化。

尽管此前偶有不灵光的地方,但 xAI 的这款大模型始终展现出了碾压级别的棋力。比赛中,Grok 4 落子时近乎冷漠的风格,更让这个招招致命的「机械野兽」看起来不可战胜。

然而,Grok 4 的神话在决赛中轰然崩塌,以 0-4 完败于喋喋不休(chatty)的 o3。

当天,Grok 4 的棋风与往日「判若两人」,频频出现低级失误,而 o3 几乎全程保持冷酷的处刑姿态。

首局较量中,Grok 4 在开局阶段就毫无缘由地白丢了一象。少子劣势下,Grok 4 竟主动寻求兑子,这显然违反了所有棋类典籍中「劣势方应避免简化局面」的黄金法则。

随着接下来的连续失误,Grok 4 被 o3 干净利落地将死。首局失利

第二局上演了西西里防御的「毒兵变例」,这是国际象棋中一种极具攻击性与风险性的开局变例,属于西西里防御的分支,常见于纳依多夫变例中。其核心是黑方故意吃掉白方看似「无保护」的 b2 或 a2 兵(实际是陷阱),从而引发激烈的战术对抗。

如果说 b2 兵对人类棋手是剧毒之物,那么 a2 兵对人工智能而言简直是致命病毒。比赛中,黑棋竟走出 12...Qxa2??,无视白方 c3 马的守护贸然吃兵。此后o3 轻松赢得第二局的胜利

而到了 Grok 4 执白的第三局,本赛事首次出现 AI 采用西西里防御的马罗兹结构。凭借稳健的盘面,Grok 4 似乎要重拾王者风范。难道前两局的溃败只是戏耍对手吗?显然不是。

当白棋走出 11.Nd5?? 并白送一马时,所有幻想随之破灭。紧接着 Grok 4 又接连葬送皇后、车象易位权,最终在第三局满盘皆输

到了决胜局,两个大模型贡献出了系列赛最胶着的一战,甚至一度轮到 o3 自毁长城,它早早因失误白送皇后,局面陷入到了绝境。

但正如解说嘉宾、国际象棋大师中村光所指出的,盘面仍暗藏玄机。此后,o3 触底反弹,与先前的致命失误形成鲜明对比,凭借精妙战术夺回后手。

比赛最终演变为 o3 多一兵的残局,理论上仍可成和。不过,正如此前 Grok 4 手握车兵却无法完成将死所暴露的缺陷,它在残局阶段显然存在致命短板。

相反,o3 展现出更精准的终盘理解力,步步为营完成升变,最终以教科书般的将杀为这场对决画上句号。

随着第四局的胜出,o3 成为首届大模型国际象棋对抗赛的冠军,Grok 4 只能屈居亚军。

Gemini 2.5 Pro 摘得季军

谷歌总算「没白来」

季军争夺战在谷歌 Gemini 2.5 Pro 与 OpenAI o4-mini 之间展开,虽然不像决赛结果那样悬殊,却也难称得上称势均力敌。凭借三胜一和的战绩,Gemini 最终摘得铜牌。

不过,Gemini 的统治级表现背后,是全程混乱不堪的对局质量,与冠军 o3 行云流水的棋风相差甚远。首局,Gemini 还能够组织起像样的攻势,让人误以为这个 AI「胸有成竹」。

然而,第三局的平局才真正暴露出这场季军战的本质 ——双方几乎都在梦游,整场对局充斥着业余级的失误

这局棋的胜率曲线如同过山车般剧烈波动,双方频频「互送大礼」,连最简单的胜势都无法把握。

完整对局形势如下所示。尽管这场充满争议的平局暴露出了 Gemini 的不足,但它的整体表现已足够亮眼。

最终,凭借另外三局的胜利,Gemini 2.5 Pro 成功锁定季军席位,不至于让谷歌这个赛事主办方颗粒无收。未来,人们更期待看到谷歌如何利用此次赛事数据来优化其 AI 系统。

原文链接:https://www.chess.com/news/view/kaggle-game-arena-chess-2025-day-3

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
突发心梗,吃丹参滴丸有用吗?医生:这2种药才是心梗急救药!

突发心梗,吃丹参滴丸有用吗?医生:这2种药才是心梗急救药!

健康科普365
2026-03-26 09:57:24
伊朗重要人事任命,释放强烈信号!

伊朗重要人事任命,释放强烈信号!

斐君观点
2026-03-25 21:08:16
特朗普坚称正在与伊朗谈判:伊朗不敢认,其领导人“害怕被自己人干掉,也害怕被美国干掉”,美国在伊朗赢麻了

特朗普坚称正在与伊朗谈判:伊朗不敢认,其领导人“害怕被自己人干掉,也害怕被美国干掉”,美国在伊朗赢麻了

极目新闻
2026-03-26 08:57:45
张雪峰的财产几个亿,竟然没买车,天天吃外卖,生活简朴到极致

张雪峰的财产几个亿,竟然没买车,天天吃外卖,生活简朴到极致

魔都姐姐杂谈
2026-03-25 15:59:12
张雪峰去世真相!网友:偌大的公司靠他个人ip养活,早死是必然的

张雪峰去世真相!网友:偌大的公司靠他个人ip养活,早死是必然的

火山詩话
2026-03-25 09:18:58
张雪峰奶奶近况令人担忧,4年内子孙相继离世,不设追思会瞒着她

张雪峰奶奶近况令人担忧,4年内子孙相继离世,不设追思会瞒着她

古希腊掌管松饼的神
2026-03-26 11:29:25
伊朗两名高级将领殒命,巴盖里家族再添亡魂,强硬派折损惨重

伊朗两名高级将领殒命,巴盖里家族再添亡魂,强硬派折损惨重

老马拉车莫少装
2026-03-26 00:02:39
“中园石化”被立案调查

“中园石化”被立案调查

每日经济新闻
2026-03-25 11:13:18
于东来:30岁开始吃药,CT拍了上百次,身体出什么问题都不足为奇,哪天说没就没了

于东来:30岁开始吃药,CT拍了上百次,身体出什么问题都不足为奇,哪天说没就没了

每日经济新闻
2026-03-25 23:58:31
热搜上63万人破防的“奥特曼蛋糕”事件:有毒父母,逼疯中国孩子

热搜上63万人破防的“奥特曼蛋糕”事件:有毒父母,逼疯中国孩子

小椰子专栏
2026-03-25 13:00:11
中国、俄罗斯、伊朗等123票赞成,美国、以色列等3票反对,联合国认定:最严重反人类罪!英法德日等52国投弃权票

中国、俄罗斯、伊朗等123票赞成,美国、以色列等3票反对,联合国认定:最严重反人类罪!英法德日等52国投弃权票

每日经济新闻
2026-03-26 13:25:09
我想过Sora会死,但没想到这么快。

我想过Sora会死,但没想到这么快。

差评XPIN
2026-03-26 00:04:51
经济学历巴曙松被带走调查

经济学历巴曙松被带走调查

地产微资讯
2026-03-25 20:49:47
伊朗议长和外长被移出美以清除名单,“时限4到5天”!专家:若达成协议最慌的是以色列!特朗普:油价涨、股市跌,我无所谓

伊朗议长和外长被移出美以清除名单,“时限4到5天”!专家:若达成协议最慌的是以色列!特朗普:油价涨、股市跌,我无所谓

每日经济新闻
2026-03-26 12:20:14
美方提“15点计划”,伊朗称“又一个谎言”,美国“一边准备谈判一边握拳”

美方提“15点计划”,伊朗称“又一个谎言”,美国“一边准备谈判一边握拳”

环球网资讯
2026-03-26 06:58:33
4个LV包都是假的!女子送检后傻眼:全在专柜买的啊,最新回应

4个LV包都是假的!女子送检后傻眼:全在专柜买的啊,最新回应

半岛晨报
2026-03-25 15:30:03
女子空置房2个月用水1961吨,费用近1.2万元,“水管封死水表仍走字”,水务公司拒回应

女子空置房2个月用水1961吨,费用近1.2万元,“水管封死水表仍走字”,水务公司拒回应

观威海
2026-03-26 10:39:05
4月1日医保7号令落地!1965-1985年出生的,这6件事务必抓紧办

4月1日医保7号令落地!1965-1985年出生的,这6件事务必抓紧办

混沌录
2026-03-25 15:50:11
比国足还惨!意大利已12年未踢世界杯,仅剩33岁维拉蒂踢过世界杯

比国足还惨!意大利已12年未踢世界杯,仅剩33岁维拉蒂踢过世界杯

小金体坛大视野
2026-03-26 11:16:02
张雪峰员工:办公室已拆掉红色锦旗,员工彻夜难眠,家长电话打爆

张雪峰员工:办公室已拆掉红色锦旗,员工彻夜难眠,家长电话打爆

每日人物
2026-03-26 13:34:51
2026-03-26 14:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
12603文章数 142593关注度
往期回顾 全部

游戏要闻

《街霸6》导演为DLC剧情道歉 兄妹变恋人是表述误导

头条要闻

伊朗议长和外长暂被移出美以清除名单 时限4到5天

头条要闻

伊朗议长和外长暂被移出美以清除名单 时限4到5天

体育要闻

35岁替补门将,凭什么入选英格兰队?

娱乐要闻

张雪峰家人首发声 不设追思会丧事从简

财经要闻

黄仁勋:芯片公司的时代已经结束了

科技要闻

Meta高管狂分百亿期权,700名员工却下岗

汽车要闻

一汽奥迪A6L e-tron开启预售 CLTC最大续航815km

态度原创

艺术
房产
教育
时尚
军事航空

艺术要闻

哪一座桥不是风景?

房产要闻

质价比标杆!三亚首创浮岛全景舱亮相,还得是万科!

教育要闻

2027届注意:暑期实习=秋招通行证,错过等一年

2026年了,最好看的还是“这件针织”!

军事要闻

担心特朗普突然停战 以总理下令48小时尽力摧毁伊设施

无障碍浏览 进入关怀版