这几天我看AI榜单看得有点勤。
几天前刚发过一次,当时还觉得,前几名已经挤得够厉害了。
结果再打开最新榜单,又变了。
Claude Opus 5最高档还是第一,63分。
Claude Fable 5,62分。
Grok 4.6和GPT-5.6 Sol都已经挤进61分这一档。
Kimi K3最高档到了60分,Qwen3.8这一代也已经做到58分左右。Artificial Analysis目前使用的 Intelligence Index v4.1.1,是把9类测试综合起来算的,并不是简单比一道题。
我盯着这几个数字看了一会儿。
突然觉得,现在AI榜单最好看的地方,已经不是“谁第一”了。
而是:第一名和后面的人,开始拉不开距离了。
![]()
如果放在一两年前,大家看AI新闻,经常会有一种感觉:
前面就是那几家公司。
后面的人想追,好像隔着一道挺高的墙。
现在这堵墙明显没以前那么高了。
Grok 4.6刚更新不久,就冲到61分。Artificial Analysis的测试里,它比上一代Grok 4.5直接涨了5分,而且已经和GPT-5.6 Sol处在同一档。
Kimi K3最高档也已经做到60分。
Qwen3.8和Claude Opus 5最高档之间,目前也就差5分,而且Qwen的使用成本明显低不少。
放在榜单上,就是几行数字。
但放到实际使用里,我觉得味道已经变了。
以前是:“到底哪个AI最厉害?”
现在更像:“这么多都挺厉害,我到底用哪个?”
这两个问题,看着差不多,其实完全不是一回事。
越来越有这种感觉。
刚开始接触这些工具的时候,我也会盯榜单。
第一名是谁?
哪个模型又超过谁?
国产模型排第几?
看得挺认真。
真用了一段时间以后,发现自己根本没那么忠诚。
写一段东西,这个顺手,我就用这个。
查资料,另一个结果更清楚,我就换过去。
碰到复杂一点的任务,哪个不容易中途跑偏,就让哪个干。
至于它到底排第一还是第三,有时候真的没那么重要。
说到底,我又不是给这些模型发奖杯。
我是想把手里的事情做完。
![]()
这让我想起以前买手机。
十几年前,大家特别爱看跑分。
新手机一发布,先看处理器,再看安兔兔多少分。
差几万分,都能讨论半天。
后来手机性能普遍够用了,很多人慢慢不看这些了。
真正影响选择的,反而变成:
电池耐不耐用。
系统顺不顺。
拍照怎么样。
价格合不合适。
AI现在可能也正在走到这个阶段。
当第一名63分,第二62分,后面61、60……
对普通用户来说,这几分到底能不能在日常使用里明显感觉出来?
未必。
但谁回答更稳定、谁更便宜、谁更懂中文、谁做自己那类工作更顺手,这些区别反而每天都能碰到。
所以我现在看AI榜单,会多看一眼,但不会再把第一名当成唯一答案。
还有一点,我觉得挺有意思。
以前一家模型更新,新闻可以热闹很久。
现在更新速度快到什么程度?
Artificial Analysis最近的更新记录里,8月份几乎隔几天就会出现新的模型评测或者版本变化。
今天61分。
过几天可能又有人62。
再过一个月,63分也未必还能待在第一。
这才是现在最有意思的地方:
“领先”这件事,正在变得越来越短。
以前领先一次,可能吃很久。
现在领先几个月,都算挺久了。
![]()
站在普通人的角度,我其实挺喜欢这种局面。
不是因为我特别关心哪家公司赢。
恰恰相反。
是因为它们越挤,我们越有得选。
一家不好用,可以换。
一家太贵,可以换。
写文章这个好用,做表格另一个好用,那就都留着。
没必要非要给自己选一个“唯一正确答案”。
以前我们总问:
“哪个AI最好?”
以后这个问题可能会越来越没意义。
更实际的问题反而是:
你今天要干什么,哪个工具最适合把这件事干完?
榜单当然还会有人看。
我也会看。
但现在再看到“某某登顶”“某某反超”,我已经没以前那么激动了。
因为第一名只有一个。
可真正好用的工具,完全可以有很多个。
对普通人来说,这可能比谁长期霸榜更重要。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.