网易首页 > 网易号 > 正文 申请入驻

「纳米香蕉」LMArena两周500万投票,引爆10倍流量!谷歌、OpenAI扎堆打擂台

0
分享至

新智元报道

编辑:元宇

【新智元导读】8月,nano‑banana登顶LMArena文生图像榜单,带动LMArena社区流量暴增10倍,月活用户300万+。nano‑banana在LMArena启动盲测后,短短两周便吸引了超过500万次总投票,并单独赢得了250万+直接投票,创下历史最高参与度。自2023年推出以来,LMArena已成为谷歌、OpenAI等AI大厂扎堆厮杀的竞技场。

今年8月,一款名为「纳米香蕉」的神秘AI图像编辑器轻松登顶Image Edit Arena榜首,直接把LMArena8月份的平台流量拉爆:

流量暴增10倍,月活300万+。

该模型自在LMArena启动盲测以来,短短两周便吸引了超过500万次总投票,并单独赢得了250万+直接投票,创下历史最高参与度。

nano‑banana的神秘身份,也在LMArena社区引发广泛猜测。

在谷歌认领「纳米香蕉」,将其正式定名为Gemini 2.5 Flash Image之前,已不少网友猜到谷歌是Nano Banana的真正主人。

还有网友贴出了在LMArena上使用正版「纳米香蕉」的方法,该方法不仅免费,而且不需要登录。

不仅能让用户「近距离」接触各种最新模型,LMArena还为大模型比拼,提供了一个真实的「罗马竞技场」,它让谷歌、OpenAI等公司的最新模型,在这里真刀真枪对决,接受成千上万用户的检阅。

用户的投票和反馈,决定了这些大模型的排名,也为大模型厂商迭代模型,提供了真实的用例数据,使他们能够更加有的放矢地改进模型。

nano‑banana爆红,让LMArena流量狂涨10倍,据LMArena首席技术官Wei-Lin Chiang证实,该站月活跃用户已超过300万。

无论谷歌,还是LMArena都成为这场流量盛宴中的最大赢家。

从Chatbot Arena到LMArena

LMArena联合创始人Wei-Lin Chiang和Anastasios Angelopoulos

LMArena前身叫Chatbot Arena,最初起源于2023年伯克利的一项研究项目,后来更名为LMArena。

Chatbot Arena像一个用户社区评测中心,它改变了通过学科测试来评测AI技术的传统方式,将评价权交给了社区用户,并且采用匿名、众包的成对比较,来评估大模型。

用户还可以选择模型进行自我测试。

ChatGPT、Llama 1等大模型的发布,为Chatbot Arena的出现提供了一个契机。

因为,当时人们还没有一个评测大模型的有效方法,于是Chiang就与伯克利研究人员Anastasios Angelopoulos,以及Ion Stoica共同创办了Chatbot Arena,也就是后来的LMArena。

他们的想法,是做一个以社区为中心的公开的、基于网络的平台,邀请所有人来参与评测。

很快,Chatbot Arena就引起了许多关注,成千上万的人前来投票,他们就利用这些用户投票数据,整理出了第一版排行榜。

最初上榜的,多是一些开源模型,唯一商用模型只有Claude和GPT。

随着更多模型的不断加入,Chatbot Arena的关注度也越来越高。各AI大厂纷纷请求将自己产品排名,并试图登上这个排行榜的榜首。

Chatbot Arena的走红,也让众多科技公司将之视为AI技术的风向标,他们像华尔街交易员盯盘一样,密切关注着Chatbot Arena榜单的变化。

这一切都让Meta AI产品管理总监Joseph Spisak感到十分惊讶,他惊叹于几个学生竟能产生如此重大的影响力。

Chiang希望LMArena能够成为一个对所有人都开放可及的平台,希望更多的用户来测试这些模型,表达他们的看法和偏好,以此帮助社区以及模型提供方,能够更好地基于这些真实用例来评估AI。

正如Chiang所言,在LMArena社区中,最受欢迎、增长最快的模型,往往来自于真实场景中的用例。「纳米香蕉」就是最成功的例子之一。

匿名登场和盲测机制,让nano-banana在LMArena自然爆红,当时普通用户无法手动挑选nano-banana,只有在 Battle里随机遇到它,社区里大量帖子讨论「刷很多局才等到香蕉」的体验。

目前,Gemini 2.5 Flash Image成为LMArena的「双料冠军」,获得了Image Edit Arena、Text-to-Image两个榜单的第一名。

从LMArena排名上,还可以看出各个领域表现最佳的模型。

比如,在编码领域,Claude排名最佳。在创意领域,Gemini位居前列。

也许是Meta内部AI团队调整的缘故,Chiang并没有听到太多Llama 4的消息。但他认为Meta正在构建的「全模型」,也许代表着未来行业的一大趋势。

大模型厂商为何钟情「屠榜」?

OpenAI、谷歌、Anthorpic等大模型厂商,为什么都喜欢将它们的模型放到LMArena等排行榜上?

是为了建立品牌曝光度,还是获得用户反馈来改进他们的模型?

显然,曝光与背书,是一个最直观的短期效应。

LMArena是业内关注度最高的公开榜之一,累计投票已达数百万次。而且科技媒体也喜欢频繁引用LMArena的数据,这些都可以为大模型品牌带来显著的口碑与流量红利。

其次,是更贴近「真实使用」的用户反馈。

LMArena采用匿名、随机配对的投票方式,并用Elo计分,这样做减少了「品牌光环」「位置偏置」等主观影响,能真实反映用户对模型回答质量的评价。

Elo系统最初用于国际象棋计分,也是LMArena排行榜背后的核心机制。在该规则下,每个选手(或模型)都有一个实力分数(Elo 分),每场对战后,会根据结果和预期,更新双方的Elo分。

这让每次用户投票都成为一场对战,模型Elo分经过成千上万次对战收敛,排名就可以更真实地反映用户偏好。

此外,LMArena提供了一个跨厂商、跨开源/闭源的同台竞技舞台,这天然就会带来更高流量的曝光,也为用户提供了更丰富的选型信息。

正如Chiang所言,希望将LMArena打造成一个人人都能参与、都能表达自己观点的开放空间。

这里的一切都是社区机制来驱动,鼓励大家提问和投票,表达自己对不同模型的评价。

对于大模型厂商来说,LMArena提供了一个很好的「照镜子」的机会。

大模型厂商可以看清自己在所在领域的排行情况,以及获得LMArena根据社区反馈提供的报告和分析,详细评估自己模型的表现,对症下药提升模型能力。

需要新的LLM基准测试吗?

当所有模型,都非常接近基准测试了,还需要新的基准测试吗?

Chiang认为这一点是非常必要的。但是其中一个核心原则,是这些基准要扎根于真实世界用例。

比如,能够超越传统的基准测试,转向更贴近真实用户场景的基准测试,尤其是善于使用AI工具完成任务的专业人士所驱动的基准。

以LMArena最新推出的WebDev基准测试为例,用户可以用提示词让一个模型搭建网站。这种基准测试,可以更好地将AI技术与真实世界用例紧密相连,使其更快在实际应用场景落地。

针对MIT关于「大多数投资AI的公司都没有看到投资回报」的报告,Chiang认为这是一项很有意思的研究。

他认为该研究反映了「将AI与真实世界用例紧密相连尤为重要」,这也正是他要将LMArena平台扩展到更多行业的原因。

希望通过更多扎根于真实用例的基准测试,去弥合技术与实用场景的鸿沟,并为之提供可衡量的标准。

Chiang表示,LMArena的目标是利用平台数据来理解模型的局限性,保持数据研究流程的透明,并将数据发布出来,以此推动社区平台的持续建设。

对于大模型厂商和「用户观众」来说,这里是一个永不落幕的竞技场。

参考资料:

https://www.businessinsider.com/lmarena-cto-compare-ai-models-google-nano-banana-2025-9

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
突发!周星驰套现走人了!

突发!周星驰套现走人了!

财经要参
2026-10-09 07:05:48
76岁路都走不稳还开演唱会捞金,全网恶评如潮,他却扬言回馈粉丝

76岁路都走不稳还开演唱会捞金,全网恶评如潮,他却扬言回馈粉丝

黎兜兜
2026-10-09 14:08:09
制动系统厂家董事长发文:个别媒体牺牲中国品牌口碑获取流量,不敢恭维

制动系统厂家董事长发文:个别媒体牺牲中国品牌口碑获取流量,不敢恭维

蓬勃新闻
2026-10-09 15:03:12
0-2!斯瓦泰克爆冷!中网4强全出炉,对阵+赛程如下,郑钦文利好

0-2!斯瓦泰克爆冷!中网4强全出炉,对阵+赛程如下,郑钦文利好

大秦壁虎白话体育
2026-10-09 21:03:45
最新!湖南永州女干部事件持续发酵,保证书内容炸裂,多个细节被扒,果然有问题

最新!湖南永州女干部事件持续发酵,保证书内容炸裂,多个细节被扒,果然有问题

子非鱼人
2026-10-09 22:43:11
太过分了!浙江好心顾客心疼骑手打赏20元,骑手却在群里编造低俗语言调侃,引发众怒

太过分了!浙江好心顾客心疼骑手打赏20元,骑手却在群里编造低俗语言调侃,引发众怒

火山詩话
2026-10-09 12:03:30
悲催!天津42岁跑友半马冲线后离世,家属征集现场线索,遭网友抵触

悲催!天津42岁跑友半马冲线后离世,家属征集现场线索,遭网友抵触

火山詩话
2026-10-09 14:37:26
随着朱思冰1-4出局,WTT中国大满贯女单4强全部诞生:中日各2人

随着朱思冰1-4出局,WTT中国大满贯女单4强全部诞生:中日各2人

侧身凌空斩
2026-10-09 20:57:31
中国海警局新闻发言人发表谈话:正告菲方立即停止侵权挑衅和不实炒作

中国海警局新闻发言人发表谈话:正告菲方立即停止侵权挑衅和不实炒作

新京报
2026-10-08 23:34:06
江淮跌停,尊界翻车,华为回应为何如此傲慢?

江淮跌停,尊界翻车,华为回应为何如此傲慢?

凤眼论
2026-10-08 19:17:27
公安部多次提醒:卖掉旧手机,不只是丢自己隐私,孩子也会受牵连

公安部多次提醒:卖掉旧手机,不只是丢自己隐私,孩子也会受牵连

你在偷看谁
2026-10-08 19:57:01
454票通过反华决议!欧盟访华前欧洲议会放狠话:中国只听得懂实力的语言

454票通过反华决议!欧盟访华前欧洲议会放狠话:中国只听得懂实力的语言

观星赏月
2026-10-09 06:54:57
2026年诺贝尔和平奖重磅发布!

2026年诺贝尔和平奖重磅发布!

高分子材料科学
2026-10-09 19:59:04
7轮不败!中超:海港4-2浙江,王钰栋造点被队友罚丢,杨希送乌龙

7轮不败!中超:海港4-2浙江,王钰栋造点被队友罚丢,杨希送乌龙

乒烧泳球
2026-10-09 21:59:40
江淮汽车再次跌停,15.09万手封跌停!逻辑特别简单,刹车板无论如何都不能被踩断,不要拿“符合国标”说事,没有任何商量余地

江淮汽车再次跌停,15.09万手封跌停!逻辑特别简单,刹车板无论如何都不能被踩断,不要拿“符合国标”说事,没有任何商量余地

火山詩话
2026-10-09 13:13:01
湖南永州女商务局长被举报婚内出轨至少8人,本人回应:没有出轨,准备报警

湖南永州女商务局长被举报婚内出轨至少8人,本人回应:没有出轨,准备报警

新动察
2026-10-09 15:12:40
乘客欧先生拒不道歉,东航再发通报!此人已露面

乘客欧先生拒不道歉,东航再发通报!此人已露面

平老师666
2026-10-08 17:56:07
居民医保个人缴费连续三年不涨,2027年仍为400元

居民医保个人缴费连续三年不涨,2027年仍为400元

第一财经资讯
2026-10-09 16:22:08
一位生殖科大夫告诉我:试管婴儿,根本不是普通人想的那么简单!

一位生殖科大夫告诉我:试管婴儿,根本不是普通人想的那么简单!

千秋文化
2026-10-09 20:11:32
1:6局面出现,中国在联合国遭围攻,美国全程沉默,中方强势反击

1:6局面出现,中国在联合国遭围攻,美国全程沉默,中方强势反击

趣文说娱
2026-10-09 11:23:12
2026-10-10 01:47:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16385文章数 67153关注度
往期回顾 全部

科技要闻

华为小米手机同日涨价,最高涨1000元

头条要闻

七旬大伯在浙江买山景别墅养老 住进去后天天提心吊胆

头条要闻

七旬大伯在浙江买山景别墅养老 住进去后天天提心吊胆

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

时隔12年,公募基金运作办法修订

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

游戏
家居
亲子
手机
公开课

任天堂女总裁回应《GTA6》上NS2:这事得问R星

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

过重书包正在影响孩子的体态和视力

手机要闻

华为又涨价了!nova 16最高涨400元,花粉:扛不住了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版