网易首页 > 网易号 > 正文 申请入驻

全球首个科研LLM竞技场上线!23款顶尖模型火拼:o3夺冠,DeepSeek第四

0
分享至

新智元报道

编辑:海狸 好困

【新智元导读】最近,Ai2耶鲁NYU联合推出了一个科研版「Chatbot Arena」——SciArena。全球23款顶尖大模型火拼真实科研任务,OpenAI o3领跑全场,DeepSeek紧追Gemini挤入前四!不过从结果来看,要猜中科研人的偏好,自动评估系统远未及格。

如今,用AI大模型辅助写论文早已成为科研工作者的家常便饭。

ZIPDO 2025教育报告显示,AI已经无缝融入70%的研究实验室,并在五年内推动相关科研论文数量增长了150%。

AI在辅助科研的路上一路狂飙,但一个关键问题却长期悬而未解:

「大模型科研能力究竟怎么样?」

传统benchmark静态且片面,难以衡量科研任务所需的上下文理解与推理能力。

为此,Ai2联合耶鲁大学和纽约大学推出了科研界的Chatbot Arena——SciArena,正式开启科学智能的「擂台赛」时代!

论文链接:https://arxiv.org/pdf/2507.01001

目前,已有23个最前沿的大语言模型登上SciArena的擂台,涵盖OpenAI、Anthropic、DeepSeek、Google等巨头产品。

其中,OpenAI o3断崖式领先,坐上了科学任务的头把交椅,在所有科学领域都稳居第一,输出的论文讲解也更有技术含量。

其他模型在不同领域各有千秋:

例如Claude-4-Opus的医疗健康知识很强,而DeepSeek-R1-0528在自然科学表现抢眼。

值得一提的是,SciArena刚发布没多久就得到了Nature的特别报道,并被盛赞为「解释大模型知识结构的新窗口」。

下面我们就来看看,评估基础模型科研能力,SciArena究竟靠谱在哪里?

SciArena:科研AI新「试金石」

SciArena是首个专为科学文献任务量身定制的大模型「开放式评估平台」。

在这里,科研人员可以对不同基础模型处理科学文献任务的表现进行比较和投票。

团队引入了Chatbot Arena式的众包、匿名、双盲对决机制,用真实科研问题来验货大模型。

SciArena专门针对科学探究的复杂性与开放性进行了优化,解决通用基准测试在科研场景中「失效」的问题。

该平台主要由三大核心组件构成:

  • SciArena平台: 科研人员在此提交问题,并「同台对比」查看不同基础模型的回复,选出自己更偏好的输出。

  • 排行榜: 平台采用Elo评分系统对各大模型进行动态排名,从而提供一份实时更新的性能评估报告。

  • SciArena-Eval: 基于SciArena平台收集的人类偏好数据构建的元评估基准集,其核心目标是检验用模型来猜测人类偏好的准确性。


对决背后:评测机制大揭秘



从提问到投票:SciArena评估全流程

SciArena的工作流程包括检索论文、调用模型回复、用户评估三个环节。

与通用问答相比,科研问答最大的壁垒在于要以严谨的科学文献为依据。

为了确保检索信息的质量与相关性,团队改编了Allen Institute for AI的Scholar QA系统,搭建了一套先进的多阶段检索流水线。

该流水线包含查询分解、段落检索和结果重排序等多个步骤。

收到用户提交的问题后,平台启用流水线,检索相关的科学论文作为上下文。

随后,平台把上下文和用户的问题合在一起,同时发送给两个随机选择的基础模型。

两个模型各自生成内容详实、附带标准引文的长篇回复。

平台会统一处理两份回复,变成格式一致的标准化纯文本,以免用户「认出」模型的回答风格。

最后,用户对这两个纯文本输出进行评估,并投票选出自己偏好的答案。

值得注意的是,SciArena的注意力主要集中于可横向评估的「通用基础模型」。

至于OpenAI Deep Research等定制型智能体或闭源研究系统,则不在平台的考虑范畴内。

102位专家,13000票

要想评测准,数据必须信得过。

SciArena团队对数据的把关严格得令人发指。

在平台上线的前四个月里,他们收集了不同科研领域的102位专家的13000多次投票。

这102位专家绝非随意参与的路人,而是科研一线的在读研究生,人均手握两篇以上论文。

而且,所有的标注员都接受了一小时的线上培训,确保评价标准一致。

再加上盲评盲选机制,SciArena的每一条评估结果都有据可依。

在SciArena的高标准和严要求下,平台的标注数据自我一致性极高(加权科恩系数κ=0.91),标注者间一致性也达到了较高水平(κ=0.76)。

这13000多次投票为SciArena平台打下了值得信赖的评估基础。

最强AI,猜不透科研人的心

在SciArena平台上,研究团队基于元评估基本集SciArena-Eval,测试了「模型评模型」的自动评估方法:

给一个评估模型一条科研问题和两个模型的回答,让它猜哪个更可能被人类选中。

结果很扎心。

哪怕是表现最好的o3模型,准确率也只有65.1%,而像Gemini-2.5-Flash和LLaMA-4系列,几乎跟「掷硬币选答案」的准确率差不多。

对比一下通用领域,像AlpacaEval、WildChat这些基准的评估模型,准确率都能跑到70%以上,相比之下,科研任务显得难多了。

看来,「让模型理解科研人的偏好」并非易事。

不过也不是全无亮点。

加入了推理能力的模型,在判断答案优劣上普遍表现更好。

例如,o4-mini比GPT-4.1高出 2.9%,DeepSeek-R1也小胜自家模型DeepSeek-V3。

这说明,会推理的AI更懂科研问题的本质。

研究团队表示,SciArena-Eval未来有望成为科研AI评估的「新标准」。

它能帮我们看清AI到底有没有真正「读懂」科研人的心思。

参考资料:

https://allenai.org/blog/sciarena

https://arxiv.org/pdf/2507.01001

https://the-decoder.com/sciarena-lets-scientists-compare-llms-on-real-research-questions/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
月薪3000的时代又回来了,还有人不愿意相信?

月薪3000的时代又回来了,还有人不愿意相信?

流苏晚晴
2026-09-29 19:01:51
林锦岐34岁喜得爱女当场晕倒!弃官归金陵太戳人

林锦岐34岁喜得爱女当场晕倒!弃官归金陵太戳人

情感大头说说
2026-09-29 01:36:41
赌王三太陈婉珍一家烧烤过中秋!何超莲晒出8千呎豪宅

赌王三太陈婉珍一家烧烤过中秋!何超莲晒出8千呎豪宅

陈意小可爱
2026-09-30 06:04:50
亚运会:陈芋汐第4跳失误获第二!卢为女子10米台预赛排名第一

亚运会:陈芋汐第4跳失误获第二!卢为女子10米台预赛排名第一

乒烧泳球
2026-09-29 10:17:49
张继科罕见发声!句句为王楚钦撑腰,这一次真说到球迷心坎里了

张继科罕见发声!句句为王楚钦撑腰,这一次真说到球迷心坎里了

十点街球体育
2026-09-29 22:00:04
28张罕见的照片,天堂和地狱只隔一条街道

28张罕见的照片,天堂和地狱只隔一条街道

中国艺术家
2026-09-27 05:33:19
伊朗要求美国解释为何拒绝“7日停火计划”伊朗外长:已准备好重启战争,即便是世界末日之战

伊朗要求美国解释为何拒绝“7日停火计划”伊朗外长:已准备好重启战争,即便是世界末日之战

每日经济新闻
2026-09-29 13:18:58
曼城官方:对英超裁定感到惊讶失望,将进行上诉

曼城官方:对英超裁定感到惊讶失望,将进行上诉

体坛周报
2026-09-30 00:47:16
华为Mate90Pro Max深度测评!看完再决定要不要入手

华为Mate90Pro Max深度测评!看完再决定要不要入手

小兔子发现大事情
2026-09-29 12:24:04
夺冠仅3天,迎4大噩耗!全家为日本效力的张本智和,终究自食恶果

夺冠仅3天,迎4大噩耗!全家为日本效力的张本智和,终究自食恶果

潋滟晴方DAY
2026-09-28 02:57:22
50岁港姐与丈夫离婚相互指责,19岁女儿力挺母亲,揭父亲家暴内幕

50岁港姐与丈夫离婚相互指责,19岁女儿力挺母亲,揭父亲家暴内幕

临云史策
2026-09-29 23:58:40
轮到中国反击了,解放军正式出兵,菲败局已定,仁爱礁迎来大结局

轮到中国反击了,解放军正式出兵,菲败局已定,仁爱礁迎来大结局

通鉴史智
2026-09-29 09:30:57
终于想明白,各地为何被要求“老破小”加装电梯了,目的特别明确

终于想明白,各地为何被要求“老破小”加装电梯了,目的特别明确

民生格物
2026-09-28 12:42:11
柬埔寨反贪局披露中国籍电诈头目张建强资金链:涉2.5亿美元,通过本地兑换商洗钱

柬埔寨反贪局披露中国籍电诈头目张建强资金链:涉2.5亿美元,通过本地兑换商洗钱

扬子晚报
2026-09-29 12:45:19
放弃2.78亿续约!明夏签3.6亿!总资产超7亿历史唯一,想一人一城

放弃2.78亿续约!明夏签3.6亿!总资产超7亿历史唯一,想一人一城

你的篮球频道
2026-09-29 10:46:52
曼城旧将米尔斯:应连续9年每个赛季扣20分,不该直接降级

曼城旧将米尔斯:应连续9年每个赛季扣20分,不该直接降级

懂球帝
2026-09-29 18:13:43
科学家已确认,在南极几千米厚的冰盖下,还藏着“另一个世界”!

科学家已确认,在南极几千米厚的冰盖下,还藏着“另一个世界”!

抽象派大师
2026-09-30 04:53:56
悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

LULU生活家
2026-08-26 19:42:18
三份报价摆在桌上,他拒绝了利物浦选择留在皇马

三份报价摆在桌上,他拒绝了利物浦选择留在皇马

元气满分吖
2026-09-29 04:50:26
峰哥刚刚杀入黄金,6天亏了4.4万,高呼对不起家人!但8月回血了111万

峰哥刚刚杀入黄金,6天亏了4.4万,高呼对不起家人!但8月回血了111万

金石随笔
2026-09-29 12:26:50
2026-09-30 07:48:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16311文章数 67096关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

杭州女孩天天坐高铁去上海上班 通勤6小时每月花3000

头条要闻

杭州女孩天天坐高铁去上海上班 通勤6小时每月花3000

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

亲子
本地
家居
手机
公开课

亲子要闻

踮着脚,嘴里含着奶嘴,把花瓶好好的抱住。责任心这块,能成大事

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

消息称苹果计划削减5000个AppleCare岗位 AI将改造客服业务

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版