网易首页 > 网易号 > 正文 申请入驻

中文大模型测评基准SuperCLUE:商汤「日日新5.0」文科能力领跑

0
分享至

日前,中文大模型测评基准SuperCLUE发布最新榜单,对商汤科技全新升级「日日新SenseNova5.0」大模型进行了全方位综合性测评,结果显示在SuperCLUE综合基准上,日日新5.0表现不俗,以总分80.03分的优异成绩刷新国内最好成绩,并在中文综合成绩上超过GPT-4-Turbo-0125。

SuperCLUE是由创立于2019年的CLUE学术社区最新发布的中文通用大模型综合性评测基准,是被行业广泛认可的AI大模型权威评测榜单。以下评测报告转载自SuperCLUE官方发布报道。

4月23日,商汤科技正式发布全新大模型日日新5.0(SenseChatV5),采用混合专家架构(MoE),参数量高达6000亿,支持200K的上下文窗口。据官方披露,SenseChatV5具备更强的知识、数学、推理及代码能力,综合性能全面对标GPT-4Turbo。

SenseChatV5体验地址:https://platform.sensenova.cn/home

那么,SenseChatV5在SuperCLUE中文基准上的表现如何?与国内外代表性大模型相比处于什么位置?在各项基础能力上如计算推理、长文本、代码生成、生成创作上会有怎样的表现?

SuperCLUE团队对SenseChatV5在SuperCLUE通用大模型综合性中文测评基准上,进行了全方位综合性测评。

测评环境

参考标准:SuperCLUE综合性测评标准

评测模型:SenseChatV5(官方于5月11日提供的内测API版本)

评测集:SuperCLUE综合性测评基准4月评测集,2194道多轮简答题,包括计算、逻辑推理、代码、长文本在内的基础十大任务。

模型GenerationConfig配置:

  • temperature=0.01
  • repetition_penalty=1.0
  • top_p=0.8
  • max_new_tokens=2048
  • stream=false

测评方法:

本次测评为自动化评测,具体评测方案可点击查阅SuperCLUE综合性测评标准。本次测评经过人工抽样校验。

先说结论

结论1:在SuperCLUE综合基准上,SenseChatV5表现不俗,以总分80.03分的优异成绩刷新国内最好成绩,并且在中文综合成绩上超过GPT-4-Turbo-0125有0.9分。

结论2:在本次测评中,理科任务上SenseChatV5取得国内最好成绩,较GPT-4-Turbo-0125低4.35分,还有一定提升空间;文科任务上SenseChatV5表现十分出色,以82.20分取得国内外最高分。

结论3:在本次测评中,SenseChatV5在各项能力上表现较为均衡,尤其在长文本、生成创作、角色扮演、安全能力、工具使用上处于全球领先位置,适用于智能体、内容创作、长程对话等应用场景。代码能力还有一定提升空间。

对比模型数据来源:

SuperCLUE,2024年4月30日

以下是我们从定量和定性两个角度对模型进行的测评分析。

测评分析

1定量分析

在SuperCLUE测评中,SenseChatV5总体表现如下:

SenseChatV5总体表现

注:对比模型数据均来源于SuperCLUE,SenseChatV5和Yi-Large取自2024年5月11日,其余所有模型取自2024年4月30日。由于部分模型分数较为接近,为了减少问题波动对排名的影响,本次测评将相距0.25分区间的模型定义为并列,以上排序不代表实际排名。

在SuperCLUE通用综合测评基准上,SenseChatV5取得80.03分,表现出色,刷新国内大模型最好成绩。并且,SenseChatV5在中文综合能力上较GPT-4-Turbo-0125高0.9分。

SenseChatV5在理科任务上的表现

对比模型数据来源:SuperCLUE

SenseChatV5在理科任务上表现不俗,取得76.78分,国内模型中排名第一,较GPT-4-Turbo-0125低4.35分,还有一定提升空间。其中,计算(80.6)、逻辑推理(73.8)、工具使用(80.8)均刷新国内最好成绩;在代码能力上还有一定优化空间。

SenseChatV5在文科任务上的表现

对比模型数据来源:SuperCLUE

SenseChatV5在文科任务上表现出色,取得82.20的高分,国内外模型中排名第一,较GPT-4-Turbo-0125高4.40分。其中,知识百科(82.4)、长文本(79.2)、角色扮演(80.4)、语义理解(81.6)、生成创作(79.4)、传统安全(90.2)均刷新国内最好成绩;

对比数据来源:SuperCLUE,2024年4月30日

将SenseChatV5与国内大模型平均得分对比,我们可以发现,SenseChatV5在所有能力上均高于平均线,展现出较均衡的综合能力。尤其在计算(+16.15)、逻辑推理(+18.89)、代码(+19.06)、长文本(+21.16)能力上远高出平均线15分以上。

SenseChatV5与国外代表模型对比

将SenseChatV5与国外代表大模型对比,SenseChatV5在文科类中文任务上好于国外大模型,尤其在长文本、生成创作能力较为领先。在理科如计算、逻辑推理、代码能力上与GPT-4-Turbo-0125还有一定提升空间。

小结:

从评测结果我们发现,SenseChatV5综合能力上表现不俗,在总分上刷新了国内外最好成绩,其中文科任务上有超过GPT-4Turbo的表现,理科任务上刷新国内最好成绩,与GPT-4Turbo还有一定距离。

2定性分析

通过一些典型示例,对比定性分析SenseChatV5的特点。

(建议:在电脑端查看获得更好体验)

示例1:长文本

示例2:生成创作

示例3:逻辑推理

模型技术特点

据官方介绍,SenseChatV5模型能力显著提升,其背后是训练数据的全面升级与训练方法的有效提升。

在数据方面,SenseChatV5采用了新一代数据生产管线,生产了10Ttokens的高质量训练数据。通过多个模型进行数据的过滤和提炼,显著提升了预料质量和信息密度;基于精细聚类的均衡采样确保对世界知识覆盖的完整性。同时,SenseChatV5还大规模采用了思维型的合成数据(数千亿tokens量级),这对于模型在逻辑推理、数学和编程等方面的能力提升起到了关键作用。

SenseChatV5采用了自研的多阶段训练链路,包括三阶段预训练、双阶段SFT和在线RLHF。通过在每个阶段设定更加清晰聚焦的目标,实现更敏捷的调优,也避免了不同目标之间的相互干扰。其中在预训练阶段,分阶段培养模型的基础语言和知识能力、长文建模能力、以及复杂逻辑推理能力(规模化采用合成数据);在SFT阶段,把任务指令遵循和对话体验优化分解到双阶段进行;在RLHF阶段,采用统一的多维度奖励模型和动态系统提示词对多维度偏好进行打分,从而更好地实现模型在多个维度和人类期望对齐。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
WTT瑞典大满贯:男单大冷门!日本世界冠军1:3出局,张本智和3:0

WTT瑞典大满贯:男单大冷门!日本世界冠军1:3出局,张本智和3:0

国乒二三事
2026-08-13 16:50:51
美财长天塌了,中国7800亿美债换成人民币结算,美这哑巴亏吃定了

美财长天塌了,中国7800亿美债换成人民币结算,美这哑巴亏吃定了

心灵得以滋养
2026-08-13 10:32:18
中方向世界通告!台海爆发战事,任何国家出兵,等同侵略中国领土

中方向世界通告!台海爆发战事,任何国家出兵,等同侵略中国领土

共工之锚
2026-08-13 00:11:53
与房东矛盾激化?茉莉奶白伦敦一门店被砸

与房东矛盾激化?茉莉奶白伦敦一门店被砸

观察者网
2026-08-13 15:11:04
蓝色小药片的“惊天反转”:明里让男人“雄起”,暗中将肿瘤“去势”?

蓝色小药片的“惊天反转”:明里让男人“雄起”,暗中将肿瘤“去势”?

一节生姜
2026-08-13 07:53:27
浙江省博物馆就长征版画错误致歉:已第一时间将问题展品撤架,修订错误内容,目前已重新布展上架

浙江省博物馆就长征版画错误致歉:已第一时间将问题展品撤架,修订错误内容,目前已重新布展上架

扬子晚报
2026-08-13 17:14:55
烧掉近千亿美元仅撑10天,美国不愿再救?日媒哀叹:日本再次战败

烧掉近千亿美元仅撑10天,美国不愿再救?日媒哀叹:日本再次战败

情动则心痛就
2026-08-13 11:24:00
三体公司原CEO投毒案细节披露:一边毒杀老板,一边长期毒害多名同事,零口供仍难逃死刑

三体公司原CEO投毒案细节披露:一边毒杀老板,一边长期毒害多名同事,零口供仍难逃死刑

红星新闻
2026-08-13 17:21:13
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
张学良儿子张闾琳辞世:9岁赴美,娶陈济棠侄女,所生两子皆成才

张学良儿子张闾琳辞世:9岁赴美,娶陈济棠侄女,所生两子皆成才

浩渺青史
2026-08-02 21:40:02
弟弟举报哥哥冒用自己身份上大学,最新发声:从来没有想过报复哥哥,也没有针对他,有想过如果举报会毁了他,但先救自己的心更强烈

弟弟举报哥哥冒用自己身份上大学,最新发声:从来没有想过报复哥哥,也没有针对他,有想过如果举报会毁了他,但先救自己的心更强烈

大风新闻
2026-08-13 15:00:10
宜昌市教育局无权宣布“进入战时状态”!

宜昌市教育局无权宣布“进入战时状态”!

李万卿
2026-08-13 10:05:16
好友证实:陈盈洁病逝

好友证实:陈盈洁病逝

南方都市报
2026-08-13 11:29:41
林肯号上的5000人正在崩溃:7死斗殴、食物配给、跳海频发,美军为何装聋作哑?

林肯号上的5000人正在崩溃:7死斗殴、食物配给、跳海频发,美军为何装聋作哑?

新姐看世界
2026-08-13 15:09:27
日方这回尴尬了!中国运动员出征日本自带食材,连水都不用当地的

日方这回尴尬了!中国运动员出征日本自带食材,连水都不用当地的

乌克兰小静
2026-08-13 02:11:10
一夜之间,本科、硕士、博士全部撤销,户口注销:第一步就错了

一夜之间,本科、硕士、博士全部撤销,户口注销:第一步就错了

大鱼简科
2026-08-13 09:45:48
普京大动作:一边释放在俄关押4年多的前美军陆战队员,一边向日本“亮肌肉”

普京大动作:一边释放在俄关押4年多的前美军陆战队员,一边向日本“亮肌肉”

红星新闻
2026-08-13 15:44:09
篡改红歌已立案,郭德纲一觉醒来大祸临头,事做太绝了杨议没说错

篡改红歌已立案,郭德纲一觉醒来大祸临头,事做太绝了杨议没说错

龙隐天下
2026-08-13 14:36:13
文强被枪决16年后,他的儿子文伽昊沦为月薪3000的普通打工者,这样的结局令人感慨不已

文强被枪决16年后,他的儿子文伽昊沦为月薪3000的普通打工者,这样的结局令人感慨不已

人生录
2026-08-10 00:05:13
雷霆就威少退役发布声明引发球迷不满:连一张海报都舍不得做

雷霆就威少退役发布声明引发球迷不满:连一张海报都舍不得做

懂球帝
2026-08-13 09:15:04
2026-08-13 19:16:49
产业家
产业家
产业互联网第一媒体
1202文章数 1341关注度
往期回顾 全部

科技要闻

DeepSeek V4 Pro更新:性价比炸裂 仍需打磨

头条要闻

台媒:岛内出现有利于统一的三个变化

头条要闻

台媒:岛内出现有利于统一的三个变化

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

试了奇瑞捷豹路虎神行者8,才知道它的i-ATS有多强?

态度原创

游戏
本地
手机
时尚
公开课

《终末地》上架Steam!锁国区 上线日期待定

本地新闻

黄州一夜,苏轼写给普通人的月光

手机要闻

iQOO Neo11至尊版手机官宣行业首发天玑9500M处理器

换季搭配,怎么能少了牛仔外套?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版