网易首页 > 网易号 > 正文 申请入驻

阿里云发布通义千问 2.0,性能超 GPT-3.5,加速追赶 GPT-4 | 新闻

0
分享至

导读:10 月 31 日,阿里云正式发布千亿级参数大模型通义千问 2.0。在 10 个权威测评中,通义千问 2.0 综合性能超过 GPT-3.5,正在加速追赶 GPT-4。当天,通义千问 APP 在各大手机应用市场正式上线,所有人都可通过 APP 直接体验最新模型能力。

本文字数:1426,阅读时长大约: 2分钟

作者:阿里云


10 月 31 日,阿里云正式发布千亿级参数大模型通义千问 2.0。在 10 个权威测评中,通义千问 2.0 综合性能超过 GPT-3.5,正在加速追赶 GPT-4。当天,通义千问 APP 在各大手机应用市场正式上线,所有人都可通过 APP 直接体验最新模型能力。

过去 6 个月,通义千问 2.0 在性能上取得巨大飞跃,相比今年 4 月发布的 1.0 版本,通义千问 2.0 在复杂指令理解、文学创作、通用数学、知识记忆、幻觉抵御等能力上均有显著提升。目前,通义千问的综合性能已经超过 GPT-3.5,加速追赶 GPT-4。

图:通义千问2.0综合性能超过 GPT-3.5,正在加速追赶 GPT-4

在 MMLU、C-Eval、GSM8K、HumanEval、MATH 等 10 个主流 Benchmark 测评集上,通义千问 2.0 的得分整体超越 Meta 的 Llama-2-70B,相比 OpenAI 的 Chat-3.5 是九胜一负,相比 GPT-4 则是四胜六负,与 GPT-4 的差距进一步缩小。

中英文理解能力是大语言模型的基本功。英语任务方面,通义千问 2.0 在 MMLU 基准的得分是 82.5,仅次于 GPT-4,通过大幅增加参数量,通义千问 2.0 能更好地理解和处理复杂的语言结构和概念;中文任务方面,通义千问 2.0 以明显优势在 C-Eval 基准获得最高得分,这是由于模型在训练中学习了更多中文语料,进一步强化了中文理解和表达能力。

在数学推理、代码理解等领域,通义千问 2.0 进步明显。在推理基准测试 GSM8K 中,通义千问排名第二,展示了强大的计算和逻辑推理能力;在 HumanEval 测试中,通义千问得分紧跟 GPT-4 和 GPT-3.5,该测试主要衡量大模型理解和执行代码片段的能力,这一能力是大模型应用于编程辅助、自动代码修复等场景的基础。

图:通义千问 2.0 发布

通义千问更成熟了,也更好用了。通义千问 2.0 在指令遵循、工具使用、精细化创作等方面作了技术优化,能够更好地被下游应用场景集成。通义大模型官网上线了多模态和插件功能,支持图片输入、文档解析等细分任务。

与此同时,基于通义大模型训练的 8 大行业模型组团上线,它们分别是:

◈ 通义灵码:智能编码助手

◈ 通义智文:AI 阅读助手

◈ 通义听悟:工作学习 AI 助手

◈ 通义星尘:个性化角色创作平台

◈ 通义点金:智能投研助手

◈ 通义晓蜜:智能客服

◈ 通义仁心:个人专属健康助手

◈ 通义法睿:AI 法律顾问。

8 大行业模型面向当下最受欢迎的多个垂直场景,使用领域数据进行专门训练。用户可以在官网直接体验模型功能,开发者可以通过网页嵌入、API/SDK 调用等方式,将模型能力集成到自己的大模型应用和服务中。

图:通义大模型家族全面升级,8 大行业模型组团上线

截至 10 月,阿里云已与 60 多个行业头部伙伴进行深度合作,推动通义千问在办公、文旅、电力、政务、医保、交通、制造、金融、软件开发等领域的落地。

周靖人透露,阿里云计划近期开源通义千问 72B 版本,此前,阿里云已先后开源 7B 和 14B 版本模型,模型累计下载量超过 100 万。阿里云将持续支持千行百业的开发者基于通义千问开源模型进行模型和应用创新。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
克拉拉的健身之旅:从坚持到转变,塑造更好的自己

克拉拉的健身之旅:从坚持到转变,塑造更好的自己

云端书馆
2024-06-04 07:14:43
四川省目前还保留市中区的两个地级市,你知道是哪两个吗?

四川省目前还保留市中区的两个地级市,你知道是哪两个吗?

一口娱乐
2024-06-19 16:54:57
贝克汉姆12岁女儿拍化妆视频,引发争议,辣妹佯装斥责却很得意

贝克汉姆12岁女儿拍化妆视频,引发争议,辣妹佯装斥责却很得意

译言
2024-06-19 16:45:55
以色列竟要求黎巴嫩不要晚上袭击以色列,原因是以色列士兵要休息

以色列竟要求黎巴嫩不要晚上袭击以色列,原因是以色列士兵要休息

橘色数码
2024-06-18 08:33:26
他刚当市长就被老百姓指责,后来官至政治局常委,如今已经86岁了

他刚当市长就被老百姓指责,后来官至政治局常委,如今已经86岁了

李姐历史
2024-06-14 09:57:42
王曼昱逆袭?奥委会未邀请,陈梦女单资格无效?名记透露最新情况

王曼昱逆袭?奥委会未邀请,陈梦女单资格无效?名记透露最新情况

东球弟
2024-06-19 16:15:36
黄一鸣首谈与王思聪恋爱全过程!坦言支持女儿长大后继承王家财产

黄一鸣首谈与王思聪恋爱全过程!坦言支持女儿长大后继承王家财产

柠檬有娱乐
2024-06-19 16:21:54
重庆老板将少女藏地下室7年,使她怀孕5次,却被其妻子发现了

重庆老板将少女藏地下室7年,使她怀孕5次,却被其妻子发现了

星辰故事屋
2024-06-18 18:29:55
湃调查|冷藏车载8人窒息身亡背后:农闲时挤车打零工的大龄女工

湃调查|冷藏车载8人窒息身亡背后:农闲时挤车打零工的大龄女工

澎湃新闻
2024-06-19 08:54:37
河南的这场高温,逼疯了96万新能源车主,你猜是什么原因?

河南的这场高温,逼疯了96万新能源车主,你猜是什么原因?

娱乐圈的笔娱君
2024-06-19 18:24:15
如何看待普京访问朝鲜?网友:历史告诉俄罗斯,只有东方才是救星

如何看待普京访问朝鲜?网友:历史告诉俄罗斯,只有东方才是救星

大东北的小豆包
2024-06-19 14:46:39
山东泰山或因涉赌假球降级?知名媒体人解答

山东泰山或因涉赌假球降级?知名媒体人解答

姜大叔侃球
2024-06-19 14:28:17
延迟1小时上下班!致全体沈阳市民的一封信

延迟1小时上下班!致全体沈阳市民的一封信

鲁中晨报
2024-06-19 17:11:04
春晚一句台词识破潜伏间谍,去世23年的赵丽蓉,仍被官媒发文缅怀

春晚一句台词识破潜伏间谍,去世23年的赵丽蓉,仍被官媒发文缅怀

蜉蝣说
2024-06-18 22:52:26
河南冷藏车事故遇难者亲属:善后工作已完成

河南冷藏车事故遇难者亲属:善后工作已完成

鲁中晨报
2024-06-19 14:27:03
被炸怕了!250枚伊朗系火箭弹,突发爆炸山火,以色列10万人撤出

被炸怕了!250枚伊朗系火箭弹,突发爆炸山火,以色列10万人撤出

博览历史
2024-06-18 18:36:55
均分9.3!耻度大开的八人好戏!

均分9.3!耻度大开的八人好戏!

天天美剧吧
2024-06-18 19:35:44
上港跟队记者:奇塔迪尼没碰到手,当年踢泰山时武磊才冤啊

上港跟队记者:奇塔迪尼没碰到手,当年踢泰山时武磊才冤啊

足球大腕
2024-06-19 17:20:00
为了延长寿命,请铭记以下六条箴言

为了延长寿命,请铭记以下六条箴言

枫叶的枫1516
2024-06-18 09:55:03
黄一鸣押对宝了,王家不会亏待女儿!透露生孩子有和王思聪商量!

黄一鸣押对宝了,王家不会亏待女儿!透露生孩子有和王思聪商量!

娱乐团长
2024-06-17 20:51:58
2024-06-19 21:12:49
Linux
Linux
Linux 中国开源社区
8016文章数 73123关注度
往期回顾 全部

科技要闻

618观察:谁为高强度的低价竞争买单?

头条要闻

61岁马旦曰落马 曾因任职地违规购置办公楼被点名通报

头条要闻

61岁马旦曰落马 曾因任职地违规购置办公楼被点名通报

体育要闻

欧洲杯最大的混子,非他莫属

娱乐要闻

黄一鸣“杀疯了” 直播间卖大葱养孩子

财经要闻

深化科创板改革 证监会发布八条措施

汽车要闻

双肾格栅变化大/内饰焕新 新一代宝马X3官图发布

态度原创

家居
房产
数码
亲子
军事航空

家居要闻

自然开放 实现灵动可变空间

房产要闻

17.9亿!终于,有民企在三亚大手笔拿地了!周边房价10万+!

数码要闻

颂拓推出 Ocean 多功能户外潜水表:潜水轨迹记录,售价 6999 元

亲子要闻

哥哥姐姐的血脉压制能有多强?网友:我都33了,见到我姐还腿软!

军事要闻

菲律宾军方称中国海警登上菲方船只并缴枪 外交部回应

无障碍浏览 进入关怀版