1. 根据《中文大模型基准测评2024年度4月报告》(superclue发布):
- baichuan3:在国内大模型中排名第一,其文科、理科能力较为均衡。在知识百科能力上以82分的成绩超越了GPT-4-turbo,在逻辑推理能力上也力压一众国内大模型拔得头筹,在计算、代码、工具使用能力上表现不俗,均排名国内前三。可应用的场景相对广泛,尤其在专业技能类的任务上表现优异,适用于数学推理、数据分析、信息处理、智能客服/语音助手以及任务拆解规划等场景,也可应用于教育、医疗、金融等垂直行业。
- 智谱glm-4:在该次测评中表现出色,位列国内大模型前列。智谱AI在数据和算法方面有一定优势,其模型能够较好地处理各种复杂的语言任务。
- 通义千问2.1:具有较强的文本生成能力,可以应用于自然语言文本的生成和创作,如自动摘要生成、文档自动化生成、创意文案生成等,为用户提供高效和智能的文本生成和创作辅助工具。
- 文心一言4.0:针对中文进行了优化,能够深刻理解中文特色和语境,捕捉语言中的微妙差异,提供较为精准的中文处理服务。
- moonshot(kimi):在处理长文本内容方面具有一定优势,能很好地理解和处理长篇文档、会议纪要等。
2. 根据智源研究院旗下的 flageval 大模型评测平台(2024 年 6 月):
- 在有标准答案的“客观评测”中,**doubao-pro(豆包大模型)**以75.96分排名第二,同时也是得分最高的国产大模型。豆包大模型的数学能力、知识运用、任务解决等多项能力在客观评测和主观评测中都有着出色表现,其中,知识运用和数学能力得分排名客观评测第一、主观评测前三,任务解决测试得分在主客观评测中均排名前三。
3. 根据中国信息通信研究院大模型安全基准测试 aisafetybench2024 年 Q1:
- 360 智脑综合排名第一。360 智脑在安全可用评分和安全评分两个方面表现良好,不仅具备较强的安全意识,还能更好回答安全问题,在安全性能方面优势很大。360 集团在网络安全领域深耕多年,拥有的安全大数据规模全球领先,其自研的认知型通用大模型在中文通用大模型基准评测等多个第三方评测中位列国产大模型能力第一梯队。
4. 其他排名参考:
- 科大讯飞星火认知大模型:采用了先进的深度学习技术和算法,拥有文本生成、语言理解、知识问答、逻辑推理、数学能力、代码能力以及多模交互等七大核心能力,在多个方面都能够实现卓越的表现,显著提升了人工智能的认知和交互水平。
- 商汤日日新大模型:在长文本、生成创作、角色扮演、安全能力、工具使用等方面处于全球领先位置,采用混合专家架构,参数量高达6000亿,支持200k的上下文窗口。
- 华为盘古 NLP 大模型:拥有超过2亿个参数,是目前最大的中文预训练语言模型之一,在处理中文文本时具有出色的性能,支持多种自然语言处理任务,如文本分类、语言模型、文本生成等。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.