网易首页 > 网易号 > 正文 申请入驻

国内最大MoE开源大模型来了,还基于此搞出个火遍港台的AI聊天应用

0
分享至

机器之心发布

机器之心编辑部

元象 XVERSE 发布中国最大 MoE 开源模型:XVERSE-MoE-A36B,加速 AI 应用低成本部署,将国产开源提升至国际领先水平。

该模型总参数 255B,激活参数 36B,达到 100B 模型性能的「跨级」跃升,同时训练时间减少 30%,推理性能提升 100%,使每 token 成本大幅下降。

元象「高性能全家桶」系列全部开源,无条件免费商用,让海量中小企业、研究者和开发者能按需选择。

MoE(Mixture of Experts)是业界最前沿的混合专家模型架构 ,将多个细分领域的专家模型组合成一个超级模型,打破了传统扩展定律(Scaling Law)的局限,可在扩大模型规模时,不显著增加训练和推理的计算成本,保持模型性能最大化。出于这个原因,行业前沿模型包括谷歌 Gemini-1.5、OpenAI 的 GPT-4 、马斯克旗下 xAI 公司的 Grok 等大模型都使用了 MoE。

在多个权威评测中,元象 MoE 效果大幅超越多个同类模型,包括国内千亿 MoE 模型 Skywork-MoE、传统 MoE 霸主 Mixtral-8x22B 以及 3140 亿参数的 MoE 开源模型 Grok-1-A86B 等。

免费下载大模型

  • Hugging Face:https://huggingface.co/xverse/XVERSE-MoE-A36B
  • 魔搭:https://modelscope.cn/models/xverse/XVERSE-MoE-A36B
  • Github:https://github.com/xverse-ai/XVERSE-MoE-A36B
  • 官网:chat.xverse.cn

落地应用好且省 登顶港台娱乐应用榜

元象此次开源,不仅填补国内空白,也在商业应用上更进一步。

元象基于 MoE 模型自主研发的 AI 角色扮演与互动网文 APP Saylo,通过逼真的 AI 角色扮演和有趣的开放剧情,火遍港台,下载量在中国台湾和香港娱乐榜分别位列第一和第三

MoE 训练范式具有「更高性能、更低成本」优势,元象在通用预训练基础上,使用海量剧本数据「继续预训练」(Continue Pre-training),并与传统 SFT(监督微调)或 RLHF(基于人类反馈的强化学习)不同,采用了大规模语料知识注入,让模型既保持了强大的通用语言理解能力,又大幅提升「剧本」这一特定应用领域的表现。

高性能「开源标杆」

元象是国内领先的 AI 与 3D 公司,秉持「通用人工智能 AGI」信仰,持续打造「高性能开源全家桶」,不仅填补国产开源空白,更将其推向了国际领先水平。

2023 年 11 月,此前国内大部分开源参数多在 7B 到 13B,而行业共识是模型达到 50 到 60B 参数门槛,大模型才能「智能涌现」,生态亟需「大」模型时,元象率先开源了 XVERSE-65B,是当时中国最大参数开源

2024 年 1 月,元象又开源全球最长上下文窗口大模型,支持输入 25 万汉字,还附手把手训练教程,让大模型应用一举进入「长文本时代」。

此次国内最大参数 MoE 开源,又是给生态贡献了一个助推低成本 AI 应用利器。

引领文娱应用

借助在 AI 和 3D 领域的客户积累,元象也迅速将大模型推向商用。

2023 年 11 月,元象成为全国最早一批、广东省前五获得《生成式人工智能服务管理暂行办法》国家备案的大模型,具备向全社会开放的产品能力。

而在更早的 10 月,元象与腾讯音乐联合推出 lyraXVERSE 加速大模型,并借助该技术全面升级音乐助手「AI 小琴」的问答、聊天与创作能力,让她情商与智商双高,为用户提供个性化、更深入、陪伴感十足的音乐互动体验。

元象大模型陆续与 QQ 音乐、虎牙直播、全民 K 歌、腾讯云等深度合作与应用探索,为文化、娱乐、旅游、金融领域打造创新领先的用户体验。

MoE 技术自研与创新

MoE 是目前业界最前沿的模型框架,由于技术较新,国内开源模型或学术研究尚未普及。元象自研 MoE 的高效训练和推理框架,并持续推动技术创新。

2024 年 4 月推出的 XVERSE-MoE-A4.2B 中,元象推动MoE 专家架构革新。与传统 MoE(如 Mixtral 8x7B)将每个专家大小等同于标准 FFN 不同,元象采用更细粒度的专家设计,每个专家大小仅为标准 FFN 的四分之一,提高了模型灵活性与性能;还将专家分为共享专家(Shared Expert)和非共享专家(Non-shared Expert)两类。共享专家在计算过程中始终保持激活状态,而非共享专家则根据需要选择性激活。这种设计有利于将通用知识压缩至共享专家参数中,减少非共享专家参数间的知识冗余。

此次推出 XVERSE-MoE-A36B,继续在 MoE 效率和效果方面进行技术创新。

(1)效率方面

MoE 架构与 4D 拓扑设计:MoE 架构的关键特性是由多个专家组成。由于专家之间需要大量的信息交换,通信负担极重。为了解决这个问题,我们采用了 4D 拓扑架构,平衡了通信、显存和计算资源的分配。这种设计优化了计算节点之间的通信路径,提高了整体计算效率。

专家路由与预丢弃策略:MoE 的另一个特点是「专家路由机制」,即需要对不同的输入进行分配,并丢弃一些超出专家计算容量的冗余数据。为此团队设计一套预丢弃策略,减少不必要的计算和传输。同时在计算流程中实现了高效的算子融合,进一步提升模型的训练性能。

通信与计算重叠:由于 MoE 架构的专家之间需要大量通信,会影响整体计算效率。为此团队设计了「多维度的通信与计算重叠」机制,即在进行参数通信的同时,最大比例并行地执行计算任务,从而减少通信等待时间。

(2)效果方面

专家权重:MoE 中的专家总数为 N ,每个 token 会选择 topK 个专家参与后续的计算,由于专家容量的限制,每个 token 实际选择到的专家数为 M,M<=K

实验 1:权重在 topM 范围内归一化

实验 2:权重在 topK 范围内归一化

实验 3:权重在 topN 范围内归一化

实验 4:权重都为 1

对比实验结果

举例说明,假设 N=8,K=4,M=3(2 号专家上 token 被丢弃),不同专家权重的计算方式所得的权重如下图:

数据动态切换:元象以往开源的模型,往往在训练前就锁定了训练数据集,并在整个训练过程中保持不变。这种做法虽然简单,但会受制于初始数据的质量和覆盖面。此次 MoE 模型的训练借鉴了「课程学习」理念,在训练过程中实现了动态数据切换,在不同阶段多次引入新处理的高质量数据,并动态调整数据采样比例。

这让模型不再被初始语料集所限制,而是能够持续学习新引入的高质量数据,提升了语料覆盖面和泛化能力。同时通过调整采样比例,也有助于平衡不同数据源对模型性能的影响。

不同数据版本的效果曲线图

学习率调度策略(LR Scheduler):在训练过程中动态切换数据集,虽有助于持续引入新知识,但也给模型带来了新的适应挑战。为了确保模型能快速且充分地学习新进数据,团队对学习率调度器进行了优化调整,在每次数据切换时会根据模型收敛状态,相应调整学习率。实验表明,这一策略有效提升了模型在数据切换后的学习速度和整体训练效果。

下图是整个训练过程中 MMLU、HumanEval 两个评测数据集的效果曲线图。

训练过程中 MMLU、HumanEval 的性能曲线持续拔高

通过设计与优化,元象 MoE 模型与其 Dense 模型 XVERSE-65B-2 相比,训练时间减少 30%、推理性能提升 100%,模型效果更佳,达到业界领先水平。

视频链接:https://mp.weixin.qq.com/s/vE4Ls9h907tPhtiY-XO6Mg

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
性商教母再遭封禁,2000万已到账

性商教母再遭封禁,2000万已到账

李东阳朋友圈
2026-04-09 11:27:49
正式回归,姚明官宣,新岗位惊喜,投入重金,联手蔡崇信

正式回归,姚明官宣,新岗位惊喜,投入重金,联手蔡崇信

东球猫猫
2026-04-10 10:39:04
美伊战争最大的输家不是美国,而是被全员抛弃的特朗普

美伊战争最大的输家不是美国,而是被全员抛弃的特朗普

纪中百大事
2026-04-10 10:18:54
26分钟轰11+3+2!湖人放弃低配版约基奇太愚蠢,他比艾顿强太多了

26分钟轰11+3+2!湖人放弃低配版约基奇太愚蠢,他比艾顿强太多了

小路看球
2026-04-09 15:07:43
诺丁汉森林1-1躺平晋级:门将25米回传乌龙,30年首进欧战八强

诺丁汉森林1-1躺平晋级:门将25米回传乌龙,30年首进欧战八强

竞技风云录
2026-04-10 05:28:39
张雪公布自己设计的跨界踏板车设计图,最新回应:正在制作踏板摩托,这款踏板偏运动越野风格,售价可能比传统的贵一点

张雪公布自己设计的跨界踏板车设计图,最新回应:正在制作踏板摩托,这款踏板偏运动越野风格,售价可能比传统的贵一点

鲁中晨报
2026-04-07 17:13:05
人都死了,才罚7.6万?越看越不对劲

人都死了,才罚7.6万?越看越不对劲

走读新生
2026-04-09 15:37:03
有没有人敢爆自己的瓜?网友:确定玩这么大吗?

有没有人敢爆自己的瓜?网友:确定玩这么大吗?

夜深爱杂谈
2026-02-18 20:55:58
美国“第一夫人”发表声明

美国“第一夫人”发表声明

鲁中晨报
2026-04-10 09:24:04
司机运18吨西瓜,收货方开30个全坏,拒付运费,发货方让拉走抵账

司机运18吨西瓜,收货方开30个全坏,拒付运费,发货方让拉走抵账

一丝不苟的法律人
2026-04-09 14:37:32
断更三年!潘石屹突然发声:我命由我

断更三年!潘石屹突然发声:我命由我

新浪财经
2026-04-07 22:44:05
总台记者观察丨美伊停火谈判 黎巴嫩成各方博弈焦点

总台记者观察丨美伊停火谈判 黎巴嫩成各方博弈焦点

北青网-北京青年报
2026-04-10 09:24:06
“以军疑从楼顶扔下巴勒斯坦儿童”,李在明:若为真,可有措施?

“以军疑从楼顶扔下巴勒斯坦儿童”,李在明:若为真,可有措施?

观察者网
2026-04-10 12:08:12
42犯47罚!2违体1人报销!王浩然一战封神,深圳双杀山西取11连胜

42犯47罚!2违体1人报销!王浩然一战封神,深圳双杀山西取11连胜

后仰大风车
2026-04-09 21:44:45
太丢人了!九江一男子驾驶无牌路虎豪车,加满近500元汽油后逃单

太丢人了!九江一男子驾驶无牌路虎豪车,加满近500元汽油后逃单

火山詩话
2026-04-10 05:51:45
王志文连斜眼都不敢?昔日大佬被打碎,太揪心!

王志文连斜眼都不敢?昔日大佬被打碎,太揪心!

喜欢历史的阿繁
2026-04-10 01:32:21
除北部以黎边境外 以色列恢复“全面活动”状态

除北部以黎边境外 以色列恢复“全面活动”状态

新京报
2026-04-09 11:08:46
华国锋题字震惊众人!没练书法的人写得竟比高手还好!

华国锋题字震惊众人!没练书法的人写得竟比高手还好!

书画相约
2026-04-10 08:19:50
A-10战机50年后还在飞:713架造完,如今只剩260架能上天

A-10战机50年后还在飞:713架造完,如今只剩260架能上天

闪存猎手
2026-04-10 08:22:53
"我不要活了!"上海一阿婆崩溃,买了近30年的保险全被退!警方:若继续持有价值百万

"我不要活了!"上海一阿婆崩溃,买了近30年的保险全被退!警方:若继续持有价值百万

台州交通广播
2026-04-09 22:32:54
2026-04-10 12:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
12721文章数 142621关注度
往期回顾 全部

科技要闻

程序员惊喜,每月100美元!OpenAI推新套餐

头条要闻

再次"一肩挑"的苏林 将中国作为出访的首个国家

头条要闻

再次"一肩挑"的苏林 将中国作为出访的首个国家

体育要闻

17岁赚了一百万美元,25岁被CBA裁员

娱乐要闻

夏克立婚内出轨 曾参加《爸爸去哪儿》

财经要闻

爱尔眼科一院长被指猥亵 总部:已被停职

汽车要闻

全新一代理想 L8 五座旗舰+5C增程系统 三季度交付

态度原创

家居
手机
旅游
游戏
公开课

家居要闻

复古风格 自然简约

手机要闻

摩托罗拉Edge 70 Pro手机渲染图曝光:3种配色,6500mAh电池

旅游要闻

上观福利|春染大别山,赴约来六安,这里有一封来自春天的邀请

《灵魂面甲》正式版上线 灵犀互娱持续深耕国产游戏出海

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版