网易首页 > 网易号 > 正文 申请入驻

刚刚,蚂蚁站在Kimi肩膀上开源了一款新模型

0
分享至


智东西
作者 李水青
编辑 心缘

智东西8月11日报道,今日,蚂蚁百灵大模型开源了一款轻量级混合推理MoE模型——Ling-3.0-tiny。

该模型总参数量为7.9B,推理时激活参数量为1.3B,主要面向高效本地部署而设计。其同步提供BF16、FP8和INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,兼顾性能、效率与可部署性。


在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny获得25分,仅比Gemma-4-26B-A4B低1分,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。

该模型的关键要点总结如下:

1、高效的混合线性架构:Ling-3.0-tiny采用月之暗面自研的KDA(Kimi增量注意力)与DeepSeek自研的MLA(多头潜在注意力)的3:1 交替堆叠结构,并配备由128个路由专家组成的稀疏MoE前馈网络,构建起高效的混合线性架构。

每个Token仅激活8个路由专家和1个共享专家,使该模型能够在长上下文建模能力、参数效率与计算成本之间实现平衡。

2、原生混合推理与智能体能力:Ling-3.0-tiny兼顾快速响应多步推理能力,可通过enable_thinking参数在单次请求中灵活开启或关闭思考模式。该模型在通用智能体任务、代码生成、数理科学推理以及指令遵循场景下均具备均衡表现。

3、本地与边缘部署:在FP8精度下,Ling-3.0-tiny在DGX Spark上的推理吞吐量可达100–105tokens/s,而在M4 Pro MacBook上则为86–90tokens/s,且在8K上下文长度时,峰值内存占用仅为8.34GiB。

如下面视频所示,百灵在36GB内存MacBook Pro复刻Infinite Wiki(无限百科)核心体验。用户阅读时点击词语即可生成上下文解释卡片,支持多层知识下钻。

该Demo全程本地推理,无需云端调用,实测首Token响应低于100毫秒;所有数据留存设备端,不会产生云端API计费,接近一个原生速度的本地知识引擎。

Hugging Face地址:
https://huggingface.co/inclusionAI/Ling-3.0-tiny
https://huggingface.co/inclusionAI/Ling-3.0-tiny-fp8
https://huggingface.co/inclusionAI/Ling-3.0-tiny-int4
ModelScope地址:
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-fp8
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-int4

一、1.3B激活参数“以小博大”,评分紧咬26B大模型

在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny获得25分。该指数从真实任务、工具使用、代码、科学推理、知识可靠性和长上下文等九个方向,综合衡量模型的跨任务能力。

百灵公布的对比结果显示,Ling-3.0-tiny的综合得分仅比Gemma-4-26B-A4B低1分,接近激活参数约4B的更大MoE模型,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。

Ling-3.0-tiny拥有7.9B总参数,但每个Token仅激活1.3B参数。这意味着,它以较低的实际计算规模,进入了主流4B至12B级模型的综合能力区间。

单项分数无法覆盖模型的全部能力,Tiny模型也无法取代所有大型模型。但从相关评测看,Ling-3.0-tiny已经具备进入代码辅助、知识工作流、工具调用和本地Agent应用的能力基础,其定位也超出了单纯追求“设备装得下”的小尺寸模型。


二、Agent评分超31B大模型,输出速度超160 tokens/s

Ling-3.0-tiny较突出的方向是真实任务与Agent执行。

其Artificial Analysis Agentic Index得分为16,高于Gemma-4-31B;其中,GDPval-AA v2取得772 Elo,τ³-Banking得分为20.80,体现了模型在任务理解、工具调用和流程推进方面的能力。


在百灵此次列出的对比模型中,Ling-3.0-tiny在IMO-AnswerBench和非幻觉率指标上取得领先成绩,在数学、科学推理、代码Agent、指令遵循和长上下文等任务上的表现也较为均衡。


在综合智能指数达到25分的同时,Ling-3.0-tiny输出速度超过160 tokens/s,输出500个Token的端到端用时约18秒,这一时间已经包含模型思考过程。


较小的激活规模由此转化为更短的任务等待时间,也有助于提升Agent连续执行任务时的响应效率。


三、站在DeepSeek、Kimi肩膀上创新架构,降低本地部署门槛

Ling-3.0-tiny延续Ling-3.0系列的原生混合线性注意力技术路线,并针对轻量化和低门槛部署进一步优化。其总参数量被控制在7.9B,每个Token的激活参数量为1.3B。

模型采用3:1 KDA-MLA架构,即每4层包含3层KDA和1层MLA,以提高长上下文处理效率。

在MoE部分,Ling-3.0-tiny设置了128个稀疏专家。每个Token会激活8个路由专家和1个共享专家,以较小的激活参数量承载更完整的模型能力。

该模型还采用原生混合推理机制,让常规任务的快速响应和复杂任务的多步思考由同一模型完成。Multi-Token Prediction训练目标则为更高效的Token预测及后续推理加速提供基础。

这些架构设计主要指向三项实际价值:减少推理所需的计算资源,降低本地部署和二次开发门槛,并让轻量模型具备接入真实Agent工作流的能力。


四、从DGX Spark到MacBook,三个精度版本覆盖不同设备

Ling-3.0-tiny此次同步开源BF16、FP8和INT4三个版本,开发者可以按照硬件条件、性能要求和成本选择部署方案。

其中,BF16版本适用于重视完整精度的研究评测和生产应用;FP8版本在模型效果、运行速度和资源占用之间寻求平衡;INT4版本进一步压低资源需求,面向算力和内存相对有限的本地环境。

三个版本的推出,使模型能够覆盖从专业级本地AI工作站到个人电脑的不同设备。开发者可以将其接入本地知识库、代码助手、UI自动化、企业任务智能体等工作流,并将模型和业务数据保留在本地环境中。

1、DGX Spark:单机可支撑小规模本地服务

Ling-3.0-tiny可在单台NVIDIA DGX Spark上运行FP8推理,模型权重文件约为7.85GB。

在2K输入测试中,单请求稳态解码速度约为100至105 tokens/s;两路请求并发时,聚合解码吞吐约为161 tokens/s。

按照上述测试结果,开发者和中小团队无需搭建大规模算力集群,仅使用一台DGX Spark便可搭建独立运行的本地模型服务,为小规模用户提供推理能力。潜在应用包括企业内部知识助手、研发团队代码助手和面向特定业务流程的任务智能体。

百灵还在DGX Spark上部署Ling-3.0-tiny,并用其驱动移动设备,演示模型理解任务、调用工具、执行自动化操作并完成验证的过程。该Demo面向开发测试中的批量试跑和回归验证场景,验证了本地模型在运行成本、数据可控性和执行可靠性方面的应用潜力。

2、MacBook:首Token响应低于100毫秒

目前,Ling-3.0-tiny已完成面向MacBook(Apple Silicon)的本地运行适配,BF16和FP8版本均可运行。

在MacBook上,该模型可以用于代码辅助、文档处理、本地知识问答和工作流自动化。由于模型与数据均留在本地,用户可以减少对云端模型服务的依赖,并在处理隐私敏感信息时拥有更可控的数据边界。

其中,FP8版本进一步降低了本地运行所需资源,并将持续生成速度提高约30%,以改善多轮交互和Agent运行体验。

正如前文提到,为验证本地高频交互能力,百灵在一台配备36GB内存的MacBook Pro上复刻了Infinite Wiki(无限百科)的核心体验。测试表明,Ling-3.0-tiny已经能够在Mac上承担高频本地交互任务,并以接近原生应用的响应速度充当本地知识引擎。

3、Mac mini:变身常驻式本地智能节点

Ling-3.0-tiny面向Apple Silicon的部署方案也可以延伸至Mac mini。

相比更侧重移动办公的MacBook,Mac mini更适合作为低功耗、常驻式的本地智能节点,为个人或小型团队持续提供知识库检索、文档分析、自动化任务和本地模型API服务。

在百灵展示的Demo中,Ling-3.0-tiny被部署在Mac mini上,用于划词翻译、语法纠错和文本改写。相关任务无需将数据上传云端,可以离线运行并提供低延迟响应,适用于个人及企业的本地阅读与写作场景。

至此,Ling-3.0-tiny已经完成从DGX Spark、MacBook到Mac mini的适配验证。不同精度版本与设备形态共同扩大了这款模型的部署范围,也让中小团队能够根据算力、数据边界和业务需求选择更合适的本地运行方式。

结语:下一步将补强事实准确性和长程Agent稳定性

百灵称,接下来其将继续增强Ling-3.0-tiny的长尾知识覆盖和事实准确性,提高复杂工具调用及长程Agent任务的稳定性,并优化代码、科学推理和长上下文能力。

团队还计划改善模型推理能力、响应时间和任务成本之间的平衡,完善FP8和INT4版本的硬件适配、推理框架支持与部署文档,并与硬件厂商、高校及开发者社区共同建设轻量模型生态。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
越南少将坦言:如果当时中国军队在谅山再多待五天,布防在那里的越军,不是被打散的问题,而是从建制上被彻底抹掉的问题, 一个都不剩下

越南少将坦言:如果当时中国军队在谅山再多待五天,布防在那里的越军,不是被打散的问题,而是从建制上被彻底抹掉的问题, 一个都不剩下

人生录
2026-08-08 00:05:22
终于来了!养老金调整主基调定了,让人心心念念,算算你能涨多少

终于来了!养老金调整主基调定了,让人心心念念,算算你能涨多少

阿讯说天下
2026-08-11 11:23:51
俄莫斯科代表团紧急来华!这次不谈油气大单

俄莫斯科代表团紧急来华!这次不谈油气大单

果妈聊娱乐
2026-08-11 08:29:30
为啥说幼师是知道秘密最多的职业?网友:所以从来不敢让孩子看见,太社死了

为啥说幼师是知道秘密最多的职业?网友:所以从来不敢让孩子看见,太社死了

带你感受人间冷暖
2026-08-12 00:05:13
管理24亿美金的加密OG叶俊德,在巴拉圭裸体坠亡!

管理24亿美金的加密OG叶俊德,在巴拉圭裸体坠亡!

CLabs加密观察
2026-08-10 10:45:02
新华社访谈|为生活写注脚的人

新华社访谈|为生活写注脚的人

新华社
2026-08-10 08:41:40
萧旭岑出来表态了!在郑丽文明确表示台湾不是一个中国之后

萧旭岑出来表态了!在郑丽文明确表示台湾不是一个中国之后

果妈聊娱乐
2026-08-11 20:54:45
“谢谢我的前男友”,浙江女演员公开透露乳腺癌发现过程:前男友发现她胸口长了痘,劝她去看医生,做了检查才发现是恶性肿瘤……

“谢谢我的前男友”,浙江女演员公开透露乳腺癌发现过程:前男友发现她胸口长了痘,劝她去看医生,做了检查才发现是恶性肿瘤……

都市快报橙柿互动
2026-08-11 19:05:13
中国公开赛战报:连爆大冷,赵心童5-6一轮游!4位世界冠军出局了

中国公开赛战报:连爆大冷,赵心童5-6一轮游!4位世界冠军出局了

球场没跑道
2026-08-12 00:10:16
网红逍遥客为救父亲氨气中毒去世,年仅36岁,姐姐:弟弟每天直播宣传东北风土人情,没能见他最后一面成此生遗憾

网红逍遥客为救父亲氨气中毒去世,年仅36岁,姐姐:弟弟每天直播宣传东北风土人情,没能见他最后一面成此生遗憾

极目新闻
2026-08-11 18:04:02
Sonja Morgan曾说“不爱穿内裤”,如今却为这款UPF50+塑形泳衣倾倒

Sonja Morgan曾说“不爱穿内裤”,如今却为这款UPF50+塑形泳衣倾倒

生活观察员啊
2026-08-11 01:24:24
陪玩陪睡只是皮毛!继手伸进裤子后,又一女星自曝,50多都不放过

陪玩陪睡只是皮毛!继手伸进裤子后,又一女星自曝,50多都不放过

不似少年游
2026-06-22 19:32:51
勒布朗妻子萨瓦娜曝被奢侈品店恶劣对待:爱马仕员工被解雇、香奈儿门店关闭

勒布朗妻子萨瓦娜曝被奢侈品店恶劣对待:爱马仕员工被解雇、香奈儿门店关闭

星河漫山野
2026-08-09 13:45:25
曝皇马将精简阵容!三大牺牲品曝光,穆帅清洗冗员,1人无人问津

曝皇马将精简阵容!三大牺牲品曝光,穆帅清洗冗员,1人无人问津

奥拜尔
2026-08-11 14:53:35
南太行失联女孩已找到!面部损毁身体腐烂,物品散落现场疑点重重

南太行失联女孩已找到!面部损毁身体腐烂,物品散落现场疑点重重

北纬的咖啡豆
2026-08-11 09:27:28
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
交了540万赎金还是被撕票!“雅典娜”案真相曝光,千万别再把线上好友当真闺蜜

交了540万赎金还是被撕票!“雅典娜”案真相曝光,千万别再把线上好友当真闺蜜

子芫伴你成长
2026-08-10 23:08:53
炸裂!妻子怀孕期间清华博士出轨:坦言女孩太漂亮,没把持住自己

炸裂!妻子怀孕期间清华博士出轨:坦言女孩太漂亮,没把持住自己

汉史趣闻
2026-08-09 10:32:37
名记:梅西的世界杯决赛状态很明显不对劲,但阿根廷没被收买

名记:梅西的世界杯决赛状态很明显不对劲,但阿根廷没被收买

懂球帝
2026-08-11 13:40:07
炸锅!美国公布UFO最新档案,金属球内发现人体,外星人实锤了?

炸锅!美国公布UFO最新档案,金属球内发现人体,外星人实锤了?

小莜读史
2026-08-11 19:14:55
2026-08-12 02:24:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12412文章数 117149关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

艺术
教育
房产
手机
军事航空

艺术要闻

色彩的盛宴,视觉的狂欢:西班牙水彩大师福斯蒂诺·马丁·冈萨雷斯的艺术世界

教育要闻

写作训练 | 我听到了楼下磨剪子的吆喝声……

房产要闻

突发,崖州湾又有大动作!

手机要闻

iQOO Z11S再预热,宁德新能源联合研发电池

军事要闻

乌克兰袭击俄罗斯炼油厂 已致13死78伤

无障碍浏览 进入关怀版