网易首页 > 网易号 > 正文 申请入驻

少即是多,这次轮到大模型来证明

0
分享至

编辑|Panda、+0

每逢重要的新模型发布,我们编辑部通常比新闻本身更早进入工作状态:提前打开官网、直播和社交媒体,等结果陆续出来,大家一边热火朝天地开始写文章,一边梳理参数、榜单和演示案例,判断这一次技术究竟向前走了多远。

这套流程已经相当熟练,大模型行业似乎也形成了一种默认的审美:更多的参数,更长的上下文,更复杂的推理,以及越来越接近「全能」的能力清单。

但设计圈有一句经典名言:Less is More。它强调设计要保持克制,知道哪里应该保留,哪里可以舍弃。

模型或许也一样。看发布会久了,我们很容易把注意力全部放在能力上限上,仿佛我们每天上班遇到的最大困难,是办公室里缺少一位能够证明黎曼猜想的同事。

其实,大多数工作并不涉及人类文明的终极命运。它们只是数量很多、过程重复、要求明确,同时又有一套复杂的流程。这种时候我们需要的往往是一个反应够快、听得懂话、能够稳定使用的工具。

7 月 24 日,蚂蚁集团旗下百灵大模型发布的最新模型Ling-3.0-flash,正是沿着这一思路设计的。它是一款面向 Agent 长程工作流的 Flash 模型,总参数量为 124B、激活参数量为 5.1B,强调快速响应、稳定调用工具,以及适合高频使用的可控成本。上下文方面,Ling-3.0-flash 原生支持 256K,可扩展至 1M,并能在长输入下保持较高召回率。



官方给它的定位是「智以密胜」,相较于百灵上一代旗舰思考模型 Ring-2.6-1T 的总参数(约 1T、激活约 63B),Ling-3.0-flash 只用了旗舰约 1/8 的总参数、约 1/12 的激活参数,就在多数基准测试上实现了「对标甚至超越」旗舰。

因此,Ling-3.0-flash 要讲的其实并非「又一个小模型」的故事,而是一次思路上的切换:模型获取智能的方式,不再单纯追求规模堆砌,而是转向对每一寸算力的高效压榨

百灵把这种取向称为「智能密度」(IQ 除以显存成本)与「智效比」(IQ 除以计算成本),而 Ling-3.0-flash 在这两个指标上的表现非常亮眼。



从产品定位上看,Ling-3.0-flash 并不试图取代那些参数量庞大的全能推理模型,而是想要承担更多「执行」工作:复杂模型先搜索信息、制定方案并拆解任务,Ling-3.0-flash 再按照方案调用工具、修改代码、处理数据,并根据运行结果不断检查和修正。

这样一来,需要深度思考的部分可以交给大模型,需要反复执行和试错的部分则由 Ling-3.0-flash 完成。在保证任务效果的同时,也减少了每一步都调用超大模型所带来的等待和成本。

这个定位踩在了一个正在成型的行业共识上。进入 2026 年,业界对 Agent 的讨论已经从「能不能自主完成任务」,转向「一套 Agent 系统里该由谁来干什么」。也就是说,一套行之有效的 Agent 系统中不仅需要能深思熟虑的大型推理模型,也需要能快速高效完成基本任务的相对轻量模型

一手实测:把「快」和「稳」放进真实工作流

那么,Ling-3.0-flash 的真实表现如何呢?目前,Ling-3.0-flash 正在开放限时免费 API 调用(截至北京时间 8 月 3 日 23:00),趁这个窗口,我们也来免费体验一番,用真实任务对其进行实测。

上手门槛比预想的低。我们选的测试工具是 OpenCode,下载打开后,Ling-3.0-flash 已经是默认的免费选项之一,不需要额外配置就能直接用。如果想接入 Claude Code 等其他工具,也可以在 OpenRouter 或百灵官方平台免费申领 API key 后自行配置。



  • 官方体验平台:https://chat.ant-ling.com/chat
  • OpenRouter 体验地址:https://openrouter.ai/inclusionai/ling-3.0-flash:free

第一个任务,我们让它构建一个模拟太阳系。结果有点出乎意料:Ling-3.0-flash 不仅正确搭出了太阳与八大行星的相对关系,还主动用不同颜色和行星环在视觉上做了区分。不仅如此,Ling-3.0-flash 的完成速度也相当快,整个过程不过 3 分钟。


https://mp.weixin.qq.com/s/E2Tl3SSalJf5Bu5u5eLchg


第二个任务偏审美:我们让它做一个「Less is More」的包豪斯风格的「机器之心精选作品集」网站,全程不用任何图片素材。



成品相当精准地还原了纯 CSS/SVG 的无图美学,三原色、几何构成、非对称网格的语言都在。这也算是对官方同类 demo 的一次侧面印证。在这类前端视觉任务上,它的表现确实撑得起「对标」二字。

视觉展示之外,我们更关心它能不能真正嵌进生产流程。于是我们把它接进了自己的工作流,指示它安装集成了机器之心自产全部行业数据的「机器之心数据 Skills」。



很快,Ling-3.0-flash 把这 4 个 skill 配置进了 OpenCode。配好 API key 之后,只需在对话框里提问,它就能按 skill 里定义的方式查询机器之心的全部行业数据。

举个例子,我们让它检索数据库中所有蚂蚁百灵发布过的模型与技术文章,并据此总结蚂蚁百灵的技术演进路线。

基于数据库中的 24 篇相关文章,Ling-3.0-flash 相当利落地梳理出了蚂蚁百灵这些年从基础设施、到 MoE 架构突破、再到全模态与智能体能力集成的一条主线,条理清晰,足以当作快速了解这家团队的一份参考。



这类「读一批结构化资料、抽取要点、组织成文」的活正是其擅长的信息聚合与结构化输出场景。

当然,我们也没只挑它擅长的来。我们尝试让它独立完成一个更复杂的工程:用 Vite + TypeScript + Three.js 加 cannon-es 物理引擎,做一个 3D 物理台球沙箱。这一次,它并没有完全跑通。

这个结果谈不上意外,反倒和 Ling-3.0-flash 自身的定位相互印证:它本就不是为「一句话端到端拿下复杂工程」而设计的全能架构师,而更适合在人把架构和路径规划清楚之后,作为执行节点分步落地。如果先由人或更大的规划模型搭好台球沙箱的模块骨架,再让它逐轮填充实现,大概率会是更顺手的协作方式。

综合几轮体验,我们的直观感受和官方口径大体吻合:在边界清晰、有明确验证信号的任务上,它响应快、执行稳,接入工作流的成本也低;而一旦任务滑向开放、松散、需要它自己从零扛起整体架构,它的短板就会显现。

这正是一个「执行模型」应有的样子:把它用在对的地方,性价比很高;用错地方,则可能会带来失望。

极致「压榨」背后:一套围绕效率重写的架构

Ling-3.0-flash 的能力,官方归因于两条线的共同作用:一是底层架构的系统性升级,二是面向生产力场景的 Agent 定向优化。

前者决定了「同样的参数能转化出多少能力」,后者决定了「这些能力能不能在真实任务里稳定交付」。

先看架构。原生混合线性注意力是这次升级的地基。



与上一代 Ling-2.6 先进行架构迁移、再继续训练不同,Ling-3.0 从预训练阶段便采用原生混合线性注意力架构,以 5:1 的比例交替堆叠 KDA 线性注意力层和 MLA 层,即每 6 层中包含 5 层 KDA 和 1 层 MLA。由于各组件从训练初期便在同一架构中共同优化,模型可以兼顾长上下文处理效率和整体能力。

这里的 KDA(Kimi Delta Attention)即 Moonshot(月之暗面)在 2025 年底 Kimi Linear 工作中提出的线性注意力机制,随后成为业界探索高效注意力的一个共同参照。

它的思路是在 Delta Rule 的状态更新里引入细粒度对角门控:让不同特征通道拥有各自独立的保留、衰减与写入控制,而不是用一个全局旋钮统一处理记忆的遗忘。

通俗地说,模型在读长文档、大型代码库时,能更精准地维护那些跨段落、跨步骤的关键信息,不至于把新旧信息混成一团。Ling-3.0 把上一代的 Lightning Attention 换成了 KDA,正是看中这一点。

MoE 稀疏度进一步压低是「智效比」的直接来源。这一取向的方法论依据来自百灵此前提出的效率杠杆(Efficiency Leverage)Ling Scaling Law:在达到同等性能的前提下,更低的专家激活比例能换来更高的算力效率。



激活比例越低,效率杠杆(相对稠密模型节省的算力)越高,且随算力预算放大。图为 1e22 FLOPs 下的估计值。来源:蚂蚁百灵团队 Efficiency Leverage 论文,arXiv:2507.17702

据介绍,Ling-3.0 据此把每个 Token 的专家激活比例从前代的 1/32 进一步降到 1/64。也就是说,124B 的总参数里,每次推理只点亮很小一部分,以极低的计算消耗驱动模型能力实现跃迁。

原生混合线性注意力、KDA 与稀疏 MoE 三者叠加,构成了它敢在 124B(激活 5.1B)体量上「越级挑战」的架构底气。

不过,这条「线性注意力 + 极致稀疏」的路线能否在更大规模上继续保持质量,行业内仍有不同看法。Acing AI 的第三方分析指出,线性注意力混合架构在研究规模(数十亿参数)上的「质量对齐」,未必能平滑迁移到前沿规模,尤其是在长上下文多跳推理这类被标准测试集低估的任务上。

当然,Ling-3.0-flash 走的本来就不是「什么都懂一点」的路线,而是把有限资源集中用在 Agent 和核心推理上。但这也提醒我们,「小体量对标大旗舰」的成立范围,需要落到具体任务上去看,而非一概而论。

除了模型本身的架构升级,Ling-3.0-flash 还针对真实生产环境中的 Agent 任务,在训练、推理服务和多智能体协同等方面做了专门优化

按照官方说法,团队将 Coding Agent、General Agent 和 Deep Research Agent 的可交互训练环境扩展至 1 万多个,并持续提高环境的多样性、质量和任务难度。强化学习阶段还引入了完整执行轨迹复盘步骤贡献评估,为长程任务提供更细粒度的步骤级训练信号。

这些训练主要提升模型在复杂约束下持续规划、调用工具、处理失败反馈和动态调整执行路径的能力。官方称,相比上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 的 Agent 能力有明显提升,部分指标达到更大参数规模模型的水平。

MiniAppBench 可以提供一个外部参照——这个基准要求模型仅凭一句用户需求生成完整可用的 APP。参与评测的 16 个主流模型平均通过率约为 17%,Ling-3.0-flash 的通过率达到 25.3%,与总参数规模约为其两倍的开源 SOTA 模型持平。

工程层面还有两处改动,针对的是「Agent 任务越长,服务越吃力」这个问题:

一是响应速度。Agent 任务的对话轮次越多、上下文越长,传统推理服务一旦本地缓存被挤出,或会话被调度至其他节点,就可能需要重新处理此前数万 Token 的上下文,导致首 Token 延迟快速上升。Ling-3.0-flash 基于 SGLang HiCache 与 Mooncake 构建了集群级分层缓存体系,将缓存从「实例私有」升级为「集群共享」,使已有上下文能够跨层级存储、跨节点复用和按需恢复。

官方实测称,在长输入场景下,命中 L3 Cache 相比重新计算,可将 TTFT 降低 60%~80% 以上。



对于 Coding Agent 和长文档问答等场景,这可以减少上下文重算并加快任务接续。

二是协同稳定性。面对复杂 Agent 任务,单一推理链路容易出现决策漂移、局部误判和容错能力不足等问题。为此,百灵升级了名为「Ling Multi-Agent」的多智能体协同架构。不同 Agent 可以围绕任务进行多层级分工,并通过交叉验证、信息补充、协同纠错和竞争式「赛马」,降低单一推理路径造成的偏差。

根据官方展示的实验结果,Ling Multi-Agent 在 BrowseComp 和 BrowseComp_zh 上的表现会随协同计算规模增加而提升。这表明,在复杂检索和深度研究任务中,能力扩展不仅取决于单个模型,也可以来自更有效的任务委派和结果校验。



从这些改动来看,Ling-3.0-flash 的产品逻辑是自洽的:把「执行」这一环节的速度、稳定性和成本做到极致,再靠工程手段解决长程交互中的重算与漂移问题

相应地,这种取舍也带来了明确的边界。模型资源更多集中于智能体与核心推理,在广度知识储备和多语言稳定性方面仍有提升空间,长对话或高压交互下也可能出现中英文混杂。

对使用者而言,这意味着一些明确的「不适合」:极度冷门、需要庞大世界知识硬背的研究任务,缺少「可验证节点」的松散开放式需求,以及「一句话帮我做完整工程」的 One-shot 预期……这些场景更适合交给更大的推理模型,或由人先把架构和路径规划好,再让它分步执行。当前版本也不具备原生多模态能力,遇到需要理解截图或音频的任务,需要配合多模态模型使用。

当「智能」开始按密度计价

从 Ling-3.0-flash 身上,可以看到一个越来越明显的行业变化:Agent 落地进入深水区之后,衡量一个模型价值的坐标,正从「参数有多大、榜单有多高」,悄悄挪向「单位算力、单位成本能换来多少可靠的执行」。

这也是 2026 年不少企业在做的取舍:与其用一个昂贵的大模型端到端包揽一切,不如让大模型负责思考、让轻量执行模型负责高频落地,用动态路由把成本压下来。

在这个坐标系里,Ling-3.0-flash 给出了一个不错的答案,但它是否适用于更多任务和场景,还需要继续验证。接下来,模型之间比拼的可能不只是能力有多强,也包括能否用更少的资源,把能力用在真正需要的地方。

而对今天的开发者来说,选择这类模型时,标准其实很简单:先想清楚要让它做什么,再把任务边界和验收标准说明白,剩下的交给它快速执行。

官方表示,Ling-3.0-flash 模型权重将在免费体验期结束后正式开源。可以开始期待了……

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
田启文告别体面痛诉周星驰:我对他掏心掏肺,他跟我算到分毫不差

田启文告别体面痛诉周星驰:我对他掏心掏肺,他跟我算到分毫不差

橙星文娱
2026-07-29 13:22:41
月租600元的出租屋里,扛钢管的单亲妈妈收到女儿的北大录取短信:是我这个“三无人员”的小小成就

月租600元的出租屋里,扛钢管的单亲妈妈收到女儿的北大录取短信:是我这个“三无人员”的小小成就

封面新闻
2026-07-29 15:19:23
徐宪平获刑15年:受贿数额特别巨大,到案后如实供述罪行,主动交代办案机关尚未掌握的部分受贿事实,认罪悔罪,积极退赃

徐宪平获刑15年:受贿数额特别巨大,到案后如实供述罪行,主动交代办案机关尚未掌握的部分受贿事实,认罪悔罪,积极退赃

政知新媒体
2026-07-29 17:58:00
国际油价,大幅下跌!

国际油价,大幅下跌!

上观新闻
2026-07-29 06:26:38
2元买走了8亿?多名公职人员被查!衡水中学背后真相浮出水面!

2元买走了8亿?多名公职人员被查!衡水中学背后真相浮出水面!

社会日日鲜
2026-07-29 10:09:44
内马尔:我想我在巴西队的时光已经结束,2030世界杯看不到我

内马尔:我想我在巴西队的时光已经结束,2030世界杯看不到我

懂球帝
2026-07-29 13:19:16
还有?当年华为到底囤了多少麒麟9000芯片,为何一直都有货?

还有?当年华为到底囤了多少麒麟9000芯片,为何一直都有货?

普陀动物世界
2026-07-29 15:01:24
日本熊本发生强震,外交部:对遇难者表示哀悼,驻日使领馆已启动应急机制

日本熊本发生强震,外交部:对遇难者表示哀悼,驻日使领馆已启动应急机制

澎湃新闻
2026-07-29 15:18:36
俄方称中俄正讨论建立公民永久免签制度,外交部回应

俄方称中俄正讨论建立公民永久免签制度,外交部回应

澎湃新闻
2026-07-29 16:27:30
广州一公交座椅背后现“大尺度”海报,公交公司:已清除,疑为乘客恶意张贴

广州一公交座椅背后现“大尺度”海报,公交公司:已清除,疑为乘客恶意张贴

上游新闻
2026-07-29 14:28:18
绝望50分钟!基辅上空导弹乱窜,朝军携带杀器入场,泽连斯基怒吼

绝望50分钟!基辅上空导弹乱窜,朝军携带杀器入场,泽连斯基怒吼

二大爷观世界
2026-07-29 11:59:23
曾有俄罗斯高官语出惊人:沙俄时期侵占的中国领土,如今可以明码标价再卖回给中国!这背后,其实折射出远东开发已陷入停滞的残酷现实

曾有俄罗斯高官语出惊人:沙俄时期侵占的中国领土,如今可以明码标价再卖回给中国!这背后,其实折射出远东开发已陷入停滞的残酷现实

人生录
2026-07-29 00:05:09
美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨

美股盘前,美光科技、闪迪、SK海力士等存储股全线转涨

每日经济新闻
2026-07-29 17:16:13
闹大了!深圳一公司饭堂停止供餐,每天补贴20元,网友:补贴太少,猪脚饭最低都要15元

闹大了!深圳一公司饭堂停止供餐,每天补贴20元,网友:补贴太少,猪脚饭最低都要15元

火山詩话
2026-07-29 10:43:42
巴基斯坦拖欠18家中企4230亿,电力部长求免滞纳金,遭中方拒绝

巴基斯坦拖欠18家中企4230亿,电力部长求免滞纳金,遭中方拒绝

流史岁月
2026-07-29 14:45:03
重庆00后网格员龚宝冬遗骸已找到,曾在彭水山体崩塌前转移群众

重庆00后网格员龚宝冬遗骸已找到,曾在彭水山体崩塌前转移群众

台州交通广播
2026-07-29 16:01:26
易中天发文悼念东野圭吾后续!汤家凤老师公开嘲讽:真恶心

易中天发文悼念东野圭吾后续!汤家凤老师公开嘲讽:真恶心

小徐讲八卦
2026-07-29 16:59:20
恐怖!6周暴跌40%!韩股崩盘烈度远超美股历史金融海啸

恐怖!6周暴跌40%!韩股崩盘烈度远超美股历史金融海啸

格隆汇APP
2026-07-29 11:47:00
微软宣布:Teams 个人版即日起在中国大陆停用,用户将迁移至其他服务

微软宣布:Teams 个人版即日起在中国大陆停用,用户将迁移至其他服务

固件更新中
2026-07-28 19:39:15
8月7日立秋,今年立秋是“闭眼秋”,老辈说的“闭眼秋”是什么意思?是好还是坏?

8月7日立秋,今年立秋是“闭眼秋”,老辈说的“闭眼秋”是什么意思?是好还是坏?

小谈食刻美食
2026-07-29 07:59:35
2026-07-29 19:07:02
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13632文章数 142707关注度
往期回顾 全部

科技要闻

Kimi K3火爆,奥特曼:开源一定有一席之地

头条要闻

金正恩女儿"高调"亮相 且场合、形式和以往有所不同

头条要闻

金正恩女儿"高调"亮相 且场合、形式和以往有所不同

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

55岁影帝黄政民出轨

财经要闻

天丝红牛多地检出成分不合格 企业申诉

汽车要闻

24K金LOGO,纯手工打磨腰线,第二代腾势D9暗夜鎏金高定色,一天只能造3台?

态度原创

艺术
旅游
房产
手机
公开课

艺术要闻

日本“书道”原来发源于我国,这幅字就是见证,启功:真正的魏晋笔法

旅游要闻

解锁海岛游新玩法!北隍城岛打造“北方第一潜水海岛”

房产要闻

海南经济+教育最强县,没悬念了!

手机要闻

芯片全线涨价警钟敲响!这时,国产手机才真正意识到自研的重要

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版