编辑|Panda、+0
每逢重要的新模型发布,我们编辑部通常比新闻本身更早进入工作状态:提前打开官网、直播和社交媒体,等结果陆续出来,大家一边热火朝天地开始写文章,一边梳理参数、榜单和演示案例,判断这一次技术究竟向前走了多远。
这套流程已经相当熟练,大模型行业似乎也形成了一种默认的审美:更多的参数,更长的上下文,更复杂的推理,以及越来越接近「全能」的能力清单。
但设计圈有一句经典名言:Less is More。它强调设计要保持克制,知道哪里应该保留,哪里可以舍弃。
模型或许也一样。看发布会久了,我们很容易把注意力全部放在能力上限上,仿佛我们每天上班遇到的最大困难,是办公室里缺少一位能够证明黎曼猜想的同事。
其实,大多数工作并不涉及人类文明的终极命运。它们只是数量很多、过程重复、要求明确,同时又有一套复杂的流程。这种时候我们需要的往往是一个反应够快、听得懂话、能够稳定使用的工具。
7 月 24 日,蚂蚁集团旗下百灵大模型发布的最新模型Ling-3.0-flash,正是沿着这一思路设计的。它是一款面向 Agent 长程工作流的 Flash 模型,总参数量为 124B、激活参数量为 5.1B,强调快速响应、稳定调用工具,以及适合高频使用的可控成本。上下文方面,Ling-3.0-flash 原生支持 256K,可扩展至 1M,并能在长输入下保持较高召回率。
![]()
官方给它的定位是「智以密胜」,相较于百灵上一代旗舰思考模型 Ring-2.6-1T 的总参数(约 1T、激活约 63B),Ling-3.0-flash 只用了旗舰约 1/8 的总参数、约 1/12 的激活参数,就在多数基准测试上实现了「对标甚至超越」旗舰。
因此,Ling-3.0-flash 要讲的其实并非「又一个小模型」的故事,而是一次思路上的切换:模型获取智能的方式,不再单纯追求规模堆砌,而是转向对每一寸算力的高效压榨。
百灵把这种取向称为「智能密度」(IQ 除以显存成本)与「智效比」(IQ 除以计算成本),而 Ling-3.0-flash 在这两个指标上的表现非常亮眼。
![]()
从产品定位上看,Ling-3.0-flash 并不试图取代那些参数量庞大的全能推理模型,而是想要承担更多「执行」工作:复杂模型先搜索信息、制定方案并拆解任务,Ling-3.0-flash 再按照方案调用工具、修改代码、处理数据,并根据运行结果不断检查和修正。
这样一来,需要深度思考的部分可以交给大模型,需要反复执行和试错的部分则由 Ling-3.0-flash 完成。在保证任务效果的同时,也减少了每一步都调用超大模型所带来的等待和成本。
这个定位踩在了一个正在成型的行业共识上。进入 2026 年,业界对 Agent 的讨论已经从「能不能自主完成任务」,转向「一套 Agent 系统里该由谁来干什么」。也就是说,一套行之有效的 Agent 系统中不仅需要能深思熟虑的大型推理模型,也需要能快速高效完成基本任务的相对轻量模型。
一手实测:把「快」和「稳」放进真实工作流
那么,Ling-3.0-flash 的真实表现如何呢?目前,Ling-3.0-flash 正在开放限时免费 API 调用(截至北京时间 8 月 3 日 23:00),趁这个窗口,我们也来免费体验一番,用真实任务对其进行实测。
上手门槛比预想的低。我们选的测试工具是 OpenCode,下载打开后,Ling-3.0-flash 已经是默认的免费选项之一,不需要额外配置就能直接用。如果想接入 Claude Code 等其他工具,也可以在 OpenRouter 或百灵官方平台免费申领 API key 后自行配置。
![]()
- 官方体验平台:https://chat.ant-ling.com/chat
- OpenRouter 体验地址:https://openrouter.ai/inclusionai/ling-3.0-flash:free
第一个任务,我们让它构建一个模拟太阳系。结果有点出乎意料:Ling-3.0-flash 不仅正确搭出了太阳与八大行星的相对关系,还主动用不同颜色和行星环在视觉上做了区分。不仅如此,Ling-3.0-flash 的完成速度也相当快,整个过程不过 3 分钟。
![]()
https://mp.weixin.qq.com/s/E2Tl3SSalJf5Bu5u5eLchg
第二个任务偏审美:我们让它做一个「Less is More」的包豪斯风格的「机器之心精选作品集」网站,全程不用任何图片素材。
![]()
成品相当精准地还原了纯 CSS/SVG 的无图美学,三原色、几何构成、非对称网格的语言都在。这也算是对官方同类 demo 的一次侧面印证。在这类前端视觉任务上,它的表现确实撑得起「对标」二字。
视觉展示之外,我们更关心它能不能真正嵌进生产流程。于是我们把它接进了自己的工作流,指示它安装集成了机器之心自产全部行业数据的「机器之心数据 Skills」。
![]()
很快,Ling-3.0-flash 把这 4 个 skill 配置进了 OpenCode。配好 API key 之后,只需在对话框里提问,它就能按 skill 里定义的方式查询机器之心的全部行业数据。
举个例子,我们让它检索数据库中所有蚂蚁百灵发布过的模型与技术文章,并据此总结蚂蚁百灵的技术演进路线。
基于数据库中的 24 篇相关文章,Ling-3.0-flash 相当利落地梳理出了蚂蚁百灵这些年从基础设施、到 MoE 架构突破、再到全模态与智能体能力集成的一条主线,条理清晰,足以当作快速了解这家团队的一份参考。
![]()
这类「读一批结构化资料、抽取要点、组织成文」的活正是其擅长的信息聚合与结构化输出场景。
当然,我们也没只挑它擅长的来。我们尝试让它独立完成一个更复杂的工程:用 Vite + TypeScript + Three.js 加 cannon-es 物理引擎,做一个 3D 物理台球沙箱。这一次,它并没有完全跑通。
这个结果谈不上意外,反倒和 Ling-3.0-flash 自身的定位相互印证:它本就不是为「一句话端到端拿下复杂工程」而设计的全能架构师,而更适合在人把架构和路径规划清楚之后,作为执行节点分步落地。如果先由人或更大的规划模型搭好台球沙箱的模块骨架,再让它逐轮填充实现,大概率会是更顺手的协作方式。
综合几轮体验,我们的直观感受和官方口径大体吻合:在边界清晰、有明确验证信号的任务上,它响应快、执行稳,接入工作流的成本也低;而一旦任务滑向开放、松散、需要它自己从零扛起整体架构,它的短板就会显现。
这正是一个「执行模型」应有的样子:把它用在对的地方,性价比很高;用错地方,则可能会带来失望。
极致「压榨」背后:一套围绕效率重写的架构
Ling-3.0-flash 的能力,官方归因于两条线的共同作用:一是底层架构的系统性升级,二是面向生产力场景的 Agent 定向优化。
前者决定了「同样的参数能转化出多少能力」,后者决定了「这些能力能不能在真实任务里稳定交付」。
先看架构。原生混合线性注意力是这次升级的地基。
![]()
与上一代 Ling-2.6 先进行架构迁移、再继续训练不同,Ling-3.0 从预训练阶段便采用原生混合线性注意力架构,以 5:1 的比例交替堆叠 KDA 线性注意力层和 MLA 层,即每 6 层中包含 5 层 KDA 和 1 层 MLA。由于各组件从训练初期便在同一架构中共同优化,模型可以兼顾长上下文处理效率和整体能力。
这里的 KDA(Kimi Delta Attention)即 Moonshot(月之暗面)在 2025 年底 Kimi Linear 工作中提出的线性注意力机制,随后成为业界探索高效注意力的一个共同参照。
它的思路是在 Delta Rule 的状态更新里引入细粒度对角门控:让不同特征通道拥有各自独立的保留、衰减与写入控制,而不是用一个全局旋钮统一处理记忆的遗忘。
通俗地说,模型在读长文档、大型代码库时,能更精准地维护那些跨段落、跨步骤的关键信息,不至于把新旧信息混成一团。Ling-3.0 把上一代的 Lightning Attention 换成了 KDA,正是看中这一点。
MoE 稀疏度进一步压低是「智效比」的直接来源。这一取向的方法论依据来自百灵此前提出的效率杠杆(Efficiency Leverage)与Ling Scaling Law:在达到同等性能的前提下,更低的专家激活比例能换来更高的算力效率。
![]()
激活比例越低,效率杠杆(相对稠密模型节省的算力)越高,且随算力预算放大。图为 1e22 FLOPs 下的估计值。来源:蚂蚁百灵团队 Efficiency Leverage 论文,arXiv:2507.17702
据介绍,Ling-3.0 据此把每个 Token 的专家激活比例从前代的 1/32 进一步降到 1/64。也就是说,124B 的总参数里,每次推理只点亮很小一部分,以极低的计算消耗驱动模型能力实现跃迁。
原生混合线性注意力、KDA 与稀疏 MoE 三者叠加,构成了它敢在 124B(激活 5.1B)体量上「越级挑战」的架构底气。
不过,这条「线性注意力 + 极致稀疏」的路线能否在更大规模上继续保持质量,行业内仍有不同看法。Acing AI 的第三方分析指出,线性注意力混合架构在研究规模(数十亿参数)上的「质量对齐」,未必能平滑迁移到前沿规模,尤其是在长上下文多跳推理这类被标准测试集低估的任务上。
当然,Ling-3.0-flash 走的本来就不是「什么都懂一点」的路线,而是把有限资源集中用在 Agent 和核心推理上。但这也提醒我们,「小体量对标大旗舰」的成立范围,需要落到具体任务上去看,而非一概而论。
除了模型本身的架构升级,Ling-3.0-flash 还针对真实生产环境中的 Agent 任务,在训练、推理服务和多智能体协同等方面做了专门优化。
按照官方说法,团队将 Coding Agent、General Agent 和 Deep Research Agent 的可交互训练环境扩展至 1 万多个,并持续提高环境的多样性、质量和任务难度。强化学习阶段还引入了完整执行轨迹复盘和步骤贡献评估,为长程任务提供更细粒度的步骤级训练信号。
这些训练主要提升模型在复杂约束下持续规划、调用工具、处理失败反馈和动态调整执行路径的能力。官方称,相比上一代旗舰 Ring-2.6-1T,Ling-3.0-flash 的 Agent 能力有明显提升,部分指标达到更大参数规模模型的水平。
MiniAppBench 可以提供一个外部参照——这个基准要求模型仅凭一句用户需求生成完整可用的 APP。参与评测的 16 个主流模型平均通过率约为 17%,Ling-3.0-flash 的通过率达到 25.3%,与总参数规模约为其两倍的开源 SOTA 模型持平。
工程层面还有两处改动,针对的是「Agent 任务越长,服务越吃力」这个问题:
一是响应速度。Agent 任务的对话轮次越多、上下文越长,传统推理服务一旦本地缓存被挤出,或会话被调度至其他节点,就可能需要重新处理此前数万 Token 的上下文,导致首 Token 延迟快速上升。Ling-3.0-flash 基于 SGLang HiCache 与 Mooncake 构建了集群级分层缓存体系,将缓存从「实例私有」升级为「集群共享」,使已有上下文能够跨层级存储、跨节点复用和按需恢复。
官方实测称,在长输入场景下,命中 L3 Cache 相比重新计算,可将 TTFT 降低 60%~80% 以上。
![]()
对于 Coding Agent 和长文档问答等场景,这可以减少上下文重算并加快任务接续。
二是协同稳定性。面对复杂 Agent 任务,单一推理链路容易出现决策漂移、局部误判和容错能力不足等问题。为此,百灵升级了名为「Ling Multi-Agent」的多智能体协同架构。不同 Agent 可以围绕任务进行多层级分工,并通过交叉验证、信息补充、协同纠错和竞争式「赛马」,降低单一推理路径造成的偏差。
根据官方展示的实验结果,Ling Multi-Agent 在 BrowseComp 和 BrowseComp_zh 上的表现会随协同计算规模增加而提升。这表明,在复杂检索和深度研究任务中,能力扩展不仅取决于单个模型,也可以来自更有效的任务委派和结果校验。
![]()
从这些改动来看,Ling-3.0-flash 的产品逻辑是自洽的:把「执行」这一环节的速度、稳定性和成本做到极致,再靠工程手段解决长程交互中的重算与漂移问题。
相应地,这种取舍也带来了明确的边界。模型资源更多集中于智能体与核心推理,在广度知识储备和多语言稳定性方面仍有提升空间,长对话或高压交互下也可能出现中英文混杂。
对使用者而言,这意味着一些明确的「不适合」:极度冷门、需要庞大世界知识硬背的研究任务,缺少「可验证节点」的松散开放式需求,以及「一句话帮我做完整工程」的 One-shot 预期……这些场景更适合交给更大的推理模型,或由人先把架构和路径规划好,再让它分步执行。当前版本也不具备原生多模态能力,遇到需要理解截图或音频的任务,需要配合多模态模型使用。
当「智能」开始按密度计价
从 Ling-3.0-flash 身上,可以看到一个越来越明显的行业变化:Agent 落地进入深水区之后,衡量一个模型价值的坐标,正从「参数有多大、榜单有多高」,悄悄挪向「单位算力、单位成本能换来多少可靠的执行」。
这也是 2026 年不少企业在做的取舍:与其用一个昂贵的大模型端到端包揽一切,不如让大模型负责思考、让轻量执行模型负责高频落地,用动态路由把成本压下来。
在这个坐标系里,Ling-3.0-flash 给出了一个不错的答案,但它是否适用于更多任务和场景,还需要继续验证。接下来,模型之间比拼的可能不只是能力有多强,也包括能否用更少的资源,把能力用在真正需要的地方。
而对今天的开发者来说,选择这类模型时,标准其实很简单:先想清楚要让它做什么,再把任务边界和验收标准说明白,剩下的交给它快速执行。
官方表示,Ling-3.0-flash 模型权重将在免费体验期结束后正式开源。可以开始期待了……
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.