9月4日下午,蚂蚁集团旗下百灵大模型团队发布了一款新模型——Ling-3.0-flash-VL。这个命名看起来只是在前代Ling-3.0-flash后面加了两个字母,但实际变化不小:它在原有模型基础上,加入了视觉理解能力和视觉Agent能力。
简单说,之前的Ling-3.0-flash是个纯文本模型,能写能聊能推理;现在这个新版本,眼睛也睁开了——能看图、能读文档、能理解图表,还能基于视觉信息去执行任务。
![]()
视觉之外,还擅长什么
从官方公布的信息来看,Ling-3.0-flash-VL的能力覆盖了六个方向:视觉感知、STEM推理、文档智能、多模态Agent任务、前端编码和医学报告解读。
这几个方向各有各的难点。STEM推理考验的是模型在数学、物理等学科题目上的逻辑能力,光"看见"题目不够,还得会算;文档智能意味着它能处理扫描件、表格、复杂排版;多模态Agent任务则要求模型不只是理解图像,还要根据图像内容做出决策和操作。
比较有意思的是前端编码和医学报告解读这两个方向。前端编码意味着模型能看着设计稿或界面截图,直接生成对应的代码;医学报告解读则涉及专业术语和影像理解,对视觉模型的准确度要求更高。
从文本到多模态,百灵在补什么课
这次发布的路径很清晰:先有文本模型打底,再叠加视觉能力。Ling-3.0-flash-VL不是从零训练的多模态模型,而是在Ling-3.0-flash的基础上扩展出来的——这意味着它继承了原有模型的文本理解和推理能力,同时新增了视觉输入的处理通道。
这种做法的好处是,文本能力不需要重新训练,视觉能力可以聚焦在"看懂"这件事上。对于开发者来说,同一个模型既能处理纯文本任务,也能处理图文混合任务,调用起来更省事。
多模态Agent,意味着什么
视觉Agent能力是这次发布里值得关注的一点。Agent本身是能自主完成任务的AI系统,加上视觉之后,它能做的事情就多了:看一张产品图,去查价格;看一张表格截图,去整理数据;看一份合同扫描件,去提取关键条款。
这类能力在办公自动化、数据分析、内容审核等场景里有实际需求。模型不再只是"回答问题",而是能"看着东西干活"。
目前官方只公布了模型的能力方向,没有给出具体的评测数据或开源计划。对于开发者来说,接下来值得关注的是:这个模型什么时候开放API、价格怎么定、以及视觉能力在真实场景里的表现是否和宣传一致。
百灵这次的动作,方向是对的——多模态是国产大模型绕不开的一站,早补早主动。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.