![]()
8月11日,智谱发布GLM-4.5V。
1060亿总参数,120亿激活参数。在41个公开视觉多模态榜单中,同级别开源模型综合效果SOTA。
这不是重点。重点是智谱同时开源了一个桌面助手应用——它可以实时截屏、录屏获取屏幕信息,依托GLM-4.5V处理代码辅助、视频分析、游戏解答、文档解读等多类视觉任务。
换句话说:AI编程获得了视觉能力。它能看到你的屏幕了。
视觉推理:AI编程的最后一公里
AI编程工具发展到今天,最大的短板不是代码生成能力,而是"理解上下文"。
当前的AI编程工具理解你的代码,靠的是文本——读取文件、分析AST、理解函数调用关系。但编程的上下文远不止代码文本本身。UI设计稿、架构图、数据库ER图、甚至你在浏览器里打开的Stack Overflow页面,都是"上下文"。
GLM-4.5V的桌面助手,用一个简单粗暴的方式解决了这个问题:直接看你的屏幕。
你在IDE里打开一个文件,它能看到。你切到浏览器查文档,它能看到。你打开Figma看设计稿,它能看到。你运行程序报错,它能看到控制台输出。
文本模式的AI编程,读的是代码。视觉模式的AI编程,读的是程序员的工作流。
这两个之间的差距,是"理解你在写什么"和"理解你在做什么"的差距。
前者能帮你补全一行代码。后者能帮你完成一个完整的需求。
41个榜单SOTA意味着什么?开源围剿闭源的速度在加快
GLM-4.5V基于智谱新一代旗舰文本基座模型GLM-4.5-Air,延续GLM-4.1V-Thinking技术路线。
注意这个"基于"——它不是从零训练的视觉模型,而是在已有强大文本能力上叠加了视觉推理。这意味着它的代码理解和视觉理解共享同一个认知底座。当它看到一段代码截图时,它不是"先识别文字再理解代码",而是"直接理解这段代码"。
这种架构思路和GPT-4V、Gemini Vision如出一辙,但智谱选择了开源。
这是一个强烈的信号。过去12个月,国内大模型厂商的开源策略经历了三个阶段:先是不敢开源(怕被追上),然后是选择性开源(小模型开源大模型闭源),现在是旗舰模型全面开源。
千问3.6登顶、GLM-4.5V登顶、DeepSeek持续输出。国产模型在编程能力上对闭源模型的追赶,已经从"差一代"变成了"同一代但各有优势"。
而这种追赶正在加速。因为开源模型的好处是:开发者可以把它部署在任何地方,用私有数据微调,针对特定编程场景优化。闭源模型做不到这一点。
桌面助手的暗线:AI编程的控制权从云端转向本地
GLM-4.5V配套的桌面助手,有一个容易被忽略但极其重要的特征:它是本地运行的。
截屏在本地。录屏在本地。推理在本地(如果部署了本地模型)。
这和云端AI编程工具有本质区别。用Cursor或Claude Code时,你的代码、你的上下文、你的操作习惯,全部上传到了云端。用GLM-4.5V桌面助手时,数据留在你自己的机器上。
对于个人开发者来说,这可能是隐私偏好的差异。对于企业来说,这是合规的生死线。
金融、军工、政府、医疗——这些行业不是"不想用AI编程",而是"不能把代码上传到第三方服务器"。本地视觉推理模型的出现,意味着这些行业也可以开始大规模应用AI编程工具了。
这才是GLM-4.5V开源背后真正的商业逻辑。不是和OpenAI抢C端用户,而是吃下那些因为安全合规原因至今没有使用AI编程工具的B端市场。
这个市场有多大?至少和已经使用了AI编程工具的市场一样大。
GUI Agent路线:为什么视觉模型必须配合桌面操作
GLM-4.5V的桌面助手,本质是一个GUI Agent。它不仅能"看懂"屏幕,还能"操作"屏幕。
这和单纯的截图分析有本质区别。截图分析是静态的——给一张图,返回一段描述。GUI Agent是动态的——它持续观察你的操作,在合适的时机介入。
这种模式的编程价值在于:它把"上下文切换"这一编程中最耗时的认知成本,转移给了AI。
传统编程中,你需要在不同工具之间反复切换:IDE写代码,终端查日志,浏览器搜索解决方案,文档页面查API,Figma看设计稿。每次切换,你的大脑需要重建上下文——"我刚才在想什么?这个变量的类型是什么?这个函数的调用链是怎样的?"
研究显示,一次上下文切换后,程序员平均需要23分钟才能完全恢复专注。而一个程序员每天要切换多少次?几十次。这意味着大量的时间不是花在写代码上,而是花在"恢复写代码的状态"上。
GUI Agent的价值在于:它帮你维持上下文。你在IDE里写到一个函数调用,切到浏览器查这个函数的文档,AI同步看到了两边的信息,在你切回IDE之前,已经把文档中的参数说明和返回值类型对齐到了你的代码上下文中。
你不需要重建上下文。因为AI一直在线。
桌面级的AI编程:从"帮你看代码"到"帮你干活"
让我们回到产品层面。桌面助手到底能做什么?
根据智谱官方的描述:日常处理如代码辅助、视频内容分析、游戏解答、文档解读等多类视觉任务。
听起来很泛。但如果把这些能力串联起来,你会发现一个全新的编程工作模式正在成形。
你在IDE里写前端代码,切到浏览器看效果,AI同步看到了你的操作——它知道你在调样式,主动提示"这个组件的margin可以优化"。你打开一个设计稿截图,AI识别出布局结构,直接生成对应的HTML+CSS。你运行的代码报错了,AI看到了报错信息,定位到相关文件,给出修复建议——你甚至不需要复制粘贴错误信息。
这不是"AI帮你写代码"。这是"AI看着你工作,随时搭把手"。
从辅助工具到协作伙伴的那条线,正在被视觉能力踏破。
视觉编程时代:你能看到的,AI也能看到
GLM-4.5V不是第一个视觉推理模型,但它是第一个把视觉能力直接打包成桌面助手、并且开源的。这意味着任何开发者都可以基于它构建自己的"AI编程眼睛"。
当AI编程工具能看见你的屏幕时,编程这件事的边界就被打破了。以前,AI只理解你让它理解的东西——你选中的代码、你输入的prompt、你指定的文件。现在,AI能看到你看到的一切。
你看到的,AI也能看到。
你没想到的,AI可能先看到了。
这就是视觉推理给AI编程带来的质变。不是更快,是更广。从理解代码,到理解开发者的完整工作上下文。从回答你的问题,到在你提问之前就给出建议。
过去的AI编程工具是工具。有了视觉的AI编程工具,开始变得像一个真正坐在你旁边的搭档。
这个搭档还不要工资,24小时在线,每天都在变得更强。
你的屏幕,从此有了第二双眼睛。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.