网易首页 > 网易号 > 正文 申请入驻

爆料一个新模型,平替 Opus 4.8 的国产之光来了

0
分享至

今天有个重磅消息,智谱正式发布了 GLM-5.2 模型,同时也开源了。

在全球百万用户参与盲测的前端开发评估系统 Code Arena 上,GLM-5.2 取得目前可用模型第一的成绩。


有一说一,国产模型这次真的站在了世界前列,属于我们普通人能用得上用得起的国产之光了。

这次 GML-5.2 有两个关键信息,我觉得应该重点聊聊。

第一,Coding 继续保持国产第一、开源第一。

在 FrontierSWE、SWE-Marathon、PostTrainBench 等多个长程任务基准上,GLM-5.2 的表现介于 Claude Opus 4.8 与 GPT 5.5 之间,是排名最高的开源模型。


我在网上看到一个 AI 博主说,如果你是通过中转服务使用 Opus,那你可能分不出有可能是 GLM-5.2 冒充的。

第二,1M token 上下文。

注意,不是标称 1M,是真正能用的 1M。

现在市面上标称 1M 的模型不少,但大部分到了长上下文后半段效果衰减得厉害。

GLM-5.2 通过注意力结构层面的创新,把 1M 长度下的效果衰减和推理成本同时压了下来。

说人话,就是它在处理超长任务时不会到后面就开始犯糊涂、忘前面说过什么。

这个能力为什么重要?我换个说法你就明白了。

现在用 AI 写代码最大的痛点不是它写不出来,而是任务一长它就忘了。

你让它改一个大项目,改到第 30 步的时候它忘了第 2 步定下的规则。你不得不反复提醒它、反复把上下文喂回去,累的不是 AI,是你。

说白了,就是「能干活,但记性差」。

因此,1M 上下文解决的就是这个问题。

一个持续工作数小时的 AI 要经历几千次工具调用、读写数万行代码、积累大量中间状态。

如果上下文窗口不够长,模型就被迫不断压缩、丢弃、再回忆,每一次压缩都是信息损耗,每一次遗忘都可能让任务在第 N 步偏离第 2 步的约束。

长程任务的失败,很多时候不是模型不够聪明,而是它忘了。

GLM-5.2 做到的是在一次任务中完整持有整个项目的全部代码、全部决策历史、全部约束条件。

这个过程,就像一个不会忘事的工程师,从头推进到尾。

这里说个案例。

之前我自己用其他模型结合 Claude Code 开发了一个小程序,当时光是 PRD 文档就有 5000 多字,因为单个文件太大,还是拆分上传的。


这次我换成 GLM-5.2 试了下,试图让它重构这个项目,还是同一份 PRD 文档。

开启 CC 的 Plan Mode 模式后,我先让模型自己加载分析需求文档并制定开发计划,然后再进入开发阶段。

过程中,我还加了一些需求,并且对一开始的信息做了修改。此时,GLM-5.2 的 1M 上下文优势就出来了,全程无纰漏。


大概用了 25 分钟左右,这个基于 PRD 的项目就全部开发完了,而且自己调起了本地的微信开发者工具。

我让它统计了代码量,总共 16000 行代码,而且能成功预览。

不过有一说一,我觉得 GLM-5.2 在前端页面的设计美观度上还有提升空间,现在属于可用,但还不是绝对好的状态。


如果是用来做一些大型项目的重构或者开发,这种 1M 上下文空间的体验就会明显好很多。

在 Terminal-Bench 2.1 上,这是一个评测 Agent 通过命令行操作一台计算机的数据集,GLM-5.2仅比Opus 4.8低4%,相比GLM-5.1提升了17.5%。

在 MCP-Atlas 上(工具使用tool-use评测的数据集),GLM-5.2仅比Opus 4.8 低 0.8%。


此外,能做的事情也变了。

整个代码库扔进去做跨文件重构,一句话需求直接出完整全栈项目,大型 SaaS 级工程持续推进不跑偏。

这些场景以前只能拆成无数个小任务反复喂上下文,现在可以一次性给完、一次性干完。

我自己也测了一个场景,就是优化我之前用 Agent 开发的个人网站。

先说下,如果你们想用上 GLM-5.2,就得去抢智谱的 Coding Plan,不过这个现在很紧俏,你们可以每天去盯一盯官方放量的时间。

如果抢到了配额,就可以配置到你的 Agent 里直接开始用,我是用 Claude Code 配合 GLM-5.2 用的。

之前开发这个网站我用了几个模型混合完成,包括 GLM-5.1、Claude Opus 4.6 和 4.8。

从前端开发质量来看,Claude 的模型确实做得更好,但是在代码本身的开发质量上,我觉得 GLM 和 Claude 的差距并没有那么大。

这次优化,我完全用 GLM-5.2 来完成,核心就是优化我之前觉得别扭的几个模块。

第一个问题就是我网站上案例墙这部分,现在的问题就是重点不突出、没有数据、视觉不美观。


我跟 GLM-5.2 提的需求并没有那么明确,只是表达了一句话需求。

但是,它的分析和问题拆解却很精准,而且还发现了代码中存在的命名问题。

讲真,它跟我说话真的是毫不客气。


不仅找准了问题,而且还给出了方案。


不仅按照这个新方案做了重新开发,还对我原有的代码结构做了优化,整个网站的代码都有被它 review。

我有一个很直观的感觉,就是一次性成功率更高,而且模型在需求理解、代码执行、完成质量上做得都不错。

优化后的最终效果,明显比之前好太多。


说实话,结果超出预期。

从实际体感来看,我觉得写出来的代码质量和最终呈现的效果跟之前我用的 Claude 模型差异并不是很大。

还是我之前说的,现在 GLM 系列的模型在国产 coding 领域的确是做得非常好的一家。

说实话,对于我们这些每天重度使用 AI 的人来说,智谱的操作是值得点赞的。

之前大家选模型默认选海外的,Claude、GPT,能力确实强。

但稳定性呢?可用性呢?账号说封就封,模型说停就停,上周 Anthropic 的事就是最好的例子。

现在,国产开源模型的价值正在被重新评估。

不是说它今天在所有维度上都比 Claude 好,而是它稳定、可控、不会哪天突然告诉你「因为政策原因,你不能用了」。

还有一点,现在国产 AI 都在不同程度上被限卡,如果这个环节能突破,我觉得不会比国外差。

GLM-5.2 这次的做法也值得一说,Coding Plan 全量用户直接可用,包括免费的 Lite 版。

这种发布方式本身就是一种态度,不搞花活,你自己试,数据说话。

最后,说下我自己的判断。

过去一年,行业衡量模型的标准正在迁移。以前比的是谁完成任务更好,谁的 benchmark 分高谁就牛。

现在比的是「能独立干多久」,谁能持续工作、不跑偏、不忘事,谁才是真正能用的生产力工具。

上下文长度的可用性和长程任务能力,正在成为下一阶段模型竞争的主线。

技术要真正普及成生产力,就一定是开放的。

所有的不开放和限制,本身其实就是对生产力进步的一种束缚。

智谱在他们官宣内容的最后提到两句英文:

A step closer to frontier intelligence for everyone.

The future of AI is open, and it is for the people.

翻译过来就是:

向前沿智能再近一步,为每一个人。

AI的未来是开放的,它属于所有人。

国产模型走到这一步,值得被看见。

················· 唐韧出品 ·················

用AI思维发现下一个机会

安可时刻

如果国产模型能解决被限卡的瓶颈,那速度和质量又会上去一个台阶。

其实对于大多数任务来说,现在国产模型已经表现不错了。从我的日常 coding 场景来看,GLM-5.2 基本也能满足大多数需求。

国外模型是很强,但我们也要给国产模型一些时间让他们成长。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
基辅一夜炸响八座城,24个仓库集体报废,俄这次不再手软

基辅一夜炸响八座城,24个仓库集体报废,俄这次不再手软

午夜搭车a
2026-08-28 09:40:41
爸爸几年如一日给女儿发:“大肥猫发给我”,刚开始以为爸爸是猫瘾太重,结果没想到...知道真相后笑着哭了

爸爸几年如一日给女儿发:“大肥猫发给我”,刚开始以为爸爸是猫瘾太重,结果没想到...知道真相后笑着哭了

铲屎官阿伟
2026-08-26 10:15:10
“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

世界圈
2026-08-27 21:36:04
将世界第一拉下马!常冰玉延续黑马之旅,5-1跻身武汉公开赛四强

将世界第一拉下马!常冰玉延续黑马之旅,5-1跻身武汉公开赛四强

全景体育V
2026-08-27 16:10:38
深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

深夜,歹徒闯入家中对她施暴近两个小时,她咬紧牙关一声不吭,只为保护楼上熟睡的女儿。当警察破门而入时,才发现这位母亲早已浑身是血

人生录
2026-07-30 00:05:11
惨!投资5000万票房3300块,这一次,傅首尔被影视圈彻底抛弃了

惨!投资5000万票房3300块,这一次,傅首尔被影视圈彻底抛弃了

得得电影
2026-08-25 14:10:56
卡塔尔外交部:以色列不存在和平伙伴

卡塔尔外交部:以色列不存在和平伙伴

环球网资讯
2026-08-26 21:51:56
深圳这座大楼一旦投用,全世界都得重新认识中国

深圳这座大楼一旦投用,全世界都得重新认识中国

天气观察站
2026-08-28 02:01:13
时隔多年!摩拜299元押金可全额退了 网友:天降横财

时隔多年!摩拜299元押金可全额退了 网友:天降横财

快科技
2026-08-27 13:31:24
油耗高到离谱!这5款轿车让车主哭晕在加油站,第一名百公里15升

油耗高到离谱!这5款轿车让车主哭晕在加油站,第一名百公里15升

三农老历
2026-08-26 03:44:41
“断子绝孙”还有救?联合国曾预言:2050年,中国人口将出乎意料

“断子绝孙”还有救?联合国曾预言:2050年,中国人口将出乎意料

悦心知足
2026-08-23 03:55:40
知情人士坚称CIA局长访俄为北约和伊朗

知情人士坚称CIA局长访俄为北约和伊朗

新华社
2026-08-27 15:06:22
景甜形象崩塌,90后富豪孙宇晨用15页长文把所有事情都抖了出来

景甜形象崩塌,90后富豪孙宇晨用15页长文把所有事情都抖了出来

西楼知趣杂谈
2026-08-28 09:04:33
创造历史!亚亚·图雷成为首位带队杀入欧冠正赛的非洲籍主教练

创造历史!亚亚·图雷成为首位带队杀入欧冠正赛的非洲籍主教练

体坛说球77
2026-08-27 09:30:38
大胆预测一下,亚运会男子100米冠军,非以下三位运动员莫属

大胆预测一下,亚运会男子100米冠军,非以下三位运动员莫属

星Xin辰大海
2026-08-27 02:42:21
中年女人最馋这几句“下流话”,比“我爱你”管用100倍,别不信

中年女人最馋这几句“下流话”,比“我爱你”管用100倍,别不信

皓皓情感说
2026-08-27 08:05:25
警惕!只要有人打电话问你“是不是本人?”立刻这样回,防骗保命

警惕!只要有人打电话问你“是不是本人?”立刻这样回,防骗保命

叮当当科技
2026-08-24 02:11:37
台风“沙德尔”在浙江台州玉环市登陆,最大风力12级;浙江159条预警连发,温州、台州、丽水等局地有特大暴雨

台风“沙德尔”在浙江台州玉环市登陆,最大风力12级;浙江159条预警连发,温州、台州、丽水等局地有特大暴雨

鲁中晨报
2026-08-28 08:58:18
陕西一单位任免35名干部

陕西一单位任免35名干部

时尚的弄潮
2026-08-28 01:19:56
仗没法打了?最反俄的利沃夫也反了,征兵官当众被壮丁刺死

仗没法打了?最反俄的利沃夫也反了,征兵官当众被壮丁刺死

芳芳历史烩
2026-08-25 04:25:22
2026-08-28 10:32:49
唐韧 incentive-icons
唐韧
用产品思维解决难题
1534文章数 2045关注度
往期回顾 全部

科技要闻

AI牛马永不下班!OpenAI让智能体自己找活

头条要闻

景甜发文回应孙宇晨起诉:我依然眼光不行

头条要闻

景甜发文回应孙宇晨起诉:我依然眼光不行

体育要闻

因为这条规则,欧联冠军一个夏天散伙了

娱乐要闻

孙宇晨魔性长文加真实诉讼,围剿景甜

财经要闻

美英对中国金企下黑手 黄金会越来越贵?

汽车要闻

搭华为ADS 5/增程纯电可选 阿尔法T7预售13.78万起

态度原创

本地
手机
时尚
旅游
公开课

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

手机要闻

全球首款阔直板!华为Pura X View开启预订:全系12GB内存、首发鸿蒙7

女装完了,晚晚来了

旅游要闻

报告:暑期中国多地发放消费券有效撬动文旅活力

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版