网易首页 > 网易号 > 正文 申请入驻

智谱发布可持续工作8小时的旗舰模型GLM-5.1,同时提价10%

0
分享至

IT之家 4 月 8 日消息,智谱正式发布新一代开源模型 GLM-5.1,官方称这是目前全球最强的开源模型。据官方介绍,其是唯一达到 8 小时级持续工作的开源模型,在最接近真实软件开发的 SWE-bench Pro 基准测试中,GLM-5.1 实现国产模型首次超越 Opus 4.6。


OpenRouter 显示,伴随此次发布,智谱 GLM 再度提价 10%。调价后,GLM-5.1 在 Coding 场景的缓存命中 Token 价格已接近 Anthropic 旗下 Claude Sonnet4.6 水平。这是国产大模型首次在核心场景实现与海外头部厂商的价格对齐。

IT之家附官方详细介绍如下:

从 3 分钟的 Vibe Coding(氛围编程)到 30 分钟的 Agentic Engineering(智能体工程),再到本次我们带来的 8 小时 Long-Horizon Task(长程任务),GLM-5.1 再次取得突破。

GLM-5.1 是我们迄今最智能的旗舰模型,也是目前全球最强的开源模型。GLM-5.1 大大提高了代码能力,在完成长程任务方面提升尤为显著。和此前分钟级交互的模型不同,它能够在一次任务中独立、持续工作超过 8 小时,期间自主规划、执行、自我进化,最终交付完整的工程级成果。

代码能力是模型智能水平进一步提升的关键。下图是业内最具代表性的三个代码评测基准的平均结果,包括衡量模型专业软件开发工作的 SWE-Bench Pro、操作命令行解决问题的 Terminal-Bench 2.0、从零构建完整代码仓库的 NL2Repo,GLM-5.1 取得全球模型第三、国产模型第一、开源模型第一。


在最接近真实软件开发的 SWE-bench Pro 基准测试中,GLM-5.1 刷新全球最佳成绩,超过 GPT-5.4、Claude Opus 4.6。SWE-Bench Pro 要求模型在真实 GitHub 仓库中定位并修复高难度工程 Bug,是衡量模型能否胜任专业软件开发的最硬指标。


你睡觉的 8 小时,是模型上班的 8 小时

过去两年,行业用 Benchmark 衡量模型有多智能。我们认为,下一阶段的衡量标准应该是“能工作多久”,即模型在 Long-Horizon Task 中的表现,能独立完成多长时间的人类任务。

在长程任务中保持稳定输出,模型面对的不只是更大代码量,而是一连串复杂的工程决策点:主动跑 benchmark、定位瓶颈、修改方案、再跑测试。这对模型提出更高的要求,需要像人类工程师一样,形成“实验 → 分析 → 优化”的完整闭环,而不是写完代码停下来等人打分。

在 METR 榜单的同等评估标准下,GLM-5.1 是唯一达到 8 小时级持续工作的开源模型,也是全球范围内除 Claude Opus 4.6 外少数具备这一能力的模型。我们的终极目标是全自治智能体(Autonomous Agent),模型 7×24 小时不间断地分解目标、执行交付、自我评价与纠正、自我进化,从此无需人类介入。

看看模型的一天 8 小时工作,都能做些什么。

场景一:8 小时从零构建 Linux 桌面

白天画好架构草图,睡前交给 GLM-5.1,早上醒来已产出完整系统。历时 8 小时整,执行 1200 多步,20 分钟时产生第一个有意义的成果,8 小时产出了一套功能完善的 Linux 桌面系统,包括:完整的桌面、窗口管理器、状态栏、应用程序、VPN 管理器、中文字体支持、游戏库等,4.8MB 的配套文件,这相当于一个 4 人团队一周的开发工作量。

以下视频是 GLM-5.1 在 8 小时内的代码提交结果:这些不是四五行的小 patch,每一次提交都是具有实质意义的系统级演进,而且全程没有人参与测试、审查代码。模型甚至给自己的代码写了一些回归测试,而且跑过了。

场景二:655 次迭代打破向量数据库优化瓶颈

向量数据库是 AI 搜索和推荐系统背后的核心引擎,而近似最近邻检索则是其中非常关键、也非常考验算法与工程能力的一环。这个过程既要求模型掌握 IVF、HNSW、向量量化等底层算法知识,也要求它具备真实的工程判断力,能够在一条优化路径碰壁时主动识别瓶颈、切换策略,而不是盲目重复同一个方向。

GLM-5.1 不是只会微调参数,而是一路自己完成了从全库扫描切到 IVF 分桶召回、引入半精度压缩、加入量化粗排、做两级路由,再到提前剪枝的整套优化链条。在 655 轮迭代里,它持续自主跑 Benchmark、定位瓶颈、调整方案,最终把向量数据库的查询吞吐从初次交付的 3108 QPS 一路推到 21472 QPS,提升到初始正式版本的 6.9 倍。

场景三:1000 轮工具调用优化真实机器学习模型负载

GLM-5.1 展现的长时间工作和自进化能力,让其从单纯的“代码生成器”进化为“主动的系统优化器”。我们在涵盖 50 个真实机器学习计算负载的 KernelBench Level 3 优化基准上,让 GLM-5.1 对每个负载独立进行持续优化。在超过 24 小时的不间断迭代中,GLM-5.1 自主完成了多轮编译 — 测试 — 分析 — 重写循环,最终取得 3.6 倍的几何平均加速比,显著高于 torch.compile max-autotune 模式的 1.49 倍。

模型展现出的优化深度与创造力尤其值得关注。GLM-5.1 能够自主编写定制 Triton Kernel 和 CUDA Kernel,运用 cuBLASLt epilogue 融合并实施 shared memory tiling 与 CUDA Graph 优化。这些优化策略覆盖了从高层算子融合到微架构级调优的完整技术栈,每一步都是模型的自主决策。

这一结果表明,在 GPU 内核优化这一传统上高度依赖专家经验的领域,AI 模型已经展现出从问题分析、方案设计到迭代调优的端到端自主工作能力。在 GPU 以及更广泛的高性能计算领域,长期制约工程效率的优化瓶颈正在被 AI 逐步打破。


Behind the 8h

让模型跑 8 小时并不难,真正难的是让第 8 小时的工作仍然有效。

此前包括 GLM-5 在内的模型,在面对复杂优化任务时,往往在早期快速取得收益后就进入瓶颈期。它们会反复尝试已知的优化手段,但无法在一条路走不通时主动切换策略。

GLM-5.1 的训练目标是突破这个瓶颈。在向量数据库优化任务中,我们观察到一个典型的 " 阶梯型 " 优化轨迹:模型在一个固定策略内进行增量调优,当收益趋于停滞时,主动分析 Benchmark 日志、定位当前瓶颈,然后跳转到结构性不同的方案 —— 从全库扫描到 IVF 分桶,从单精度到量化粗排,从单层路由到两级剪枝。每一次跳跃都伴随着短暂的 Recall 下降,因为模型在探索新方向时会暂时打破约束,随后再调回来。这个 " 打破-修复 " 的循环本身就是有效优化的标志。

在 KernelBench 上,我们通过对比多个模型的优化曲线,更直接地看到了这个差异。GLM-5 在前期上升较快,但很早就趋于平坦;GLM-5.1 在同样的时间窗口内持续上升得更久,最终达到了 GLM-5 的 1.4 倍。关键在于模型能把 " 有效优化 " 的窗口延伸多远。

在 Linux 桌面构建任务中,挑战又不一样了。前两个场景都有明确的数值指标(QPS、加速比)可以用来衡量每一步是否有效,但构建一个完整的桌面系统没有单一指标,什么算 " 好 " 取决于功能完整度、视觉一致性、交互质量的综合判断。这要求模型具备初步的自我评估能力:在每一轮执行后审视自己的产出,判断哪里需要改进、继续优化。这是三个场景中反馈信号最弱的一个,也是当前最需要突破的方向。

我们认为,延长模型的 " 有效工作时长 " 是提升智能体能力的一个基础维度。在这条路上仍然有显著的技术挑战:如何克服模型面对复杂任务的上下文焦虑、如何在数千次工具调用后保持执行的一致性、如何更早地跳出局部最优,以及更重要的是如何在没有确定数值指标的任务上建立可靠的自我评估机制。GLM-5.1 是我们在这个方向上迈出的一步,我们会持续推进。

GLM-5.1 不只是一个更强的模型,而是一种新的技术范式的开启。此刻,尝试给它一个指令,然后离开 8 小时。

开源与使用方式

  • 1.官方 API 接入
    • BigModel 开放平台:https://docs.bigmodel.cn/cn/guide/models/text/glm-5.1
    • Z.ai:https://docs.z.ai/guides/llm/glm-5.1
  • 2.产品体验
    • GLM-5.1 即将登陆 Z.ai:https://chat.z.ai
    • GLM-5.1 已纳入 GLM Coding Plan (Max / Pro / Lite),支持 Claude Code、OpenCode 等主流开发工具。
  • 3.开源链接
    • GitHub:https://github.com/zai-org/GLM-5
    • Hugging Face:https://huggingface.co/zai-org/GLM-5.1
    • ModelScope:https://modelscope.cn/models/ZhipuAI/GLM-5.1

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一家6口挤在出租屋 妻子打赏男主播近30万 丈夫:男主播叫她“姐姐”,她打赏他1576次

一家6口挤在出租屋 妻子打赏男主播近30万 丈夫:男主播叫她“姐姐”,她打赏他1576次

封面新闻
2026-08-25 14:49:06
天呢!30岁男子失业饿肚子,导致肾衰竭,评论区炸锅了...

天呢!30岁男子失业饿肚子,导致肾衰竭,评论区炸锅了...

慧翔百科
2026-08-24 17:38:05
真可怜啊!网友同情明星,不火了只能接廉价商演,一场仅仅5万元左右!评论区被气得不轻!

真可怜啊!网友同情明星,不火了只能接廉价商演,一场仅仅5万元左右!评论区被气得不轻!

谭谈社会
2026-08-25 14:40:14
江苏多地发现“巨型老鼠”!环保部门提醒:别抓、别喂、别放生

江苏多地发现“巨型老鼠”!环保部门提醒:别抓、别喂、别放生

上游新闻
2026-08-26 12:13:04
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
马克龙即将下台,接班人基本锁定,中国将面对一个完全不同的法国

马克龙即将下台,接班人基本锁定,中国将面对一个完全不同的法国

影孖看世界
2026-08-25 22:04:24
打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

汉史趣闻
2026-08-24 16:49:25
深夜街头,赵某某(男,20岁)、向某(男,20岁)二人刻意猛轰油门、翘头翘尾,甚至公然闯红灯,涉寻衅滋事被行政拘留

深夜街头,赵某某(男,20岁)、向某(男,20岁)二人刻意猛轰油门、翘头翘尾,甚至公然闯红灯,涉寻衅滋事被行政拘留

环球网资讯
2026-08-26 14:46:16
南海出大事了!菲律宾又搞来一条破船,这次直接弄沉了!

南海出大事了!菲律宾又搞来一条破船,这次直接弄沉了!

回京历史梦
2026-08-25 17:48:50
全线失血的阿里,吓坏资本市场!

全线失血的阿里,吓坏资本市场!

功夫财经
2026-08-26 08:02:55
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

新首相决定对中国赔钱那一刻,全世界都看懂了:不能对华继续天真

比利
2026-08-06 11:11:07
那英田震同日开演唱会,一个众星拱月排面足,一个孤勇赴场见风骨

那英田震同日开演唱会,一个众星拱月排面足,一个孤勇赴场见风骨

娱乐E君
2026-08-25 11:32:47
集体大跳水!深圳出发最猛暴跌67%!有人抄底捡漏,网友:必须冲

集体大跳水!深圳出发最猛暴跌67%!有人抄底捡漏,网友:必须冲

南方都市报
2026-08-26 08:16:42
25岁中国女留学生在韩遇害,知情人称嫌疑人长期向女性发送骚扰信息

25岁中国女留学生在韩遇害,知情人称嫌疑人长期向女性发送骚扰信息

上观新闻
2026-08-26 17:37:59
那英也没想到,北京的一场演唱会, 竟将自己的江湖地位暴露无遗

那英也没想到,北京的一场演唱会, 竟将自己的江湖地位暴露无遗

寒士之言本尊
2026-08-25 18:55:05
伊朗1000万美元悬赏特朗普小儿子,其行踪被全面监控!“特朗普或将余生难安”

伊朗1000万美元悬赏特朗普小儿子,其行踪被全面监控!“特朗普或将余生难安”

纵相新闻
2026-08-26 10:02:14
武汉公开赛战报!5-2,5-3赵心童,塞尔比晋级,16强出炉中国5席

武汉公开赛战报!5-2,5-3赵心童,塞尔比晋级,16强出炉中国5席

领悟看世界
2026-08-26 02:44:01
西藏吉隆口岸附近发生泥石流 失联人员或有道路施工者

西藏吉隆口岸附近发生泥石流 失联人员或有道路施工者

红星新闻
2026-08-26 16:33:42
想买歼-10CE!“注意到中国战机出色表现”

想买歼-10CE!“注意到中国战机出色表现”

环球时报国际
2026-08-26 17:18:39
2026-08-26 21:43:00
IT之家
IT之家
爱科技,爱这里 - 前沿科技人气平台
362963文章数 607469关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

男子未领证办婚礼后离世留400万财产 女方要求分200万

头条要闻

男子未领证办婚礼后离世留400万财产 女方要求分200万

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

硬派增程SUV新选手 北汽泰钽700上市焕新价24.98万起

态度原创

旅游
时尚
游戏
教育
手机

旅游要闻

“必吃榜”境外再拓20城,更多异国地道风味被中国游客“吃”上榜

告别黑白灰,秋天穿“这个颜色”减龄又好看

《巫师3重制版》NS2版截图曝光:进步巨大 焕然一新

教育要闻

关于2026年悦读相伴项目申请结果的公示

手机要闻

真我新机realme P4s印度发布,144Hz高刷屏+8000mAh电池

无障碍浏览 进入关怀版