8月26日,智谱认领了此前在海外开发者社区引发热议的神秘模型“牛来”,其真身是GLM-5系列首个原生多模态模型GLM-5.3-Flash,并同步开源。
这个模型在正式亮相前,以匿名代号Ox Alpha在OpenRouter和OpenCode上免费开放测试,5天内流量累计超过50万亿token,刷新了两个平台的流量增长纪录,使用量一度超过DeepSeek的两倍。真正引发关注的,是智谱随后披露的一个细节——这些流量全部由国产芯片承载。智谱在官方技术文档中表示,公司调用超过10万张国产芯片集群用于该模型推理服务,芯片通过自研高带宽互联网络连接,并采用生产级Encode–Prefill–Decode(EPD)分离式架构。与同一硬件上的初始基线相比,端到端服务性能提升了3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平。
GLM-5.3-Flash总参数3200亿,每次推理仅激活180亿参数,采用稀疏注意力与线性注意力混合架构。据智谱介绍,其在Artificial Analysis Intelligence Index中获得57分,与Anthropic的Claude Opus 4.8持平。价格方面,其常规定价约为GLM-5.3的十分之一,限时折扣期间约为二十分之一,与Claude Opus 4.8相比约为后者的四十分之一。
半导体研究机构SemiAnalysis在X平台发文评论:“所有流量均由国产芯片承载,硬件效率和单token成本已可与英伟达GPU相媲美。继Jalapeño(OpenAI自研推理芯片)昨日宣布之后,CUDA护城河再度受到考验。”
智谱称,过去一周是其首次在大规模流量中尝试用国产芯片集群提供服务。
市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。
本文源自:市场资讯
作者:听潮
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.