网易首页 > 网易号 > 正文 申请入驻

面壁智能放大招!开源全尺寸BitCPM-CANN:国产算力首次跑通1.58-bit训练,推理显存省5/6

0
分享至


智东西
作者 王涵
编辑 漠影

2026年,AI专用HBM内存价格暴涨超165%,显存/HBM正在成为模型扩展最昂贵、最稀缺的资源之一,模型公司的核心推理成本居高不下;

而另一边,高端AI芯片对华出口管制反复横跳,让国产算力生态在面临高昂过路费与供应链安全风险的夹缝中艰难求生。

两件事叠加,指向同一个问题:在硬件受限的情况下,国产模型厂商,该怎么继续做模型?

智东西5月25日报道,在2026年5月23日的华为昇腾开发者大会上,面壁智能联合清华大学、OpenBMB开源社区,正式发布了BitCPM-CANN——全球首个完全基于国产华为昇腾平台训练并开源的三值(1.58-bit)大模型。0.5B到8B全尺寸开源,推理显存节省5/6

BitCPM-CANN有什么不同?它的亮相意味着什么?国产芯片训练的路,又能不能走通呢?

一、1.58-bit三值权重如何跑通昇腾,省下6倍显存?

BitCPM-CANN是全球首个完全基于国产算力平台(华为昇腾)训练并开源的三值(1.58-bit)大模型。

那什么是三值?普通大模型的参数通常用16位或8位浮点数表示,而BitCPM-CANN每个参数只能取三个值:-1、0、+1。理论上,其每个参数平均只需1.58 bit来存储。

为了节省显存,业界的传统思路一般是把32位精度降到8位,这样确实会损失一些精度,但能换来4倍的显存节省。而BitCPM-CANN路线不太一样:团队认为压缩后的每一个比特,都应该尽可能多地学进知识,而不是白白浪费掉。

所以,虽然BitCPM-CANN只有1.58 bit,但是它的信息密度其实非常高,不是“牺牲精度换内存”的妥协。这个特点,在HBM紧缺、长上下文处理、MoE扩展这类特别吃显存的场景里,尤其能发挥价值。

那BitCPM-CANN是怎么做到的?其技术路线可以划分为三个关键步骤:

第一步:把1.58-bit三值权重跑进训练算子。

研发团队采用STE(直通估计器)方案,在训练阶段保留全精度残差用于梯度更新,在导出阶段则输出严格的三值权重,从而将离散权重真正嵌入华为昇腾的训练算子中。

第二步:用完整QAT加后训练蒸馏守住模型能力。

团队在昇腾上完整部署了量化感知训练(QAT)与后训练蒸馏流程,在保证模型效果不下降的前提下,将训练吞吐量的损失控制在仅5%的水平。

第三步:把低比特能力沉淀为MindSpeed训练基础设施。

团队还基于Megatron‑LM框架嵌入可插拔的QAT并行线性层,统一了checkpoint格式并支持32K长序列训练,使低比特训练能力成为昇腾平台上可复用、可扩展的公共底座

二、60B入终端:BitCPM-CANN撬动端侧AI落地

目前,BitCPM-CANN已开源0.5B到8B的全尺寸版本,在1B、3B、8B三个规格上,模型均保留了全精度版本95.7%以上的能力,其中3B版本达到97.2%。即使在数学、代码等高敏感任务上,3B版本的表现也已进入接近全精度的区间。

这些数据意味着1.58-bit已经具备面向真实模型族、真实评测集、真实训练栈的工程说服力。


端侧,这是BitCPM-CANN价值最容易被感知到的地方,因为端侧的用户最多,场景也最广。

拿8B模型来说,传统BF16格式要占大约16GB显存,这个数字已经超过绝大多数手机的内存容量了,更别提还要留给其他应用空间。

BitCPM-CANN把它压缩到2-3GB,手机内存就能轻松跑起来。手机厂商不需要为了跑大模型去堆昂贵的超大内存,普通旗舰机就能流畅运行8B级别的对话模型。

如果再往前走一步,结合MoE架构——每次只激活一部分参数——未来甚至有望把60B级别的模型塞进笔记本电脑、平板,甚至高端手机里。

硬件这边也在同步推进。高通的8850/8397等新一代端侧芯片,已经原生支持2-bit以下的低比特推理。芯片厂商早就把跑道铺好了,就差一个好模型。BitCPM-CANN刚好提供1.58-bit的权重,跟硬件能力完美匹配。

更值得关注的是,BitCPM-CANN全都基于华为昇腾芯片搭建,实现了全链路原生适配国产算力,跟英伟达CUDA生态没有依赖关系。

这意味着其整个训练流程——前向计算、反向传播、量化算子的实现、分布式训练的调度——全部在昇腾上原生完成,中间不需要去CUDA上跑一遍验证再搬回来。

这是昇腾平台上第一个完整跑通1.58-bit训练,并且做了全精度对标评测的公开成果,模型规模直接推到了8B量级,不是几百兆的小模型演示。

国产NPU在大规模三值量化训练这个方向上,之前几乎没有公开的系统化成果,BitCPM-CANN算是把这块空白补上了。

未来,昇腾生态里的低比特模型研发,都可以依托这套底座往前走。环境层、长序列支持、并行策略、融合算子、调试工具,一套链路已经沉淀下来了。后续其他团队想在昇腾上做低比特训练,不需要再从零开始踩坑。

国产芯片、国产模型、国产训练框架一体化的自主产业链条,正在一点点变成现实。

三、四年深耕,全栈自研:面壁智能如何掌握端侧AI话语权?

BitCPM-CANN并非凭空出现,而是面壁智能在端侧AI这条路线上长期深耕的自然结果。

针对端侧AI,面壁已形成自己的模型矩阵——“小钢炮”系列(MiniCPM)。顾名思义,这是参数虽小、能力却强的一系列模型。MiniCPM在GitHub上累计收获超3万星标,Hugging Face开源总下载量超过3000万,成为中国端侧AI领域最受欢迎的开源模型家族之一。


但把时间拨回面壁成立之初,情况远没有这么乐观。2022年,国产芯片在训练大模型上尚不成熟,国内AI基础设施与国外差距明显。也正因如此,绝大多数公司选择了最省事的路径——直接依赖英伟达CUDA生态。

然而,面壁智能却做了一个截然不同的决定:自己写框架,自己搭底座。面壁智能从一开始就不绑定CUDA,换句话说,面壁智能的工程师从头就已经在亲手解决那些底层问题,例如显存怎么分配、通信怎么优化、算子怎么融合。

更重要的是,这个起点引发了一连串的技术积累。此后,他们自研了一套训练框架,取名BM-Train(Big Model Train)。

从稀疏架构InfLLM到低比特量化方法BitCPM、推理框架CPM.cu,面壁智能逐步构建起覆盖训练到推理的全栈端侧技术体系。正是这些积累,让面壁智能能够把验证成熟的1.58-bit训练方法,完整地搬到昇腾平台上,做出BitCPM-CANN,从底层算子到训练框架,全链路在昇腾原生跑通。

更难得的是,他们在国产芯片生态上的积累远不止昇腾一家。此前,面壁智能曾参与协助华为昇腾、鲲鹏,以及寒武纪、天数智芯等国产芯片构建和优化软件栈。这些经历让面壁智能建立起了对国产芯片生态的独特认知:知道坑在哪,也知道怎么绕过去。

端侧大模型的性能释放,离不开模型厂商与芯片厂商的共同投入。在这个赛道上,面壁智能追求的从来不只是参与,而是成为推动者与构建者。

结语:硬件受限,模型效率先行

过去两年,行业把Scaling Law奉为圭臬,算力成了唯一的门槛。

而BitCPM-CANN代表了另一条路线:在硬件给定的前提下,把模型的信息密度推向极限。更重要的是,BitCPM-CANN证明了这条路线可以在国产算力上完整跑通。

回到最开头的那个问题“在硬件受限的情况下,国产模型厂商,该怎么继续做大模型?”

面壁智能用BitCPM-CANN给出了答案:当硬件追赶需要时间,模型效率可以先行。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中美外长这通电话释放出的信息

中美外长这通电话释放出的信息

环球时报国际
2026-09-18 15:33:04
朱迅老公王志送别敬一丹,走路不稳惹人担忧,夫妻俩超低调分开走

朱迅老公王志送别敬一丹,走路不稳惹人担忧,夫妻俩超低调分开走

180视角
2026-09-18 09:25:13
被打崩绝非偶然!中国男篮高大身躯下,却是“民国篮球”的现实

被打崩绝非偶然!中国男篮高大身躯下,却是“民国篮球”的现实

中国足球的那些事儿
2026-09-18 20:20:14
调查显示:华为赛力斯合作模式调整后,七成受访网友称坚决不买问界、当前定价偏高

调查显示:华为赛力斯合作模式调整后,七成受访网友称坚决不买问界、当前定价偏高

新浪财经
2026-09-18 14:58:59
陈冠希现开机仪式,长发齐肩胡子拉碴,跟大肚垮脸的黄秋生差别大

陈冠希现开机仪式,长发齐肩胡子拉碴,跟大肚垮脸的黄秋生差别大

娱说瑜悦
2026-09-17 19:06:50
智谱ZCode被曝偷传用户数据,官方致歉

智谱ZCode被曝偷传用户数据,官方致歉

识礁Farsight
2026-09-18 18:06:56
10岁男孩溺亡两个月后,班主任被立案侦查

10岁男孩溺亡两个月后,班主任被立案侦查

中国新闻周刊
2026-09-18 21:37:24
河南一数学老师花300多万拍院线电影,上映三天票房不到3万,本人回应:已无力回天

河南一数学老师花300多万拍院线电影,上映三天票房不到3万,本人回应:已无力回天

互联网大观
2026-09-18 17:44:42
王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

ETtoday星光云
2026-09-17 13:51:01
徐湖平上千件文物流失仅获刑三年:不是法外开恩,而是法条规定的边界

徐湖平上千件文物流失仅获刑三年:不是法外开恩,而是法条规定的边界

十为先生
2026-09-18 18:25:57
浙江4-1大胜三镇,托利奇2射1传,米特里策传射,李昂飞踹染红

浙江4-1大胜三镇,托利奇2射1传,米特里策传射,李昂飞踹染红

懂球帝
2026-09-18 21:42:29
家属回应“女子生育后渐失明失聪”:患NF2罕见病,生育前已有症状 医生称极罕见、无普遍性

家属回应“女子生育后渐失明失聪”:患NF2罕见病,生育前已有症状 医生称极罕见、无普遍性

红星新闻
2026-09-18 17:08:22
私吞上亿善款终于尘埃落定?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款终于尘埃落定?官方正式宣布,54岁韩红身份迎来转变

阿伧说事
2026-09-15 15:58:58
蒋介石临终痛哭:杀他是我一生最大错误,要不然根本不会败退台湾

蒋介石临终痛哭:杀他是我一生最大错误,要不然根本不会败退台湾

凡人侃史
2026-09-18 14:24:56
中央政法委发布公示

中央政法委发布公示

政知新媒体
2026-09-18 14:44:25
太尴尬了!上海豫园的汉服女生对国人全程无视,老外开口就答应,一段路人求合影视频引争议

太尴尬了!上海豫园的汉服女生对国人全程无视,老外开口就答应,一段路人求合影视频引争议

火山詩话
2026-09-18 05:55:55
9月18日俄乌最新——西科尔斯基:那谁,有种放马过来

9月18日俄乌最新——西科尔斯基:那谁,有种放马过来

西楼饮月
2026-09-18 22:00:11
普京通告全俄,希望1.4亿俄罗斯人在未来3天,为胜利采取行动

普京通告全俄,希望1.4亿俄罗斯人在未来3天,为胜利采取行动

浯江孤舟
2026-09-18 09:08:10
中央安全生产考核巡查组在浙江明查暗访:安全培训,岂能变成应付检查的“纸面安全”

中央安全生产考核巡查组在浙江明查暗访:安全培训,岂能变成应付检查的“纸面安全”

新京报
2026-09-18 08:43:12
秦王级别墓葬现世!墓主或为秦始皇嫡祖母

秦王级别墓葬现世!墓主或为秦始皇嫡祖母

91.6陕西交通广播
2026-09-18 20:56:20
2026-09-19 01:16:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12620文章数 117168关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

游戏
健康
教育
旅游
公开课

《给他爱5》废弃“自由城”DLC可能会加入到《GTA6》中

脑动脉瘤的治疗方法,该选哪一种?

教育要闻

注意:今日开始,推免系统开放注册!

旅游要闻

510万元/人、6天行程、681份售出!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版