网易首页 > 网易号 > 正文 申请入驻

把“Token工厂”搬回家,是不是一场好生意

0
分享至


出品|虎嗅科技组

作者|陈伊凡

编辑|苗正卿

头图|AI生成

这是虎嗅WAIC“追踪Token商业新范式”系列文章第17期。

关于 AI算力的故事,通常以十亿美元为单位讲述——数据中心、万卡集群、只有巨头才付得起的账单。后摩智能的故事是一个例外:它关乎每一个人。

2026年,深圳华强北的电子市场里出现了一种新物种:巴掌大小的铝合金盒子,内置一颗10瓦功耗的芯片,却能运行千亿参数的大语言模型。这个需求,在OpenClaw出来之后,被推向了高点。

联想在此基础上推出了 AI 主机P7,长城电脑发布了 N90Pro AI PC。一个全新的硬件品类正在成形——Agent Computer:专为 AI 设计的硬件载体。

这类端侧设备的心脏,是一颗存算一体芯片,来自一家叫做后摩智能的公司。

如果不是大模型引发的指数级推理需求,市场或许很难注意到后摩智能和存算一体。这家公司至今成立6年,成立前两年,验证了存算一体做大算力端边AI芯片的商业路径的可行性,2023年,押注大模型。那对后摩而言是一个关键节点。这一次,和CEO吴强聊天里,能感受到语气里的高昂和希望。

传统芯片的工作方式,像是一辆跑车必须不停地在仓库和赛道之间往返拉货——每跑一圈计算,就得回仓库取一趟数据,再开回来。路上花的时间和油钱,比真正跑圈的还多。过去这不是问题,因为货少,跑几趟就够了。但 AI 计算的数据量是爆炸性的,相当于每秒钟要跑几十万趟,高速公路再宽,也堵死了。英伟达的 GPU 相当于把公路从四车道拓宽到几十车道,确实快了,但车还是得跑,油还是得烧。

存算一体的思路是:既然搬数据是瓶颈,那就不搬了。把计算直接放到存储内部去做,数据原地不动就能完成运算。吴强打过一个比方:GPU 通用性更好,它除了做 AI 还可以做天气预报、原子弹仿真。但让存算一体芯片做天气预报,非常不合适,可是做神经网络,不管是 CV 还是大模型,都比 GPU 干得好。


吴强 图片由后摩智能提供

2020年底吴强决定创业时,中国半导体正处于国产替代的狂热高峰的三年。中美科技脱钩加速,英伟达高端芯片对华出口受限,一级市场的钱疯狂涌入 GPU 赛道,造富神话一个接一个。壁仞科技成立9个月就拿了11亿 A 轮,摩尔线程成立百天即成独角兽,十几家公司扎堆讲“中国英伟达”的故事,合计融资超过百亿。

朋友也劝吴强直接做 GPU 国产替代,故事好讲,投资人也听得懂,他曾在AMD参与CUDA的早期开发,对GPU的生态熟悉,但他的判断是:“如果我也去做 GPU,刚开始会容易点,但长期来说很难有差异化。”

那个时候,所谓“颠覆英伟达”的技术很多,有人选了光计算,有人选了量子计算,吴强选了存算一体,原因是,它更接近落地和商业化。但即便如此,彼时的存算一体,仍是一种停留在学术论文中的计算范式,去挑战冯·诺依曼体系延续了八十年的统治地位。天使轮融资,好多投资人都听不懂,"当时国内做大算力存算一体的公司几乎没有,国外也只有一两家在探索。

存算一体,这个词显然对大众而言太过陌生和学术。这种存算一体芯片有的用在耳机中,但大算力存算一体,则用在PC、手机、各种边缘服务器上。

转变发生在2023年,大模型之后,吴强判断,未来一定会有很多物理场景需要在本地跑大模型,因为传输越来越昂贵,有隐私问题,时延也不允许,因此大模型端边推理一定是趋势。

2023年下半年,后摩用第一代产品适配了智谱的 GLM-6B 模型,发现存算一体跑大模型效果出奇地好。"所以我们当时就预判,应该为大模型端边推理做一款芯片。"吴强说,那会儿 Agent 还只是一个几乎没人讨论的概念。

过去的端侧 AI 芯片不过是 SoC 里附带的6T 算力,号称"端边 AI“,实际上只能跑一些玩具级的小模型。M50 彻底改变了这个局面:10瓦功耗、160TOPS 算力,可以运行几百亿到千亿参数的大模型。

2024年初,大算力的存算一体芯片M50开始做,2025年初流片,2026年2月正式量产。

2026年上半年,后摩智能收到了超出预期的客户订单。它的客户名单从联想、长城延伸到运营商的通信 AI RAN、陪伴机器人公司,以及一批正在深圳涌现的 Agent 硬件公司,这是一片崭新的增量市场。

吴强说,如果要用一句话概括后摩,是让端侧“免费Token工厂”成为可能。

它背后,是以大模型为主的AI产业正在经历的一次结构性迁移:算力正在从集中式的数据中心,向分布式的终端设备转移,这个结构洞的经济学逻辑,可能比技术本身更具产业的颠覆意义。而后摩,显然是这场需求结构性迁移的受益者。

和吴强聊,我们试图回答几个关键问题,存算一体是否真的能在通用大模型推理上大规模替代 GPU/NPU?在存算一体芯片大规模商业化之后,端侧大模型会不会把 AI 推理从云端按量付费,改造成一次性硬件买断的生意?成本要降到什么程度,Token工厂会进入家家户户?


一场关于"搬不搬数据"的效率之争

虎嗅:六年前确实很少听到存算一体这个概念。那个时候存算一体芯片商业化了吗?国内外有哪些公司在做?

吴强:包括国外在内,当时大部分公司做的都是小算力、超低功耗的方向,比如知存做的是 NOR Flash 的存内计算,用在耳机芯片里。真正做大算力存内计算芯片的,国内当时是零,国外也只有一两家创业公司在探索。

虎嗅:理清一下一个区别,之前的存算一体做的是小功耗的产品,比如耳机。我们现在做大算力的存算一体芯片,替代的是哪类产品?

吴强: 存算一体是一个技术路线。小算力超低功耗的方向用的是模拟计算,存储介质是 NOR Flash。我们这一波的路线大概从2017、2018年在学术界开始,用 SRAM 做纯数字的存内计算,可以把精度做高,把算力和算力密度都做上去。

在大算力这个领域,我们面向的场景不是耳机,而是 PC、手机、各种边缘服务器等。

虎嗅:所以你们对标的是原来的推理GPU 或 TPU?存算一体跟 GPU 相比,客户能感知到的优势是什么?

吴强:对客户来说,他不需要知道底层是存算一体还是常规架构。他能感受到的就是:功耗更低,或者在同等芯片面积下算力更大。

存算一体解决的核心问题是能效比——同等面积下算力更大,带宽更大。比如我们现在在消费终端上,一个手掌大小的盒子里,一颗芯片能跑几百亿到一千亿参数的模型,功耗只有10瓦左右。同样的场景,其他公司的产品可能要大几十瓦。

虎嗅:我能理解为,存算一体能在通用大模型推理上替代 GPU/NPU吗?

吴强:两者各有侧重:GPU/NPU强在通用性和生态,存算一体强在能效和端侧部署。两者不是互相取代的关系,而是各有不可替代的价值。

虎嗅:现在还有近存计算,近存计算和存内计算有什么区别?

吴强: 近存计算,只是把计算和数据存储拉近了,实际上还有数据搬运,只不过距离变近了。Groq 走的就是这条路。而我们做的存内计算,是真正在存储内部做计算,很多情况下数据是不动的。所以我们的能效比更高,算力密度也更高——同样一个小盒子,可以提供更大的算力。


大模型救活了一条新的路

虎嗅:端侧大模型这件事出来之前,存算一体的市场是什么样的?你们那个时候的市场竞争状况如何?

吴强: 之前也可以做推理,比如计算机视觉的推理——智能驾驶、安防监控。存算一体做 CV 也能做得好,只要是数据为主的矩阵向量相乘的计算,它都比常规架构更高效。但 CV 市场非常红海,格局已定,商业机会不多。

大模型出来以后,第一,这是个新兴市场,机会更多;第二,存算一体做大模型更合适,因为数据量更大,数据量越大,存算一体的优势就越大。

虎嗅:大模型时代,推理的需求爆发,那个时候后摩接到的第一个这一类的需求是来自哪一类的客户?

吴强:存算一体除了可以让 Token 的成本降低,另外一个优势它把功耗做到极致,把成本做到极致。以前端边有很多的AI 芯片,都是小算力。

大模型出来之后,有客户希望在端边跑大模型,特别是今年初,这种需求特别多,客户希望做一个像联想AI主机P7这样的AI终端。

虎嗅:OpenClaw 出来之后,对公司的客户结构有什么变化?

吴强:我们目前客户主要来自四个场景:第一是 Agent Computer,这是增量市场,一个全新的形态;第二是智能终端,包括 PC、会议纪要一体机、实时翻译机,未来还有手机、平板、学习机;第三是具身机器人,目前主要做陪伴机器人;第四是边缘服务器,比如通信类的 AI RAN等。

虎嗅:陪伴机器人公司很多用的是云端方案,因为考虑到端侧部署成本更高,这方面也有后摩的市场吗?

吴强: 现在大部分陪伴机器人确实用云端。但云端方案有几个问题:第一,它赌客户不用。如果客户真的用起来,成本吃不消,而中国用户不习惯付订阅费;第二,隐私问题,如果只是声音还好,但如果有摄像头,大家还是敏感的。

主打便宜的一般用云端,先卖出去再说。但主打体验的、稍微高端的,基本都会有本地算力。比如陪伴机器人,需要能看到你的表情,判断你是不是皱眉、心情不好,这种算法需要本地算力,高净值客户也在意隐私。

虎嗅:你们的芯片能把 Token 生产成本降到原来的多少?

吴强:理论上是一个数量级的提升。当然今天我们还做不到10倍,但至少几倍的提升是现在可以努力的方向。

除了降低 Token 成本,更大的优势是:存功耗和成本做到极致,让大模型在端边运行变成了可能。

虎嗅:从 Token 经济学的角度看,端侧推理和云端推理的成本结构有什么本质区别?后摩的存算一体架构如何改变 Token 的“生产成本”的,这背后的逻辑是什么?

吴强:端边推理和云端推理的结构有本质区别,云端推理是持续消耗的成本结构,用的越多,付费越多。端边推理一次性硬件投入,零边际成本。设备购买后,所有推理任务在本地完成,无Token消费、无调用次数限制。一次性投入之后,使用是个免费token 工厂。

存算一体架构改变Token生产成本的逻辑在于两个方面:首先是存算一体的低功耗、高效率推理可以让token生成的成本降低;其次,更重要的一方面,在端边功耗和成本敏感的场景下,存算一体让足够大的大模型运行变成可能,让免费token 工厂变得可能。

虎嗅:端侧大模型会不会把 AI 推理从云端按量付费,改造成一次性硬件买断的生意?

吴强:端侧模型其实是将AI从一种持续的运营成本,转变为一种可预期的资本投入,为用户和企业提供了一种全新的选择。未来的主流模式更可能是“端云协同”,系统自动判断任务该由端侧还是云端处理,在成本、性能和体验之间找到平衡点。

让每个人都能用上免费的Token工厂

虎嗅:这几年在你的观察视角下是否发现了一些新的需求?我们是否有针对这些涌现的新的需求做产品?或者说这些需求对我们的产品提出了什么挑战?

吴强:模型在逐步变大,对算力和带宽的要求在变高,从单一大语言模型向多模态迁移等新的需求,针对这些需求,我们也在做端边能处理更大规模参数的芯片,未来,端边芯片应该能处理接近或超过今天满血版模型的能力,同时,我们针对消费终端的多模态模型需求,也布局了更适合做dense多模态模型的芯片。

虎嗅:你们现在有海外的客户吗?国产模型加国产芯片在国际竞争上是否有优势?

吴强: 我觉得中国未来“Token 出海”是一个很大的机会。

我的逻辑是:免费产品一定是大家用最好的——社交网络、搜索都是这样。但 Token 要花钱,只要花钱,即使你不是最好的,性价比高也有市场。

国产开源模型加国产芯片,绝对能力可能做不到海外 SOTA 水平,但通过性价比,一定能覆盖到国际舞台。我们现在海外客户都是做端边智能设备的,他们的逻辑是:海外网络没有中国那么好,特别是农村地区;对隐私也更敏感。他们很喜欢这种本地的“免费 Token 工厂”——小巧、不依赖网络、足够智能。

你可以把这看成广义的 Token 出口,出口的是一台 Token 机器。

虎嗅:中美在存算一体上的技术差距有多大?

吴强:存算一体的好处是我们跟巨头在同一起跑线上。之前这还是学术界的领域,海外和整个行业走的都是英伟达或 ARM 的路线。存算一体作为新的探索性技术,大家起点一样。而且巨头有更大的包袱。英伟达那套东西已经走得很深了,要用存算一体这种颠覆性技术,意味着把原来的东西通通打破,历史包袱太重。英伟达收购 Groq,也只是拿来配合使用,把大模型里有低延迟需求的部分分给 Groq 做,本质上还是改良,不会放弃 GPGPU。而我们从零开始,没有包袱,整个架构都是存算一体。

虎嗅:我可以理解为,大模型之后后摩的价值也出现了大幅提升,如果拿掉国产替代的叙事,后摩的价值在哪里?

吴强: 今天的格局是:训练方面英伟达还是主导;推理方面国产比例越来越大,大家发现至少在推理上跟英伟达差不多。所以现在拼的不是国产替代,而是都是国产的情况下,谁的性价比更高、性能更好。

后摩从第一天就没有主打国产替代。我们一直说自己是“国产创新”,一直说不能用英伟达的方式打英伟达,要弯道超车。后摩今天的价值是:我们用了一个跟英伟达完全不同的新技术,把它从学术概念变成了现实,做到了量产和商业化,并且在大算力存算一体赛道上走在全球前列——不只是中国前列。

虎嗅:现在其实也有很多做端侧和边缘芯片的厂商,半导体又是一个头部效应很明显的行业,端侧未来还需要那么多家算力芯片公司吗?后摩的竞争窗口期你认为还有多长?

吴强:目前端侧芯片大部分还是控制为主的CPU芯片或者SoC芯片,AI算力一般都很小,传统端边AI芯片算力仅为6-16T左右,随着大模型的普及,算力超过百T的端边大模型芯片,会逐渐成为主导,在这块后摩是先行者。

未来整合的话,端边可能也不超过5家。当然大家会相互试探——比如高通做手机也往 PC 上布局——但每家都有自己的主战场。

虎嗅:如果用一句话描述后摩智能在 Token 新范式中的角色定位,你觉得是什么?

吴强:让端侧“免费Token工厂”成为可能。

虎嗅:或者说家家户户都有一个超节点?

吴强:是的。就是这类“家用超节点”,可以把家里的所有智能设备都连到这上面去。

虎嗅:成本要降到什么程度,Token工厂会进入家家户户?

吴强:现在有的盒子可能在几千块钱,随着市场规模扩大,技术成熟,成本会持续下降。现在,差的可能不是成本,而是一个杀手级应用,让大家觉得“必须拥有本地Token工厂”。一旦这个应用出现,叠加已降至临界点的成本,Token工厂才能真正进入千家万户。

虎嗅:未来5年,后摩面前最大的挑战可能是什么?你觉得真正的威胁可能会来自那些公司

吴强: 从组织发展角度,今天公司还在生存阶段,大家都很拼,go big or go home。如果5年后真的做到了头部,组织怎么进一步迭代,这是一个挑战。

从产业角度,如果那时候端边已经是很大的市场,竞争会很激烈。端边推理的生态壁垒不像云端训练那么深,所以必须不停提升效率才能保持领先。

我觉得真正的威胁不会来自巨头,会来自另外的创业公司,用一套完全新的技术打法对我形成降维打击。而那个东西是我当时忽略的、没有重视的。



本文来自虎嗅,原文链接:https://www.huxiu.com/article/4876593.html?f=wyxwapp

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为了洗地,某些大v能“无耻”成这样,是我没想到的!

为了洗地,某些大v能“无耻”成这样,是我没想到的!

走读新生
2026-08-19 15:06:29
同事一个月请了3次丧假,结果领导说:你家亲戚死光了?然后同事就给了领导一耳光!我们上去拉偏架,最后领导被揍的鼻青脸肿,还降职调岗

同事一个月请了3次丧假,结果领导说:你家亲戚死光了?然后同事就给了领导一耳光!我们上去拉偏架,最后领导被揍的鼻青脸肿,还降职调岗

品读时刻
2026-07-29 09:08:42
大妈花50万买基金,账号忘了15年,孙子找回看到余额,全家愣住了

大妈花50万买基金,账号忘了15年,孙子找回看到余额,全家愣住了

黄家湖的忧伤
2025-08-12 17:05:12
网传苏州房价跌得特别厉害,几乎腰斩,评论区炸锅...

网传苏州房价跌得特别厉害,几乎腰斩,评论区炸锅...

慧翔百科
2026-08-19 11:27:14
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
29岁海归女年收入仅15万,却要求男方资产不能低于1000万,还表示自己要闪婚、着急生孩子,评论区一点面子都不给!

29岁海归女年收入仅15万,却要求男方资产不能低于1000万,还表示自己要闪婚、着急生孩子,评论区一点面子都不给!

谭谈社会
2026-08-18 13:31:32
一旦中日爆发冲突,朝鲜和俄罗斯极有可能直接军事介入,而他们不是为了帮助中国的

一旦中日爆发冲突,朝鲜和俄罗斯极有可能直接军事介入,而他们不是为了帮助中国的

人生录
2026-08-19 00:05:17
中超本土射手榜:张玉宁韦世豪领跑,王钰栋成为最大惊喜

中超本土射手榜:张玉宁韦世豪领跑,王钰栋成为最大惊喜

林子说事
2026-08-19 10:19:48
吴官正的儿子婚后住岳父家,向他抱怨:你是武汉市长,给我找不到一间房子?

吴官正的儿子婚后住岳父家,向他抱怨:你是武汉市长,给我找不到一间房子?

帝哥说史
2026-08-19 14:25:03
好想来再曝“鬼秤”事件,总价111元复秤仅需60多

好想来再曝“鬼秤”事件,总价111元复秤仅需60多

界面新闻
2026-08-19 00:01:02
湖人队乱套了!内讧大爆发,东契奇夺冠梦碎,詹姆斯成幸运王

湖人队乱套了!内讧大爆发,东契奇夺冠梦碎,詹姆斯成幸运王

寒士之言本尊
2026-08-19 19:30:31
不出意外的话,2027年起,燃油车或将迎来一轮史诗级进步

不出意外的话,2027年起,燃油车或将迎来一轮史诗级进步

周哥一影视
2026-08-18 13:35:27
央美清美审丑链全曝光:6个艺术家三代接力把丑化中国人做成生意

央美清美审丑链全曝光:6个艺术家三代接力把丑化中国人做成生意

今夜繁星坠落
2026-08-19 01:44:41
台湾名嘴扎堆到访大陆:有人在祖先墓前长跪不起,有人叹乡村巨变

台湾名嘴扎堆到访大陆:有人在祖先墓前长跪不起,有人叹乡村巨变

徐云流浪中国
2026-08-19 00:14:09
庄则栋的儿子,不会打球却成亿万富豪,和日本继母关系密切

庄则栋的儿子,不会打球却成亿万富豪,和日本继母关系密切

可乐谈情感
2026-08-19 00:03:43
32岁博士,已任安徽一市正处级职务

32岁博士,已任安徽一市正处级职务

凤凰网安徽
2026-08-19 17:37:21
“老师已经很委婉了!”女生学舞蹈被劝退,老师:长相还是很重要的!

“老师已经很委婉了!”女生学舞蹈被劝退,老师:长相还是很重要的!

林林先生
2026-08-19 10:37:03
又见海港名宿艾哈迈多夫 他跟奥斯卡 还有2022赛季加盟巴尔加斯都是美好回忆

又见海港名宿艾哈迈多夫 他跟奥斯卡 还有2022赛季加盟巴尔加斯都是美好回忆

80后体育大蜀黍
2026-08-19 18:41:10
伊朗举行已故最高领袖下葬四十日纪念仪式,此前消息称穆杰塔巴将主持仪式,他尚未现身

伊朗举行已故最高领袖下葬四十日纪念仪式,此前消息称穆杰塔巴将主持仪式,他尚未现身

政知新媒体
2026-08-19 19:44:22
放话挑战中国队!张本智和:亚运会要包揽3金 与松岛会师男单决赛

放话挑战中国队!张本智和:亚运会要包揽3金 与松岛会师男单决赛

风过乡
2026-08-19 12:58:56
2026-08-19 20:47:00
虎嗅APP incentive-icons
虎嗅APP
个性化商业资讯与观点交流平台
27345文章数 688020关注度
往期回顾 全部

科技要闻

宇树的悬念还在后面

头条要闻

结婚8年发现三娃均非亲生 男方已将孩子全部送还女方

头条要闻

结婚8年发现三娃均非亲生 男方已将孩子全部送还女方

体育要闻

拥有“儿皇梦”的罗德里,为何选择巴萨?

娱乐要闻

章子怡财路遭到质疑,套现3亿冲上热搜

财经要闻

内部反腐,让大疆错过宇树250亿收益?

汽车要闻

小米澎程N70体验 后排空间夸张亦可旋转对坐

态度原创

教育
时尚
本地
旅游
公开课

教育要闻

不确定自家的小朋友是否真的能做出来,毕竟条件太少了

断码秒杀|| 这些衣服现在入手真的好划算

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

旅游要闻

西藏班戈:羌塘明珠色林错

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版