演讲人:周强 光羽芯辰创始人、董事长兼总经理
整理:会议纪要 | 来源:公开演讲录音整理稿
纪要摘要
本次分享围绕一个核心判断展开:AI 推理的下一程不在单一架构的算力竞赛,而在“让合适的计算单元做合适的事”。端侧受内存墙、带宽、散热与生态碎片化四重约束,云端则被 HBM 价格与 GPU 架构沉重拖累;破局路径是端云协同(先做强端侧,再分工卸载)与PD 分离(Prefill 交 GPGPU,Decode 交 3D 堆叠专用芯片)。三大技术底座为 3D 堆叠、异构计算(LPU / TNQ / GNQ)、存储分层;据此推出的 TC1000 已量产,TC2000、TC3000 已排定路线图。
一、Token 正在“贬值”,推理需求在指数级增长
开场以 Token 切入。豆包平台日均 Token 调用量两年增长约 1500 倍;今年流行的 AI 应用 WorkBuddy,上线三个月后用户人均 Token 使用量即增长 10 倍。演讲人判断:Token 是一个价值迅速贬值的概念——去年某大厂 APP 每日赠送 100 万 Token,看似足够,实际很快不够用;以公司自身实施的 AI 编码系统为例,日均消耗约需 1 亿 Token。由此推演,个人层面一年内 Token 的计量单位将从 Token 走向 G Token、T Token 乃至更大数量级。
关键结论:Token 单位的上移,反向说明推理侧需求正以指数级方式增长,而当前 Token 供给与推理能力仍不足以满足需求。这不是周期性的小波动,而是算力需求结构的一次换挡。
二、端侧与云端:各自的难处 2.1 端侧的四个约束
- 内存与带宽:
端侧可借助云端技术补位,但 LPDDR4 的带宽上限是硬约束,成本再高也难以做出高带宽推理系统;
- 功耗与散热:
端侧设备散热条件苛刻,尤其是缺乏主动散热机制时——去年上市的手机运行 7B 规模模型,所需散热能力已接近运行《王者荣耀》;
- 生态碎片化:
端侧芯片架构缺乏统一标准,整个生态处于碎片化状态;
- 结论:
端侧单独扛起大模型推理并不现实,必须与云端协作。
云端的问题集中在两点:
- HBM 价格高企:
最新款 36GB HBM3E 单价接近 3000 多美元,半年内涨幅约 120%;加上推理过程中 KV Cache 使用量增加、算力架构利用率偏低,云端 Token 成本看不到大幅下降趋势;
- 架构过重:
GPU 架构“过于沉重、负担太重”,让单一架构独自承担所有工作既不经济也不必要。
因此,更经济的路径是让不同类型的计算架构各司其职,而不是押注某一种架构通吃全部负载。
三、端云协同:先让端侧变强,再谈分工
演讲人以游戏作比:云端像一个 600 亿参数的“打野”,能力很强;端侧则像一个刚穿上鞋子的“辅助”。端要想与云真正协作,第一件事是先加强自身能力。当端侧性能提升后,通过任务路由在端侧处理一部分负载,再把适合的工作卸载到云端,即可形成更分散的 Token 机制,替代云端单一的 Token 结构。
端侧做法(自 2024 年国内 3D 封装技术成熟趋势起步,光羽是国内最早从事 3D 架构设计的公司之一):
- 3D 堆叠提带宽:
实现终端侧约 100 平方毫米芯片带宽达到 TB/s 量级;
- 存储分层扩容量:
把不重要数据卸载到成本更低的 SSD 或 LPDDR,端侧模型部署能力扩展至 35B 量级,功耗控制在 10W 以内;
- 路由卸载:
以路由技术把部分云端任务在终端侧处理,端与云协同。
![]()
图 1|端云协同 + PD 分离两条路径示意 四、云端新范式:PD 分离(Prefill-Decode 分离)
云端除端云任务分工外,还可通过 PD 分离把部分任务卸载到 GPU 与 HBM 上。核心判断是:GPU 非常适合 Prefill(预填充),但未必适合 Decode(解码)。
阶段
负载特征
合适计算单元
Prefill 预填充
计算密集型,对算力要求高
GPGPU
Decode 解码
依赖高带宽与存储容量
3D 堆叠 + 存储分层专用芯片
目前系统普遍缺乏有效的解码能力。若以不同计算架构承接解码高负载,GPU 便可专注 Prefill、无需配置过多高性能硬件。把 Prefill 与 Decode 分开处理,以成本较低的 3D 堆叠与存储分层技术转移解码负载,云端推理成本可降低 30% 乃至 60%。
五、三大技术底座 5.1 3D 堆叠
今年 3D 堆叠概念火热,国内已有十几家公司研发 3D 堆叠芯片设计方案,先进封装领域已有 7—10 条产线可进行 3D 堆叠。但要真正制造出合格产品,异构堆叠过程中设计与工艺的协调、带宽利用率的提升,是难度极高的领域。
5.2 异构计算:LPU / TNQ / GNQ
算力密度与通用计算扩展难以兼得,无法同时实现通用性与专用性的平衡。光羽的方案是设置两种不同类型的核心:
- TNQ:
针对 Transformer 架构优化的专用计算核心,满足边缘场景对计算性能密度的要求;
- GNQ:
通用型核心,类似 GPGPU,用于支持各类计算任务的扩展;
- LPU:
今年热门概念,光羽芯片架构中已设计基于 LPU 的计算架构,本月实现产品批量生产;通过流式处理与静态编译提升带宽利用率,为卸载 HBM 负载打基础。
三者协同,可在终端层面兼顾通用性与专用性,并让计算与存储更紧密结合。
5.3 存储分层
按数据的内存读取速度差异分开存储:多专家模型中活跃专家需要高带宽,不活跃专家则不需要。把需要大量带宽的“热”数据放在高温存储,把不需要太多带宽的“冷”数据放在低温存储;再配合 3D DRAM 技术处理冷数据(如尚未激活的专家级数据可放 SSD),终端侧即可以更低成本支持更大规模模型。
案例:TC1000 的冷热分层。即将量产的 TC1000 仅配 10GB 3D DRAM;若不分层,仅能运行 13B 密集模型,而通过冷热数据分离,可运行 35B MoE 模型。一旦能跑 35B MoE,端侧就不再是“只有一双鞋子的辅助”,可与云端展开更多形式的协同。
六、云端机会:池化与端云处理器分离
端侧架构的计算需求与云端解码过程需求高度相似——解码同样需要更高带宽,也需通过分层存储为整节点的 HBM 提供内存支撑。光羽称之为“池化”技术:以分层存储、用 HBM 替代传统存储方式。
实现上,光羽在后续芯片迭代中开发算力更强、存储容量更大、存储层次更丰富的芯片,与 GPU 合作伙伴协作,消除解码过程对性能的影响,把 Prefill 交给 GPGPU,从而在云端实现更高性能表现。
七、产品路线图:TC1000 → TC2000 → TC3000
![]()
图 2|TC 系列芯片路线图(整理绘制;资料来源见文末)
产品
定位
关键特性
进度
TC1000 / TC1040
端云协同处理器
四层 DRAM 堆叠;LPU+TNQ+GNQ;10GB 3D DRAM;10W;35B MoE 数十 tok/s
已量产 TC2000
端侧低功耗
混合式计算架构(存内处理+端处理);功耗目标 <4W
2027 起生产
TC3000
PD 分离解码专用
多层存储 SSD→LPDDR→3D DRAM;单芯片本地处理万亿参数模型
2027 起生产
演讲现场展示了 TC1000 系列样片与样品采购协议。TC1000 为全球最早实现大规模量产的四层 DRAM 内存架构芯片之一,TC1040 为同系列型号;演讲人表示当天即携带样片到场,希望现场达成合作。
八、行业判断与结语
无论端侧模式、端云协同,还是与云端共同实现 PD 分离,推理市场规模都非常大。演讲人希望看到更多同行参与其中,并以“共同拓圆”作结:
“也许今天光羽能在这个圆的一侧突破 1 厘米的距离,而昨天我们的同行则在圆的另一侧突破了 1 厘米。如果我们能看到十几家类似的公司,通过各种存储与计算技术、多种堆叠式技术架构来进一步扩大这个‘圆’的边界,那么我们就能够提升推理性能。我们希望邀请同行与其他企业一起合作,共同打造人工智能推理基础设施的新格局。”
演讲人以一句直白的话收束:端侧、端云协同与 PD 分离三条路径,指向的是同一个方向——把推理从“单一架构的算力竞赛”带向“系统级、异构协同的成本与能效优化”。
附|光羽芯辰公开资料速览
- 公司概况:
上海光羽芯辰科技有限公司,2024 年成立于上海奉贤,专注端侧大模型 AI 芯片与 3D 存算/近存算一体化架构研发,以及云端高性能推理。创始人周强博士毕业于复旦大学微电子学院,曾任职于芯原微、AMD、燧原科技、摩尔线程,历任研发与高管要职,拥有从芯片设计到量产商业化的全栈经验。
- 融资与股东:
成立时即完成种子轮(燧原科技、兆易创新等产业资本),此后完成天使轮(讯飞创投)、Pre-A 轮(中金资本、耀途资本等)等轮次;2026 年 9 月完成 A 轮交割,半年内累计融资近 20 亿元。战略股东包括知名 AI 独角兽与存储龙头企业,宁德时代亦参与战略入股合作。
- 技术体系:
自研 EdgeAIon® 全栈软硬件体系,融合 3D 堆叠、存算一体(CIM)、近存算、流式处理、静态编译与存储分层,目标为提升推理过程中存储带宽与计算单元的实际利用率(公司披露带宽与算力利用率超 70%/80%,约为行业均值 2 倍)。
- 产品与量产:
TC1000 系列在 2026 世界人工智能大会全球首发,采用四层存储堆叠,一次流片成功、良率超出预期,已实现量产部署;公司称其为业内首款 3D 堆叠近存算低功耗大模型推理端侧高算力芯片。公司披露数据为:等效带宽提升约 10 倍、同等算力功耗约为传统方案三分之一,3B 模型约 300 tok/s、35B 参数约 70 tok/s。
- 三个“国内唯一”:
演讲人提出——国内唯一同时拥有云端 GPU、3D 端侧 LPU 流片量产落地经验的全栈研发团队;国内唯一实现 3D 堆叠 LPU 流式处理架构量产落地的厂商;唯一打通云端、端侧双向兼容的一体化生态框架,可无缝对接燧原等国产云端算力产品,搭建端云混合协同组网。
- 标准与专利:
牵头制定《端侧 AI 的 3D DRAM 芯片集成技术规范》团体标准并已发布;累计近百项发明专利。
- 商业化进展:
与宁德时代围绕人形机器人、工业端 AI 联合研发;与联想研究院合作开发 AI PC、AI 算力盒子等,年内可出样机;与多家头部手机厂商的终端产品预计 2026 年底至 2027 年初陆续量产上市;与掌锐电子在“端侧 AI 芯片+智能座舱”方向合作。
- 行业共性挑战:
算法周更频率与芯片长周期研发的矛盾;端侧极限功耗下的软硬件调度难题;各厂商生态割裂、缺乏统一标准。
![]()
图 3|AI 推理芯片 3D 封装结构示意(示意图)
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.