10月1日,华为Mate 90系列发布,Mate 90 Pro Max用的那片芯片叫麒麟9050 Pro——官方给出的三个数字是:灵犀CPU多核性能提升23%,马良GPU渲染性能提升40%以上,达芬奇架构NPU性能提升140%。
![]()
一片芯片,三个模块,三个完全不同的增幅。这三个数字,大概率不是同一件事做出来的。
这颗芯片的改动,是从"平层公寓"改成"复式楼"
先纠正一个常见误解:逻辑折叠不是3D封装,也不是把多颗现成芯片摞起来。何庭波在阐述中把"折叠"和"堆叠"做了区分——堆叠更像把多个现成模块在封装层面连接起来,而折叠是把一个原本在平面上展开的完整逻辑系统,放到三维空间中重新设计、重新布线、重新定义时序。
![]()
麒麟9050 Pro芯片官方宣传展示图
换句话说,过去是把芯片当成一张纸,所有功能单元平铺在上面排位置;现在是把这张纸对折再对折,上下叠起来放。华为自己的比喻是把平层公寓改造成复式建筑,增设垂直互联通道,相当于在芯片内部装上"电梯",大幅缩短信号传输路径。
这个改动带来的直接结果是:麒麟9050 Pro的晶体管密度从每平方毫米1.55亿颗提升至2.38亿颗,按论文披露的口径提升约53.5%。按华为的说法,这个幅度的密度跨越通常需要三年才能完成。
![]()
麒麟9050 Pro逻辑单元三维重构示意图
三个模块增幅差这么大,真正的分水岭是"信号走了多远"
三个模块共用同一套三维架构,增幅却差出一个数量级,差别不在晶体管密度,而在各自本来有多"堵车"。
- CPU:灵犀架构9核16线程,多核性能提升23%。CPU的瓶颈是调度——九个核之间要频繁交换数据,连线长了、绕路多了,并发就上不去。折叠把核簇堆得更紧凑,路径变短,并发调度效率自然提升。
- GPU:马良架构渲染性能提升40%,第二代光锥硬加速光线渲染数达5500万条/秒。GPU是典型的"流水线作业",渲染管线的每一段都要把数据交给下一段,中间的连线密度直接决定吞吐。折叠把管线和光锥单元垂直堆叠,单元间连接密度提升,瓶颈就从连线转移到计算本身。
![]()
麒麟9050 Pro芯片功能模块架构示意图
- NPU:性能提升140%。这才是增幅最反常的一个。NPU做的是张量计算,算得快不快,一半取决于计算单元,另一半取决于能不能及时把数据喂进去。而端侧跑30B模型,最要命的就是喂数据——访存带宽一宽,计算单元立刻被用满。
三个模块的增幅排序,正好和它们对"连线长短"的敏感程度排序一致。
那500万条通道,才是真正的共性引擎
三个模块共用的那个底座,是垂直互联。麒麟9050 Pro内置500万个信号传输键合通道,跨Die传输带宽达125TB/s,关键路径时延下降30%以上。
![]()
这是什么概念?在三维堆叠的早期研究里,研究者对比过2D平面设计和3D折叠设计:同样跑在630MHz时,3D IC的功耗比2D低约20%;而当追求最高性能时,2D设计最高跑到630MHz,3D IC达到1.2GHz——接近两倍的频率提升,原因就是折叠天然缩短连线。
换句话说,23%、40%、140%这三个数字,并不是三个独立的架构创新各自做出来的,它们是同一个三维底座,在三个对时延敏感度不同的模块上,长出的三种不同结果。
![]()
传统架构与逻辑折叠架构性能对比演示
这些数字能信多少
有一点需要说清楚。
- 这一技术路径的长期商用表现,目前仍基于首批产品的短期测试。天使投资人、人工智能专家郭涛提醒,该技术仍处首轮量产验证期,架构创新不能替代制程工艺;艾媒咨询CEO张毅也表示,它能否扩散并获得行业共识,还需要生态共鸣和进一步市场验证。
逻辑折叠的真正意义,不在于这颗芯片比对手快多少,而在于它把芯片性能的竞争维度,从"谁的晶体管更小",换成了"谁能让信号在自己的芯片里跑得更快"。这两个问题,解法完全不同。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.