网易首页 > 网易号 > 正文 申请入驻

八年,阿里把数据中心芯片全做了一遍

0
分享至


如果文章对你有用,请在文末点击“在看”,“分享”和“赞”

2018年9月,杭州云栖大会,阿里宣布成立一家名叫平头哥的芯片公司,名字据说来源于那个男人的一次非洲之旅。

说实话,当时业内看好的人并不多。互联网公司做芯片,听起来总有点跨界玩票的意思。芯片是一个出了名的慢行业,要投入长周期、重资金,还得接受失败率很高的现实:一颗芯片从立项到量产通常要好几年,一次流片的费用就可能是几千万甚至上亿,而且一旦出错,钱和时间都回不来。

很多人觉得,一家习惯了「小步快跑、快速迭代」的互联网公司,未必能沉得住这口气。

八年过去了,还是在云栖大会,还是这家叫平头哥的公司,发布了新一代训推一体AI芯片真武V900,性能提升至真武M890的3倍,是目前算力最强的中国自研AI芯片(之一),能够满足万亿参数级大模型的训练和推理。


这几年,「算力」成了整个AI行业最焦虑的词。模型越做越大,卡越来越难买,每家公司都在问同一个问题:我们的算力到底从哪儿来?在这样的背景下再看这八年,当年那个被质疑玩票的平头哥,已经悄悄地把数据中心里几乎所有关键芯片都做了一遍。

八年,从单点突破到全栈自研

先来看看平头哥的半年造芯路径。

2019年,成立刚一年的平头哥推出第一颗芯片含光800。这是一颗为具体场景深度定制的推理芯片,每秒能处理7万8千张图片,当时拿下了同类芯片性能和能效比两项第一,后来用在了双11淘宝主搜里。

2021年,服务器CPU倚天710发布,阿里成为国内第一家具备CPU研发设计能力的互联网公司。这颗芯片性能比同期业界标杆高20%,能效比提升超过50%,现在还在阿里云上跑视频编解码、高性能计算和游戏等业务。


2023年,存储侧补上了第一颗SSD主控芯片镇岳510。

2024年,首颗训推一体AI芯片真武810E推出,配合自研T-Head SAIL软件栈,支撑了千问大模型的训练和推理。

今年4月,网络侧发布首款智能网卡磐脉920,这是国内首款内置PCIe Switch的400G智能网卡。

今年5月,真武M890亮相,性能是810E的3倍,同时推出了搭载ICN Switch 1.0的128卡超节点。

今年9月,真武V900发布,性能又是M890的3倍。

AI芯片、服务器CPU、互联芯片、智能网卡、存储主控,八年时间,算力、网力、存力全做了一遍。真武系列三年迭代三代,已经服务超过650家企业客户。阿里巴巴集团CEO吴泳铭在云栖大会上表示,由于平头哥芯片产品线的成熟和客户的广泛应用,平头哥AI芯片的年出货量将大幅提升。


从造零件,到造系统

回头看这条时间线,今年是一个明显的转折。

前几年,平头哥做的更像是造零件:缺什么就补什么,一颗一颗地把数据中心里的关键芯片从无到有做出来。

到了今年,这些零件开始被组装成一台完整的机器。

为什么是现在?因为AI对算力的需求已经变了。大模型到了万亿参数、MoE架构和Agent应用普及的阶段,单纯比拼某一颗芯片的指标已经不够,真正要比的是整个计算系统的效率。

如果把一个AI计算系统拆开来看,大致有三个层次:最底层是单颗芯片的计算能力,中间是芯片与芯片之间的连接能力,最上层是负责调度和执行的通用计算能力。

这次云栖大会上的三个和芯片相关的进展,正好分别对应这三层:真武V900解决「算得快」,ICN Switch和超节点解决「连得好」,倚天CPU路线图解决「调度得动」。

下面我们一层一层来看。

真武V900,训练推理如何既要又要

真武V900是一颗训推一体的芯片。现在很多AI芯片是有分工的,要么主攻训练,要么主攻推理,因为这两件事对硬件的要求差别很大。

训练是一个吃显存的过程。以常见的混合精度加Adam优化器为例,每个参数除了权重本身,还要存梯度、FP32主权重和两份优化器状态,粗略算下来每个参数要占16字节左右。一个万亿参数的模型,光是这些状态就要16TB左右,这还没算中间激活值。所以训练必须把模型切到大量芯片上,每颗芯片的显存越大,需要切的份数就越少,芯片之间的通信也就越少。

推理则是一个吃带宽的过程。大模型生成每一个Token,都要把相关的权重从显存里读一遍,同时还要维护不断增长的KV Cache。这个阶段的瓶颈往往不在计算,而在显存容量和带宽。所以推理会想方设法压低精度,从FP16到FP8再到FP4,精度每降一半,同样的显存能装下的参数量就翻一倍,读取的数据量也减少一半。当然,精度降到FP4后很容易损失模型效果,所以业界一般会配合按块缩放之类的技术来保住精度。

训推一体,就是要一颗芯片同时满足这两套几乎相反的需求。真武V900基于平头哥自研的并行计算架构,搭载216GB大容量显存,片间互联带宽达到1200GB/s,已经和绿厂最新的Blackwell Ultra进到了同一个量级(显存288GB,NVLink带宽1.8TB/s)。它原生支持从高精度训练到低精度、超低精度推理的全场景。和上一代M890相比,V900单芯片性能提升至3倍。


要知道,M890今年5月才发布,4个月后又翻了3倍,说明平头哥没有在挤牙膏。

根据阿里的说法,V900将于2027年第一季度量产售卖。

真正的短板:通信墙

不过,单芯片性能再强,也只是把木桶的长板变得更长。现在决定AI系统性能的那块短板,是芯片和芯片之间的通信能力,也就是传说中的「通信墙」。

这个瓶颈也不是一下子产生的,而是和模型的变化、芯片连接方式的变化紧密相关。

在传统设计里,一台AI服务器里一般装着8颗AI芯片。在同一台服务器内部,芯片之间用专用的高速互联直接相连,带宽能做到几百GB/s甚至上TB/s。但是一旦跨出这台服务器,芯片之间就只能通过网卡和交换机走网络,带宽大约只有几十50GB/s,和机内互联相比差了一个数量级以上,延迟也高得多。

打个比方,同一台服务器里的芯片就像坐在同一间办公室的同事,有事转个身就能说;跨服务器的芯片则像在不同楼里办公,每次沟通都得打电话、发邮件。业内有行业黑话,把前一种叫Scale-up(纵向扩展),后一种叫Scale-out(横向扩展)。

问题在于,大模型里通信最密集的那些操作,比如张量并行和前面提到的专家并行,都需要芯片之间频繁交换数据。用前面办公室的例子,这些专家只有在同一间办公室里才能高效运行。模型规模还不大的时候,8颗芯片组成的小办公室基本够用。可到了万亿参数的MoE模型,专家往往要分布到几十甚至上百颗芯片上,8卡明显装不下,大量通信只能走慢得多的网络。

通信墙就是这样形成的。

解决思路其实很直接:把这间办公室扩大。现在常用的方法,就是用专门的互联芯片,把高速互联的范围从一台服务器里的8颗芯片,扩展到几十、几百甚至上千颗芯片,让它们之间都能以接近机内的带宽和延迟通信。这样一组由大量AI芯片组成、内部全部高速互联的系统,就是超节点的雏形。

所以,一个超节点能连多少颗芯片、连得有多快,很大程度上决定了它能高效运行多大的模型。

超节点,让千颗芯片像一颗芯片

那么,上千颗芯片到底怎么才能连成一个超节点?这就是这次的第二个看点。

超节点的核心是一颗专门负责芯片之间数据交换的互联芯片ICN Switch,即片间互联网络(Inter-Chip Network)。

这颗芯片并不是第一次出现。今年5月的阿里云峰会上,平头哥就和真武M890一起发布了ICN Switch 1.0。它支持平头哥自研的ICN互联总线协议,吞吐量达到25.6Tbps,芯片之间点对点时延低于150纳秒。阿里用它把128颗M890装进一个机柜,组成了128卡超节点,全带宽互联的规模从上一代的16卡提升到了64卡。


这次云栖大会,平头哥把真武V900和ICN Switch组合在一起,把全带宽高速互联的规模推到了千卡级别,而且同一套架构可以覆盖从单机8卡到千卡集群的全部场景。从16卡到64卡,再到千卡,相当于前面说的办公室在一年多时间里扩大了几十倍。

规模变大只是一方面,更关键的是这个超节点里的芯片之间怎么通信。它遵循两个很重要的原则:原生内存语义和内存统一编址。

先讲内存语义。传统的芯片间通信走的是「消息语义」:发送方要准备好数据缓冲区、构造描述符、发起DMA传输,接收方收到后还要做完成通知、同步,再把数据拷贝到计算要用的位置。每一步都有软件栈的开销,一次通信往往要花几微秒。对大块数据来说,这点开销可以忽略;但对MoE那种高频的小数据包来说,真正传输数据的时间可能还没有这些手续花的时间长。

内存语义则是让一颗芯片直接用读写指令访问另一颗芯片的显存,就像访问自己的本地内存一样,中间没有打包、握手和拷贝。在M890那一代,ICN Switch 1.0已经把通信时延做到了百纳秒级,比传统方式低了一个数量级。

再讲统一编址,它指的是所有卡的显存在地址空间上连成一片,形成一个全局共享的大内存。对软件来说,它看到的不再是一千块互相独立的显存,而是一块巨大的内存。

打个比方,原来每个车间都有自己的仓库,想用别的车间的零件,得填单子、打包、发货、签收。现在所有仓库打通了,货架统一编号,需要哪个零件直接到对应的货架上拿。

这个特性带来的最大价值其实在软件端。做过分布式训练的朋友应该都清楚,数据放在哪张卡、什么时候搬、怎么和计算重叠,这些工作非常消耗精力,也很容易出错。统一编址让编程模型大大简化,框架和算子开发者可以把更多精力放在模型本身。这也是全球AI芯片厂商都在往内存语义互联方向走的原因。

从M890的128卡超节点,到V900的千卡全带宽高速互联,Scale-up域扩大了将近一个数量级,而且同一套架构可以覆盖从单机8卡到千卡集群的全场景。

也就是说,现在上千颗真武V900终于可以像一颗"超级芯片"那样协同工作了。


算、存、网拼齐:一台50万卡的计算机

有了算力和互联还不够。这次阿里发布的新一代超节点服务器里放了四类自研芯片:真武V900负责计算,ICN Switch负责超节点内的Scale-up互联,磐脉智能网卡负责超节点之间的Scale-out网络,镇岳SSD主控负责数据存取。


算、存、网三块一次性补齐,而且做到了系统级的协同优化。

再加上阿里云新设计的智算中心网络架构,这套系统可以稳定支撑50万卡规模的单一AI集群。

另外,基于真武M890的超节点已经规模化商用,是国内第一个跑通Qwen3.8和Kimi K3两个超2万亿参数模型的超节点。你正在用的这两个模型,很可能就跑在平头哥的这几颗芯片上。通过算子优化和软硬件协同,真武超节点实例在Agentic推理场景里最多可以实现1.5倍的性能提升。

硬件不换,靠系统优化多出50%的性能,这就是全栈的价值。

CPU,智能体时代被低估的主角

最后一层是CPU。

过去两年说到AI算力,大家主要关注的是GPU。但到了智能体时代,CPU的重要性正在回升。智能体的任务规划、状态管理、工具调用,以及大量数据的预处理和编排,几乎都要由CPU完成。

GPU负责思考,CPU负责安排和执行。如果CPU跟不上,GPU再强也只能空等。

所以Agent需要的CPU,要单核性能强、内存带宽高,并且和GPU紧耦合。

这次平头哥首次公开了倚天服务器CPU的路线图:2027年推出倚天720和倚天730。720在单核性能、核密度和能效上全面提升;730首次采用平头哥全自研的CPU微架构,单核SPECint 2017/GHz性能最高可达倚天710的1.4倍。

未来还将继续推出倚天750,采用第二代自研核,并支持平头哥自研的ICN片间互联总线协议。这个就有意思了。


目前CPU和AI芯片之间大多通过PCIe连接,带宽和延迟都比较有限。在Agent场景下,CPU负责调度,AI芯片负责推理,两者之间的数据交互非常频繁,PCIe很容易成为瓶颈,通信墙再次出现。另外,随着上下文越来越长,业界也在尝试把一部分KV Cache放到CPU的大容量内存里,这同样需要CPU和AI芯片之间有一条更宽、更快的通道。

倚天750接入ICN总线,意味着CPU就和真武AI芯片进入了同一套互联体系。前面讲的超节点解决的是AI芯片之间怎么连,这一步解决的则是CPU和AI芯片之间怎么连。到这里,阿里算力版图中的关键大芯片拼图也补上了。

定义需求,不要猜需求

回到开头的那个问题:八年前那个被质疑「玩票」的平头哥,现在到底做成了什么?

这次云栖大会给出的回答,是他们做了一套为AI时代量身定制的计算系统。

真武负责算力,ICN Switch负责互联,磐脉负责网络,镇岳负责存储,倚天负责调度,未来CPU和AI芯片还会接入同一条总线。


现在算力的竞争,已经从拼芯片,进入到拼系统的时代,这样的体系必须有真实场景来反复打磨。而阿里做芯片最大的优势,就是它本身拥有庞大而完整的应用场景:有云、有淘宝、有钉钉、有各种实际业务,还有千问这样一线水平的大模型。芯片做出来可以直接放进阿里云和自家业务里跑,用自家最前沿的模型去验证和优化,然后快速规模化。

芯片、模型、平台、云,这条完整的链条,是绝大多数芯片公司很难复制的。

从这个角度看,很多芯片公司是在猜几年以后大家需要什么,而阿里是在自己定义几年以后需要什么。

八年前的质疑,今年在云栖大会上有了一个相当完整的回答。

(注:本文不代表老石任职单位的观点。)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
房产税可能很快就会到来

房产税可能很快就会到来

谭谈财经
2026-09-30 21:27:05
糖尿病不能“碰”牛肉?医生:不只是牛肉,这5物能不吃就不吃

糖尿病不能“碰”牛肉?医生:不只是牛肉,这5物能不吃就不吃

叙说医疗健康
2026-10-03 06:00:21
81岁秦沛近况曝光 加拿大退休生活充实 再婚日籍太太生活低调

81岁秦沛近况曝光 加拿大退休生活充实 再婚日籍太太生活低调

TVB资讯台
2026-10-02 22:12:12
彭加木到底是失踪还是叛逃?其实这一切,早就在他的计划之内?

彭加木到底是失踪还是叛逃?其实这一切,早就在他的计划之内?

纯白的梵唱
2026-10-02 18:16:22
媒体爆料沙特打击胡塞方案

媒体爆料沙特打击胡塞方案

界面新闻
2026-10-03 10:42:54
老了肌肉流失怎么办?医生:2样东西必须吃,2件事做得越早越好

老了肌肉流失怎么办?医生:2样东西必须吃,2件事做得越早越好

健康科普365
2026-09-30 11:40:19
残酷!中铁等央国企职工不内退,可能连继续留下来的位置都没有了

残酷!中铁等央国企职工不内退,可能连继续留下来的位置都没有了

职场资深秘书
2026-10-03 10:58:51
迪拜航空救人牙医打破沉默:39岁机长是英雄,副机长被制服后哀求“杀了我”

迪拜航空救人牙医打破沉默:39岁机长是英雄,副机长被制服后哀求“杀了我”

译言
2026-10-02 08:26:47
张本智和张本美和兄妹:打球不是唯一出路,人家考进早稻田大学

张本智和张本美和兄妹:打球不是唯一出路,人家考进早稻田大学

林子说事
2026-10-03 10:32:05
最高法明确:不再一律定罪,即日起施行!

最高法明确:不再一律定罪,即日起施行!

法律内参
2026-10-02 23:18:35
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
两性关系:发现了没,寿命长的男人,大多都有这五个好习惯

两性关系:发现了没,寿命长的男人,大多都有这五个好习惯

荔子言
2026-09-08 14:55:50
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
炸锅!拉夫罗夫领衔60高官弃席,俄政坛曝光,政治火车头惊天玩法

炸锅!拉夫罗夫领衔60高官弃席,俄政坛曝光,政治火车头惊天玩法

月下守候
2026-10-02 21:28:21
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
台媒:两架F-16V战斗机抵达志航基地后,会立即进入地下机库!

台媒:两架F-16V战斗机抵达志航基地后,会立即进入地下机库!

闻识
2026-10-02 14:17:56
说出来你可能不信,八国联军的总头子,那个叫瓦德西的德国佬,拎着刀在中国烧杀抢掠一圈回去之后,干了一件让全世界都没想到的事。

说出来你可能不信,八国联军的总头子,那个叫瓦德西的德国佬,拎着刀在中国烧杀抢掠一圈回去之后,干了一件让全世界都没想到的事。

回京历史梦
2026-10-02 14:35:10
恒生科技一年跌掉40%,这是港股A股化了?

恒生科技一年跌掉40%,这是港股A股化了?

城事堂
2026-10-03 08:20:20
美国、法国、德国、英国、意大利、日本、加拿大,将立即启动行动

美国、法国、德国、英国、意大利、日本、加拿大,将立即启动行动

政知新媒体
2026-10-03 08:13:21
医护这类副业被叫停!卫健委发文:严禁私自接单,违规者将被暂停执业

医护这类副业被叫停!卫健委发文:严禁私自接单,违规者将被暂停执业

华医网
2026-10-03 05:41:51
2026-10-03 12:23:00
老石谈芯 incentive-icons
老石谈芯
你能看懂的芯片技术科普与解析
239文章数 6075关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

33岁音乐教师赴泰国后失联 其手机IP曾两次显示在缅甸

头条要闻

33岁音乐教师赴泰国后失联 其手机IP曾两次显示在缅甸

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

假期快乐!贾乃亮晒和甜馨国庆出游照

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

教育
家居
亲子
数码
艺术

教育要闻

孩子的童年很短,请用100件爱的小事填满

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

恶治坏习惯哈哈哈哈哈哈

数码要闻

AMD掌机芯片大变革!锐龙Z3系列曝光:Zen 6架构、25mm封装

艺术要闻

赵无极《蓝色夜航》,5275万港元!

无障碍浏览 进入关怀版