公众号记得加星标⭐️,第一时间看推送不会错过。
据路透社报道,一家名为CScale的AI互连初创公司在最近完成了1.45亿美元的融资,英伟达和英特尔旗下投资机构最近都参与投资了。
据介绍,CScale成立于2023年,其首席执行官是 Martin Lund,他此前在网络巨头思科系统公司负责芯片和硬件系统。关于该公司的目标,主要面向大规模AI数据中心开发光互连技术,目标是解决传统铜互连在传输距离、带宽、功耗等方面的限制。
报道指出,与单纯追求更高传输速率不同,CScale更关注超大规模AI集群中的系统可靠性。
铜互联,走向极限?
在数据中心布线中,铜缆和光纤之间的讨论已经持续了很多年。不过,随着数据中心网络速率不断提高,这场竞争正在出现新的变化。
过去,40Gbps已经是数据中心较高的网络速率,如今100Gbps已经越来越普遍,大型企业和云数据中心甚至已经进入400Gbps时代。与此同时,交换机本身也在不断升级。更强大的ASIC让交换机能够承载越来越高的数据容量,数据中心需要考虑的问题也随之发生变化:这些越来越大的数据流量,究竟应该如何从交换机有效地分配到服务器,同时还要控制整个网络的功耗?
在这样的背景下,铜缆在数据中心中的位置正在受到挑战。
目前,光纤已经遍布数据中心网络的大部分区域,铜缆主要还集中在设备分配区域内部,也就是机柜中的交换机与服务器之间。对于短距离、尤其是50Gbps以下的应用而言,铜缆依然具有成本低、可靠性高等优势,因此仍然有一定的应用空间。但随着网络速度继续提升,铜缆的问题开始越来越明显,其中最主要的两个问题就是传输距离和功耗。
随着速率提高,通过铜缆传输电信号变得越来越复杂。电信号本身受到ASIC能力的限制,要把高速信号传得更远,也需要消耗更多电能。这甚至开始影响短距离的直接连接铜缆(DAC)。与此同时,交换机容量越来越大,一台1U交换机已经能够连接多个机柜的服务器。在这样的网络架构下,即使是过去被认为不长的距离,铜缆也可能已经难以满足高速传输的要求。
因此,一些数据中心开始减少传统的机架顶部(ToR)交换机部署,转而采用机柜中部或机柜末端交换机,并结合结构化布线,以更有效地完成网络连接。
功耗问题同样突出。相关资料显示,在超过10G之后,双绞线铜缆的应用已经基本停止增长,其中一个重要原因就是功耗。铜链路需要从连接两端获得电能来完成电信号传输。目前,10G铜收发器的最大功耗约为3~5W,虽然比DAC使用的收发器低约0.5~1W,但与多模光纤收发器相比,功耗几乎高出10倍。
而在数据中心里,功耗并不只是电费的问题。更多的功耗意味着更多的热量,也意味着更高的散热成本。有报道指出,如果把这些因素一起计算进去,铜连接的运营成本可能达到光纤的两倍。此外,功耗差异也不仅存在于网络线缆本身,交换机内部的铜走线同样会产生能量损耗。把这些环节全部加起来,差距就会更加明显。
当然,铜缆并没有马上退出数据中心。
为铜续命,光伺机崛起
正如英伟达黄仁勋,以及Marvell和博通的高管一直所表达的观点,能用铜的地方可以继续用铜,是很有价格优势。事实上,这也是铜和光过去几年比较焦灼的原因。
回到铜互连,DAC目前仍是数据中心常见的短距离连接方案。被动DAC依靠主机信号传输,主动DAC则通过加入电子器件增强和调理信号,从而支持更高速率和更长距离,但也会带来额外功耗。虽然DAC成本较低,但随着传输距离和网络速率提升,信号衰减问题依然存在。
AOC则采用光纤传输,在带宽、重量和布线方面更具优势,但其长度通常需要提前确定,且发生故障或网络升级时往往需要整体更换。更重要的是,DAC和AOC本质上都是点对点连接,灵活性不如结构化布线。在数据中心规模扩大、网络速率不断升级的情况下,这种固定连接方式也意味着更高的后期维护和升级成本。
此外,Credo近年来大力推动的AEC,也可以看作铜互连面对高速率升级所做的一次“自我延伸”。通过引入有源信号调理,AEC试图突破传统铜缆的距离和速率限制,从而让铜互连继续覆盖一部分原本可能逐渐转向光互连的应用场景。
在更进一步的方向上,无论是近期火热的NPO,还是大家公认的共封装光学(CPO)也都是被看做向光走的选择。尤其是CPO,其核心思路是把电光转换引擎进一步靠近交换机ASIC,从而减少甚至消除交换机内部的铜走线。这样做的目的,是减少短距离铜连接产生的电损耗,从而在提高带宽的同时降低功耗。
从长远来看,CPO希望进一步减少网络链路中最后几英寸的铜连接,使数据中心网络逐渐走向更加接近ASIC到ASIC的全光连接。不过,这一目标并不容易实现,还需要整个产业链进行合作,并通过新的标准解决不同产品之间的互操作问题。
过去一段时间,上市公司和初创企业都在投入数十亿美元,致力于用光连接取代传统的有线连接。众所周知,光连接使用激光脉冲而非电子来传输数据。但这些激光器容易发生故障,因此许多追求这项技术的公司都将激光器与芯片分离,以便于更换。
随着未来AI数据中心连接数千颗加速器、跨越数十个机架甚至达到GW级规模,即使单个激光器或光学器件的故障率很低,整个系统出现器件失效也将成为难以避免的问题,其带来的问题就更加严峻。
CScale的破局之道
按照路透社的报道,在一次采访中, Lund拒绝透露 CScale 技术的具体细节,只表示该公司将把激光器集成到芯片上,这样即使激光器发生故障,也不会中断数据流。
“我们没有使用任何新奇的技术,” Lund说。“我们使用的是成熟的技术,并以一种新颖的方式将它们整合在一起,但保留了多年来一直应用于业界并值得信赖的光纤技术。”Lund指出。
CScale首席执行官Martin Lund表示:“随着人工智能规模化部署扩展到数十个机架,光互连变得至关重要。在这种规模下,可靠、可预测的通信是系统经济性的根本。更便捷的部件更换可以提高可维护性,但无法保证系统的连续性。我们设计的互连方案旨在确保系统的连续性。激光器会发生故障,但计算不应该发生故障。”
据介绍,CScale 正在构建一个集成式光引擎,旨在为千兆瓦级人工智能基础设施提供可靠的光连接。
而从路透社的报道可以看到,该公司以前名为CSpeed。基于此,我们搜索到了更多关于该公司的方案介绍。总而言之,该公司的理念是用硅光子学和高密度激光阵列驱动的光纤连接取代连接人工智能硬件的铜互连。
Cspeed 的目标是使光纤连接足够密集且经济高效,从而满足人工智能基础设施当前对大规模部署的需求。这项研究的核心是一个高密度III-V族激光阵列——一种由化合物半导体构成的集成光源,被设计成大型光学系统的核心组件。这是一项深入且物理含量极高的研究,耗时数年,鲜少见诸报端,但如果成功,它将成为无形的基础设施。
具体而言,我们认为,其思路可以如此理解。
众所周知,硅光子本身擅长对光进行传输、调制和处理,但并不适合直接产生激光,因此需要借助InP、GaAs等III-V族材料提供光源。CScale希望将大量激光器以更高密度集成到光互连系统中,再配合硅光子器件和光纤,实现大量AI芯片之间的高速连接。对于未来需要连接数千颗AI加速器的超大规模计算系统而言,光源能否做到足够高的集成度,同时控制成本、功耗和封装复杂度,将成为这条路线能否落地的关键。
而CScale真正有意思的地方,还在于它并没有把问题停留在“如何把铜换成光”上。随着光互连规模扩大,激光器本身的可靠性也会成为新的挑战。当一个AI系统拥有数以万计甚至更多的光学连接时,单个激光器出现故障并不是完全可以避免的事情。因此,CScale希望从系统架构层面解决这一问题,即使某个激光器或光链路出现故障,也不会让整个计算任务中断。换句话说,它关注的不只是光互连的速度和功耗,还包括在超大规模AI集群中的可靠性和故障容忍能力。
从这个角度看,CScale所探索的其实是一条比传统光模块更加激进的路线:让光从数据中心网络的连接手段,进一步变成AI计算系统内部的基础设施。过去光互连更多承担服务器与交换机、交换机与交换机之间的数据传输,而CScale试图将这一边界继续向计算芯片侧推进。最终竞争的重点,也可能不再只是单个光模块能跑到多少Tbps,而是能否以足够高的密度、足够低的功耗和足够高的可靠性,让数千颗AI加速器通过光互连真正组成一个更大的计算系统。
总而言之,CScale走的不是简单的“光替铜”,而是以硅光子为基础,把III-V激光阵列、光电芯片和光纤进一步推向AI计算芯片,通过高度集成的Optical I/O,把AI加速器之间原本受铜互连距离限制的高速通信转移到光域,同时通过架构设计解决大规模光互连的可靠性问题。英伟达和英特尔资本的投资,除了财务投资外,也算是他们对上述方案的认可。
CScale也透露,公司迄今已筹集了 1.88 亿美元,并计划在 2028 年前交付其芯片。
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第4546期内容,欢迎关注。
加星标⭐️第一时间看推送~
![]()
![]()
求推荐
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.