![]()
©潮涌AI编辑部
AI基础设施的竞争,正在从单点算力扩展到集群协同效率。
9月4日,天津大学-凌波智芯先进算力互联技术联合实验室在天津大学正式成立。
联合实验室聚焦人工智能算力互联,将围绕高性能AI网卡、Scale-out网络、无链接RoCE、先进流量控制、高并发状态管理和可靠传输等方向开展联合攻关。
在大模型训练和推理场景中,GPU并不是孤立工作。多节点、多GPU集群需要频繁进行Collective通信、All-to-All数据交换、专家并行和跨节点KV数据交换。Scale-out网络也因此从服务器的配套部件,逐渐成为决定GPU有效利用率和系统吞吐的关键变量。
凌波智芯切入的正是AI集群中的网络互联问题。
公司围绕LINGBO系列高性能AI网卡研发,提出“无链接RoCE”技术路线,希望在保持RoCEv2和开放以太网基础生态的前提下,通过重新设计网卡内部通信状态、队列与可靠传输机制,让网卡在高并发AI通信下仍能维持高效的数据面处理。
![]()
凌波智芯SNIC产品
传统面向连接的RDMA网卡通常以QP及其关联上下文作为传输和可靠性管理的重要粒度。一个通信关系背后,需要维护序列号、窗口、重传、拥塞控制以及队列等状态。当GPU数量、并发通信关系以及Collective并行度同时上升时,状态项数量、查表频率和片上SRAM压力会快速放大。
所谓“无链接RoCE”,并不是取消RDMA的可靠性语义,也不是让数据包无序、无状态地在网络中自由发送,而是把数据传输从大量细粒度连接上下文中解耦。凌波智芯采用面向目的端的状态聚合思路,使同一目的端的多条通信流能够共享部分传输上下文和调度资源,降低连接数量增长对片上存储和状态访问带来的压力。
围绕这一架构,凌波智芯还设计了HP4流控和SSR选择性重传。HP4的核心思想是依据接收端可承载能力、网络往返特征和当前活跃发送关系,对可注入网络的数据量进行主动约束,把拥塞管理从“事后退让”尽可能前移到“事前注入控制”。SSR则采用PacketContainer思想,通过选择性确认反馈缺失位置,使发送端只重传真正丢失的数据,而不是重复发送已经正确到达的整个数据段。
![]()
从产业观察角度看,这一项目的关注点不在于单一技术名词,而在于能否把网络论文、硬件IP和真实集群验证连成一条链。联合实验室将把高校在网络体系、拥塞控制和系统研究方面的原创成果,与企业在FPGA、芯片RTL、板卡、驱动和客户场景验证方面的工程能力连接起来。
后续在客户POC阶段,还需要进一步覆盖主流GPU、交换机、训练框架和不同拓扑,验证软硬件互操作性,以及新网卡与现有RoCE网络混合部署时的兼容能力。这也意味着,真实多节点网络中的有效带宽、Collective完成时间、P99尾时延、丢包恢复时间和规模扩展效率,将成为观察这一技术工程化进展的重要指标。
同日,天津大学与凌波智芯签署相关入股增资协议,双方合作由联合科研进一步延伸到成果转化和产业协同。凌波智芯创始人、天津大学教授李文信表示,LINGBO系列AI网卡是现阶段技术落地的重要产品载体,但联合实验室长期希望沉淀的是协议、架构、算法、核心IP和系统能力。
![]()
![]()
![]()
=▹
联系我们 CONTACT US!
请添加微信xingminghui15
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.