Meta把定制硅片的边界从计算推到了网络层。新发布的MTIA 300是该公司首款专门针对排名和推荐模型训练优化的内部加速器,核心变化不在算力,而在通信。
通信开销成推荐模型训练瓶颈
![]()
Meta指出,推荐模型在加速器之间的通信上花费的时间要多得多。传统GPU集群里,数据传输和计算往往互相等待,通信带宽成为训练大型嵌入表的关键瓶颈。MTIA 300的设计目标就是让这两件事同时进行。
芯片直接集成了12个定制的800 Gbps RDMA网卡,不再依赖外部PCIe卡。这意味着加速器之间的通信延迟被压缩,数据不必绕道主机接口。与此同时,芯片内还塞进了16个专用消息引擎,它们独立于主计算网格处理集体操作,让数据处理和数据传输真正并发执行。
针对AllReduce和AllToAll做架构微调
推荐模型训练里常见的AllReduce和AllToAll操作,是MTIA 300架构优化的重点。这两类集体通信操作用于训练大型嵌入表,通信带宽恰恰是限制性能的主要因素。Meta把网络能力直接嵌入芯片封装,相当于把过去分散在集群层面的通信负担,下沉到了单颗加速器内部。
效果上,与传统GPU集群相比,MTIA 300把总通信时间减少了3.9倍。这个数字来自Meta对通信路径的重新设计,而非单纯堆叠算力。
定制硅片路线从计算延伸到网络
MTIA 300的发布标志着Meta定制芯片战略的一次延伸。此前外界关注点多在计算单元本身,这次Meta把网络接口和集体通信引擎一并纳入芯片设计,说明推荐系统训练的现实瓶颈已经转移到数据搬运环节。
对Meta而言,推荐模型是核心业务负载,通信效率直接关系到训练成本和迭代速度。把网卡和消息引擎做进芯片,减少对外部互连的依赖,是一条更贴合自身工作负载的路径。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.