大模型能力持续演进,但AI的下一阶段竞争正在发生变化。模型能力之外,如何构建可靠的智能体、完善AI工程体系,并让AI在复杂业务环境中稳定运行,正成为产业探索的新重点。 8月21日至22日,AICon全球人工智能开发与应用大会将在深圳举办。大会全日程已100%上线,来自产业一线的技术专家将围绕Agent工程化、大模型基础设施、AI Native研发、具身智能等前沿方向,分享AI时代的技术探索与工程实践。 华为2012实验室大模型系统工程技术专家李柏潮已确认出席“AI Infra、推理工程与异构计算”专题,并发表题为《盘古训练与推理通信优化实践:亲和昇腾平台的性能探索》的主题分享。 通信开销是大模型训练和推理中不可忽视的性能瓶颈。在MoE模型中,AllToAll通信占总端到端时间的30%以上,一直以来的优化重点;而在1M超长上下文场景下,Host to Device的KV Cache传输延迟已成为推理TTFT的新“拦路虎”。李柏潮指出,只有深度亲和昇腾硬件进行通信优化,才能最大化将昇腾算力潜能转化为模型训练/推理性能提升。 本次分享围绕昇腾平台的两类通信优化展开:第一部分聚焦MoE场景下的AllToAll,通过适配昇腾950的网络拓扑和CCU通信加速器,在盘古模型的EP通信域AllToAll上实现了10%以上的性能提升;第二部分关注超长序列推理中的KV Cache卸载,通过Omni Cache高效的H2D和D2H通信,实现TTFT提升10%以上。更进一步,李柏潮还展望了如何通过昇腾亲和实现最优的通算掩盖,使通信不再成为暴露在训练/推理端到端时延中的短板。 李柏潮是华为2012实验室大模型系统工程技术专家,中山大学博士,在华为长期从事通信协议研究工作,研究方向覆盖数据中心网络、广域网络、终端无线网络。当前聚焦优化盘古模型训练/推理的通信性能,主导盘古模型在昇腾950上的通信算子性能优化。 在本次会议的详细演讲中,李柏潮将重点解答以下问题: 1. 大模型的训练/推理在通信方面面临哪些技术挑战?包括MoE阶段的AllToAll通信这一长期关键瓶颈,以及超长上下文场景下H2D通信成为推理场景新出现的性能瓶颈。 2. 如何亲和昇腾硬件,加速EP域的AllToAll?通过拓扑亲和案例(DeepEP方案不适用于昇腾910A3)、算力亲和案例(发挥昇腾950专门通信加速引擎CCU的最大效用)、模型亲和案例(使用自定义通信算子实现灵活的集合通信新语义)三个层面展开。 3. 如何软硬双管齐下,加速H2D(Host to Device)通信交互?硬件方面,昇腾950为每个NPU提供专用H2D通路;软件方面,Omni Cache实现高效KV Cache卸载;进一步优化方面,亲和昇腾硬件实现融合算子/多流并行的流水编排。 李柏潮还强调,针对昇腾950硬件平台进行通信优化,是牺牲普适性换取性能提升的策略。同样的策略应用到其他平台(如昇腾910A2/A3、NVIDIA H20)可能会失效,甚至带来性能劣化。此次分享旨在帮助业界了解昇腾950的硬件特性,为其他模型的训练/推理部署提供亲和硬件的参考,同时通过盘古模型在通信算子、并行策略方面的优化实践,为其他模型的部署优化提供借鉴。 除上述专题外,本次大会还策划了AI Infra、推理工程与异构计算、超级个体与蜂群智能的共生进化、迈向机器人AGI的关键技术与产业实践、Agent安全:从风险到可控、大模型效率工程与Agent系统实践、AI Agent高价值商业场景实战等10个专题论坛,届时将有来自不同行业、不同领域、不同企业的50+资深专家现场带来前沿技术洞察和一线实践经验。 目前,AICon深圳站日程已100%上线,包括10大专题、1个动手实验室、近60场重磅议题,集结浙大知名高校教授及阿里、腾讯、华为、快手、Google Cloud团队等头部企业技术专家,聚焦Agent工程化,构建可靠智能的技术路径。更多详情可扫码或联系票务经理13269078023咨询。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.