在边缘计算场景中,AI从单一功能走向持续运行的智能体,移动计算的矛盾正从“有没有算力”转向“算力该放在哪里、如何调度、怎样省电”。 在这一背景下,Arm在Arm Everywhere China年度大会上发布第二代移动终端计算子系统(CSS for Mobile 2)。这一平台集成了全新Arm Mali G2-Ultra NX GPU、搭载SME2的Arm C2 CPU集群、增强型系统IP、物理实现方案以及开发者软件生态,目标直指智能体AI和AI原生移动图形。会后,Arm边缘AI执行副总裁Chris Bergey与Arm边缘AI智能终端计算副总裁James McNiven接受专访,话题从GPU内神经网络加速器的位置选择,一路延伸到智能体功耗、存储成本与移动神经图形的未来。
![]()
不是“GPU对NPU”,而是不同负载用不同引擎
Arm把神经网络加速器放进GPU,而不是放进NPU,这件事在外界看来像一道路线选择题。James McNiven不这么看。“不同类型的AI工作负载需要不同形式的加速能力,而异构计算正是满足各类计算需求的最佳方式。不同的应用场景和计算强度,需要由不同类型的计算引擎来承担。”在他的描述里,GPU中集成的神经网络加速器专门服务神经图形工作负载;C2 CPU集群里的SME2单元基于CPU指令集加速AI,提供更快的响应和更低延迟;芯片合作伙伴通常还会集成专用NPU,去加速其自身特定的AI应用。换句话说,Arm没有用GPU内加速器否定NPU,而是让不同引擎各管一摊。“每一种计算引擎都应具备相应的AI加速能力,让各类工作负载都能够在最适合的计算单元上高效运行。”
![]()
位置差异直接决定了能力差异。James McNiven进一步解释,SME2部署在CPU集群中,能提供极低延迟和快速响应,还能利用CPU已有的安全模型与安全机制;神经网络加速器集成在GPU内部,则可以共享执行引擎的内存和缓存资源,例如L1和L2缓存,因此能以更高效率处理AI图形相关工作负载。更关键的是,AI加速功能与图形渲染管线可以紧密协同,与其他工作负载统一调度、并行处理,从而发挥整个系统的最佳效率。
精度选择也遵循同样的分工逻辑。Arm神经网络加速器本身支持INT8和INT16,James McNiven说这是“为了在保证神经超级采样等应用场景所需精度的同时,实现更高的效率,并提供优异的能效与性能表现”。FP16在内的浮点格式运算则由执行引擎中的标准着色器核心处理。NX并非覆盖所有数据类型的一体化矩阵计算单元,专用整数推理和通用浮点计算各司其职,在专用AI加速与通用计算能力之间取得平衡。
CPU重新成为智能体AI的编排引擎
CPU在智能体AI中的角色,是Arm此次发布的另一条主线。C2 CPU集群结合C2-Ultra、C2-Pro CPU和双SME2单元,C2-Ultra相比上一代可实现最高1.7倍AI性能提升、15%单线程性能提升,相同性能下最高降低38%功耗;双SME2配置使最新小语言模型运行速度提升高达70%。但James McNiven提醒,架构升级与日常体验不能简单画等号。从Cortex-X925升级到C1-Ultra,IPC实现两位数增长,主频也有所提高,综合性能最高约20%,具体表现会随实际负载不同而变化。他不便评价合作伙伴的具体产品实现,但这番话点出了移动AI的现实:终端体验不仅取决于CPU架构,还受散热、系统调度、软件适配和内存带宽影响。
Arm的应对方式是硬件与生态同时推进。Chris Bergey说:“SME2最独特的一点在于,它的编程方式和CPU保持一致。”开发者无需采用独立编程模型,可沿用熟悉的CPU编程方式,通过指令直接调用SME2的矩阵计算能力,实现极低延迟,也更易开发。配合Arm Kleidi软件库,开发者将其集成到AI框架或使用ExecuTorch等抽象化框架时,底层软件会自动适配:硬件有SME2就调用,没有则不调用。这种“无感加速”对智能体AI尤其重要,因为智能体需要频繁调用工具、维持上下文,却不能每次都唤醒高功耗加速器。
![]()
存储暴涨与智能体功耗,Arm的答案不是堆硬件
存储成本与智能体功耗是专访中无法回避的现实问题。Chris Bergey坦言:“移动产业正承受来自多方面的成本压力,不仅是存储价格,还有晶圆成本。我们正与合作伙伴推进全链路优化,关键之一就是推动 AI 模型向更小、更高效的方向演进。”Arm已与阿里巴巴通义千问合作,在SME2上实现2-bit量化模型,模型规模非常小,因此能在性能、成本和能效之间取得更好平衡。让图形能力具备神经网络处理能力,也能减轻系统内其他同类加速器的压力。这不是等待存储降价,而是从模型、压缩、调度和异构分工多个维度降低资源占用。
智能体“持续运行”带来的功耗和内存难题,James McNiven先拆解了概念。“这取决于我们如何定义‘持续运行’这个概念。”手机全时段高强度占用整个系统,与按周期调度是两回事。部分智能体可以周期性触发运行,并不需要微秒级不间断持续工作。Chris Bergey补充了一个更具体的视角:玩游戏时同时活跃的线程通常只有三到四个,却可能持续一个小时甚至更久,说明智能调度本身就能释放很多空间;而夜间充电时段可以用来做KV缓存优化和上下文预处理。由此可以理解成电池供电与充电供电两种模式,高负载任务尽量放在充电时完成。这套思路能否落地,取决于OEM和智能体供应商如何设计任务流程,Arm能做的是把硬件和调度能力准备好,真正体验仍要看终端侧的选择。
![]()
移动神经图形,能效优先,开放生态
图形是Arm此次发布的另一条主线。Mali G2-Ultra NX是首款集成专用神经网络加速器的 Mali GPU,并引入全新执行引擎和第三代光线追踪单元,在神经网络处理场景下可实现最高4倍每瓦性能提升,现有游戏内容中也有高达14%的性能提升。谈及移动端神经图形与桌面DLSS5的差距,James McNiven的回答很务实:二者底层技术原理高度相近,Arm同样具备超级分辨率能力,并通过NFRU实现完整帧生成。差异在于,Arm把能效放在核心位置,NSS模型比其他同类方案体量更精简。“DLSS5目前已经支持多帧生成,而现阶段NFRU主要实现单次额外帧生成,也就是实现帧率翻倍,这是我们当前所能实现的技术能力。当然,我们也计划进一步拓展至多帧生成能力。”移动端不能简单照搬桌面端的多帧生成,功耗、散热和内存都更紧张,现阶段重点仍是高质量超分辨率和帧率提升。
Arm同时推动开放生态。James McNiven说:“开发者可以直接前往Hugging Face下载模型权重,并结合我们提供的工具进行实验和开发。”从腾讯游戏Magic Dawn、Unity中国团结引擎,到网易《燕云十六声》的NSS版本,再到《暗区突围:无限》的NSSD演示和《无限暖暖》的NSS集成,神经图形正从技术演示走向真实游戏内容。Chris Bergey还透露,由Sumo Digital开发的《光影新生》已完成制作,但还需约30至60天测试与验证,以适配全新芯片平台,上线时间另行通知。
![]()
![]()
CSS边界由市场决定
Arm的边缘计算早已不局限于手机,而是覆盖PC、机器人和物理AI,这些领域之间CSS的边界自然需要一套划分逻辑。Chris Bergey说:“核心判断依据就是市场需求。”NVIDIA RTX产品采用的Cortex-X925核心,是两年前搭载在CSS for Mobile中的成熟技术,就当时市场需求而言,是最合适、最成熟的解决方案。如今PC领域势头更强,安全能力等独特需求也在增加,Arm便会针对性地打造全新CSS及差异化产品。由此可见,Arm对成熟IP和组件的复用并非盲目,而是有明确取舍;产品演进方向最终取决于市场和客户的实际需求,而非为差异化而差异化。
![]()
这解释了Arm此次发布的核心逻辑:它不再只是提供CPU、GPU等单点IP,而是以CSS for Mobile 2这样的计算平台,把CPU、GPU、系统IP、物理实现和软件生态打包,回应智能体AI和AI原生图形的系统级需求。两位高管反复强调, 不同工作负载应当运行在最适合的计算单元上:CPU负责编排与低延迟响应,GPU内的NX负责神经图形,SME2负责CPU侧AI加速,NPU由芯片伙伴按需集成,KleidiAI、AI Portal和开放模型权重则降低开发门槛。
![]()
智能体AI时代,没有单一加速器能包打天下。Arm的策略不是制造“唯一答案”,而是让每个计算引擎都具备AI能力,再通过统一软件栈和生态协作把碎片化风险压下去。存储成本、功耗、开发者选择仍是现实挑战,但竞争已经从单点算力转向系统级协同。Arm能否把“AI everywhere”从平台叙事变成开发者和用户可感知的体验,将决定下一代移动AI的节奏。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.