面对代理AI工作负载,企业究竟该选择何种计算架构?Arm与Google Cloud给出的答案指向一个常被忽略的方向:让CPU承担更多关键任务,而不仅仅依赖昂贵的加速器。
当企业团队开始部署代理工作流时,他们面对的核心挑战并非单纯的算力峰值,而是如何在多样化工作负载之间实现灵活、高效的资源调度。这要求基础设施能够管理异构环境——既需要高性能加速器处理大规模训练和推理,也需要CPU来构建代理AI的编排层。
![]()
Arm软件生态系统开发总监Bhumik Patel直指问题本质:关键在于将工作负载类型与计算能力尽可能精确匹配。随着自主代理日益普及,CPU恰好擅长处理代理状态管理、语义路由、工具选择,以及为不受信任的生成代码创建安全隔离沙盒这类任务。Patel向The New Stack解释道:“代理任务如编排、调用API、内存管理,都是CPU擅长的领域,因此这是一种分布式并发的AI工作负载。”
这种智能工作负载解耦为代理AI带来了可量化的效率提升。Google Cloud Compute Engine产品组合中的Google Axion处理器,正成为践行这一理念的代表性产品。该处理器系列属于Google定制Arm处理器家族,专为性能、效率与通用性而设计,其功能集支持通用工作负载、基于CPU的AI工作负载以及其他需Arm原生兼容性与直接硬件访问的专用任务。
Axion是Google首款基于Arm架构的定制服务器CPU,于2024年4月发布,专门针对超大规模云与AI时代的数据中心工作负载打造。更重要的是,Axion凝聚了Google十余年的定制芯片创新经验,这让Google能够更迅速地将客户反馈融入芯片设计之中,去应对CPU领域更复杂、更具通用性的需求。
具体到性能表现,Google Axion产品组经理Mo Farhat给出了一个明确的对比数据:在Axion N4A实例上运行的Google Kubernetes Engine Agent Sandbox,其性价比优于排名第二的超大规模云服务商方案,优势幅度高达30%。GKE Sandbox是一个开源的Kubernetes原生原语,专门用于安全执行AI生成的不受信任代码。
成本考量之外,在CPU实例上运行部分AI工作负载还具备实际可行性,尤其是在处理较小数据集或较低复杂度模型时。智能工作负载分配机制使代理AI不再将所有负载集中到单一计算类型上,从而实现了更高的成本效益与运行效率。Google Cloud构建的流动计算基础,让工程团队能够根据实际需求灵活预留和调度资源,这或许正是企业级代理AI走向大规模落地的关键一步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.