业界不断购买GPU,却可能是在解决错误的问题。2026年8月一项基于微软Azure生产负载的新研究发现,代理式执行(agentic execution)会反复跨越CPU-GPU边界,把CPU编排直接推上关键路径。
这应该让许多基础设施路线图感到不安。AI代理编排并不是简单的“发送提示词、拿到token”。代理需要规划、调用工具、检索状态、等待API、把工作交给其他代理、处理失败重试、执行策略检查——每一步都会在GPU之外引入延迟。
对于企业和初创公司而言,即使模型更快,如果编排、内存、网络和调度设计不佳,系统整体仍可能更慢。传统LLM基础设施相对容易理解:请求到达,GPU执行推理,返回token。而代理系统完全不同。
一个用户请求可能触发多次LLM调用、数据库查询、向量检索、API请求、认证检查、内存读写、代理间通信以及重试和回退。GPU只处理其中一部分旅程。AI代理性能取决于推理、编排、工具、内存、网络和外部系统中最慢的那条路径。增加更快的GPU可以改善模型执行,但无法消除CPU调度、API等待、数据库过载、代理队列或依赖关系设计不当造成的延迟。
因此,生产环境性能必须端到端优化。近期关于基础设施感知的多代理编排研究发现,模型请求可能会在繁忙资源后面排队,而同等能力的基础设施却在空闲。在高负载下,基础设施感知路由的延迟和服务级别合规性明显优于忽略实时基础设施状况的编排策略。
这项研究提醒我们,当AI Agent成为主流应用形态,单纯堆砌GPU已经无法解决性能瓶颈。企业需要重新审视CPU、内存、网络和调度层面的设计,把性能优化从模型层扩展到系统全栈。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.