IT时代网8月12日消息,由华为 2012 实验室、华为云、计算、终端等团队联合打造的开源智能体平台 openJiuwen,近日联合昇腾推出一项名为"算力亲和"的全链路协同技术。
该技术打通了 Agent 框架、推理引擎与底层算力之间的协同壁垒,让 KV Cache(键值缓存)从被动管理走向主动协同,使 Agent 推理的首 Token 时延降低 57% 以上,推理存储占用峰值下降 25%。
AI Agent 任务越来越长,单个任务可能持续数十分钟甚至数小时,多个 Agent 还要分工;任务越长、协作越多,产生的 KV Cache 就越庞大、时延越久。传统推理引擎只看得见请求和缓存,读不懂 Agent 在做什么——子任务结束了,缓存可能还占着昂贵的 NPU 显存;会话挂起时,缓存仍占着最贵的资源位。
openJiuwen 的作法是在 Agent 与推理引擎之间建立一套"状态契约",即 Agent Hint:Agent 在关键状态变化时发出信号,告诉引擎当前会话的生命周期状态,引擎据此执行驱逐、卸载、预取等缓存动作,让缓存随任务节奏在存储层级间主动流动。测试显示,开启算力亲和后,请求端到端时延降低 27.61%,前缀缓存命中率提升 33%,池化缓存使用量峰值降低 25.24%。该能力即将开源。
![]()
注:本文中包含AI辅助创作的内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.