网易首页 > 网易号 > 正文 申请入驻

Agentic AI崛起,CPU成为新的性能瓶颈

“AI对齐问题”终于成为现实

0
分享至



随着AI智能体不断调用工具、生成子智能体并处理更长的Token序列,CPU在AI基础设施中的计算负载持续增加,并逐渐成为影响整体性能的关键瓶颈。

今年早些时候,Amazon Web Services(AWS)的高层向工程师提出了一项新的要求:必须尽可能节省CPU计算资源。据报道,随着AI工作负载不断挤压公司的云基础设施,AWS的CPU服务器容量的等待时间出现了爆发式增长。

这个问题似乎让AWS措手不及,而且原因显而易见。AI的蓬勃发展导致GPU需求激增,随后内存需求也随之飙升。CPU基本没有出现在这轮增长中,因为与GPU相比,CPU的并行能力相对有限,因此并不适合AI模型推理——也就是运行并向用户提供大语言模型(LLM)服务的过程。

但随着Agentic AI(智能体AI)系统兴起,这一叙事正在发生变化。Agentic AI允许AI模型自主运行,并调用其他子智能体来完成任务。

Moor Insights & Strategy副总裁兼首席数据中心分析师Matt Kimball表示,2026年CPU需求出现了明显增长,其中很大一部分来自Agentic AI的发展。Kimball说:“让一个智能体工作,并假设它生成100个智能体是一回事。如果我要把这种模式推广到整个企业,那么这100个智能体很快就会变成数万个、数十万个甚至数百万个智能体。你会看到智能体生成子智能体、发起API(应用程序编程接口)调用,并通过Anthropic的模型上下文协议与更多智能体进行通信。”

AI agents需要使用计算机,而计算机需要CPU

Kimball所说的情况,部分涉及所谓的“工具调用(tool use)”。这是对LLM能力的一种概括,即让大语言模型访问互联网、打开桌面上的文件,以及使用各种软件来完成任务。

经过工具调用训练的LLM能够学会调用其他软件。虽然LLM的推理过程仍然主要在GPU或类似的AI加速器上执行,但LLM发起的工具调用通常会交由CPU处理。

“Agentic AI任务中的许多环节,本质上都是基于CPU的工作。”英特尔高级研究科学家Souvik Kundu解释道,“CPU负责解析输出结果、确定应该调用哪个工具、发起API调用或运行代码、收集结果,并将结果反馈回去。”AMD计算与企业AI副总裁Madhu Rangarajan也表达了类似观点。他表示:“在我们的测试中,实际Agentic AI流程的八个阶段中有七个完全在CPU上运行。”

例如,当一个LLM负责编写软件时,它很可能会调用各种工具,将代码写入文件、移动或替换文件、下载所需的软件包,并在LLM认为代码已经完成后构建软件。

Kundu与佐治亚理工学院的研究人员共同撰写了一篇关于Agentic AI优化的论文。他们发现,当LLM推理在GPU上执行时,CPU往往处于空闲状态;反过来,当工具调用在CPU上执行时,GPU又经常处于空闲状态。为了优化这一现象,Kundu及其同事提出了调度优化方案。在持续负载下,该方案最多可以将端到端延迟,即Agentic AI工作负载从开始到结束所需的时间,降低至原来的约1/1.8,也就是性能提升最高约1.8倍。

这只是一个开始,但这种性能提升面对的是一个不断变化的目标。Agentic AI系统能够以机器的速度产生工作,并在运行过程中不断放大工作量。OpenAI曾无意间“入侵”Hugging Face,其模型在一个小时内发起了多达300次操作,而一个智能体还可以生成自己的子智能体,由后者继续发起工具调用。

此外,还有一个重要因素可能会随着模型变得更加复杂而进一步增加CPU的工作负载,那就是安全护栏(safety guardrails)。

Kundu表示,对agents行为进行安全和策略检查,通常需要依据特定规则检查语法和日志文件。安全护栏也可能使用小型模型(参数量低于10亿)来分析任务复杂度或意图。虽然这些任务也可以在GPU上执行,但实际情况往往并非如此,因为这些模型规模较小,同时又需要尽可能降低延迟,因此相关工作通常会留在CPU上执行。



增加可用 CPU 的数量可以显著降低 Llama-8B 对较长序列长度的响应延迟。来源:Euijun Chung、Yuxiao Jia 等。

Tokenization进一步加剧CPU瓶颈

Euijun Chung佐治亚理工学院博士生Euijun Chung近期与其他研究人员共同撰写了一篇论文,其研究结果与Kundu的研究相辅相成。

Chung及其合作者发现,当服务器的CPU核心数量不足时,系统在向GPU分发工作方面会逐渐跟不上。这会导致GPU因为等待指令而停顿。

除此之外,这篇论文还涉及LLM工作负载中的另一个关键环节:Tokenization(Token化)。

Tokenization是LLM推理关键的第一步,它会将文本转换成模型能够处理的整数Token ID。与大多数LLM推理所需要的矩阵运算不同,Tokenization属于具有大量分支、依赖数据的顺序字符串处理。虽然可以通过将文本分块来实现并行处理,但它并不像LLM推理的大部分计算那样具备大规模并行能力。

对于较短的提示词而言,Tokenization是一项相对简单的任务,即使是入门级CPU也不会承受太大压力。然而,一个会发起工具调用的Agentic AI模型,还必须对工具调用返回的结果进行解析和Tokenization。

Chung表示:“假设你有一个持续进行的序列,其中包含10万个Token,而一次工具调用返回了1000个Token,那么Tokenizer就必须再次对整个序列进行Tokenization。而且,每一次Agentic工具调用都需要进行Tokenization。”这不仅提高了Tokenization发生的频率,也增加了每次需要处理的Token数量。Chung认为,未来的Tokenizer或许能够找到缓解这一问题的方法,但对于当前的LLM推理而言,这仍然是一个问题。

论文发现,首Token生成延迟(time-to-first-token),即模型生成回复中的第一个词所需的时间,会随着序列长度增加而大幅上升。增加CPU核心数量可以缓解这一问题。在更长序列的测试中,增加CPU核心数量可以将首Token生成延迟降低约1.5倍至7倍。

由于测试硬件存在限制,Chung及其同事只能测试规模相对较小的模型,例如阿里巴巴的Qwen 3-30B和Meta的Llama 3.1-70B。他推测,更大型的模型可能因为整体GPU需求更高,而不会出现如此明显的CPU瓶颈,但同时他预计Agentic AI会将Token序列长度推向远超其团队测试范围的水平。

Chung表示:“如果你考虑Anthropic的Claude这样的模型,很容易就会达到50万个甚至100万个Token。在Agentic AI的世界里,平均序列长度会不断增长,所以我预计这个问题在未来的工作负载中会变得更加严重。”

CPU紧缺才刚刚开始吗?

亚马逊开始限制CPU资源使用,只是Kundu和Chung发现其研究具有现实意义的诸多迹象之一。

Intel的服务器CPU至少已经到年底前都已售罄。AMD已经将服务器CPU预测产量翻倍。Arm和Qualcomm都宣布了专门用于加速Agentic AI的新型CPU。就连NVIDIA也将基于Arm架构、面向Agentic AI的Vera CPU优先推出,该处理器也是NVIDIA Vera Rubin平台的一部分。

Kimball表示,这些发展清楚表明,AI行业正在更加重视CPU性能。他认为,CPU需求的激增是一个“绝对明显的信号”,说明CPU如今已经被视为Agentic AI系统的关键组成部分。

遗憾的是,这可能会进一步演变为更广泛的CPU短缺和价格上涨,就像此前GPU和内存市场已经出现的情况一样。

Kimball表示:“我们已经在某种程度上看到CPU紧缺了。从市场限制来看,这种趋势甚至蔓延到了消费领域。”他补充说,尽管英特尔新的18A制程推动了公司客户端业务的销售增长,但英特尔仍然削减了客户端CPU的产量,转而优先生产服务器CPU。在Kimball看来,这表明CPU厂商将会向更具商业价值的市场倾斜。

*声明:本文系原作者创作。文章内容系其个人观点,我方转载仅为分享与讨论,不代表我方赞成或认同,如有异议,请联系后台。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1TB!苹果Pro Max新机公布:9月9日,即将登场!

1TB!苹果Pro Max新机公布:9月9日,即将登场!

科技堡垒
2026-08-23 11:22:59
许家印亲哥的寄生人生:靠恒大躺赚 20 年,71 岁成老赖,却躲过了牢狱之灾

许家印亲哥的寄生人生:靠恒大躺赚 20 年,71 岁成老赖,却躲过了牢狱之灾

一盅情怀
2026-08-23 14:04:26
远超比亚迪,暴赚3000亿!出口94万辆,这个国产汽车闷声发大财

远超比亚迪,暴赚3000亿!出口94万辆,这个国产汽车闷声发大财

史之铭
2026-08-24 02:18:43
吹牛的人形机器人找不到市场,有市场的工业机器人搞不了

吹牛的人形机器人找不到市场,有市场的工业机器人搞不了

柏铭锐谈
2026-08-22 20:30:06
0-4!0-1!沙特联第二轮:C罗追赶新纪录+菲尼克斯两场三球一助攻

0-4!0-1!沙特联第二轮:C罗追赶新纪录+菲尼克斯两场三球一助攻

包饺子ai剪辑
2026-08-23 14:52:33
终于有星二代颜值赶超父母了,张智霖19岁儿子,留寸头又帅又阳刚

终于有星二代颜值赶超父母了,张智霖19岁儿子,留寸头又帅又阳刚

清川逐影
2026-08-23 20:37:25
美国眼里歼-16,只要落地埃及,中东将难以承受这个代价

美国眼里歼-16,只要落地埃及,中东将难以承受这个代价

影孖看世界
2026-08-22 23:05:01
“龙餐厅”原型刘磊自曝,和演员没共鸣,英美大兵里有他的保护伞

“龙餐厅”原型刘磊自曝,和演员没共鸣,英美大兵里有他的保护伞

嫹笔牂牂
2026-08-18 07:06:29
每体:阿尔瓦雷斯赛后独自进更衣室是因为有工作人员找他

每体:阿尔瓦雷斯赛后独自进更衣室是因为有工作人员找他

懂球帝
2026-08-24 03:04:07
轮到以斩首了?一天8轮空袭,土耳其遭重创,联合国态度出人意料

轮到以斩首了?一天8轮空袭,土耳其遭重创,联合国态度出人意料

青青衫书生
2026-08-21 16:18:12
王菲调侃那英:演唱会为何会请肖战出任嘉宾?那英的回应太圈粉了

王菲调侃那英:演唱会为何会请肖战出任嘉宾?那英的回应太圈粉了

史料布籍
2026-08-23 13:35:42
暴雨+台风双预警,部分地区需警惕强对流天气

暴雨+台风双预警,部分地区需警惕强对流天气

界面新闻
2026-08-24 06:52:38
原来唐师曾前妻是她,北京著名导演,离婚后无怨无悔照顾他28年

原来唐师曾前妻是她,北京著名导演,离婚后无怨无悔照顾他28年

草莓信箱
2026-08-24 10:51:01
你见过最毁三观的事是什么?网友:吃亲家一碗面,把亲家母给勾上了

你见过最毁三观的事是什么?网友:吃亲家一碗面,把亲家母给勾上了

带你感受人间冷暖
2026-08-14 10:19:31
日本7月访日游客创历史新高,但中国大陆游客暴跌56%......

日本7月访日游客创历史新高,但中国大陆游客暴跌56%......

日本窗
2026-08-21 17:17:11
婚姻制度真神奇,让月入3K的男人过上3W的生活水准,而对女人呢?

婚姻制度真神奇,让月入3K的男人过上3W的生活水准,而对女人呢?

夜深爱杂谈
2026-08-23 20:26:44
科创板史上最大IPO要来了

科创板史上最大IPO要来了

PE星球
2026-08-24 08:35:31
你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

芹姐说生活
2026-08-21 22:28:55
人民日报发文锐评“买票占座”,释放3大信号,原来我们都错了!

人民日报发文锐评“买票占座”,释放3大信号,原来我们都错了!

一念痴狂
2026-08-23 01:43:00
炸裂啊!英国博主一条似乎求偶的视频,评论区火爆远超王水牛,很多中年女子留言不堪入目

炸裂啊!英国博主一条似乎求偶的视频,评论区火爆远超王水牛,很多中年女子留言不堪入目

火山詩话
2026-08-23 08:40:09
2026-08-24 11:31:00
半导体产业纵横 incentive-icons
半导体产业纵横
探索IC产业无限可能。
3203文章数 1347关注度
往期回顾 全部

科技要闻

“捂脸跑”机器人火出圈,它自己想出来的

头条要闻

妈妈骑车带娃电话手表掉落 手表自动拍到两张人脸照

头条要闻

妈妈骑车带娃电话手表掉落 手表自动拍到两张人脸照

体育要闻

46岁小罗复出,为什么选了一支意丙球队?

娱乐要闻

张韶涵演唱会突发不适,本人发文道歉

财经要闻

泡泡玛特,最大的问题才刚显现

汽车要闻

华为乾崑全栈赋能/更倾向城市出行 猛士X700车展首秀

态度原创

数码
旅游
家居
公开课
军事航空

数码要闻

画质党狂喜!英伟达DLSS 4.5光线重建8月25日发布:RTX 20到50全系免费升级

旅游要闻

东营市东营区:以葡为媒 农文旅铺就富民路

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国与以色列发生“罕见冲突”

无障碍浏览 进入关怀版