网易首页 > 网易号 > 正文 申请入驻

智能体AI时代为什么CPU同等重要?AMD锐龙AI Halo本地智能体推理实测解析

0
分享至

【ZOL中关村在线原创技术解析】聊天式AI和智能体AI看似都在使用大模型能力帮助用户解决特定任务,但对于底层硬件系统来说,实际上考验的是完全不同的能力。

聊天AI是给出答案的一次性响应,这比的是谁的GPU更强、谁的token吐得更快。而智能体AI却是一整套已完成、并且经过验证的工作成果,从读取几百份文件开始、到做OCR识别、提取关键信息、再到生成报告,最后还要自我核查,确保结果可用。因此,前者比拼的是“单点爆发力”,后者比拼的是“全流程贯通能力”,而这恰恰是GPU算力无法单独决定胜负的领域。这也是为什么当前芯片厂商都在讲的智能体AI时代CPU与GPU配比重回1:1的底层原因。


年初CES,AMD发布了锐龙AI Halo迷你主机,并在近期的AMD Advancing AI大会上公布了升级款机型。随后,AMD发布了一份基于锐龙AI Halo平台的本地智能体基准测试(HEPA)报告,这份报告很好地解答了智能体AI时代CPU的重要性。



根据测试结果来看,在真实的企业级智能体工作负载下,搭载AMD锐龙AI Max+ 395处理器的锐龙AI Halo,在多项关键指标上其实已经超越了GPU能力强劲的NVIDIA DGX Spark(GB10),这背后揭示的,其实是本地AI硬件评价标准的一次根本性转变。

·智能体工作流大部分不是跑在GPU之上

与聊天AI先思考再给出答案不同,智能体要完成一项任务,通常需要经过解析、OCR、切分、嵌入、检索、数据链整理、生成、验证等多个阶段。AMD的测试将这一流程拆解为8个具体环节,测试结果发现:其中的7个阶段均会运行在CPU上,只有生成这一个阶段,也就是模型输出token的过程会运行在GPU 上。具体可以参看下表:


换句话说,GPU只在整个任务的临门一脚环节发力,而解析文档、识别扫描件、切分内容、生成向量、检索证据这些真正耗费系统资源的准备工作负载,几乎全部压在CPU身上。这意味着,一台设备的智能体的实际表现,很大程度上取决于CPU的编排与并行处理能力,而不只是GPU的峰值算力,这与聊天AI时代的AI应用逻辑完全不同。


·从token速度到全流程效率

聊天时代最常被提及的两个指标是首token响应时间(TTFT)和每秒token数,它们衡量的是单个模型流式输出单次回答的速度。但对智能体而言,这两个指标只能反映流水线中“生成”这一小段的表现,无法说明任务整体完成得有多快。


因此,智能体时代真正有意义的指标变成了端到端完成时间,即从接收任务到交付经过验证的成果所需的总时长,以及每个已完成工作流的成本。这也是AMD设计HEPA基准测试的出发点,也就是不再单独衡量推理速度,而是衡量把所有活干完所需要的时间和所付出的代价。

·HEPA基准测试:贴近真实企业场景的极限压力测试

HEPA,全称Hermes Executive Presentation Agent,是AMD自定义设计的基准测试,用来模拟一个高度真实的企业知识工作场景,包括:智能体需要处理302份本地文件(相当于一个大型团队共享网盘),文件中混杂着有效信息、冗余材料、过时甚至相互冲突的内容,还包含需要真正OCR识别的扫描件和源自图像的素材。

智能体必须完整读取这批数据、对扫描件执行OCR、将内容切分为801个片段并生成嵌入向量、检索出有证据支撑的内容包、生成一份可提交董事会的高管演示文稿(配套备忘录、图表及带引用来源的附录),并最终通过一套确定性的质量验证流程。整个过程更像是老板扔给你一个几百GB的共享盘,要求“下午三点前给出一份能上会的PPT”,而不是简单地“回答某一个问题”。

这项测试在两台配置对等的设备上进行:一台是搭载AMD锐龙AI Max+ 395(16核32线程)的锐龙AI Halo开发者设备,另一台是搭载GB10(20核Arm 架构)的NVIDIA DGX Spark。两者均配备128GB统一内存,运行相同的语料库、相同的编排模型(Qwen3.6-35B-A3B混合专家模型)、相同的嵌入模型与真实TesseractOCR,并且都完成了5/5次有效运行与25/25项确定性质量检查,确保结果具备可比性。

在完全相同的测试条件下,AMD锐龙AI Halo在端到端完成时间、CPU编排效率和每工作流成本三项关键指标上,均优于NVIDIA DGX Spark,具体参考下方表格:


CPU编排阶段,锐龙AI Halo领先34%。从测试结果看到,AMD完成CPU侧准备工作仅用时152.1 秒,而DGX Spark耗时229.9秒。根据AMD官方信息,其中差距最大的环节是嵌入与路由,AMD用时71.5秒,DGX Spark用时139.6秒,差距接近一倍。

端到端工作流方面,锐龙AI Halo快15%。AMD完成整个经过验证的工作流用时311.6秒,DGX Spark用时367.1秒,AMD提前55.5秒交付结果。在智能体场景中,这才是真正有意义的核心KPI,即交出一份可用的成果,而不是比拼谁的token吐得更快。


每工作流成本方面,锐龙AI Halo低27%。按三年硬件摊销计算(不含能源成本),AMD每个已完成工作流的成本约为0.0132美元,DGX Spark约为0.0182美元。值得注意的是,即便DGX Spark在单纯的GPU推理阶段更具优势,它依然在整体任务上落后,因为前面我们也说了,推理只是智能体AI流水线中的一环,CPU密集型的编排工作同样会决定最终的成败。

·AMD为什么能赢?答案就藏在CPU里

那么为什么GPU能力更强的DGX Spark反倒在智能体工作流中的效率不及锐龙AI Halo呢?其实答案就是CPU。


AMD锐龙AI Max+ 395拥有16 个Zen 5核心以及32个有效工作线程,并集成了AVX-512/VNNI向量加速指令集,同时具备面向文档处理与检索技术栈高度优化的原生x86工具链。相比之下,DGX Spark的Grace Blackwell 平台虽然拥有20个Arm核心,但它不支持超线程,而且向量加速依赖的是SVE2而非效率更高的AVX-512。

而且解析、OCR、嵌入、路由这些阶段本质上都是高度数据并行的任务,会随着核心数、线程数的增加而近似线性地提速,也会随着数据集规模扩大而放大差距。更多的线程、更强的向量处理能力,意味着可以同时处理更多源文件的解析、嵌入与路由,这正是AMD在“嵌入与路由”这一决定性环节领先近一倍的根本原因。同时如果数据体量越大,这种架构优势就体现得越加明显。

·系统制胜,而非单一芯片的竞赛

AMD锐龙AI Halo的设计思路可以概括为一个智能体、两个引擎、一个统一内存池。智能体负责规划、调用工具、验证结果;CPU承担解析、OCR、切分嵌入、检索路由、数据整理等编排循环;GPU则专注于token生成;而128GB超大统一内存,让编排模型与生成模型始终保持常驻状态,模型与数据之间无需反复加载、来回搬运。


这种大容量统一内存的存在,本身就是让在本地完整运行一整套模型组合成为可能的关键前提,如果没有它,模型甚至无法被完整加载进设备。而随着本地智能体逐步演化为完整的模型“全家桶”(编排模型、常驻小模型、嵌入模型、重排序模型、OCR模型、语音模型、图像模型协同运行),这种系统级的均衡设计所带来的优势,只会持续累积、不断放大。

·从“谁的GPU更强”到“谁的系统更快更省”

聊天AI时代,人们习惯问的问题是,“谁的GPU更强?”但到了智能体AI时代,真正值得追问的问题变成了,“谁的系统能够以更快的速度、更低的成本完成整个工作流?”


AMD的HEPA测试给出了非常明确的答案,一个系统完全可能赢得单纯的token生成速度竞赛,却依然会在真实的智能体AI工作流任务完成度上落败,因为智能体工作流本身就是一场涉及编排、检索、验证的系统性工程,而非一次孤立的矩阵运算。

对于希望在本地部署智能体应用的企业与开发者而言,AMD的这项测试其实更具参考价值,因为它在评估本地AI硬件时,不是只看GPU算力峰值,而是综合考察CPU的并行处理能力、内存架构设计,以及整个系统在真实工作负载下的端到端表现。同时锐龙AI Halo所代表的,正是这样一种以平衡系统为核心设计理念的本地智能体计算平台。

如果说过去的聊天式AI讲的是关于GPU的故事,那么智能体AI所讲的,则是一个关于系统的故事。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
董路:我又养出白眼狼!免费带他出国踢球+告我侵权 我逼你来了?

董路:我又养出白眼狼!免费带他出国踢球+告我侵权 我逼你来了?

念洲
2026-08-08 09:25:28
高市早苗出席广岛和平纪念仪式:作为世界上唯一在战争中遭受核爆的国家,日本坚持“无核三原则”;美驻日大使缺席!

高市早苗出席广岛和平纪念仪式:作为世界上唯一在战争中遭受核爆的国家,日本坚持“无核三原则”;美驻日大使缺席!

每日经济新闻
2026-08-08 01:31:51
郑丽文演给谁看?给日本捐款百万后,紧急表态:台湾从来不是国家

郑丽文演给谁看?给日本捐款百万后,紧急表态:台湾从来不是国家

一路荒凉如歌a
2026-08-09 05:09:16
温州发布台风“白海豚”最新预报情况:持续久、雨量大,需严防次生灾害

温州发布台风“白海豚”最新预报情况:持续久、雨量大,需严防次生灾害

石辰搞笑日常
2026-08-09 01:22:48
男子为了防老婆,把工资转给老妈,老妈为了安全,把200万存款交给女儿保管,女儿两口子投资失利,老妈讨要,女婿:这钱我们也能用!

男子为了防老婆,把工资转给老妈,老妈为了安全,把200万存款交给女儿保管,女儿两口子投资失利,老妈讨要,女婿:这钱我们也能用!

背包旅行
2026-08-08 11:38:16
穆里尼奥彻底暴怒!赛季还未开打,皇马内部矛盾已经爆发

穆里尼奥彻底暴怒!赛季还未开打,皇马内部矛盾已经爆发

澜归序
2026-08-08 07:45:08
信号强烈!主动披露两名海警牺牲后,军方强硬发声,南海重磅行动

信号强烈!主动披露两名海警牺牲后,军方强硬发声,南海重磅行动

战友老邓
2026-08-08 15:03:26
手绘美钞出圈博主:爆火没多久,有警察上门提醒不能拿手绘造假;其自述曾遭校园霸凌,辍学后在工地迎来人生转折点

手绘美钞出圈博主:爆火没多久,有警察上门提醒不能拿手绘造假;其自述曾遭校园霸凌,辍学后在工地迎来人生转折点

扬子晚报
2026-08-08 08:55:53
马斯克警告SpaceX空头:95%可借股票已借出,他们仍加倍下注

马斯克警告SpaceX空头:95%可借股票已借出,他们仍加倍下注

爬虫饲养员
2026-08-08 21:27:22
热议成都6轮不胜:把徐正源老本吃没了;分差若进入个位数会有连锁反应

热议成都6轮不胜:把徐正源老本吃没了;分差若进入个位数会有连锁反应

懂球帝
2026-08-09 00:18:20
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
难怪电诈灭不完!若不是高官透内幕,咱还被蒙鼓里,最后还得吃亏

难怪电诈灭不完!若不是高官透内幕,咱还被蒙鼓里,最后还得吃亏

白米饭怎么吃
2026-08-08 20:03:37
煮虾不去线,有人嫌脏有人无所谓,老渔民却说出了实话!

煮虾不去线,有人嫌脏有人无所谓,老渔民却说出了实话!

娱乐圈见解说
2026-08-07 01:58:56
时代落幕:本田正式暂停在华燃油车厂,日系燃油车退出中国倒计时

时代落幕:本田正式暂停在华燃油车厂,日系燃油车退出中国倒计时

民间胡扯老哥
2026-08-08 04:26:55
丢人丢到国外了!49岁中国奥运冠军严重违规被查,官方:他已辞职

丢人丢到国外了!49岁中国奥运冠军严重违规被查,官方:他已辞职

二疯说球
2026-07-31 10:14:55
随着蒯曼4-1,张本美和4-1,WTT横滨冠军赛女单4强诞生:国乒包揽3席

随着蒯曼4-1,张本美和4-1,WTT横滨冠军赛女单4强诞生:国乒包揽3席

侧身凌空斩
2026-08-08 19:37:46
中国深夜通告全球,次日准时出兵,菲方没料到我军歼-10也来了

中国深夜通告全球,次日准时出兵,菲方没料到我军歼-10也来了

叹为观止易
2026-08-04 08:25:47
千年难遇的美人,太漂亮了,没有一点毛病,太完美了

千年难遇的美人,太漂亮了,没有一点毛病,太完美了

手工制作阿歼
2026-08-02 03:16:29
台风天一家四口翻越隔离带观浪,9岁男孩被巨浪卷走!目击者:已警告过危险,他们不听

台风天一家四口翻越隔离带观浪,9岁男孩被巨浪卷走!目击者:已警告过危险,他们不听

听心堂
2026-08-08 18:08:00
黄瓜再次成为关注对象!多名院士发现:常吃黄瓜的人,有7个变化

黄瓜再次成为关注对象!多名院士发现:常吃黄瓜的人,有7个变化

任医生聊健康
2026-08-03 08:40:30
2026-08-09 05:48:49
中关村在线 incentive-icons
中关村在线
中关村在线全球第一科技门户
385122文章数 875174关注度
往期回顾 全部

科技要闻

SpaceX最快下周完成600亿美元收购Cursor

头条要闻

十多万人报名的考试成绩全作废 考生:为何让别人买单

头条要闻

十多万人报名的考试成绩全作废 考生:为何让别人买单

体育要闻

蓉城0-1玉昆 中超6轮不胜仍13分领跑 奥斯卡头球制胜+赛季16球

娱乐要闻

萧敬腾坦白!与大14岁妻子选择丁克

财经要闻

一枚“回旋镖”,击中王思聪

汽车要闻

华为乾崑+大六座 星海V6预售8.99万元起

态度原创

艺术
亲子
时尚
数码
游戏

艺术要闻

任伯年『荷』

亲子要闻

双胞胎的关系过于亲密真的是正常吗?网友:班上的龙凤胎在一起了

立秋之后,穿最浪漫的裤子去散步

数码要闻

斯蒂芬·库里特别版谷歌Pixel Watch 5手表曝光

被发行商逼入绝境后,他们把预算300亿韩元的抽卡二游魔改成了单机,居然在Steam上火了?

无障碍浏览 进入关怀版