网易首页 > 网易号 > 正文 申请入驻

对话芯展速许玮:“内存墙”下,AI缺的是GPU的“放大器”

0
分享至

Token经济时代,衡量AI价值的标准,正从模型能力转向Token生产效率。AI因此从工具演变为新的关键生产要素,而存储也从单纯的资源供给,升级为支撑Token持续、高效生产的系统能力。

过去几年,AI行业信奉一个朴素的逻辑:算力不够,就堆更多的GPU、更贵的GPU。但对于中小企业和个人开发者来说,通常只能是望“卡”兴叹。而在算力欠缺的背后,更需要搞明白一个事实,那就是GPU有效算力利用率仅30%-60%。

2026 年 5 月 Dell World 大会上,NVidia CEO 黄仁勋对彭博表态:"当前 AI 产业最大的制约因素根本不是 GPU 算力,而是存储",并解释"GPU 大部分时间都在等待数据"。当大模型推理从“以算力为中心”走向“以效能为核心”,数据和存储才是下一阶段AI基础设施的核心命题。


"AI的竞争,本质上是算力效率的竞争。"芯展速产品副总裁许玮表示,推理成本的优化已从单纯堆叠算力,转向数据和存储“存算协同”的系统级效率提升。要做的是如何在有限的条件下,去尽最大可能挖掘每一块GPU的利用率,从而去实现算力的平权。

内存墙,AI发展的新瓶颈

算力,是AI时代绕不过去的词语。

这几年,AI产业的竞争几乎围绕"算力"展开。无论是英伟达GPU持续供不应求,还是云厂商不断扩建AI数据中心,行业普遍认为,只要拥有更多GPU,就意味着拥有更强的算力能力。然而,随着大模型推理和AI Agent进入规模化应用,一个越来越明显的现象开始出现:GPU越来越强,但真正能够释放出来的算力却没有同步提升。

许玮透露,即便是英伟达最新一代GPU,在实际推理场景中的有效算力利用率也普遍只有30%至70%,大量昂贵的计算资源并没有持续处于计算状态,而是在等待数据。

问题的根源,在于AI计算体系出现了越来越严重的"算存失衡"。

AI推理并不是一个单纯的计算过程,而是一个完整的数据流动过程。模型参数需要不断读取,KV Cache需要持续更新,数据需要在GPU、显存、CPU以及存储系统之间频繁交换。计算、存储、通信三个环节环环相扣,任何一个环节跟不上,都将拖慢整个系统的效率。

过去二十年间,GPU计算能力实现了跨越式增长,整体算力提升约6万倍。相比之下,显存容量却仅增长几十倍。计算能力与存储能力增长速度的巨大落差,使得数据供应速度远远赶不上GPU计算速度,一道越来越宽的"内存墙"由此形成。

许玮指出,“内存墙”让昂贵的算力芯片普遍处于“吃不饱”的等待状态,正在成为AI推理性能的核心瓶颈。现在,这一矛盾进一步被放大。算力越堆越多,能用的却越来越少。

随着模型参数不断增加、上下文窗口持续扩展,以及AI Agent需要处理更长、更复杂的任务链路,推理过程中KV Cache规模迅速膨胀,占用大量GPU显存。当显存资源不足时,系统不得不频繁在GPU、CPU内存和存储之间进行数据交换,甚至重复计算历史Token,不仅增加了推理延迟,也进一步降低了GPU利用率。

从本质上来看,“内存墙”并非单纯的存储容量不足,而是计算能力增长速度远远超过数据供给能力所形成的系统性瓶颈。当算力与存储无法保持同步演进,GPU便难以持续"吃饱",整个AI基础设施的性能天花板也不再由计算芯片决定,而开始受到存储架构和数据流动效率的制约。

“因此,对于当前AI产业而言,真正需要解决的问题,已经不是如何继续堆叠更多算力,而是如何打破‘内存墙’,让已有算力得到更充分、更高效的释放。”许玮说道。

不堆算力,用存储扩展显存

事实上,无论是消费级的RTX 5090还是数据中心的B300,都同样面临"内存墙"带来的制约。GPU计算能力不断提升,但显存容量和数据供给能力的增长却相对有限,导致算力增长与系统整体效率并不同步。

当下,大量开发者和企业希望利用消费级GPU进行AI推理与微调,但面临两个核心瓶颈:一个是多卡并行效率受限:消费级GPU默认P2P通信被限制,多卡数据需经CPU中转,延迟高,数据传输路径被迫拉长。资源消耗大,大量的PCIe带宽被低效的数据搬运所浪费,系统整体性能被卡在“通信”环节。

另一个则是长上下文处理困难:传统KV Cache显存利用率通常低于40%,极大地限制了单卡兵法能力。并有严重的内存碎片化问题,超长文本(8K+ token)易触发OOM,长文档问答几乎不可用。

面对日益突出的"内存墙",行业并非没有应对方案。最直接的路径,依然是继续提升算力,去堆更贵的芯片。只是,这样的做法虽然能够提升性能,但成本却呈现非线性增长——投入不断增加,性能收益却难以保持同样幅度的提升。

“你可以极端地去堆最贵的GPU卡,也不能说他错,只不过这种所谓的标准配置是一种商业妥协。”在许玮看来,用户不应该只看GPU参数,而要看整个系统的效能。

所谓系统效能,不仅包括GPU自身的计算能力,更包括数据如何流动、显存如何利用、多卡之间如何通信,以及整个推理过程能否保持高效率。对于企业而言,真正需要关注的不是拥有多少TOPS,而是在训练和推理过程中,能够以多高效率完成Token生成。

在这样的背景下,行业开始出现另一条技术路线——用存储扩展显存,不是做更贵的专业卡,而是释放消费级GPU的潜力。芯展速也是选择的这一路径,并在WAIC 2026上展示了AI90解决方案。许玮称,“推理成本的优化已从单纯堆叠算力,转向数据和存储‘存算协同’的系统级效率提升。”

据介绍,针对P2P通信的缺失,AI90通过智能P2P互联技术解锁硬件P2P,优化GPU间的数据通路,使消费级GPU在跨卡通信时无需再经过CPU和主机内存中转,实现GPU直连,实现GPU之间的直连,提升多卡并行效率。

至于KV Cache的不足问题,AI90通过将KV Cache从HBM卸载至高性能SSD,构建"HBM+DRAM+SSD"三级存储体系,让原本受限于显存容量的大模型推理拥有更大的缓存空间,缓解长上下文场景下的显存压力。

"AI的竞争,本质上是算力效率的竞争。"许玮表示,当大家都在堆GPU的时候,我们选择从存储侧切入,是为了让每一块GPU都能真正发挥出全部算力。

算力平权,仍需整个产业链作答

不做GPU,但做GPU的“放大器”,AI90更强调的是AI部署成本的下降,中小企业、开发者甚至个人用户,也能够基于消费级GPU部署本地AI,而不必完全依赖昂贵的数据中心资源。


根据芯展速在WAIC展会上公布的数据,在AI90的解决方案下,Llama 3 70B模型推理,4卡5090集群吞吐量从120 tk/s提升至610 tk/s;64K上下文首Token延迟从27.99秒降至0.564秒,显存利用率从30%-40%提升至85%-95%,支持上下文从约8K扩展至128K+。

不过,现阶段仍然有很多工作要做,比如异构GPU架构的适配,以及更多生态伙伴共同支持。

在许玮看来,“这是一个超千亿的市场,用存储扩展显存,本质不是为了和谁竞争,更多的是希望让每一块钱的算力投资产出更多Token,让每一家中小企业和开发者都用得起大模型。”

“将存储变为‘算力的放大器’,这不仅是技术选择,更是AI基础设施走向普惠的必然路径,算力平权的‘iPhone时刻’也终会到来。”(文 | 志读科技,作者 | 杜志强,编辑 | 杨林)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
科技小登全崩了,宇树近乎腰斩,发生了什么

科技小登全崩了,宇树近乎腰斩,发生了什么

金石随笔
2026-08-24 12:34:25
闹大了!韩沛颖开撕《主角》剧组,引发全网热议,账号被冲评论区沦陷

闹大了!韩沛颖开撕《主角》剧组,引发全网热议,账号被冲评论区沦陷

糊咖娱乐
2026-08-24 15:02:01
上市连跌四天,宇树科技今又大跌,现股价605,首日进去的已亏45%

上市连跌四天,宇树科技今又大跌,现股价605,首日进去的已亏45%

财经智多星
2026-08-24 10:54:21
周琦落选亚运男篮名单引热议,记者:无伤病且积极恢复,渴望为国效力

周琦落选亚运男篮名单引热议,记者:无伤病且积极恢复,渴望为国效力

赛场速报局
2026-08-24 12:44:53
赫鲁晓夫说:斯大林为了取悦毛主席,出卖了高岗

赫鲁晓夫说:斯大林为了取悦毛主席,出卖了高岗

【历史客栈】
2026-08-24 10:02:20
王毅在首尔说韩朝是两个独立国家,《朝鲜日报》急着搬台湾来类比,却不知中国从二十年前就这么说了,这次是真的彻底自己打脸了

王毅在首尔说韩朝是两个独立国家,《朝鲜日报》急着搬台湾来类比,却不知中国从二十年前就这么说了,这次是真的彻底自己打脸了

林杰论事
2026-08-24 07:59:32
22岁小伙篮球赛中倒地后离世,父亲在直播中目睹,队友烧掉球衣球鞋称不再打球

22岁小伙篮球赛中倒地后离世,父亲在直播中目睹,队友烧掉球衣球鞋称不再打球

极目新闻
2026-08-23 18:13:42
海军舰员,为什么要蒙脸,戴手套?两次海战换来的血泪教训

海军舰员,为什么要蒙脸,戴手套?两次海战换来的血泪教训

清沐执笔
2026-08-22 22:11:19
多所高校发布严正声明

多所高校发布严正声明

秦皇岛发布
2026-08-24 17:14:02
个人所得税大涨25.9%

个人所得税大涨25.9%

曹多鱼的财经世界
2026-08-24 14:45:00
江苏吾悦曝大瓜!原配抓小三,丈夫维护小三打老婆,原配身份不简单

江苏吾悦曝大瓜!原配抓小三,丈夫维护小三打老婆,原配身份不简单

180视角
2026-08-24 14:28:20
李运代理深圳市人民政府市长

李运代理深圳市人民政府市长

界面新闻
2026-08-24 15:36:11
儿子花5.9万元为母亲购买“白发转黑”套餐,反映“没有效果”后,店家剃光老人头发,并拔掉新长出的白发,称是为了“让毛囊吸收精华”

儿子花5.9万元为母亲购买“白发转黑”套餐,反映“没有效果”后,店家剃光老人头发,并拔掉新长出的白发,称是为了“让毛囊吸收精华”

鲁中晨报
2026-08-24 10:34:13
陈武同志逝世

陈武同志逝世

新华社
2026-08-24 17:41:05
老人进店晕倒店家帮扶送医后离世,店家遭索赔补偿1.9万?当事店主:已处理好了!其子已删除视频

老人进店晕倒店家帮扶送医后离世,店家遭索赔补偿1.9万?当事店主:已处理好了!其子已删除视频

红星新闻
2026-08-24 12:27:37
有个体育生女朋友是啥体验?网友:体力不行的真的会被累到气血不行

有个体育生女朋友是啥体验?网友:体力不行的真的会被累到气血不行

带你感受人间冷暖
2026-08-24 00:05:32
俄乌大结局终于要来?最大罪人已浮现,不是美国

俄乌大结局终于要来?最大罪人已浮现,不是美国

江启
2026-08-24 07:31:00
武汉公开赛:赵心童5-0造惨案!下轮将战世界亚军,吴宜泽被3连鞭

武汉公开赛:赵心童5-0造惨案!下轮将战世界亚军,吴宜泽被3连鞭

小火箭爱体育
2026-08-24 15:29:49
唐师曾卖房治病去世:他用命换真相的人,最后连工伤都认定不了?

唐师曾卖房治病去世:他用命换真相的人,最后连工伤都认定不了?

天天热点见闻
2026-08-24 08:26:32
美国没其他招了:“史上最严制裁”,能击垮伊朗吗?

美国没其他招了:“史上最严制裁”,能击垮伊朗吗?

新民周刊
2026-08-24 12:36:58
2026-08-24 18:12:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
138491文章数 862534关注度
往期回顾 全部

科技要闻

宇树科技,3天跌了1000亿

头条要闻

美国"经济绞杀"之际 伊朗宣布发现千亿方级的优质气田

头条要闻

美国"经济绞杀"之际 伊朗宣布发现千亿方级的优质气田

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

韩沛颖开撕《主角》剧组引发全网热议

财经要闻

宇树IPO:追高、被套,多久能回血?

汽车要闻

智能超混 国民家轿 上汽大众ID. ERA 5S上市 限时8.99万元起

态度原创

健康
游戏
数码
公开课
军事航空

孩子有脊柱侧弯,还能正常运动吗?

大尺度巅峰之作!《喋血街头2RE》确认2027年Q1发售

数码要闻

串联式WOLED面板!技嘉27英寸电竞显示器曝光:240Hz/480Hz双模可切

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美国与以色列发生“罕见冲突”

无障碍浏览 进入关怀版