网易首页 > 网易号 > 正文 申请入驻

AI Coding,正在把存储推向前台

0
分享至



当AI Coding上下文动辄 128K、任务一跑数天,大量“算过的记忆”因存不下而被反复重算,“以存代算”正成为企业AI账单的关键。

文|赵艳秋

编|牛慧

很多人已经开始意识到,当AI Coding从“补全一行代码”走向“端到端完成任务”,它开始在改写AI推理基础设施

最直接的压力来自上下文长度。AI Coding是最典型的长上下文场景:以往8K已算长序列,现在64K是常态,128K往上才算得上“长”。一个任务可能持续数天,每一轮推理都要复用此前积累的信息。这些信息本已算好了结果,却常常因为存不下而被删除,等到下一轮需要时,再花算力重算一遍。于是,一笔越来越难忽视的重复计算开销浮出水面——而如何消除它,正在成为推理基础设施要解决的问题。

在华为全联接大会2026上,一位产品工程师说,从2024年公司开始讲长上下文和KV Cache时还属于少数派;到今年上半年,几乎所有存储厂商都在讲同一件事。

智能体真正落地之后,存储不再是后台角色。它能否留住这些“记忆”,直接影响着一家企业的AI账单。

01

一个人的三天,和800TB的记忆

陈工是某集团软件开发中心的开发者,团队有五百人,他是其中之一。

最近,他手上的任务是按照新规范,更新一个老系统的模块。他的开发模式和一年前已完全不同。过去是他写一段代码让AI补全,贴一段报错让AI找Bug;现在他和Agent协同工作,走的是规范驱动开发(SDD)流程——先做逆向,把老系统的结构还原出来;再采集和确认新需求;然后进入规约环节,让后面所有代码按同一套规范贯标;再后面是编程、测试,反复优化。

每一环的产物都要经他确认后,AI才能进入下一环。在某头部银行AI Coding场景里,典型轮次超过两百次,周期从一天到一周,单次上下文128K。

三天里,陈工几乎没有手写过代码。他的工作变成了定义问题、补充上下文、判断结果对不对。

这是开发的新模式。2026开发者生态系统调查显示,开发者代码里平均已有54%由AI生成,一年前还是28%;中国银行半年报披露,其智能研发助手月活用户超过一万人。变化更剧烈的是任务长度。AI研究组织METR的测试显示,智能体能独立完成的任务跨度,已从GPT-3 的约9秒,拉长到2026年Claude Opus 4.6的约12小时。

但新问题也随之而来:这些上下文,存不住。

AI Coding任务里,每一轮大约超过95%的内容是重复的——同一份规约、同一份接口定义、前面所有的讨论记录,每次几乎都是原封不动的。

而模型每读一遍上下文,都会在每一层网络算出K、V向量存下来,这就是KV Cache,它是模型的“阅读笔记”。有笔记,下一轮模型只读新增部分;没笔记,模型就要从头重算。

为什么笔记不都存下来?这是因为模型的笔记很占地方。比如在部分模型上,大约1000个Token的上下文,对应上百MB的KV Cache;一个128K的长序列,就是十几GB。如果团队500人,每人每天下发多个任务,任务要跑几天,笔记就得保存几天。在一个智谱GLM-5.3-flash的实测中,这样一个500人团队三天产生的KV Cache超过800TB。

而算力卡上的高带宽显存(HBM)是GB级的,加上服务器内存(DRAM),合起来也只有几十TB。800TB对几十TB,几乎是瞬间填满。装不下了,系统就先删掉旧的,腾给新的。



这里有一个关键指标叫命中率——一次新请求的上下文里,有多少比例能直接找到现成笔记,不必重算。陈工的会话95%都是老内容,命中率本该有95%。但笔记存不下、被删掉了,实测只有三成多。这意味着六成本可以直接取用的内容,每一轮都要重算一遍,浪费大量token。

实际上,token消耗的账,今年也开始第一次出现在金融机构的财务考核里。比如,招商银行2026年6月披露,截至5月底日均Token消耗已达330亿,工商银行两年内Token消耗增长近百倍。已有银行高层在年中总结会上直接提出,不能无休止地烧钱消耗Token,所有大模型和智能体应用都要建立投入产出比评估机制。

而在几乎所有大模型的定价体系里,命中缓存的输入Token和未命中的输入Token,是两个价钱。以DeepSeek V4-Flash的公开价格为例,命中是每百万Token0.0028 美元,未命中是 0.14 美元,相差50倍。

AI Coding原本应该是所有AI场景里命中率最高、最便宜的,现实中却最贵。这件事成为用户的一大痛点。

02

把记忆搬出显存

怎么把这些记忆留住?业界给出了三个选项

全放在GPU卡的HBM上:速度最快,但只有GB级容量,成本极高。HBM加服务器内存:能到TB级,面对800TB的需求,仍是杯水车薪,成本同样不友好。这两条路不只是贵,容量上限也卡住了命中率上限。

于是有了第三条路:HBM加内存再加外置存储,容量拉到PB级,还能继续扩展,单位成本最低。华为选的是第三条。



但一说到“外置存储”,做推理系统的人立刻会有疑问:从外部盘里取数据,会不会很慢?这个疑问是对的。要让这条路成立,得同时解决两件事——存储本身要够快,调度系统要够聪明。

首先要解决快的问题。KV Cache加载需要高带宽,取大模型的笔记动辄要把十几GB的文件,“一把”搬上来。HBM的带宽是每秒TB级,DRAM内存带宽也达到每秒几十GB。外置存储要当得起“第三级缓存”,带宽必须尽可能贴近内存水平。华为OceanStor A800单框提供500GB/s带宽、1.6PB可用容量,并支持Scale-out横向扩展。



华为推出的AI数据平台

这个高带宽是怎么实现的?先要有足够强的硬件打底,然后是架构上的创新,比如数控分离——过去CPU既要指挥数据往哪走,又要亲自搬数据;现在控制流归CPU,数据从DPU直通到SSD,路径更短,时延自然下来。

但存储这一端通路再宽,算力卡那段路如果变成羊肠小道,速度照样上不去。DataTurbo就是解决这一段的——它在AI服务器上部署DTFS客户端,配合OceanStor A800的DPU硬件卸载,绕过传统协议栈,让数据在内核态直通存储,甚至通过NDS能力直达NPU。核心是让存储500GB/s的高带宽真正发挥出来。

其次是调度。几百TB的KV Cache里,哪些该留在HBM,哪些该放内存,哪些该下沉到外部的SSD?什么时候取?怎么取?这需要一位“管理员”。华为去年发布并已开源了UCM(Unified Cache Manager,推理记忆数据管理器),就是在做这件事:

它首先识别冷却的KV Cache,从HBM逐级下沉到SSD,热数据则留在HBM中,温数据放内存。

然后UCM要决定谁能用。例如,Coding每一轮上下文开头一大段是固定的,只有末尾是新的。这段不变的开头叫前缀,可以一直留着反复用。UCM把它做在全局KV池,让所有节点乃至跨集群共用同一份KV Cache。500名开发者的任务虽然分散在不同服务器上,但A机器算过的前缀,请求落到B机器时也能命中。

最后它决定怎么取。 模型是一层一层往下算的,UCM也就一层一层地加载KV,在模型计算第N层时,把第N+1层的笔记取上来。就像厨师炒第一道菜时,助手已经去准备第二道菜的食材。取数的时间,就这样被藏进了模型处理新输入的时间里。

这两方面的配合,让命中率从三成多可以提升到九成以上,原本用于重复计算的算力被省了出来。首Token时延(TTFT)最大降低90%;假设原来首Token时延是10秒,一分钟机器只能响应6个请求;现在缩短到2秒,一分钟就能响应30个请求,算力没有增加,并发翻了五倍。每秒生成token数(TPS)加速50%到200%,同样的算力在单位时间内吐出更多Token。

单位时间产出的Token越多、能响应的请求越多,每个Token摊到的成本就越低。

03

一把尺子下,客户跑出来了数字

AI Coding成为大模型最大应用场景后,行业急需基准测试指引产业发展。

2026华为全联接大会上,信通院发布《大模型推理优化 AI Coding 场景基准测试》,华为OceanStor A800/A600首批通过认证。

该基准针对代码补全、长上下文、多轮 Agentic三大AI Coding推理优化场景制定评测标准,从开发体验、系统吞吐双维度评估。其中代码补全以TTFT、TPOP衡量时延;长上下文评估超大输入下吞吐与时延;多轮Agentic结合HumanEval/RepoBench/ SWE-bench数据集,采用TTFT、TPOT评估系统性能与输出质量。

与此同时,这套方案也在客户现网跑出了结果。

一家头部金融机构,它建了一套支撑全行关键业务代码开发的AI Coding助手,痛点和陈工一模一样,从代码补全走向规范驱动开发之后,轮次超过上百、周期一天到一周、上下文 128K,超过90%是重复计算,助手效率低,任务排队积压。

接入OceanStor A800存储和UCM之后,AI编程任务KV命中率从35%提升到92%。首Token时延从55.94秒降到4.24秒,降幅92%;每秒Token数从19493涨到41227,提升2.1倍。

另一个案例来自运营商。2026年9月,天津移动宣布与华为合作的AI推理加速方案实现全国运营商首个现网规模商用:OceanStor A800加昇腾910C集群,基于UCM技术实现KV Cache的高效复用。现网数据显示,在GLM-5.1、Kimi-K2.6、DeepSeek V4、Qwen等主流模型的64K、128K长序列场景下,单卡吞吐提升1.1至3倍,首Token时延降低30%至40%,Token推理成本降低30%,已用于对外Token服务。

这套方案还在医疗、制造、政务等多个行业落地,AI Coding是目前最典型的场景,也是客户最密集的切入点,不过场景也从AI Coding不断延伸。医疗机构科研过程的学术论文、证券公司研报分析、政府卷宗分析,都是同一类长上下文场景。

过去几年,AI基础设施围绕训练展开,存储一直是后台的配角。但当智能体开始干活,命中率、响应速度,开始影响财务考核的Token账单,尤其在长序列场景里,几百TB的"阅读笔记",命中率是三成还是九成,背后是50倍的Token价差。AI Coding最先把这件事摆上了台面,留住记忆,就是省下算力。"以存代算"不再只是一个技术选项,而是每一家用AI写代码的企业都绕不开的一道必答题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

趣文说娱
2026-09-06 14:26:45
50岁左右的成熟阿姨这样打扮,显得简单大方又有女人味

50岁左右的成熟阿姨这样打扮,显得简单大方又有女人味

美女穿搭分享
2026-09-26 18:25:27
天空记者:C罗很有可能已经踢完了在国家队的最后一场比赛

天空记者:C罗很有可能已经踢完了在国家队的最后一场比赛

梦忆之浅
2026-10-02 11:49:00
中国为什么愿意长期帮老挝?说白了,中国愿意帮它

中国为什么愿意长期帮老挝?说白了,中国愿意帮它

果妈聊娱乐
2026-10-01 12:09:17
比芯片更可怕的危机来了?人类挖了几千年的铜,竟成未来命门!

比芯片更可怕的危机来了?人类挖了几千年的铜,竟成未来命门!

福建睿平
2026-09-30 07:28:24
越南废除了汉字、韩国废除了汉字、日本也废除了汉字,结果呢?

越南废除了汉字、韩国废除了汉字、日本也废除了汉字,结果呢?

乌克兰小静
2026-09-09 08:28:59
英国媒体确认了:乌克兰总统泽连斯基公开表示,有超过8000名朝鲜士兵驻扎在俄罗斯境内,另外朝鲜正准备向俄罗斯增派10000名朝鲜士兵

英国媒体确认了:乌克兰总统泽连斯基公开表示,有超过8000名朝鲜士兵驻扎在俄罗斯境内,另外朝鲜正准备向俄罗斯增派10000名朝鲜士兵

吉刻新闻
2026-09-29 19:28:17
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
很多人的大钱,都是这么亏光的!

很多人的大钱,都是这么亏光的!

星图金融研究院
2026-10-02 07:48:35
最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

周军律师聊案子
2026-04-21 09:50:16
校方回应“音乐教师在泰国失联”:家属已报警,全力配合警方立案侦查

校方回应“音乐教师在泰国失联”:家属已报警,全力配合警方立案侦查

澎湃新闻
2026-10-02 11:34:26
今天起,洛杉矶县全境加税,最低10.25%

今天起,洛杉矶县全境加税,最低10.25%

大洛杉矶LA
2026-10-02 07:10:21
42岁港星定居深圳被投诉扰民,和邻居沟通态度差,回怼嫌吵买别墅

42岁港星定居深圳被投诉扰民,和邻居沟通态度差,回怼嫌吵买别墅

晋哥说电影
2026-08-21 16:37:20
闹剧结束!杜伦正式签约,5年2亿值不值?

闹剧结束!杜伦正式签约,5年2亿值不值?

篮球实录
2026-10-02 12:01:43
蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

果妈聊娱乐
2026-08-23 08:38:03
伊朗内部发生激烈交火!安全部队出动坦克控局,准将级指挥官阵亡

伊朗内部发生激烈交火!安全部队出动坦克控局,准将级指挥官阵亡

比利
2026-10-01 12:36:52
看得我窒息了,原来真的有这样的家庭!网友:这就是变态的控制欲

看得我窒息了,原来真的有这样的家庭!网友:这就是变态的控制欲

夜深爱杂谈
2026-08-29 21:20:42
向华强大嫂设灵,殡仪馆外站满警察!她是“五亿探长”吕乐的姑姑

向华强大嫂设灵,殡仪馆外站满警察!她是“五亿探长”吕乐的姑姑

八卦宝宝
2026-10-01 20:50:42
正式官宣告别!国乒回国仅2天,26岁王楚钦深夜艰难作出重大决定,终于跨出这步!全网祝福

正式官宣告别!国乒回国仅2天,26岁王楚钦深夜艰难作出重大决定,终于跨出这步!全网祝福

锐评利物浦
2026-10-02 11:16:07
当初,于根伟判断武汉三镇保级的理由是什么,可能是球队的稳定性

当初,于根伟判断武汉三镇保级的理由是什么,可能是球队的稳定性

足球分析员
2026-10-02 11:00:08
2026-10-02 12:35:00
数智前线 incentive-icons
数智前线
关注数字化和智能化
1504文章数 620关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

牛弹琴:普京再提2014年"政变" 称有件事他一直想不通

头条要闻

牛弹琴:普京再提2014年"政变" 称有件事他一直想不通

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

房产
旅游
健康
教育
手机

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

旅游要闻

20位博主已出发,带你玩转江西乡村

刷酸祛痘,为什么有人翻车?

教育要闻

高考照片自己做!2027山东高考报名证件照片辅助!

手机要闻

一加16手机官宣首次搭载三频GPS +四频北斗,10月12日发布

无障碍浏览 进入关怀版