风险投资机构a16z最近的动作,像是在给整个AI行业画一条新的起跑线。他们宣布成立一支规模达11亿美元的“机器时代基金”(Machine Age Fund),专门投向AI的物理层基础设施——从芯片、内存、网络、存储,一路延伸到数据中心、机器人,甚至家用AI设备。
这支基金成立的时机,恰好踩在了一个行业争论的节点上:当所有人都在盯着模型参数还能不能继续膨胀时,a16z的三位核心人物——联合创始人Ben Horowitz、普通合伙人Martin Casado、管理合伙人Raghu Raghuram——却在对谈中反复强调一个判断:AI真正的瓶颈,正在从模型本身,悄悄转移到模型以下的整个物理世界。
![]()
算力需求为什么还没到顶?
a16z对这支基金最重要的判断之一,是AI对计算资源的需求远未见顶。最早的大模型应用场景是聊天,用户问一句,模型答一句,一轮任务就结束了。但进入推理模型和Agent阶段后,一次任务背后的计算过程被显著拉长。
一个直观的对比是:一次普通聊天可能只消耗上百个token,而一个Agent完成任务可能需要几千个token。强化学习、思维链、长期运行的Agent,本质上都在通过更多推理来扩展模型能力。换句话说,现阶段很多提高AI能力的方法,本身就意味着消耗更多计算。
与此同时,AI能处理的任务范围也在扩大。编程是较早被深度改变的场景,但Martin提到,他现在已经会让Agent帮自己更新不同服务里的信用卡信息、取消订阅和整理邮件。这些事情与写代码无关,而是过去需要人坐在电脑前逐项完成的普通工作。Raghu将这种变化形容为“在电脑里创造出了一批知识工作者”,Ben则直接把Agent称作一种“新型员工”。
当然,这类Agent仍然存在很多问题。Ben提到,它们可能消耗大量Token却没有完成有效工作,也会忘事、产生幻觉,并带来安全风险。但与此同时,它们也可以非常高效。因此,他认为企业接下来需要学习的,是如何让这些Agent与人类员工一起工作。
在a16z看来,编程只是一个开始。Raghu提到,全球还有大量知识工作者没有真正进入AI工作流;再往后,还有科学、材料、生物、创意生产,以及机器人等场景。Martin更愿意把AI类比为蒸汽机或电力——人类可能还需要几十年,才能逐步找到计算可以被投入哪些问题之中。今天语言和代码已经率先被解锁,电脑操作刚刚开始,还有大量领域没有真正展开。
AI还有一个特殊之处:它可以被用来创造和优化更多AI。Martin将这种现象称为“自催化效应”——AI可以被用来优化训练代码,甚至参与设计下一代AI系统。AI越强,就越可能被用来创造更多AI,并进一步产生新的算力需求。只要更多GPU和资金仍然能够换来更好的结果,a16z就认为,这条需求曲线暂时还很难见顶。
真正短缺的,不只是GPU
如果说需求侧的问题是AI消耗算力的速度越来越快,那么供给侧的问题更直接:现实世界很难用同样的速度扩产。
Raghu在对谈中提到,最能感知真实算力需求的几家Hyperscaler(超大规模云服务商)仍在大幅增加资本开支。按照他给出的数字,今年这些公司的资本开支合计已经达到7,000多亿美元,未来还可能继续向1万亿美元靠近。他认为,这些云厂商能够同时看到来自前沿AI实验室、AI原生公司、企业客户以及不同地区市场的算力需求,因此它们持续增加资本开支,是需求侧一个值得关注的信号。
供给端的信号同样明显。Martin提到,一些关键基础设施产能已经被提前预订到2028年;Raghu则称,一家头部内存厂商仅靠目前已经拿到的订单,就需要未来三年的产能才能满足。
这也是他们在对谈中反复拿今天与互联网泡沫时期比较的原因。上世纪90年代末,市场也曾大规模投资互联网基础设施,大量光纤被提前铺设,后来却出现了不少长期没有使用的“暗光纤”。Ben回忆道,当时的问题在于,基础设施建设跑在了真实需求前面:互联网用户还没有足够多,视频等真正消耗大量带宽的应用也没有成熟。
今天的AI更像是反过来:需求已经出现,真正跟不上的是供给。而这个供给问题并不限于GPU,Ben总结为:“电力、冷却、内存、GPU,你说什么,我们就缺什么。”一套AI集群不仅需要计算芯片,还需要高带宽内存、网络互联、电源和冷却系统。继续向外延伸,还涉及数据中心、电网接入、变压器和发电能力。
随着AI服务器功率不断提高,过去为传统云计算设计的数据中心也开始出现不适配的问题。机架功率正在从过去大约5-10kW,提升到100-150kW。功率密度快速上升之后,风冷越来越难满足需求,Ben表示,液冷对于前沿数据中心来说已经基本成为必要配置。
供电方式、建筑设计和施工条件也会随之变化。Raghu提到,当数据中心使用更高电压时,能够处理相关系统的专业施工人员也会成为限制条件。Ben还谈到,一些大型科技公司已经开始培训相关技术工人。
更难解决的是建设周期。芯片周期通常需要三到四年,而数据中心从破土动工到建成往往需要四到五年。而且数据中心建好后还要解决电网接入和电源问题,而变压器、涡轮机等设备本身也存在供应限制。
Raghu用一个简单的对比概括这种错配:如果一个传统产业能够以每年20%-30%的速度增长,已经是很好的增长水平,但它现在需要承接的是一个以三位数速度增长的AI软件行业。这也是为什么a16z认为,AI基础设施的问题已经不只是芯片产能,而是整个物理基础设施体系能不能跟上AI的增长速度。
AI基础设施,可能要重新设计一遍
如果只是短缺,最直接的答案是扩产。但a16z更看重的是这一轮需求可能迫使现有计算基础设施发生架构上的变化。
Raghu在对谈中提出,很多现有基础设施原本并不是为AI工作负载设计的,因此需要重新从最基础的问题出发:模型究竟在执行什么样的计算,内存应该如何组织,芯片之间怎么通信,功耗如何分配,最后再把这些部分重新组合成一套系统。因此,“机器时代基金”关注的不只是下一颗计算芯片,而是计算芯片、内存、网络、电源芯片、系统软件等整个基础设施链条。
Martin则用一笔经济账解释了为什么这种变化现在开始变得重要。按照他的估算,训练一个前沿模型可能需要30亿至50亿美元,训练完……
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.