每次用AI按量付费时,你有没有想过一个问题:屏幕上蹦出来的那串文字,到底凭什么值这个价?点拾投资最近一篇分析文章,借黄仁勋在达沃斯提出的“五层蛋糕”框架,把Token的生产成本拆了个底朝天。结论有点反直觉:AI看着像软件生意,骨子里却越来越像重工业。
五层蛋糕,芯片才是吞金兽
![]()
黄仁勋把AI基础设施比作一个五层蛋糕,从上到下依次是能源、芯片、基础设施、模型、应用。在大规模商用推理的口径下,各层成本占比大致是这样的:
- 芯片层:约40%~55%,最大成本项,没有之一
- 基础设施层:约15%~20%,机房、网络、散热都算这里
- 能源层:约10%~20%,电费看着吓人,其实排第三
- 模型层:约10%~15%,训练和调优的摊销
- 应用层:约5%~10%,产品侧的开销
硬件相关的三层加起来,占了总成本的七成左右。换句话说,你付的每一笔Token费用里,大头不是“智能”,而是芯片折旧和机房租金。这哪是软件公司的成本结构,分明是重资产工厂的账本。
两个误会:Token不是电力的转售
很多人以为AI收费贵是因为耗电,文章直接泼了盆冷水:Token并非电力的转售,单Token的边际电耗只是完全成本的一小部分。一枚Token的完全成本,得摊入芯片折旧、显存带宽的机会成本、数据中心的利用率,甚至服务质量溢价。
同样一度电,喂给不同芯片、放在不同利用率的机房,产出的Token数量天差地别。所以电价单独解释不了Token价格,把AI账单等同于电费账单,属于没算明白账。
另一个误会是拿单Token价格当唯一标尺。实际上,前沿旗舰模型和经济档模型的推理成本能差出几十倍;长上下文任务更吃显存,成本自然更高;而批处理任务能把集群利用率从60%拉到70%~80%,成本随之摊薄。谷歌2026年推出的分层推理定价,就是按等待时间和稳定性分档,批处理档直接半价——同一个模型,换个用法,价格能差出一大截。
双时钟矛盾:算法跑得飞快,物理世界跟不上
文章最扎心的观察,是提出了“双时钟”概念。算法侧的成本下降快得惊人,3年能降到原来的1/250,迭代以天和周计。但物理侧完全是另一套节奏:数据中心扩建要18~36个月,变压器交付周期平均2.5年,HBM产能年增只有30%~50%,电力更是结构性短缺。
两套时钟同场运转,结果就是一边价格战打得火热,一边算力紧张到排队。5000亿美元砸下去,买不来物理世界的加速,也买不来社区的同意。在某种程度上,钱不是瓶颈,时间才是。
Token经济拼的不是代码,是组织能力
理解Token成本,不是为了得到一个死价格,而是看清一个事实:当智力服务开始被计量、被调用、被定价,AI真正进入的不只是聊天框,而是一套新的工业秩序。竞争不再是哪家公司更会写代码,而是谁能更高效地把能源、芯片、模型和人类需求组织起来。
对模型公司,拼的是芯片采购和集群调度;对云厂商,拼的是基础设施利用率和电力锁定;对应用公司,拼的是怎么把Token成本转成用户愿意付的价值。三拨人,各自的战场不一样,但账本都在同一张五层蛋糕图上。
Token看上去像软件,骨子里却越来越像重工业。下次再为AI账单肉疼,可以想想黄仁勋这张蛋糕图——你付的不是电费,是整条重工业产业链的折旧费。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.