来源:市场资讯
(来源:芝能汽车)
这两年,一个挺有意思的现象。英伟达把算力做成了全球基础设施,也打开了中国本土的算力需求。
国内 GPU 公司在一批一批出现。昇腾、寒武纪、摩尔线程、沐曦,再到最近拿下大额融资的 曦望。
这个赛道已经这么挤了,为什么还会有人往里走?
![]()
几年前,AI绕不开两个词:模型、训练。谁的模型更大,谁的训练更快,谁就更有话语权。
算力的意义是把模型“堆出来”,现在讨论的重点慢慢变了,模型不再只是训练一次 ;应用开始落地 ,请求在持续发生,现在算力现在变成“持续性消耗”。
现在的情况已经变了,模型开始进入日常使用,调用变成一件持续发生的事情。算力变成一笔长期支出,这个变化一旦出现,很多原本不敏感的问题就会被放大。
钱花在哪里,很快就变得清楚。训练依然重要,但它是低频行为,而推理是高频动作,每一次对话、每一次生成、每一次调用,都会消耗算力。调用规模一旦上来,成本就跟着往上走。
很多公司开始重新算账,发现真正压利润的,不是模型训练阶段,而是后面源源不断的推理消耗。
今天承担这些任务的 GPU,最早是为图形渲染设计的,后来被拉去做 AI 训练,架构是围绕高精度、长时间连续计算来优化的。
但推理的负载特征完全不同,请求是离散的,精度可以降低,系统更在意响应效率和整体利用率。
如果继续沿用原来的设计思路,就会出现一种情况:算力看起来很强,但并没有被用到该用的地方,功耗降不下来,成本也很难压缩。
问题不在于算力够不够,而在于算力用得划不划算。
![]()
新玩家的切入点就清晰了。与其再去做一张更强的通用 GPU,不如换一个方向,专门盯住推理这件事。
曦望的路径基本就是这么展开的,是围绕推理去重新安排架构,把资源集中在一件事上。很多在训练中必不可少的模块,在这里被直接拿掉,计算精度往下走,围绕低精度推理做优化,目标很明确,就是把单次调用的成本压下来。
这种取舍也体现在内存方案上。过去高端 GPU 普遍使用 HBM,追求极致带宽,但成本也随之抬高。
推理场景对带宽的要求没有那么极端,却更依赖容量和能效,于是出现了另一种选择,比如转向 LPDDR 这类更强调成本控制的方案。
带宽不再是唯一指标,整体性价比开始变得更重要,这其实是设计目标发生变化后的自然结果。
芯片本身只是起点,客户真正需要的,是一套能跑业务的算力。如果只提供芯片,后面还要补集群、软件、模型适配,这些成本同样不低,也会影响最终的使用体验。
所以现在很多厂商开始往系统层走,把芯片、服务器、集群方案和软件栈一起打包,尽量减少用户的迁移成本。这一步做得顺不顺,往往比单点性能更关键。
说到这里,还不能急着给结论。换一个方向,并不代表问题自动消失,它只是换了位置。技术路径上,行业已经在往降低推理成本的方向走,包括 NVIDIA 也在不断强调每个 token 的成本控制,这说明方向没有偏。
但生态仍然是个难题,开发环境、模型适配、历史积累,这些都不是短时间能补齐的。再加上客户的选择很现实,性能有差距可以接受,成本如果没有明显优势,就很难推动迁移。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.