企业AI部署从实验走向规模化时,一个被反复买单的教训是:第一阶段那些“不管三七二十一,先把最贵集群买来跑大模型”的做法,正变成越来越烫手的token账单。AMD全球企业技术销售副总裁John Hampton在AMD Advancing AI活动上直言,相当多企业的第一阶段可以用“准备、开火、瞄准”来形容——先去竞品那儿买下大型GPU集群,把所有工作负载一股脑丢给云端的前沿模型,然后才盯着账单发愣。
Hampton在接受theCUBE采访时指出,当AI应用从简单的提示交互迈向自主工作流,前沿模型在庞大GPU集群上运行的成本已经压得IT主管喘不过气。token经济学——也就是AI token消耗背后的经济账——正在成为企业IT决策者必须直面的头号课题。
![]()
“token经济学确实已经成了企业最关心的事,”Hampton说,“成本可负担性和投资回报正经受严峻考验。”换句话说,企业不能再默认所有任务都该扔给最贵的云端前沿模型,而是需要根据每个用例匹配最合适的硬件,无论是CPU还是成本、功耗更低的GPU。
AMD自己就拿内部系统做了一次真金白银的试验。他们把工作负载通过AI token路由定向到自有的MI350P GPU,而不是继续依赖外部前沿云模型。结果带来的改变颇为直接:token账单下降了43%,而响应速度反而提升了2.9倍。Hampton把这一数字称作整个试点的关键看点——既甩掉了很大一块成本包袱,又让推理跑得更快。
这种混合路由的思路,本质上是在算力经济学里重新定义什么才是“最优解”。Hampton的态度很明确:最优方案并不总是那些跑在大型GPU集群上的前沿模型,很多时候用CPU或低功耗GPU做推理,已经能交出足够好的答卷。下一阶段能在AI部署中持续跑通的企业,会把硬件现代化和AI token路由一起纳入算力经济账,而不是继续在失控的token消耗中盲目踩油门。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.