二月份,我在Hacker News上刷到Taalas。点进去之前,我以为又是一家拿benchmark曲线说话的推理初创公司。结果它来自多伦多,做的事情是把Llama 3.1 8B蚀刻进硅片——不是“加载”到芯片里,而是“蚀刻”,让模型权重在晶圆厂里直接变成物理晶体管。
我的第一反应不是“这很新鲜”,而是“这一幕见过”。Groq和它是同一个问题的两种解法:同样追求速度,但Groq在最后一步停了下来,权重放在芯片里却仍可重写。于是核心问题就变成——为了换速度,你愿意把模型里的多少东西永久固化?八个月之内,Nvidia和AMD分别将其中一家公司收入囊中。
![]()
这才是真正值得注意的部分。现在有一种相当重要的事情正在幕后发生,但因为它看起来只是“芯片新闻”,很容易被忽略。每一次工作负载离开通用计算硬件,都会永久改变谁能承担得起运行它。而AI推理,正处在这场迁移的中间。它最终会走多远,不是等着被测量的固定值,因为问题的每一部分都还在设计之中——模型、芯片,甚至模型产生输出的方式本身。
这个故事我们看过。比特币挖矿在四年内从CPU走到GPU、FPGA,再到专用ASIC——应用特定集成电路,只做一件事的芯片。每一步都用灵活性换效率,每一步都不可逆。2013年第一台Avalon矿机发货后,GPU挖矿并没有变慢,而是变得毫无意义。
这套模式如今到处都是,正因为它太成功反而看不见。YouTube用自己定制的Argos芯片做视频转码,Google说它比之前精心优化的软件方案快20到33倍。网络交换机是Broadcom的专用硅片。你的手机里也有固定功能的H.265解码块、处理相机的ISP(图像信号处理器)……专用化已经无孔不入。
AI推理会是下一个。区别在于,这次模型的权重可以被刻成物理电路,而且一旦刻下,就不能反悔。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.