今年二月,我在Hacker News上看到一条关于Taalas的帖子。本以为又是一家拿基准图表来刷存在感的AI推理创业公司,没想到这家多伦多公司把Llama 3.1 8B直接蚀刻进了硅片——不是加载进去,而是蚀刻进去,权重在晶圆厂里就变成了物理晶体管。 我的第一反应不是“这很新鲜”,而是“我们以前就干过”。Groq已经在这个问题上研究了多年,最终只差一步:它把权重留在芯片上,但仍然可擦写。两家公司其实都在回答同一个问题——为了速度,你愿意把模型的多少部分永久固化在硬件里?引人注目的是,在八个月内,英伟达和AMD分别收购了其中一家。 这才是真正值得关注的地方。看起来像芯片新闻,但背后发生着更重要的变化。每当某个工作负载离开通用硬件,整个产业的成本结构就会被永久改写。AI推理现在正处于这个迁移的中点。模型、芯片,乃至模型产生输出的方式,都还在设计之中,所以这趟旅程会走多远,并不是一个等着被测量的定值。 这个剧本我们见过。比特币挖矿在四年内从CPU转移到GPU、FPGA,再到专用ASIC——只能做一件事、其他都做不了的芯片。每一步都在用灵活性换效率,而且不可逆。2013年第一批Avalon矿机发货后,GPU挖矿并没有变慢,而是变得毫无意义。 这种专用化如今无处不在,因为太成功反而让人视而不见。YouTube用自己设计的Argos芯片转码视频,谷歌称其比之前的优化软件方案快20到33倍。网络交换是博通的天下。你的手机里,H.265解码有专门的固定功能单元,相机有ISP,以及更多正在专用化的模块。 当这些工作负载固化到硅片上,谁负担得起、谁被挤出牌桌,都会随之改变。Taalas和Groq只是最新的信号:AI推理正在沿着同样的轨迹滑向专用硬件。而一旦滑落,恐怕就不会回头了。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.