网易首页 > 网易号 > 正文 申请入驻

AMD买下只有20几人的Taalas,AI芯片的玩法要变了?

0
分享至

作者:姚金鑫-J叔( Johnson_in_AI )

我有一个习惯,隔几天和业界大佬们坐会儿,聊聊天。之前ARM中国的CEO Allen Wu,本身也有在投资一些项目,有一次去找Allen的时候,他提到了之前Tenstorrent的Ljubisa Bajic,说离开后搞了个新项目还是做AI芯片,只是说要把AI模型直接固化在芯片里,出厂之后就不能再改了。

Allen问我怎么看。

就像我之前专门写文章分析Groq( )一样:只要别考虑泛化能力,性能和产品化大概率会非常好。至于生意做不做得成,那就是另一回事了。

后来, Ljubisa 真的把芯片做出来了。而就在昨天,AMD宣布把这家公司整个买了下来,这家公司叫Taalas。。

整个公司只有二十几个人,没有公开的大客户,唯一的产品HC1,规格看起来也很粗糙:N6工艺,815个平方,530亿个晶体管,功耗250W左右,但,没有HBM,没有外部DRAM,只能运行一个模型,Llama 3.1 8B。


当大多数厂商(尤其是国产AI芯片厂商)还在拼命增加通用性、支持更多模型、更多精度、更多算子的时候,Taalas朝着完全相反的方向走向了另一个极端。

那这件事情就有意思了,老读者应该知道,我这个核芯洞察公众号的一贯调性,就是从一些行业发生的蛛丝马迹里,找到一些可以窥视发展趋势的信号。

今天我们就来核芯洞察一下:为什么一颗只能跑一个模型的芯片,开始有了真实的产业价值?

一、把模型刻进芯片:一次极端的取舍

稍微先做个铺垫,解释一下一般的GPU是怎么跑模型的。

模型的权重(也就是训练出来的那几百亿个参数)平时存放在HBM这种高速内存里。推理的时候,GPU不断把权重从内存搬出来,送进计算单元做矩阵运算,算完再取下一批。换模型,本质上就是换一份权重数据。

这套模式最大的好处是灵活:同一颗GPU今天跑千问,明天跑DeepSeek,后天跑一个刚刚发布的新模型,硬件不用动。

凡事都有代价,每生成一个Token,都要把海量权重在内存和计算单元之间搬一遍。这就像一个厨师做每一道菜,都得把整个仓库的食材搬到操作台上再搬回去——搬运本身消耗了大部分时间和电力。

Taalas的做法是:不搬了,把食材直接砌进灶台。

HC1把Llama 3.1 8B的权重写进了芯片内部的Mask ROM(掩膜只读存储器),连一部分数据流的走向都跟着一起固化。芯片一旦流片完成,它天生就是一台Llama 3.1 8B推理机,不是"被配置成",而是"就是"。

想换模型怎么办?改两层掩膜,重新造一批芯片。Taalas给出的周期大约两个月。

这当然把GPU最值钱的通用性彻底扔掉了,trade-off换来了:

  • 不需要昂贵的HBM;

  • 不需要CoWoS这类先进封装去连接计算芯片和内存;

  • 权重不再来回搬运,省时间和功耗;

  • 那些原本为了"可编程"而付出的面积、控制逻辑和调度开销,也可以省了。


看看这么极致的效果,按照Taalas公布的夸张数字:在1K输入、1K输出的Llama 3.1 8B测试中,单用户可达16,960 tokens/s,每百万Token成本0.75美分。

不过这个数据出自Taalas自己的测试,可能需要打折看,毕竟模型可能被激进量化,上下文长度也很短,和真实生产环境差距不小。但即便打上很大的折扣,它依然说明了一件事:

模型必须随时可换这个约束,本身就吃掉了AI芯片相当大的一部分性能空间。

这才是Taalas真正有意思的地方。它在思考一个新问题——AI芯片,到底需要多通用?

二、旧思想遇上新时机:Agent把Token速度变成了钱

平心而论,Taalas的技术思想并不新鲜。专用ASIC、Gate Array,这些概念在半导体行业里存在了几十年,成功和失败都有案例。

现如今,变的不是技术,是工作负载。

本来嘛,AI基础设施的重心在训练。大家关心的是用多少张GPU、多大算力、多少HBM,可以把更大的模型训出来。芯片的通用性在训练场景里是刚需——模型结构天天在改。

当大模型进入大规模应用,推理的分量迅速上升。而Agent的兴起,又把推理系统的性能要求整个换了一套。

大模型在传统聊天场景里,真正的瓶颈是人的阅读理解速度,一秒生成50个Token还是150个Token,对读的人来说体验差别有限,人机交互带宽有点窄。

Agent不一样,它不用给人看,它给自己看,机器的理解速度那就不知道高到哪里去了。

假设一个Agent要连续执行50个步骤,每步产生500个Token,一次任务就是顺序生成25,000个Token:

  • 200 tokens/s:需要2分钟;

  • 1,200 tokens/s:需要20秒;

  • 12,000 tokens/s:理论上2秒。

同一个任务,用户体验从"泡一壶茶回来看结果"变成"点一下就出来"。当AI开始替人连续调用工具、写代码、查资料、跑分析,Token的生成速度本身就变成了商业价值——这也是NVIDIA为什么要把Interactivity(每个用户每秒拿到多少Token)单独拎出来,作为AI服务的一个等级指标。


问题在于,GPU想把单用户的Decode速度继续往上推,越来越难。

Decode阶段天生受制于内存带宽。而模型越大,参数就必须切分到更多GPU上,于是每生成一个Token,都伴随着GPU之间的大量同步和通信。以DeepSeek-V3这类大型MoE模型为例,Tensor Parallel带来All-Reduce,MoE的专家分发与回收又制造出大量All-to-All流量。

计算单元越强,这个矛盾越尖锐:在众所周知的内存墙之外,一道通讯墙正在浮现。

于是我们看到了一批思路完全不同的推理架构:

  • Groq:把权重塞进片上SRAM,用容量换极低延迟;(请看我之前的分析文章)

  • Cerebras:整片晶圆做成一颗芯片,从物理上消灭多芯片通信;(请看我之前的分析文章)

  • Taalas:更极端,干脆让模型成为芯片的组成部分。

这些案例可以看出:推理时代的AI芯片,正在从对泛化能力的要求,扩展到把某一类Token生产任务做得更快、更便宜的要求

三、AMD如何定位Taalas?

此前不久其实就在不久前,AMD刚刚宣布与Cerebras合作。按双方公开的架构设想,Helios负责Prefill(把长长的输入一次读进去),Cerebras负责高速Decode(一个一个往外吐Token)。按说AMD应该不缺一个高速的Decode方案,这个位置已经有人了。

那他为什么收购Taalas呢。所以J叔认为Taalas在AMD有更明确的定位


一:技术应用: Speculative Decoding

这里不得不提一下最近开始火起来的Speculative Decoding(投机解码),它的逻辑是:让一个小模型飞快地写出一批候选Token,再交给大模型一次性验证。小模型只负责快,不负责对;大模型只负责审,不负责写。

举个例子:让一个打字飞快但不太可靠的实习生先出草稿,资深专家审一遍——审稿比重写快得多。其实现在很多人的AI写作也差不多是这个意思!

这么看来,这简直天然是Taalas完美匹配的场景。小模型、版本固定、长期运行、只求速度——其他所有对Taalas的要求,在这个场景下都被削弱了:Draft Model本来就该长期冻结,模型能不能随便换无所谓。就算偶尔出现一些错误,验证模型也会把错的Token直接扔掉。

二:系统视角:MoE专家引擎

这一条其实更值得每一个芯片产品经理关注。

大型的MoE模型有海量的Expert参数。训练一结束,这些权重基本就固定不动了;而每个Token,只会激活其中很少的几个Expert。

想象一个几百人的专家团,每来一个问题只找其中两三位,而每位专家的知识库常年不变、被反复查阅。

对应到推理过程对芯片硬件的需求,数据量大、内容固定、反复读取、稀疏访问这四条,正好是ROM最擅长的活。

顺着这个思路,未来AMD的推理系统可以把Transformer从中间拆开:

AMD的GPU负责Attention和KV Cache(管记忆),Taalas负责FFN或MoE Expert(管知识),两边只交换中间的Activation。

NVIDIA已经在Rubin与Groq LPX的组合中公开提出了类似架构,叫Attention-FFN Disaggregation,简称AFD。

如果AMD也沿这条路走,Taalas的定位就完全不同了。它不必独立扛起整个模型,也不必自己保存动辄几十万Token的KV Cache——它只需要把自己最擅长的那一段做到极致。

三:商业模式:AMD最熟悉的半定制生意

AMD在过去的显卡时代,一直在给PlayStation和Xbox做半定制SoC,客户提需求、承诺采购量,AMD按需求定制芯片。这是AMD在业内做得最顺、也最赚钱的一门生意之一。

AI时代很可能出现同样的模式。

一家超大规模云厂商或模型公司,冻结一个准备用6到12个月的模型版本;AMD提供标准的Helios计算系统,同时为这个特定模型定制一层Model-Specific Silicon。

这样一来,Taalas就不再是一颗只能跑一个模型的怪芯片,而是AMD整套AI系统里的一个可定制模块。

这门生意,从系统视角的商业模式来看,那比单独卖HC1值钱得多,关键是,可以在AI factory这个世代,逐步蚕食Nvidia英伟达的份额。

这才是最重要的一点,也是我们这篇核芯洞察分析文章中最为创新且独立的视角!

四、Transformer正在被拆开,计算解耦是趋势

计算解耦是J叔这两年最常说的话题(内含解读P-D分离的文章:),借着这次的收购我们再深入地掰扯一下。


我们习惯把一颗GPU当作模型运行的基本单位,Attention、FFN、KV Cache、权重、控制逻辑,全部由同一种计算平台包办。AFD这类架构开始动摇这个习惯,因为这些工作负载本来就完全不同:

  • Attention:高度依赖KV Cache,上下文越长,越吃内存容量和内存带宽;

  • FFN / MoE Expert:本质是在大量固定权重上做矩阵计算,吃的是算力密度;

  • 投机解码的小模型:只要求极低延迟,对容量和算力都不敏感。

以前之所以都塞进GPU,技术上的原因主要是因为芯片之间通信太贵,拆开不划算。现在模型规模越来越大、Token速度要求越来越高,把不同的活交给不同的硬件,经济上的意义更合算。

这样一来,就很明显可以看到一个趋势,以后的AI计算计算系统就得解耦,需要从单一加速器走向解耦式AI系统。

那如果计算一旦被拆开,系统就会遇到另一个问题:芯片之间,怎么连?

如果GPU保管KV Cache、Taalas负责Expert,那么每生成一个Token,Activation都要在两边跑一趟。此时决定系统性能的,是一批过去容易被忽略的指标:带宽、延迟、抖动、带宽密度,以及每比特传输的功耗。

这就是另一个趋势:AI Fabric的地位也会快速上升。AI计算越异构,Fabric越关键。

今天这类连接还能靠高速以太网、PCIe和专用Scale-Up互联撑住。但当解耦从芯片级扩展到板级、机架级乃至超节点级,铜互联在距离、功耗和带宽密度上的压力会越来越难掩盖。

Optical I/O、NPO、CPO,以及更彻底的光Fabric,会因此拿到新的系统级需求。从这个角度看,光互联未来要干的事远远超出连接GPU,它要连接的是性质各异的计算资源、内存资源,和各种各样的专用加速器。

J叔正在做这项工作,所期望努力达到的目标,其长远意义就在于此。

五、Taalas的这笔交易,对AI芯片产业的三个启示

最后我们聊聊这笔交易对我们的启示,毕竟产业分析是咱核芯洞察这个号最基本的调性!


第一,GPU之外的架构创新空间,比想象的大得多。

芯片产品经理们,不要只想着做一颗国产GPU。随着推理占比上升,值得做的事情还挺多:Decode Engine、KV Cache系统、MoE Expert引擎、内存扩展、Model-Specific Silicon、AI Fabric,每一个都可能长出独立的产品,甚至独立的公司。

第二,模型和芯片需要进入真正的协同设计。

传统上,都是先训完模型,再想办法部署到现成的芯片上。

但如果应用场景适合模型冻结一段时间,那么量化方案、MoE结构、Sliding Window Attention、MLA,甚至KV Cache的组织方式,都可以提前进入芯片设计阶段。

这么说来,模型就可能成为芯片设计的输入之一。

第三,评价一家AI芯片公司的方式要改了。

算力和显存的评价方式远远落伍了,以后更重要的问题应该是:"这颗芯片,在整个Token生产系统里负责哪一段?"

这是两种完全不同的产品思路,也对应着两种完全不同的公司。

J叔一贯喜欢做的,就是对未来有预见的事情。这并不是赌,而是深度分析之后的确定性。这一点,不论是对产品定义,还是对投资决策,都有重要的意义!

(本文作者姚金鑫-J叔为独角兽芯片公司产品与供应链负责人,CCF高性能计算专委会执行委员,如果希望进一步交流行业问题,可添加微信(Johnson_in_AI),请注明公司、职位)。本文不构成投资建议。)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
曼联英超首轮先发仅两位置待定!芒特力战蒂莱曼斯,谢什科与时间赛跑

曼联英超首轮先发仅两位置待定!芒特力战蒂莱曼斯,谢什科与时间赛跑

罗米的曼联博客
2026-08-11 10:58:15
央视《重器》首播2集,我想说:中国司法剧大门被黄景瑜踹烂了

央视《重器》首播2集,我想说:中国司法剧大门被黄景瑜踹烂了

白面书誏
2026-08-10 22:27:33
最清醒两位上将:一个归隐南京不顾不问,一个身居京城从不参会

最清醒两位上将:一个归隐南京不顾不问,一个身居京城从不参会

麓谷隐士
2026-08-11 07:25:07
彭博社:中国稀土这张“王牌”正逐步失去威力?背后的真相是什么?

彭博社:中国稀土这张“王牌”正逐步失去威力?背后的真相是什么?

麓谷隐士
2026-08-10 14:20:19
中央点名!一南一北两大“弱省会”,加担子了

中央点名!一南一北两大“弱省会”,加担子了

西部城市
2026-08-10 19:12:46
准者老板:里夫斯当年代言费就70万,现在续约不起了

准者老板:里夫斯当年代言费就70万,现在续约不起了

懂球帝
2026-08-10 15:00:14
三大洲足联发表联合声明:因凡蒂诺,下课!

三大洲足联发表联合声明:因凡蒂诺,下课!

第一财经资讯
2026-08-11 01:12:10
百花奖闭幕红毯明星生图:高叶刘诗诗造型出彩,张子枫瘦小似孩子

百花奖闭幕红毯明星生图:高叶刘诗诗造型出彩,张子枫瘦小似孩子

八卦先生
2026-08-10 22:59:26
万万没想到,另一场大战随时可能开打,中国还避得了吗?

万万没想到,另一场大战随时可能开打,中国还避得了吗?

霁寒飘雪
2026-08-11 11:41:13
一旦起飞就意味开战,不加油可绕地球飞80圈,连美国也不敢击落

一旦起飞就意味开战,不加油可绕地球飞80圈,连美国也不敢击落

倔强的毛驴
2026-08-10 04:46:19
白海豚大拐弯:江浙沪多地特大暴雨破纪录,北方暴雨启动或有三个重点

白海豚大拐弯:江浙沪多地特大暴雨破纪录,北方暴雨启动或有三个重点

中国气象爱好者
2026-08-11 00:03:49
斯诺克战报:4位魔王遭血洗,16强仅剩独苗

斯诺克战报:4位魔王遭血洗,16强仅剩独苗

枫尘余往逝
2026-08-10 14:49:35
首例5胞胎长大了,父亲已劳累去世,母亲直言:如能重来一个也不要

首例5胞胎长大了,父亲已劳累去世,母亲直言:如能重来一个也不要

柳絮忆史
2025-07-22 07:15:03
英超老板财富榜:纽卡居首,贝索斯若入股利物浦将升第2

英超老板财富榜:纽卡居首,贝索斯若入股利物浦将升第2

懂球帝
2026-08-11 12:14:09
油价大跌“超1.57元/升”,连降3次的油价,8月14日或再大降,今年第5次“超500元/吨”大跌中!

油价大跌“超1.57元/升”,连降3次的油价,8月14日或再大降,今年第5次“超500元/吨”大跌中!

油价早知道
2026-08-10 08:56:36
名校女硕士:已进入“神仙岗”,卷到冒烟,月入1000

名校女硕士:已进入“神仙岗”,卷到冒烟,月入1000

视觉志
2026-08-11 10:02:21
脸皮太厚!老头老太太们去星巴克蹭空调,占满座位就是不消费,被店员关空调还不走人,网友:给子女丢脸了!

脸皮太厚!老头老太太们去星巴克蹭空调,占满座位就是不消费,被店员关空调还不走人,网友:给子女丢脸了!

谭谈社会
2026-08-09 00:54:44
一个女人过得好不好,看体重就知道了,别不信,真的特别准

一个女人过得好不好,看体重就知道了,别不信,真的特别准

伊人河畔
2026-08-11 09:37:53
官宣落地!苹果国行AI正式上线,Mac全面接入阿里千问

官宣落地!苹果国行AI正式上线,Mac全面接入阿里千问

魏家东
2026-08-09 11:08:04
6年前我国铁路负债高达5.48万亿,再看如今的数据,结果令人意外

6年前我国铁路负债高达5.48万亿,再看如今的数据,结果令人意外

离离言几许
2026-08-10 14:12:54
2026-08-11 12:31:00
J叔谈芯 incentive-icons
J叔谈芯
从芯片的角度,解析信息产业
4文章数 0关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

世界小姐已被撕票 嫌犯还有另一宗更广为人知绑架案

头条要闻

世界小姐已被撕票 嫌犯还有另一宗更广为人知绑架案

体育要闻

阿森纳的39号球衣,有了最适合的主人

娱乐要闻

“易烊千玺影帝加冕:00后的崛起!

财经要闻

北京楼市新政落地,观望客开始入场

汽车要闻

搭载猎鹰500/限时售10.49万起 2027款艾瑞泽8PRO上市

态度原创

游戏
艺术
时尚
手机
军事航空

TGA还有存在意义吗?玩家:边骂边看 有猛料时挺开心

艺术要闻

吴冠中画漓江的第一幅,拍了2305万!

陈都灵:在虚实之间,静候一朵水晶玫瑰的盛开

手机要闻

三星面临芯片专利诉讼,Galaxy S10至S26系列被指侵权

军事要闻

特朗普被指不想再打了:哪怕未达成核协议也想退出

无障碍浏览 进入关怀版