网易首页 > 网易号 > 正文 申请入驻

速度定义智能,AI的下一个Scaling Law

0
分享至

在智能体时代,推理速度本身正在成为智能的一部分。延迟直接决定了智能的可用性。

迟到的智能,在越来越多重要场景下,就是不存在的智能:量化金融、实时语音客户服务、研究实验、机器人动作、安全事件响应等,这些任务有一个共同特点:AI已经嵌入一个高速运转的长程智能体(Agent)工作流,用户正在焦急地等待问题解决——智能体循环成数量级放大每一步延迟!

高速推理,已经开始成为竞争前沿。Anthropic在Claude Opus 4.6阶段就推出了快速模式(Fast Mode),以标准模式6倍的价格提供约2.5倍的交互速度;上周,OpenAI又开始测试基于Cerebras的超快模式(Ultrafast),让GPT-5.6 Sol的速度最高提升14倍,价格尚未公布。与此同时,Etched估值快速攀升,Groq与Taalas分别先后被英伟达和AMD收入囊中,谷歌也在开发比TPU更加专门化的Frozen v2芯片。

AI行业已经尝到了超高速推理的甜头。用户开始愿意为更低的延迟和更快的响应支付更多费用,这不仅为模型厂商打开了新的价值和利润空间,也正在给AI芯片行业带来一场新的变局。

一场新的竞速赛开始了。有人试图把模型直接“写进”芯片,喊出了“模型即计算机”的口号,有人则试图用软件把通用GPU变成一颗“临时专用芯片”。前者以AMD收购Taalas为代表,后者则以从中国走向全球的TileRT为典型。

消灭通用性

AI推理的竞争,是在吞吐效率与交互性之间寻找新的价值曲线。前者追求的是单位能源能够处理多少token,后者追求的则是单个用户能够以多快的速度获得响应。

过去,通用GPU及围绕其构建的标准化集群,几乎是AI算力的唯一答案。但GPU的计算核心与大容量存储在物理上仍然分离,即使HBM已经被尽可能靠近计算核心,模型权重和KV缓存仍需要在不同层级的存储与计算单元之间不断搬运。

行业正在逐步从“一个硬件解决所有问题”的思路中解耦出来。所谓“解耦”,本质上是在承认,AI推理并不是一种单一的计算任务,不同阶段、不同数据、不同延迟要求,需要不同的解决方案。

长期以来,谷歌TPU等定制加速器试图针对特定AI工作负载优化计算效率;英伟达收购Groq后推出LPU,进一步把推理中的预填充(prefill)与解码(decode)分开处理;而在内存体系中,SRAM(静态随机存取存储器)重新受到重视,则是因为它可以把最频繁、最敏感的数据访问留在距离计算更近的地方。某种程度上,CPU的重新崛起也是类似的逻辑:随着智能体编排在整个AI推理中的占比越来越高,这些任务并不适合全部交给GPU处理。

2026/07/03 完整阅读 >

在这个解耦的过程中,针对某一特定任务与场景的芯片的专用性越来越强。ASIC本来就是“应用即硬件”,芯片从设计之初,就不再追求运行所有程序,而是针对某一种工作负载进行优化;到了Etched,芯片进一步针对Transformer这类特定模型架构进行优化,从“应用即硬件”走向了“算法即硬件”;而Taalas则把这种专用化推进得更彻底,直接走向“模型即硬件”。

芯片越是专用,速度往往就越快。今年2月,Taalas发布了首款芯片HC1。它并非从内存中加载权重到可编程加速器,而是直接将特定模型的权重,以只读存储器的形式硬编码进芯片中。这导致其只能运行Llama-3.1-8B模型,完全不具备灵活性,而这恰恰是它的设计目的所在。因为这换来了每秒17000个token的极致推理速度,是目前推理速度最快芯片的10倍。这也是为什么Taalas把自己的理念称为“模型即计算机(Model is the Computer)”。


而且,Taalas HC1采用台积电N6工艺,没有先进封装,也没有CoWoS瓶颈,也无需HBM内存,成本更低。它的单芯片TDP约为250W(风冷)。根据Taalas的分析,同样运行Llama-3.1-8B,与成本为3.79美分/百万token的B200(吞吐量优化)相比,Taalas HC1运行成本仅为它的1/5。

焊死数据搬运路线

Taalas计算效率的关键之一,是借鉴了存内计算(CIM)的精髓。后者的关键在于,让计算尽可能靠近权重存储的位置,从源头减少计算单元与内存之间频繁的数据搬运,从而降低内存访问带来的延迟和功耗。

此前,在CIM方向上,存在数字存内计算(DCIM)、模拟存内计算(ACIM)和混合存内计算(HCIM)等不同技术路线。d-Matrix的Corsair芯片,以及Axelera AI的Europa系列芯片这样的专用芯片,采用的就是DCIM,在存储阵列附近配置数字计算逻辑,在保留一定可编程性的同时,减少数据移动;相比ACIM,DCIM通常具有更好的抗噪性和计算精度,也更容易与现有数字计算体系结合。

Taalas则没有停留在典型的可编程CIM架构上,而是进一步走向Hard-Wired(硬连线)。它不仅让计算靠近权重存储,而且进一步把计算路径和数据流固定在硬件中,从而减少运行时控制和软件映射的开销。

Taalas认为大模型不应该再跑到传统计算机上,提出了口号:大模型就是计算机。

既然模型推理过程中,大量计算实际上是在反复读取相同的模型权重,那么,与其每次推理都从HBM等外部内存中把权重搬到计算单元,不如直接把权重变成芯片本身的一部分。此外,Taalas仍然保留了可编程的片上SRAM,用于保存KV缓存等推理过程中不断变化的数据。


采用类似激进专用化思路的,还有Etched此前规划的Sohu芯片,以及谷歌秘密推进中的Frozen V2芯片。在谷歌内部主导这一项目的杰夫.迪安(Jeff Dean),在最近一次访访谈中,提到了移动数据与实际计算相比,在能耗上的千倍差异,这正是今天AI推理效率的核心矛盾之一。

通用GPU解决这一矛盾的一种方式,就是提高批处理大小(Batch Size),让一次从内存中搬入的数据尽可能服务更多用户,从而摊薄数据搬运等固定成本。但Batch越大,单个用户需要等待的时间通常也越长,交互性(interactivity)随之下降。

因此,通用GPU推理天然存在一条吞吐量与低延迟之间的权衡曲线。这也是黄仁勋今年年初在GTC上反复强调的推理的帕累托前沿:你很难同时把单位算力的吞吐效率和单用户响应速度都推到极致。

激进的代价

谷歌的Frozen V2芯片仍处于保密状态,外界知之甚少。据称,Frozen V1曾计划将权重直接嵌入芯片,但这种方案因为过于缺乏灵活性,而遭到搁置。

以谷歌Gemini-3系列为例,从去年底以来,该系列预览版模型的生命周期只有半年左右,低于Gemini-2系列的1年左右;正式版生命周期预计也从Gemini-2系列的1.5年左右降至当前系列的1年左右。而且,今年以来,更重要的是,模型小版本的迭代也在明显加快,在今年3月发布Gemini-3.1系列后,连续迭代了Gemini-3.5与Gemini-3.6。


如果这种迭代与退役速度持续下去,专用芯片刚刚完成量产,所“刻入”的模型可能就已经不是市场最需要的版本。尽管部分API已经形成相对稳定、成熟的使用场景,但在模型真正被刻入芯片之前,厂商很难准确预判未来一段时间内究竟哪一个模型会成为主流。

这恰恰是“模型即硬件”路线最大的悖论。模型越重要、推理规模越大,把它固化到硬件中的经济价值越高;但模型迭代越快,这种固化的经济价值反而越低。据称,Frozen v2因此改为冻结架构,允许更新权重,但至于要锁定多少模型信息,以及如何技术实现,目前尚无确切信息。

Taalas同样如此。Taalas会先批量制造包含大量通用硬件结构的准成品芯片,等具体模型确定后,再通过修改少量掩膜层(mask layers),把对应模型的权重写入掩膜ROM。这意味着Taalas并不是每换一个模型就重新设计一颗芯片。

按照其披露的流程,只需要修改两层掩膜,就可以针对新的模型重新定制芯片,整个过程可以压缩到大约两个月。这两层不仅决定模型权重如何被写入芯片,也可以改变模型在芯片内部的计算路径和数据流(dataflow),从而让同一套芯片骨架适配不同模型;微调权重(fine-tuned weights)则可以放入可编程的SRAM中。


与此同时,公司还构建了自动化工具,可以在1周内把模型转换成RTL(寄存器传输级)硬件描述代码,进一步加速完成芯片设计。

AMD看中了Taalas未来

HC1仅仅是一次技术验证。Taalas真正希望证明的,是这套架构能否进一步扩展到更大参数规模的模型,并最终进入前沿模型的推理市场。

年初,Taalas已经模拟了将DeepSeek-R1-671B完整部署到多颗芯片上的方案。如果进一步将SRAM从主芯片中拆分出来,采用独立芯片承载,Taalas预计单颗芯片的模型参数密度可以提高到约200亿参数,以MXFP4格式存储。这意味着,完整容纳6710亿参数仍需要大约30颗定制芯片,每颗芯片固化整个模型权重的一部分。

这套方案在经济账上仍然成立。据Taalas模拟估算,这套约30颗芯片组成的DeepSeek R1推理系统,速度可以达到约12,000 token/秒/用户,是当时主流GPU解决方案的约20倍;每百万token成本则只有吞吐量优化型GPU方案的一半左右。

但Taalas把GPU承担的模型迭代风险,转移给了芯片采购者。一旦模型更换,原本固化在芯片中的权重就失去了价值,需要重新定制和流片。而且,模型越多,客户需要管理的定制芯片SKU(库存与产品型号)也越复杂。对于通常需要同时支持大量模型、并根据需求动态调度算力的云厂商而言,这种复杂性本身就是成本。

按照年初的计划,Taalas将在今年初夏前后推出第二代芯片,用于运行规模适中的推理模型,并计划在年底前进一步支持前沿级模型。然而,到了8月,AMD出手了。它同样押注超低延迟推理与模型专用化路线的成立。这距离英伟达以200亿美元收购Groq,大约只有9个月。

在7月的AAI 2026大会上,AMD几乎在所有AI基础设施产品线上,都选择英伟达作为直接竞争对象。它推出的Helios机架级AI平台强调开放的硬件、网络与软件生态,希望让客户能够在统一平台上组合不同类型的计算资源,而不是被绑定在单一封闭体系中。当时,AMD宣布了与Cerebras的合作,由Helios承担高吞吐的预填充,由Cerebras负责对延迟最敏感的解码。这已经是一次铺垫。

2026/07/25 完整阅读 >

Taalas本身也有浓厚的AMD基因。该公司CEO兼联合创始人Ljubisa Bajic,此前曾在AMD负责CPU-GPU融合芯片设计,并担任集成电路设计总监;他的妻子Lejla Bajic,在Taalas担任COO,曾是ATI的高级工程师,在AMD收购ATI后成为系统工程高级经理;另一位联合创始人Drago Ignjatovic则曾负责AMD APU和GPU设计,后来升任ASIC设计总监。三位创始人的经历,几乎覆盖了从GPU、APU到ASIC的多代芯片设计经验。

AMD长期覆盖的市场中,也存在大量更适合“长期稳定运行”的场景,包括边缘AI(edge AI)、嵌入式AI(embedded AI)、工业设备、汽车、机器人以及通信基础设施。这些场景与云端前沿模型不同,设备一旦出货,通常要运行数年,模型也往往不会每几个月彻底更换一次;它们也往往是速度与成本敏感性的应用场景。这规避了模型生命周期可能短于芯片生命周期的商业风险。

更值得注意的是,AMD正在积极拥抱另一类正在改变AI基础设施竞争的资产:中国开源模型。据Hugging Face刚刚发布的季度报告,在今年夏天,AMD已经超越英伟达,成为美国“发布”开源模型最多的科技公司;它们的作用主要在分发层和优化层,而不是在模型创造层。

这可能正是AMD与Taalas之间一个容易被忽视的连接点。如果AMD能够同时掌握模型适配和专用推理硬件,就有机会把“开放模型生态”进一步延伸到“模型专用芯片”。而且,AMD本身就拥有完整的芯片设计和制造能力,可以放大Taalas的“快速流片”优势。

TileRT,中国方案

中国不乏类似的硬件团队。在Taalas受到市场关注的同时,瞬元(Sytrix)就宣称旗下模型处理单元(MPU),能容纳比Taalas HC1更多的模型参数。但国内相对成熟的另一条探索路径,并不是继续把芯片做得更加专用,而是反过来利用软件,把通用GPU变成一台针对特定模型、特定推理阶段优化的“临时专用机器”。

这种“软件定义的专用化”,已经出现了一个颇具代表性的尝试:TileRT。传统GPU推理会把一个模型拆成大量独立的计算任务(Kernel),一个接一个地启动执行;TileRT则把整个解码过程提前编译成一个持续驻留GPU的引擎,让GPU从“不断启动小任务”变成“持续运行一个大任务”。而且,不同GPU在执行过程中可以承担不同角色。

这听起来有点类似DeepSeek此前通过让计算、通信和内存访问尽可能重叠(overlap),来压榨GPU效率的思路。两者并非同一项技术,但背后共享着一种对数据流(Dataflow)的重新组织。

事实上,TileRT与TileLang师出同门。去年,DeepSeek开源DSA的部分关键CUDA算子时,TileLang就出现在相关技术文档中。这款最初由北京大学团队研发、如今走向全球的新型GPU编程语言,也是今年广为流传的梁文锋讲话中,被认为有潜力撼动CUDA护城河的主角。

2025/09/30 完整阅读 >

围绕TileLang,一个更完整的TileAI生态也正在形成。过去一年,TileAI社区又进一步推出了面向分布式架构的TileScale、AI驱动的算子自动生成框架TileFoundry及其算子库TileOPs,以及面向极限低延迟推理的TileRT;很快,该社区还将发布TileSight性能分析模型。

TileRT实际上是在尝试用软件完成Taalas试图通过专用硬件完成的一件事:把数据流“固定”下来。区别在于,Taalas把这种固定写进芯片,而TileRT把它写进编译器生成的执行计划。

这种软件专用化确实可以换来明显的速度提升。据SemiAnalysis测评,在单台B200解码服务器上,以FP8精度运行GLM-5 744B基准测试时,TileRT可以达到约500 token/秒/用户的速度,比采用传统推理引擎的GB300 NVL72系统快约3倍;在每输出token成本相同的情况下,其交互速度也可以达到传统引擎的约2倍。

目前,TileRT已经在智谱的GLM-5.1-HighSpeed高速推理服务与小米的MiMo-V2.5-Pro-UltraSpeed等真实生产服务中完成了验证。


当然,TileRT也仍然开始承担专用硬件的代价。它采用提前编译(Ahead-of-Time Compilation),某种程度上形成了一个“模型适配白名单”,每支持一种新的模型架构,都需要重新进行大量工程适配。而模型一旦换了架构、改变了注意力机制、调整了稀疏路由,原有的执行计划就可能失效,需要重新编译和调优。

但是,这仍然是一个非常重要的商业优势。GPU是一种高度可重新配置的计算资产。如果今天判断低延迟需求过高,可以把部分GPU交给TileRT;如果明天模型或者流量结构发生变化,又可以把这些GPU重新交给vLLM、SGLang等通用推理引擎。相比重新采购一套Groq、Cerebras或者Taalas,这种“软件定义的专用化”,显然相对更加灵活。从这个角度上看,这对如今仍在推理市场占据主导优势的英伟达而言,仍然是一个好消息。


而对于中国而言,过去很长一段时间,AI芯片竞争更多聚焦于单卡性能的追赶,此后又逐渐转向超节点(SuperNode)和集群层面的系统性竞争。但芯片与模型的协同优化进一步演化为协同设计(Co-Design),正在成为中国AI生态形成的一项重要能力。来自模型侧对计算、通信和内存访问的理解,可以一路向下传递到编译器、算子和推理系统,并最终反过来影响芯片架构。

如果说过去中国是在追赶“更强的芯片”,那么下一阶段,或许会在此基础上,开始探索“更懂模型的芯片”。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
伟伟道来 | 强撑颜面:美国派出第三艘航母,伊朗威胁升级冲突

伟伟道来 | 强撑颜面:美国派出第三艘航母,伊朗威胁升级冲突

经济观察报
2026-08-17 16:48:08
125亿光年外发现三个超大质量黑洞 早期宇宙系统震惊天文学家

125亿光年外发现三个超大质量黑洞 早期宇宙系统震惊天文学家

硬核实验室哦
2026-08-17 01:07:59
哈里王子正式宣布!计划重归英国履行王室职责,国王父亲难了

哈里王子正式宣布!计划重归英国履行王室职责,国王父亲难了

笑饮孤鸿非
2026-08-18 00:21:37
央视怒批!戏子误国,这3位明星恶贯满盈,没有一个人值得同情!

央视怒批!戏子误国,这3位明星恶贯满盈,没有一个人值得同情!

旧史新谭
2026-08-17 16:07:02
“结婚8年3孩非亲生案”庭审结束 女方在庭审中态度恶劣 面对追问孩子生父 她回怼:“我怎么知道?”

“结婚8年3孩非亲生案”庭审结束 女方在庭审中态度恶劣 面对追问孩子生父 她回怼:“我怎么知道?”

闪电新闻
2026-08-17 23:02:18
突发,章子怡套现巨款走人

突发,章子怡套现巨款走人

新浪财经
2026-08-17 18:27:59
王菲附体啊!李嫣在北京街头的路人抓拍,松弛又带着一股桀骜的劲儿,网友:这个天使,她出生才有了嫣然天使基金

王菲附体啊!李嫣在北京街头的路人抓拍,松弛又带着一股桀骜的劲儿,网友:这个天使,她出生才有了嫣然天使基金

火山詩话
2026-08-17 16:46:19
女法官又放名言:你老婆死在别人床上你就完全没有责任吗

女法官又放名言:你老婆死在别人床上你就完全没有责任吗

大国老记老顾
2026-08-17 15:31:52
8月16日4点44分锁定,5点01分击碎!西班牙战机打响东欧第一枪

8月16日4点44分锁定,5点01分击碎!西班牙战机打响东欧第一枪

伴君终老a
2026-08-17 14:46:38
家里老人走了才知道,退休金3000元,能领的抚恤金有这么多

家里老人走了才知道,退休金3000元,能领的抚恤金有这么多

小陆搞笑日常
2026-08-17 17:19:50
平安银行行长冀光恒:几乎所有的股份制银行都在重拾对公,压力随之而来

平安银行行长冀光恒:几乎所有的股份制银行都在重拾对公,压力随之而来

北京商报
2026-08-17 18:07:15
看看康生真迹,才知什么叫“眼高于顶”

看看康生真迹,才知什么叫“眼高于顶”

中国艺术家
2026-08-17 05:24:34
男子酒后与妻子吵架跳江,消防员沿江搜寻一夜未果,第二天男子在对岸睡醒后,又自己游回来了

男子酒后与妻子吵架跳江,消防员沿江搜寻一夜未果,第二天男子在对岸睡醒后,又自己游回来了

鲁中晨报
2026-08-17 10:42:35
1-4惨败丢冠!张本智和不喊了:呆呆愣在原地 决赛前曾2亲日本国旗

1-4惨败丢冠!张本智和不喊了:呆呆愣在原地 决赛前曾2亲日本国旗

风过乡
2026-08-17 06:59:51
伊朗也没料到,先等来的不是援手,是6国通牒,一手好牌打得稀碎

伊朗也没料到,先等来的不是援手,是6国通牒,一手好牌打得稀碎

民间胡扯老哥
2026-08-17 07:15:24
中国男篮77-84新西兰 球员评价:3人优秀,5人及格,3人低迷

中国男篮77-84新西兰 球员评价:3人优秀,5人及格,3人低迷

篮球资讯达人
2026-08-17 21:17:13
NBA官方:ESPN关于伦纳德“阴阳合同”事件的报道存在大量不实

NBA官方:ESPN关于伦纳德“阴阳合同”事件的报道存在大量不实

懂球帝
2026-08-18 03:48:06
中国拉响警报,大战一触即发,土耳其朝鲜已下场,俄乌战局扩张!

中国拉响警报,大战一触即发,土耳其朝鲜已下场,俄乌战局扩张!

阿策聊实事
2026-08-16 23:15:43
私生活太滥了!20多天周旋4名男子,一女子怀孕后上网求算孩子生父

私生活太滥了!20多天周旋4名男子,一女子怀孕后上网求算孩子生父

火山詩话
2026-08-17 08:52:33
惊爆!劲爆!据称:“如果打击的有效性得到确认,几乎所有俄罗斯联邦的航天项目将被暂停”

惊爆!劲爆!据称:“如果打击的有效性得到确认,几乎所有俄罗斯联邦的航天项目将被暂停”

扶苏聊历史
2026-08-17 16:02:20
2026-08-18 05:04:49
未尽研究 incentive-icons
未尽研究
新能源、人工智能、合成生物、地缘X
455文章数 66关注度
往期回顾 全部

科技要闻

马斯克600亿美元买条近路

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

头条要闻

因老板娘一句随口交代 打工走失男子独守深山老宅25年

体育要闻

C罗:可能是生涯最后一年 未来都规划好了

娱乐要闻

立案风波席卷德云社多场巡演叫停!

财经要闻

爱丽家居跨界玩存储:溢价背后藏着机密案

汽车要闻

2027款艾瑞泽8 PRO 年轻人的务实之选

态度原创

健康
时尚
教育
公开课
军事航空

专家解答青少年脊柱侧弯七大问题

夏天裤子不要总穿黑色,试试粉色阔腿长裤,舒适显瘦又有个性

教育要闻

中国正在崛起的4个专业,将来不愁就业,今年考上的赚大了!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

俄遭大规模袭击 24小时内击落1478架乌无人机刷新纪录

无障碍浏览 进入关怀版