![]()
过去几年,AI产业最受关注的事情之一,是如何训练出一个更大的模型。
更多参数、更多数据和更多算力,被投入一次次训练之中。模型的能力边界也由此不断提高:从生成文字和图片,到编写代码、复杂推理,再到能够调用工具并连续执行任务的Agent。
但产业的重心正在发生变化。如果说训练解决的是让模型学会什么,推理解决的就是让模型真正开始工作。用户与大模型进行一次对话、生成一段代码,或者让Agent完成一项任务,背后发生的都是推理。模型输出的token越来越多,对推理算力的消耗也随之上升。
这意味着,决定AI能否大规模进入产业的,不仅是模型有多聪明,还有每一次智能调用是否足够快、足够稳定,也足够便宜。
这引出了另外一些衡量芯片的问题:一个用户每秒能够获得多少token?系统能够同时服务多少人?在电力、设备和运维成本计算进来后,每百万token究竟需要多少钱?基于此,推理正在从一个技术环节,变成一门需要精确计算成本和效率的生意。
LPU正是在这一背景下受到关注。
LPU即语言处理单元,是一种面向多模态大语言模型推理需求进行专门优化的处理器架构。相较于面向更通用计算任务的GPU,LPU试图围绕Transformer的数据流、内存访问、编译调度和模型执行方式进行更有针对性的设计,以提高token生成速度、降低延迟,并让推理过程更加稳定和可预测。
这个领域,我们注意到了一家正在快速成长且潜力巨大的公司——深明奥思。
今年5月,我们在其上海公司第一次见到创始人张强。
![]()
深明奥思创始人张强
张强讲技术不绕,但也不太愿意只停留在技术上。谈到深明奥思与其他AI推理芯片公司的区别时,他首先讲的不是算力、带宽或制程,而是一个顺序。
传统芯片公司的研发通常从硬件开始:先设计内核和芯片,再开发软件,让算力尽可能得到释放。
深明奥思把这个顺序调整了过来。
他们先设计指令集,再做软件栈和编译器,确定一套能够高效支持Transformer的计算方式,最后才根据这套系统设计硬件。
一家硬件公司,为什么要从软件开始?
按照张强的解释,这是一次“以终为始”的设计。深明奥思要交付的产品,并不只是一颗芯片,而是能让模型完成任务的整套系统。既然如此,芯片就不能只从自身的算力出发,而要从模型怎样运行、客户怎样使用,一路反推回来。
这个看似简单的顺序变化,透露出深明奥思对 AI 推理芯片的理解。
训练时代,芯片更像一种算力资源。到了推理阶段,它开始成为服务的一部分:一个用户每秒能够获得多少token,一次任务需要等待多久,模型能否稳定运行,数据能否留在企业内部,接入一套新系统需要付出多少成本——这些过去位于芯片之外的问题,正在进入芯片的产品定义。
因此,深明奥思想做的并不只是一颗 LPU。
在端侧,它要把芯片、板卡和模型装进一台能够本地部署的机器,让企业在保护知识产权和信息安全的情况下使用大模型;在云端,它又要处理并发、长文本、多卡互联和单位token成本;同时,还需要用标准API和生态兼容降低客户的迁移难度。
芯片的边界,由此从一块硅片不断向外延伸。
这条路线背后,是团队对数据流计算长达十余年的积累。早在2012年,团队成员就曾参与微软的数据流项目。那时,数据流计算仍是一项偏小众的技术。Transformer出现之后,大规模推理带来了新的计算需求,一项沉寂多年的技术也重新获得了进入主流市场的机会。
但技术等来了它的时代,不等于公司已经等来了答案。
当芯片从算力产品变成生产工具,一家芯片公司需要具备多少过去不属于它的能力?当产品边界不断扩大,架构、软件、模型和生态之间应该如何分工?而一家成立不久的公司,又能否把十余年的技术积累,变成客户真正愿意使用的产品?
带着这些问题,我们与张强展开了这场对话。以下为访谈实录,经编辑。
01
模型与产品:芯片公司也要教客户“怎么提问”
【编者按】深明奥思没有把产品停在芯片和板卡上。张强认为,同一个模型交到不同的人手里,结果可能完全不同,芯片公司不仅要提高 token 产出,还要把模型选择、Agent 调度和使用经验一并交给客户。一颗推理芯片怎样从能跑模型变成能完成工作,这是产品定义的起点。
张强:我们做产品的定位,(是希望)这样的模型能够在保护使用者知识产权和信息安全的情况下,提供专业产出和大模型服务,能够在保证质量的情况下提高效率。
芯流:如果把它定义为一个生产力工具,是不是意味着芯片设计之后,在装到板卡中成为一个机器产品,(这时)公司内部已经可以内测它是否符合潜在的用户需求。
张强:是的,我们自己也在做。
芯流:所以设计 AI 芯片的公司有一个天然优势,就是它可以自行完成前期α用户的测试。
张强:我们自己对于模型的产出速度、智能化水平、专长都会测量,同样参数量,不同的模型有不同的专长,Coding、图像、金融分析、法律条款等都可以自己测。
芯流:所以我们在内测芯片时,也需要评估它在不同行业应用中的实际效果,对吗?
张强:这个过程中,模型公司的产品会带来很大变化。有几个变化的趋势,第一,边缘端会越来越专业,而且模型要有一定的参数量,比如说我们观察到的典型档位27B、35B。云端去年超过1T的模型还不多,但今年就是2T、2.8T,后面预计还有5T甚至10T的模型,模型的参数量在云端会越来越大。第二,MoE模型会越来越多。
大模型还有个特点就是千人千面,不同的人、同一个模型、同一个问题、同一个任务,可能问的方式不一样、关键词不一样,最后得出的结果就不一样。
这并不像Windows软件,操作时敲 A 字母就出来 A 字母,大模型不一样,同一个任务,人的风格不一样,让大模型做的时候关键词不一样,以及迭代过程中 step by step节奏不一样,顺序不一样,最后产出的智能表现和结果也会有偏差。
不过,总的来说,AI提效已经非常明显。
芯流:既然不同的人提问结果可能不同,有没有可能为了让芯片、板卡及解决方案更好卖,我们要在板卡的解决方案上附加一些如何更好使用芯片和 AI 的示范,或者是一个应用库?
张强:我们的芯片只要是Transformer架构,不管哪一家的都会支持得很好。无论算力利用率、带宽利用率、延迟、安全都会很好。你刚刚说的想法也非常重要,我们会提供不同模型使用的一些经验,结合Agent调度模型,方式各有不同。
首先我们自己要能有这个能力去问他问题。第二是用什么样的方式,去高效提问,让大模型高效产出。这就是用大模型的人的不同,能力不同,风格不同,所产生的不同效果。
芯流:所以对于AI芯片和做AI的解决方案公司而言,如何教会人使用最顶级的智能,本身也是一个产品的重要设计环节。
张强:是非常重要的方式,尤其在Coding 、金融领域,对大模型的结构,Agent和大模型如何配合,调度Agent的能力,其实都有技巧,方式不同,带来的效果不同。
02
架构与路径:先做软件,再让硬件“长”出来
【编者按】深明奥思选择了一条与传统芯片设计相反的路径:先做指令集、编译器和软件栈,再据此定义硬件。团队骨干成员,早在2012年就参与过数据流项目,一项曾经小众的技术,在 Transformer 时代重新找到用武之地。但 LPU 并不只是一个架构名称,真正的门槛是四套能力能否同时成立。
芯流:对于公司而言,其实核心是对于Transformer架构有很好的支持。国内目前做 AI芯片的,对于 Transformer 架构支持的比较好的公司有哪些?
张强:其实在推理这块,2025年才是元年,2026年则是产品的元年。之前大家focus在训练中,当前大模型训练主要采用GPU或GPGPU等通用加速器,GPGPU裸算力特别高,特别适用于训练,因为训练的工作负载更动态、算子类型更多,GPGPU能跑出很好的效果。
但是推理对效率和准确性,以及带宽利用率提出更多、更不一样的要求,GPGPU 并非最优解。这也是为什么英伟达与 Groq 达成推理技术许可并吸纳其核心团队,因为英伟达也意识到,从训练时代转到推理时代 GPGPU 不是最优解,所以要补充新架构。
我们在2025年初成立,就是为了推理而生。
芯流:国内基于LPU架构的AI推理芯片公司也不少,有些公司也会提到SRAM的重要性,这两点目前看起来似乎是AI推理芯片非常重要的模块,但是大家说的这两点是比较共通的,这么多的LPU 芯片公司里面,深明奥思的独特性在哪里?
张强:数据流架构的计算有个非常显著的特点,就是以数据为中心的计算。以往的计算架构更多以计算控制为中心。很大的区别在于什么叫LPU?在我们公司的定义中,它是在指令集设计、硬件架构、软件栈架构和编译器共同开发出来的一个系统架构。这样的公司还是比较少的。
什么叫数据流计算?就是以数据为中心的计算,控制、调度和同步更多由编译器静态安排,所以最重要的是编译器+指令集+软件栈,在编译器、指令集和软件栈高效支持了Transformer架构计算的情况下,再据此设计硬件,才得到了LPU。
芯流:所以LPU芯片其实是软件的三个核心,然后才有了硬件设计。这三个公司内部都在自研吗?
张强:软件栈、指令集和编译器,包括硬件的LPU 架构,都是公司自研的。过去的芯片设计先设计硬件,再用软件适配硬件。LPU是先定义面向目标负载的指令集和执行模型,然后进行软件栈和编译器的设计,最后确定它们最高效地支持计算,再根据这个架构去设计硬件。
芯流:所以做AI推理芯片的时候,要以终为始。
张强:对,以前先做一个内核,再用软件把这个内核的算力发挥到最大。现在先用软件栈、编译器、指令集把计算效率发挥到最大,然后再根据这个去设计硬件,符合编译器、软件栈、指令集的运算。
03
AI与组织:十个人的工作,为什么现在一个人能做
【编者按】张强举了一个例子:过去做一套可用的 Linux 软件系统需要十个人,现在借助大模型,一个人也可能完成。人变少并不意味着工程能力不再重要,恰恰相反,组织会更依赖能够定义产品、设计架构并驾驭AI的核心研发者。AI 正在改变的,不只是芯片效率,还有芯片公司的形态。
芯流:我觉得大家可能都会有一个疑问,之前的芯片设计时代,其实要同时把三个软件的核心都搞定,难度蛮大的。尤其在没有AI coding的情况下,我们为什么能凭借比较少的人,能够搞定这三个软件的核心,最根本原因是什么?
张强:我们自身的经验和能力足够高,另外也在用大模型提高效率。
比如这么大一个芯片,要做Linux,以前一个Linux的软件系统和操作系统,要做出来需要10个人,现在只要1个人就够了。这就是大模型在研发公司里带来的组织变化和工作关系变化,我们要适应它去提高效率。人员成本是很多芯片公司不盈利的主要原因。
大模型现在可以帮助这些研发公司提高效率、降低成本。不是不需要人,但需要有能力、核心定义能力、核心设计能力、能够用好大模型的人。
芯流:核心研发最需要的,其实是那些能够给出需要一个什么样的产品需求的人。
张强:对,架构设计,包括硬件架构、软件架构、编译器的设计,编译器本身也有架构设计,这样的人非常核心。
芯流:目前的芯片设计研发公司,在经过AI效率的大幅提升之后,其实芯片设计公司的形态可能会发生一些变化。未来可能是由若干个非常厉害的架构师去组成的一个精简组织。
张强:而且是非常高效有战斗力的组织。这个形态的变化还有很大空间。目前全球大约有 80 亿人,但只有200万人在深度使用大模型。但是就这200万人,现在算力token也很告急,不够卖。所以需要这样的芯片的计算中心还很多,市场足够大。
公司在做了端侧芯片之后,会转到云端,因为端侧和云端是推理的两种部署形态:端侧强调本地化部署,有助于保护知识产权和信息安全;云端则强调并发和规模化服务,可以服务更多人,产生高效的 Token 推理能力。
04
云端与生态:客户买的不是一张卡,而是少改业务
【编者按】从单卡走向服务器和机柜,不是简单地把卡堆起来。通信、内存访问、模型切分、KV cache 和请求调度,最终都要落到单位 token 的成本上。张强更看重另一个容易被忽略的指标:迁移成本。客户不想重写业务系统,因此板卡、标准 API 和生态兼容,本身就是芯片产品的一部分。
芯流:刚才还提到带宽利用率,哪些因素会严重影响带宽利用率?
张强:带宽利用率和架构息息相关。GPGPU现在有三层cache,LPU架构带宽利用率会提高到85%以上。在同样一个产品定义的带宽或者设计的带宽下,我们的带宽利用率高,产生token的速度就更快,这就是产品的价值。
另一个是推理的准确性,因为GPGPU的架构是为了general purpose的计算,所以需要用强大的并行计算,裸算率高。
云端芯片需要提供稳定、可预期的服务。在相同任务条件下,公司会把任务完成时间的波动控制在很小的范围内。对于客户而言,他能够得到一个非常准确和可预判、可预知的服务,这个很重要。
芯流:我们能够做到这么高的带宽利用率,最关键的是什么?我们的架构相对优势如何?
张强:架构本身的设计就是为了推理而生的。
芯流:国内用 LPU 架构做 AI芯片的公司也有一些了,如果我们用 LPU 架构能够实现85%的话,别人是不是也可以?
张强:任何技术都有门槛,也需要长期积累,指令集、软件栈、编译器、硬件架构设计,四个同时要做,而且都做好,并不容易。
芯流:首先考验一个芯片设计公司的三大软件核心能力和一个芯片硬件设计能力。把这四个能力逐一去做检验之后,真正能做到的很少。
张强:对,就像英伟达的GPGPU架构大家都知道,但是很难做到同等性能。
芯流:所以说带宽利用率是一个结果的表现,而不是一个因。
谈到云端AI芯片,有一个话题肯定绕不过,今年的 WAIC 上,其实有非常多的多卡互联的方案,甚至可以看到中科曙光的镇馆之宝是万卡互联,我们既然要做云端,后面是不是也要去做多卡互联?怎么解决互联的技术和生态的问题?
张强:首先从芯片角度,我们会针对 prefill 和 decode 做优化,从单卡到机柜或者说系统,不是简单的堆砌过程,是如何把整个系统的通讯、互联以及算力的集成打造到最优解。从单卡到服务器和机柜,核心不是简单的堆卡,而是让通信、内存访问和模型切分协同工作,我们会围绕推理任务的特点来设计方案,重点关注多卡之间的数据交换效率、KV cache 管理、请求调度、高并发处理和故障隔离。
集群规模并不是越大越好,关键是扩展后,每张卡的有效利用率还能保持,单位 token 的成本和 TCO 是否继续下降。训练有万卡集群,越大训练效率越高,而推理是一种服务,会有集中式和分布式,虽然都是云端,但是两种形态。所以token 的成本是不是持续下降、TCO 的成本是不是持续下降是客户首要关心的。技术上的实现还包括通讯和延迟,还有每个大模型的切分的协同。
芯流:目前公司做LPU,是不是会涉及到一些生态适配问题?目前我们国内的客户的LPU的需求是否有一些独特的地方?需要去做哪些工作?
张强:生态对于芯片工作来讲非常重要,可以说没有生态就没有芯片的应用,所以为什么会有 Wintel 这样的一个概念,就是微软加Intel,就是因为它是一个生态的结合。
生态兼容是云端 LPU 能否被采用的关键,我们会提供标准化的软件接口和工具链,让客户在上层应用少写代码,甚至不写代码,通过兼容主流的推理框架、模型格式和标准API接入的方式降低迁移成本,客户的需求很明确,希望在不重写业务系统的情况下,获得更低成本、更稳定、更可控的推理服务,所以迁移成本本身就是产品竞争力的一部分。
生态兼容在我们这样的产品上非常重要的,我们在公司创立之初,就专门有负责生态的团队来做生态兼容。
芯流:我们有强调板卡级交付和标准的API接口交付,尤其是后面一种API接口的交付,我觉得还是蛮新的,至少就此前我接触的很多芯片设计公司而言,都没有听过。怎么去理解我们面向客户的两种形式的交流?
张强:做芯片就要考虑整个系统的应用,如何让客户非常容易把它用起来,并降低迁移成本和迁移难度,这个是我们最开始从芯片定义、设计、到生态打造贯穿进来的。
传统的芯片采购往往要求客户自己完成硬件设计、驱动设计和模型部署以及上层应用的改造,时间成本和研发成本都很高,纯云服务又可能要面临数据安全、延迟和长期的成本问题,板卡级的交付加标准 API 接入,相当于把复杂的工程往下沉,客户可以更快把推理能力接入到现有系统。
对客户而言,真正重要的是少改业务,快速上线、稳定运行,而不是从底层重新搭建一套 AI 的基础设施。这样的话,token工厂很快就能够产生价值。
05
尾声
访谈后半段,我们向张强提出过一个直接的问题:国内采用LPU和数据流架构的公司并不只有深明奥思,如果大家选择的是相似的方向,其他公司是否也能做到同样的带宽利用率?
但在张强看来,LPU并不是一个知道原理便能够复制的架构。它要求指令集、编译器、软件栈和硬件架构同时成立,而且四项能力必须同时做好。
这可能是理解深明奥思竞争壁垒最重要的一句话。
指令集决定计算以什么方式发生,编译器负责把模型转换成芯片能够高效执行的任务,软件栈连接模型、框架和应用,硬件则最终承载这套计算方式。
四项能力并不是简单相加,而更接近相乘。任何一项存在明显短板,都会限制整套系统的效率。最终呈现出来的token速度、带宽利用率和推理稳定性,只是结果,并不是原因。
正如张强所说,英伟达的GPGPU架构并不是秘密,但知道一种架构如何工作,与真正做出同等性能的产品,是两件完全不同的事情。
而当推理芯片走向客户,壁垒还会继续向外延伸。
芯片能否运行模型,是第一层;能否稳定、高效地产出token,是第二层;能否通过板卡和标准API进入客户原有系统,是第三层。再往后,还有模型适配、生态兼容、规模交付和客户信任。
这几层能力共同构成的,才是一家推理芯片公司的完整壁垒。
这也是深明奥思把设计顺序倒过来的原因。
先做指令集、编译器和软件栈,再让硬件从中长出来。这个选择听起来漂亮,真正做起来却并不轻松。芯片最终仍要流片、量产、适配模型、进入客户系统,所谓高带宽利用率、稳定推理和低迁移成本,也都要在真实业务里被反复验证。
推理芯片是一个既旧又新的产业。
旧,是因为芯片仍然遵循漫长而严苛的工程规律,任何一个环节都无法靠概念跳过。新,是因为客户购买的东西正在发生变化。他们不再只买一颗芯片或一张卡,还要购买稳定的token、可预知的成本、不离开本地的数据,以及尽可能少改业务的接入过程。
这决定了推理芯片不会是一场简单的竞赛。
深明奥思的特殊之处,正在于它没有从怎样造一颗更大的芯片开始,而是从客户究竟要完成什么工作开始。
这条路提出了一个值得观察的样本:一家 AI 芯片公司,是否可以先从客户要完成的工作出发,再一路反推到最底层的硬件?
*头图由AI生成
- XINLIU -
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.