网易首页 > 网易号 > 正文 申请入驻

端侧AI,GPU重新崛起!

0
分享至

在边缘计算与大模型融合的浪潮下,芯片行业正经历一场深刻的架构变革。长期以来,为了应对图像渲染、语音识别、计算机视觉及神经网络推理等多元化任务,芯片厂商往往倾向于在SoC中不断叠加专用的加速模块——CPU、GPU、DSP与NPU各司其职。

但问题也由此产生。“每一个加速器都能很好地解决一个问题,但每一个加速器也会创造一个依赖。”

在Imagination Technologies日前举行的媒体开放日活动上,公司CEO Markus Mosen将这种代价形象地称为一笔“边境税”:不同计算单元像一座座孤岛,数据要不断经过外部内存在GPU、NPU、DSP、CPU之间搬运,每跨过一次边界,都要同时付出三种成本——能耗、时延,以及工程师的开发和维护时间。



Imagination CEO Markus Mose

对此,Imagination想做“减法”。让GPU从单纯的图形处理器,进一步成为图形、通用计算和AI之间的“融合加速器”。近日,Imagination正式公布其最新的E系列GPU IP的计算性能数据,显著的性能提升进一步强化了其GPU-First的战略,E系列采用一颗处理器、一套架构和一套软件栈,同时处理图形、计算和AI工作负载。

碎片化架构的“边境税”与GPU的重心崛起

从终端用户的角度看,一部手机、一辆汽车、一个机器人或者一台工业摄像机,其实并不会把“感知、建模、推理、决策、渲染”看成五件毫不相关的事情。它们发生在同一条数据链路里,面对同一个响应时间,共享同一块电池,也共享同一个内存和功耗预算。

现在的问题是,工作负载已经融合,硅片架构却没有完全跟上。

传统异构SoC往往由CPU、GPU、NPU和DSP分别承担不同任务,每个处理器又拥有自己的本地存储和软件环境。中间结果不得不反复进出DRAM。Markus认为,这些“边界”本身就是成本。

数据搬运消耗的是纳焦耳,任务切换增加的是毫秒,而驱动、工具链、安全模型和软件维护最终消耗的,则是以“工程师年”来计算的研发资源。Imagination因此提出,与其不断增加新的专用计算岛,不如尽可能建立一个共享、可编程的计算中心。

融合已经在发生,谁最适合成为这个计算重心?Imagination的判断是GPU。

理由并不只是GPU算力高,而是它同时具备几个已经存在的基础:高度可编程、大规模部署、成熟的驱动和工具链、标准API以及庞大的开发者生态。更重要的是,对于手机、PC和数字座舱等视觉设备来说,GPU本来就是无法被拿掉的处理器。

按照Markus所说:“计算的重心正在往GPU转移,图形和AI靠得更近,需要统一内存、统一调度、统一软件栈。”这一切归根到底就是两个字——效率,既是客户开发的效率,也是产品跑起来的效率。要最好地解决效率,方向就是GPU。

E系列:把AI真正嵌进GPU

“GPU是用户体验的核心”Imagination首席营收官Jake Kochnowicz先抛出了这样一个判断。

无论手机、平板、PC还是数字座舱,只要设备拥有屏幕,最终呈现在用户眼前的每一个像素,几乎都绕不开GPU。与此同时,经过几十年的发展,GPU已经从单纯的图形处理器变成高度可编程的并行计算平台。DirectX、Vulkan、OpenCL等行业标准,以及围绕GPU形成的驱动、工具链和开发者生态,也早已相对成熟。

因此,在Jake看来,当AI开始越来越深地介入用户体验,GPU其实是最自然的承载者之一。图像超分、神经渲染、生成式AI、语音助手、生产力工具乃至本地大模型,都需要大量并行计算。而在很多SoC中,GPU本身已经是面积和计算能力最大的处理单元之一。

过去给SoC增加AI能力,一个很直接的办法是再加入一个NPU。虽然每个处理器都能在自己的领域获得更高效率,但代价是芯片内部形成越来越多的“计算孤岛”:GPU处理图形,NPU处理AI,CPU负责调度,不同计算单元拥有不同的数据路径和软件环境。

E系列选择的是另一条路。不是继续增加新的计算岛,而是把AI矩阵计算能力直接融入GPU原有的数据路径。

E系列最核心的一项架构变化,是矩阵加速能力与GPU执行单元的深度耦合。Jake介绍,E系列将矩阵乘法能力直接放进GPU内部,紧邻现有图形计算单元。“这意味着AI能把GPU现成的一整套东西都用上:寄存器、控制、缓存、固件、驱动、工具链,还有围绕GPU的整个生态,这是对既有投资极高的杠杆利用。”



从性能上来看,在1GHz下,E系列单核心FP32算力达到2 TFLOPS;矩阵计算方面,FP16/BF16可达到16 TFLOPS,INT8/FP8达到32 TOPS。最大四核配置下,FP16矩阵性能超过100 TFLOPS,FP8则超过200 TFLOPS,相比D系列提升超过4倍。

但Imagination反复强调,GPU不能只看TOPS和FLOPS,它还得能塞进真实系统,给系统设计者留足选择。E系列核心从单核到四核可扩展,峰值配置下可寻址内存1TB,峰值读带宽768GB/s,通过AXI能接HBM、LPDDR、GDDR或者统一内存任意一种。不同产品规模可以变化,但背后使用的仍然是同一套IP和软件栈。



这或许也是Imagination所谓“融合”的真正含义:并不是所有任务都必须由GPU完成,而是尽可能让不同任务共享同一套底层计算资源和软件基础。

图形与AI的融合典范:神经超分辨率NSR

此次媒体开放日中发布的NSR神经超分辨率,最能体现这种融合价值的一个应用。

今天AI超分已经不是新鲜概念。英伟达有DLSS,AMD有FSR,移动GPU厂商也在陆续把AI引入图形渲染。

但Imagination给NSR找到的切入口并不是单纯追求更高画质,而是数据搬运效率。

传统GPU+NPU方案中,GPU先完成渲染,再把结果写入DDR;NPU重新读取数据完成超分,然后再写回内存。Jake强调到,在任何设备里去内存取数都可能极贵,数据搬得越远越耗时越耗电。神经渲染就是展示这种距离成本,以及“融合”为什么有价值的最好例子。

E系列的做法则是将图形Shader和矩阵计算放得足够近,使图形与AI可以在同一套GPU执行环境里完成。这与Imagination长期采用的TBDR(分块延迟渲染)架构也形成了结合:不是等完整一帧图像全部生成后再处理,而是以Tile为单位进行渲染和计算。



这非常符合移动和边缘设备的特点。因为与拥有独立显存和巨大显存带宽的桌面GPU不同,手机、汽车、机器人SoC上的GPU往往需要和CPU、ISP等模块共享系统内存,每一次额外的数据搬运都更加昂贵。

NSR采用单次处理网络,并结合Imagination的网络自压缩技术,可移除约65%的冗余权重。在1GHz单核E系列GPU上,将540p画面提升至1080p仅需2.3毫秒;从1080p提升至4K时,带宽消耗最高可降低54%,帧率提升2.5倍。



现场demo对比了1080p原生和540p超分到1080p的画面,画质呈现完全没有损失

向AI扩展,并不意味着Imagination放弃GPU最传统的图形能力。图形仍是基本盘。

E系列也在明显向更高性能的图形市场扩张。

按照Imagination公布的数据,四核E系列运行《博德之门3》时可以超过60fps,《古墓丽影:暗影》《毁灭战士:永恒》等PC游戏也已完成展示。相比上一代D系列,其每TFLOPS对应的帧率最高提升54%,能效最高改善39%。这一提升的核心之一,同样是减少无效的数据移动和提高计算资源利用率。



E系列里集成了Imagination自研的高性能RISC-V固件处理器,在GPU架构上把图形和计算工作并行调度。底层最多支持4核、16台虚拟机,带高质量服务、工作负载优先级和内存隔离,云游戏、云桌面这类场景都能撑住。

从神经渲染走向端侧大模型,全栈AI推理优化

图形只是第一步。从神经渲染继续向前,E系列瞄准的是更广泛的端侧AI,并重点强化了两类基础计算:矩阵乘法和卷积。

Jake表示:“如果矩阵乘法代表推理和思考,那么卷积就是感知。”

E系列矩阵乘法性能最高提升4.8倍,卷积性能最高提升4.4倍,分别对应语言模型和视觉感知等不同AI工作负载。



到了大语言模型,Imagination将LLM推理拆成两个阶段:prefill(预填充,就是“问”)和decode(解码,就是“答”)。从工作负载复杂度和用户体验看,最难、最重要的是prefill——要在尽量短的时间里给大模型处理海量数据,衡量指标是time to first token(TTFT),也就是处理器听懂你的问题、开始吐第一个token要多久。E系列把prefill性能提升了4.7倍,这对好几个场景都很关键:手机上让大模型做摘要,你希望几乎秒回;车或者机器人看到数据,必须以足够高的帧率处理图像。

Decode阶段(每秒多少token)则取决于系统带宽,也就是片上内存给的带宽,每个token都要搬数据、重载权重。我们在工具和软件上投入,帮客户把模型量化到低位宽还保住精度。但要说清楚,AI不只是看TOPS——系统带宽受限时,更多TOPS解决不了系统问题。E系列的目标,是把开发者需要的算力给足,让系统集成商能专心去做他们终端产品的整套系统。

实际测试中,车机行程规划可实现约0.2秒TTFT、150 tokens/s;智能眼镜环境描述约0.25秒、153 tokens/s;邮件解读和摘要约0.86秒、126 tokens/s。对于轻量化端侧模型而言,首Token时间已经可以压到1秒以内。

这种能力在Agentic AI时代尤为重要。现场Demo通过Llama.cpp连接OpenCode智能体框架,模型在输出第一个Token之前,需要先完成工具调用、数据收集和推理。对于代码Agent等长上下文场景,文件越多、工具调用越复杂,对Prefill性能的要求也越高。与此同时,端侧运行还能降低云端调用成本,并减少代码、数据等敏感信息离开设备的风险。

除了算力,E系列也在数据精度上进一步向AI靠拢,支持BF16、mxFP8、mxFP4等格式。不同场景可以在精度、带宽和模型容量之间进行取舍:自动驾驶等场景更强调高精度,而消费级边缘设备受内存和带宽限制,更低精度的数据格式则有助于降低资源占用。

从矩阵计算、卷积,到Prefill、Decode,再到数据精度和软件栈,Imagination试图做的并不是单纯给GPU增加AI算力,而是围绕端侧AI推理进行一整套系统级优化。

统一软件栈的重要性

对于GPU而言,硬件性能只是基础,真正决定能力能否落地的,很大一部分还在软件。

Imagination在图形侧支持DirectX 12、OpenCL、Vulkan,可运行于Linux、Android和Windows;AI与计算侧则进一步支持ONNX、PyTorch,并持续向Llama.cpp等开源项目贡献优化。同时,公司还提供自有计算库、开发工具和分析器,帮助开发者完成从开发、优化到部署的完整流程。

Jake特别强调,E系列始终构建在统一的软件栈上。客户针对某一代GPU所做的软件优化,不会因GPU产品换代而付诸东流,而是能够一代一代、持续沿用。

E系列也只是第一步。Imagination给出的路线图是:D系列开始构建计算库和SDK;E系列正式把AI计算引入GPU;下一代F系列继续提升规模扩展效率;再往后的产品,则进一步提高AI计算密度和能效。



中国市场:从重要客户市场走向共同创新

近期,Imagination完成中国区管理团队调整,任命谢巍出任执行副总裁兼中国区总经理,宣雄文出任中国区销售副总裁,并继续强化北京、上海、深圳等地的客户支持和销售网络。

这一调整背后,也与中国市场对GPU能力提出的更高要求有关。Jake Kochnowicz在媒体问答中表示,相比部分海外市场更侧重汽车等深度嵌入式应用,中国客户对于更高性能、更完整功能集以及图形与计算融合能力的需求更加突出,而且往往出现得更早。“中国对图形和计算的需求非常强,现在跟中国客户的互动,正在帮助我们创新,把GPU IP的能力边界继续往前推。”

从业务进展来看,Imagination也在进一步加码中国市场。Markus Mosen透露,公司今年已经获得国内重要战略客户的授权;未来还希望与中国客户建立更紧密的合作关系,包括探索联合实验室等模式。不过现阶段的重点,仍是持续加强研发和本地支持,把更先进的GPU IP带给中国客户。

谢巍则表示:“中国一直是Imagination非常核心的战略市场,中国的开发生态和出货量这几年都在飞速发展。并透露确认今年中国桌面级市场相关出货正在接近百万台量级。”

在他看来,下一阶段的机会也不仅限于桌面GPU。随着AI智能体和边缘AI发展,E系列GPU IP将面向汽车、边缘计算、具身智能机器人等场景。Imagination希望通过更深入的客户走访、更完善的本地技术支持和开放的软件生态,把中国市场的需求更快反馈到产品和技术路线中。

中国对于Imagination的价值正在发生变化:不仅是一个规模庞大的GPU市场,也开始成为高性能GPU需求、AI应用创新以及产品路线演进的重要推动力。

回顾芯片发展史,计算架构一直在“专用化”和“通用化”之间摆动。早期PC时代,大量2D、视频等专用功能最终被更可编程的GPU逐步吸收。今天,边缘AI似乎又来到类似节点。

E系列的意义,就在于尝试把一部分AI计算重新收拢到GPU内部,让图形、计算和AI共享更统一的数据路径和软件基础,从而降低那笔“边境税”。

这不意味着GPU会取代CPU或NPU。AI系统设计没有唯一正确的答案,而Imagination认为,E系列在所有方案中都能胜任:可以采用GPU-only,也可以采用GPU+NPU、NPU+GPU,或者两者相对均衡的架构。但随着神经渲染、端侧大模型和Agentic AI不断进入终端,几类处理器之间原本清晰的边界正在变得越来越模糊。

E系列并不只是Imagination的一次GPU升级,更代表了它对未来端侧AI架构方向的一次押注。

*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
菲海警在中国海警水炮拦截下,还是完成对仁爱礁破船医疗后送任务

菲海警在中国海警水炮拦截下,还是完成对仁爱礁破船医疗后送任务

三叔的装备空间
2026-10-08 21:33:53
26年全网最大绿毛龟事件:百万粉博主自曝被coser女友劈腿,两个月花了30多万,女方家中留有多名男性的亲密合照……

26年全网最大绿毛龟事件:百万粉博主自曝被coser女友劈腿,两个月花了30多万,女方家中留有多名男性的亲密合照……

贴小君
2026-10-08 23:06:14
不可思议啊!网传江苏夫妻教数学物理五年收入340万,还清房贷车贷,目标300万躺平

不可思议啊!网传江苏夫妻教数学物理五年收入340万,还清房贷车贷,目标300万躺平

火山詩话
2026-10-06 07:37:59
俄鼠疫研究所员工不明原因肺炎去世,专家:应关注是否有新病例报告

俄鼠疫研究所员工不明原因肺炎去世,专家:应关注是否有新病例报告

中国新闻周刊
2026-10-08 23:52:15
藏族小女孩赶牛让路,自信笑容“硬控”路过司机,打动数万网友!家人:8岁,一年级,性格开朗

藏族小女孩赶牛让路,自信笑容“硬控”路过司机,打动数万网友!家人:8岁,一年级,性格开朗

红星新闻
2026-10-08 18:23:46
WTT中国大满贯:决赛对阵出炉!国乒无人晋级,张本松岛1:3被淘汰

WTT中国大满贯:决赛对阵出炉!国乒无人晋级,张本松岛1:3被淘汰

国乒二三事
2026-10-09 06:40:10
尊界这个声明,已经把公关文案水平拉到了极致

尊界这个声明,已经把公关文案水平拉到了极致

万能的大叔
2026-10-09 00:47:51
克什米尔地方官员曾称:若必须选,我们既不想加入印度,也不想加入巴基斯坦,克什米尔民众更倾向于加入中国,其背后是70年难以破解的僵局

克什米尔地方官员曾称:若必须选,我们既不想加入印度,也不想加入巴基斯坦,克什米尔民众更倾向于加入中国,其背后是70年难以破解的僵局

z千年历史老号
2026-10-08 18:31:38
白马寺又开始晒粮食了,空地上铺满黄豆、花生,景区工作人员:都是僧人们自己种的,农禅并重是祖训,存粮充足时还会免费发放

白马寺又开始晒粮食了,空地上铺满黄豆、花生,景区工作人员:都是僧人们自己种的,农禅并重是祖训,存粮充足时还会免费发放

极目新闻
2026-10-08 18:40:16
广西一女子买牛肉丸被商家误会逃单并公开监控 当事人:群内遭指责,脸看得一清二楚

广西一女子买牛肉丸被商家误会逃单并公开监控 当事人:群内遭指责,脸看得一清二楚

封面新闻
2026-10-08 19:29:05
“渠首所在地”!河南省委书记、代省长,一同调研南水北调中线工程

“渠首所在地”!河南省委书记、代省长,一同调研南水北调中线工程

政知新媒体
2026-10-08 22:23:08
中国断供稀土5个多月,日本工厂无一停产,是真摆脱了还是在硬撑

中国断供稀土5个多月,日本工厂无一停产,是真摆脱了还是在硬撑

经纬戎韬
2026-10-09 00:05:39
网友直播猛踩尊界V800刹车:上万人观看,狂收礼物

网友直播猛踩尊界V800刹车:上万人观看,狂收礼物

三言科技
2026-10-08 22:47:16
“神车”的刹车板断了——造车的需要良知,买车的需要常识

“神车”的刹车板断了——造车的需要良知,买车的需要常识

细雨中的呼喊
2026-10-08 17:23:46
姚明抵达澳门!正式上任,新职位曝光,携手火箭队友!

姚明抵达澳门!正式上任,新职位曝光,携手火箭队友!

体坛卡卡说
2026-10-08 19:15:50
中国汽车不需要华为模式

中国汽车不需要华为模式

凤眼论
2026-10-08 23:07:12
造成9人死亡、26人受伤,湖南临澧“6·16”较大爆炸事故调查报告公布:11人被采取强制措施,32名公职人员被追责问责

造成9人死亡、26人受伤,湖南临澧“6·16”较大爆炸事故调查报告公布:11人被采取强制措施,32名公职人员被追责问责

政知新媒体
2026-10-08 23:47:25
小飞人陈妤颉暂时未达世锦赛标准,世界排名第43,望通过积分入围

小飞人陈妤颉暂时未达世锦赛标准,世界排名第43,望通过积分入围

杨华评论
2026-10-08 21:14:31
难以置信!网传山东考生620分考入哈工程自动化,国庆毅然返乡复读,宿舍床位已全部清空

难以置信!网传山东考生620分考入哈工程自动化,国庆毅然返乡复读,宿舍床位已全部清空

火山詩话
2026-10-08 08:30:15
一场2-0,中网4强已决出2席!郑钦文比赛时间确定,争冠格局乱了

一场2-0,中网4强已决出2席!郑钦文比赛时间确定,争冠格局乱了

侃球熊弟
2026-10-08 21:04:16
2026-10-09 09:03:00
半导体行业观察
半导体行业观察
专注观察全球半导体行业资讯
14970文章数 35044关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

男生给马做"美甲"月薪可达六位数 全国持证者仅70余人

头条要闻

男生给马做"美甲"月薪可达六位数 全国持证者仅70余人

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

演员王晓慧刚担女主,就被曝已婚生子

财经要闻

鬼故事再现?OpenAI营收被爆巨大预期差

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

本地
游戏
艺术
公开课
军事航空

本地新闻

转型再出发 奋勇打头阵

《GTA6》加入了露骨的成人内容 R星认真打磨了

艺术要闻

炸裂!龙门石窟首次发现造像琉璃眼珠,千年佛像竟“睁眼”了,熠熠闪光品相逆天!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美日将在距台仅110公里处演习

无障碍浏览 进入关怀版