![]()
“计算需求在指数级攀升,今天,仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的缺口。”2026年世界人工智能大会(WAIC)期间,无问芯穹联合创始人兼CEO夏立雪这样说。
这不是危言耸听。从Pre-training(预训练)到Post-training(后训练),从Test-time(推理时扩展)到Agentic scaling(智能体扩展),四条Scaling Law同时起作用。“模型训练和推理的超级市场正在互相孕育。”夏立雪说。
但算力的供给,仍然是线性的,供需之间的缺口就是机会。
![]()
“规模×效率”一个公式,三个落点
无问芯穹给出的答案,是一套名为“前店后厂一中心”的Agentic Infra战略布局。这个带着工业时代气息的命名,并非偶然。“今天最重要的是解决那些最落地的需求。”夏立雪说。
这套体系的底层逻辑,是一个AI生产力公式:AI生产力 = 智能资源规模×Token 转化效率×AI生产力转化效率。
三个因子,对应三个落点——“一中心”是算力集散中心(Agentic Infra自主式基础设施平台),解决智能资源规模最大化;“后厂”是Token工厂(Agentic MaaS大模型服务平台),解决Token转化效率;“前店”是AI生产力商店(Agentic Infra行业解决方案),解决生产力转化效率。
![]()
“向下汇聚能源和芯片,向上支撑模型和应用。”夏立雪这样定义这套体系的边界。
算力集散中心把散落的GPU变成一台“大电脑”
“算力的异质化、碎片化问题是全球性的,”夏立雪认为,“如何把不同的、跨区域的算力资源,高效聚合协同起来,是扩大智能资源规模的关键。”
无问芯穹的解法是“多元异构、软硬协同”。其异构集群跨域训练系统,通过计算通信重叠的流水编排、自适应的通信流调度和异构算力调度机制,三位一体全栈协同优化。
![]()
这套系统已经经受过三类生产级考验——
超远距离聚合:联合中国电信,完成国内首例超4000公里大模型跨域混训,新疆哈密与广东深圳两地集群联合训练性能提升165%。
多数据中心聚合:打通4个不同代际、不同型号的GPU集群,联合训练近百亿参数大模型,四集群协同性能提升41%,盘活了不同批次的存量异构算力。
混合云算力聚合:本地私有集群与公有云算力安全互通混训,整体性能提升68%。
目前,这套跨域训练系统已在全国部署触达超37000P算力,覆盖16种主流芯片。
![]()
更值得关注的是强化学习场景。相比传统预训练,强化学习的“多角色协同”特性对硬件种类需求更复杂、规模量级更庞大。跨集群之后,不同角色的等待时间被拉长;万卡级规模下,故障以小时级频率出现。
无问芯穹的做法是把全栈协同贯穿到底——从网络、平台到框架一体式深度优化,实现全局资源一盘棋调度。跨域通信效率提升3-4倍,通信开销100%全掩盖;故障无感训练机制实现连续一周零中断稳定运行。
“这只是一个起点。”夏立雪说,“未来,我们能够将跨域计算资源的支撑规模,持续拓展至十万卡级以上,支撑下一代Agentic AI的在线进化。”
Token工厂优化即利润
如果说算力集散中心解决的是“规模”,Token工厂解决的就是“效率”。
夏立雪用千卡至万卡规模下的完整推理服务技术栈,揭示了一座Token工厂内部的可优化空间——“从网关、路由,到底层推理实例,Token工厂层层可优化、处处有增量。”
这次发布的核心技术突破,是首创的跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode, PDD) 。
![]()
智能体推理的需求特征是“三极”:上下文极长、交互轮次极多、缓存命中率极高。不同芯片在Prefill和Decode阶段的性能差异极大,而现有集群几乎都是同构的,各有“偏科”。
PDD的解题思路是:用高性价比的广域网以太网把各地已建好的同构数据中心连接起来,让算力强的集群做Prefill,让显存带宽高的集群做Decode。相当于让“偏科”的硬件只刷自己最擅长的题。
但基于以太网的KV Cache跨集群传输存在带宽和延迟瓶颈。无问芯穹的推理团队做了两件事:一是把Decode Radix Cache技术迁移至跨集群异构PD分离架构,实现 KV Cache传输数据量降低一个数量级;二是将传统的“P-D”链路解构为“P-RLD-MD”三级分离,用 RelayDecode先行输出Token,让用户完全感受不到长达数十秒的传输延迟。
实测显示:首Token延迟降低51.5%,单Token成本降低37.5%。
过去一年,无问芯穹的Token工厂已通过一系列原始技术创新,推动推理成本下降10倍。夏立雪判断,随着PDD架构规模化落地,“推理成本依然有10倍的下降空间。”
![]()
业务数据印证了这一趋势。截至7月,平台单日Token调用量较去年12月增长40倍。与Kimi、智谱、Minimax、阶跃星辰等头部大模型企业的合作,在真实业务场景中持续打磨优化经验。
夏立雪说:“6月的GTC上,黄仁勋展示了英伟达的‘算力即收入’曲线。无问芯穹的Token工厂,则希望用这个‘优化即利润’的增长飞轮,向推理时代交出Token效率的答卷。”
AI生产力商店:从Token到行业价值
有了算力和Token,下一步是把它们变成行业真正认可的AI生产力。
无问芯穹正通过Agentic Infra行业解决方案,将 Token 转化为产业价值。目前已覆盖文娱游戏、医疗健康、法律服务、能源电力等多个垂直行业。
![]()
文娱游戏领域,携手VAST的Tripo 3D大模型打造AGENTIC 3D GAME GEN解决方案;医疗健康领域,服务上海瑞金医院的算力及模型管理;法律领域,打造“律盾芯人”,与段和段、君合、竞天公诚、通商等律所合作;能源领域,与南网能源探索智算中心能耗智能预测与协同调度。
更关键的是,无问芯穹也在用智能体赋能基础设施本身——打造了一套基础设施智能体蜂群。
![]()
三个子集对应三个方向:面向用户的平台管家智能体系统(全局统筹者,能独立解决80%日常问题);面向集群的运维智能体系统(7×24小时值守,运维人效提升5倍以上,关键故障处理效率提升6倍);面向芯片的算子生成智能体系统 KernelMind(五步闭环工作流,在GLM5.2实测中,NVIDIA旗舰卡端到端性能提升 7.3%,AMD旗舰卡提升39%)。
“我们不仅用Agent赋能资源规模扩展、提效Token生产,更致力于以Agent能力驱动整套AI Infra形成自主迭代、自我优化的闭环,让基础设施越用越强。”夏立雪说。
向物理世界延伸
演讲最后,夏立雪将视野从云端数字世界延伸至物理世界。“在物理世界中,具身智能的Scaling Law同样需要高效率、大规模的基础设施支持。”
无问芯穹公布了在具身智能领域的两项技术升级——
![]()
RLinf V0.3:面向具身智能的大规模真机强化学习训练框架,支持真机设备1000+次在线上下线、训练零中断,近百台真机规模专线需求降至2Gbps以下。
Mizar-Robo:面向机器人与端侧AI场景的全栈推理优化体系。在与自变量机器人WALL-OSS系列模型的联合优化部署中,推理性能提升7.14倍,Thor平台实测端侧推理时延从500ms压缩至70ms,降幅达86%。
![]()
同时,无问芯穹发布了首个面向大规模具身任务的云边端一体化管理与调度平台,首次把云端GPU集群、边缘算力节点和机器人真机设备统一接入一个平台。
![]()
“让智能无所不能,是AGI,而让智能无处不在,是AGI Infra。”夏立雪说。
在夏立雪看来,AGI是目标,AGI Infra是路径。无问芯穹的“前店后厂一中心”,本质上是在为这条路径铺设地基——从散落各地的异构算力,到高效运转的Token工厂,再到赋能千行百业的行业方案,乃至向物理世界的延伸。
这套体系的价值,在于它指向了一个方向:AI基础设施正在从“被动支撑”走向“主动进化”。当基础设施本身拥有了智能体能力,它就不再只是工具,而成为AGI时代真正的生产力引擎。
“用智能进化智能,用生产力加速生产力。”这或许就是下一代AI基础设施的终极形态。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.