在刚结束的 WAIC 上,如果还盯着各家厂商展台上单张板卡标着多少 TFLOPS 算力,大概率会漏掉行业底层最核心的变局。眼下的算力战场,早已不再是拿一颗芯片跟对手拼单卡性能的时代,行业的注意力开始全面转向"超节点"交付与实际系统的稳定性。
![]()
过去大家挑硬件,习惯先看芯片制程和单卡跑分。但在大模型参数动辄上千亿、智能体需要吞吐超长上下文的场景下,单张 GPU 的板载显存和带宽根本跑不起来。现实情况是,千卡甚至万卡集群一旦跑起来,大量的时间和功耗都浪费在了芯片与芯片之间的通信等待上。如果拿修高速公路来打比方,以前是不断把单辆车造得更快,现在则是要搞清楚怎么防止几十万辆车在收费站卡死。
![]()
这也就是为什么超节点会成为新的攻防焦点。把几十上百颗计算核心通过高速互联协议绑在一起,在逻辑上直接组装成一台具备统一内存编址的超级计算机,极大地拉低通信延迟。
![]()
腾讯云在论坛上公布将于 2026 年第四季度部署 NPO 近封装光学超级节点,本质上也是在解决通信带宽和功耗物理极限的问题。相比于经常被拿来讨论的 CPO 方案,NPO 将光电转换芯片直接放在与主计算芯片同一块板卡上,不仅拉近了距离,还去掉了光模块里发热大、功耗高 的 DSP 芯片。在眼下的工程物理约束下,这是把超节点落地成本降下来、提升能效表现极其务实的一条路径。
![]()
供给侧在拼系统交付,需求侧的"Token 经济"也在改写算力消耗的逻辑。随着智能体(Agent)应用频繁高频地在后台调用模型,每次处理复杂任务都需要自动拆解步骤、反复轮询,Token 消耗量呈现出几何级数的增长。推理端的算力需求,不再是过去偶尔问答一次的断续状态,而是变成了像水电一样持续流动的工业品。
![]()
政策端的变化同样非常务实。北京市最新印发的智能体扶持政策里,直接提到了"Token 工厂"、发放算力券与 Token 券。补贴从过去单纯资助研发端做芯片,延伸到了使用端去补贴 Token 消耗,直接用真实场景和调用量去喂饱算力基础设施。
![]()
当然,超节点从技术验证走向大规模商用,底层的物理坑点依然不少。集群规模一旦扩大,多租户业务隔离怎么做、上千个核心如何防止算力分配不均、高密度散热架构怎么迭代,甚至软件栈和开源生态的适配度,都需要时间去打磨。NPO 方案的后续推广,同样依赖行业统一标准的建立。
![]()
国产 GPU 的成熟度不能再用简单的单卡对标去评估。算力系统跑得稳定、集群互联效率足够高、推理成本能压到让中小创业者用得起,才是这个新阶段最真实的硬件底层逻辑。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.