![]()
量子纠错对于构建可扩展的容错量子计算机不可或缺,而实时解码能力,直接决定大规模量子硬件能否真正跑出容错算力。一直以来,解码端的通信时延、集群扩展能力,都是限制量子纠错规模化的现实瓶颈。
当前国内多数量子解码系统采用PCIe直连方案,PCIe受机箱硬件物理约束,只能实现机箱内部的设备互连,一旦需要接入更多解码计算节点,就会遇到跨机箱扩展壁垒,很难支撑未来数百、数千逻辑比特的大规模解码任务。
英伟达NVQLink方案选择基于RoCE以太网实现量子处理单元与高性能计算资源耦合,公开测试的平均往返时延为3.839微秒,但这套方案保留了以太网完整协议栈带来的额外开销,仅完成网络回环测试,尚未实现完整闭环实时解码验证。
国防科技大学团队本次提出的THQLink架构,基于国产TH-Express高速互连网络,完成量子控制系统与高性能计算集群的深度绑定。
实测整套互连链路平均往返时延为2.944微秒,对比NVQLink时延降低23.3%。架构内置可扩展交换组网能力,每多连一个计算结点,仅带来130纳秒的增量时延开销。
基于此,这套架构可以横向扩展到超大规模高性能集群,不再被机箱空间限制,真正为大码距、多逻辑比特量子纠错提供可落地基础。相关研究成果已发布于arXiv预印本平台。
![]()
容错量子计算的硬约束
量子比特极易受到退相干、控制误差和测量误差影响。量子纠错通过多个物理量子比特编码一个逻辑量子比特,并周期性测量稳定子,从而在不直接读取逻辑量子态的情况下发现错误。
稳定子测量生成的数据被称为错误综合征。经典解码器需要根据连续多轮错误综合征,判断最可能发生的物理错误,并给出相应的泡利纠正或泡利帧更新。
对于超导量子计算平台,一轮量子纠错周期通常约为1微秒。如果解码器长期跟不上综合数据生成速度,数据就会持续积压,最终影响逻辑操作的执行。
在量子存储实验中,部分泡利纠正可以通过泡利帧跟踪延后处理;但进入容错逻辑计算后,问题会更加严格。执行逻辑T门等非Clifford操作前,系统通常需要解析尚未处理的泡利帧,并据此调整后续操作。
因此,实时解码不仅关系到数据吞吐量,也直接影响逻辑量子线路能否持续运行。
一个实用的解码系统必须同时兼顾精度、速度和可扩展性。专用ASIC和FPGA速度快、功耗低,却往往面临算法固化问题;CPU、GPU和TPU更灵活,但传统TCP/IP或通用以太网可能带来较高且不稳定的通信时延。
在可编程性与实时性能之间取得平衡,成为量子纠错解码架构设计的关键挑战。
![]()
THQLink架构
THQLink架构把通用高性能计算集群作为解码计算引擎,通过高速互连网络与量子控制系统实现紧耦合。
整个架构由三个层次的组件构成:量子控制系统侧的FPGA实现TH-Express物理层与链路层协议,并集成综合征到数据包的转换逻辑;TH-Express交换机构建无阻塞、全线速的交换矩阵,负责数据包的路由与转发;HPC侧的通用计算节点运行解码算法,并处理通信、任务调度、纠正映射等前/后处理工作。
![]()
图:THQLink整体架构
在解码算法层面,研究团队采用并行窗口解码策略,解决大码距表面码解码算力压力。
传统全局解码会一次性处理全部时空维度的症候数据,计算量会随着纠错轮次快速上涨。并行窗口策略会把完整症候流切分为A类窗口与B类窗口。A窗口并行执行,负责窗口核心区域的错误解析,边界无法完全判定的缺陷,转化为人工边界缺陷传递给B窗口。B窗口同样并行运算,专门处理窗口接缝处的边界缺陷。
![]()
图:并行窗口解码方案示意图
只要集群算力充足,解码总耗时不会随着纠错轮数增加而持续膨胀,在保障解码精度损失可控的前提下,大幅降低单轮解码时延。
整套架构不绑定特定解码算法,MWPM、并查集、机器学习解码器都可以直接部署运行,同时也适配超导、中性原子、离子阱等不同技术路线的量子硬件。
除量子纠错之外,还能够支撑混合量子-经典算法、量子硬件校准、噪声缓解等其他工作负载,面向量子中心超算场景具备很强的适配性。
![]()
码距19表面码1微秒实时解码
为验证THQLink架构的实际解码性能,研究团队在表面码存储器实验上进行了完整的端到端测试。实验平台采用Intel Xeon Gold 6348 CPU(28物理核心)作为解码计算节点,AMD Virtex UltraScale+FPGA模拟量子控制系统,两者通过TH-Express互连。
实验选用工业界广泛使用的Sparse blossom(MWPM家族)作为基础解码器,噪声模型采用电路级去极化噪声,分别设置0.1%和0.3%两类物理错误率开展对照测试。
实验首先完成网络基础性能标定。FPGA直连单个高性能机柜的场景下,互连平均往返时延2.944微秒,时延标准差173纳秒,抖动控制在较低水平。
![]()
图:TH-Express在HPC与FPGA直连时的往返时延
当系统横向扩展,增加交换机跳数以接入更多计算节点,每增加一跳带来的平均增量时延仅130纳秒。这个数值意味着,就算扩展到大规模集群,通信带来的额外时间开销依旧可控,不会成为系统性能瓶颈。
![]()
图:每增加一跳交换机带来的增量时延开销
研究团队分别对比全局解码策略与并行窗口解码策略的端到端解码性能。码距较小时,并行窗口因为窗口切分、边界信息交互会带来少量额外开销,全局解码性能略有优势。随着码距不断增大,并行窗口策略的算力优势充分释放。
在物理错误率0.1%、10倍码距纠错轮次的测试条件下,并行窗口方案可以完成码距19表面码的实时解码,单轮整体耗时控制在1微秒实时阈值以内,而同等条件下全局解码仅可以做到码距11。
![]()
图:全局MWPM解码器在d×d×d表面码存储电路上的端到端解码时延(p=0.1%)
物理错误率提升到0.3%之后,症候图错误节点密度提升,匹配迭代运算量上涨,两套方案整体时延都会上升,但并行窗口依旧维持显著性能优势。
逻辑错误率方面,并行窗口解码相比全局解码略有升高,这是由于核心-缓冲区边界附近的缺陷在窗口内局部解决而非全局最优匹配。但在大码距和长综合征序列条件下,并行窗口以可接受的精度损失换取了数量级的延迟降低,符合实用场景下的工程权衡。
![]()
从单机实时走向集群实时
这项研究验证了一条全新的技术路线:不依赖专用FPGA/ASIC解码芯片,依靠通用高性能计算集群,搭配国产高速网络,同样可以实现量子纠错的闭环实时解码。
THQLink架构解决了传统PCIe直连方案无法跨机箱扩展的痛点,对比国外同类NVQLink方案,取得更低的往返通信时延,并且完成完整的端到端闭环解码演示。
同时,这套架构拥有很好的软件灵活性,后续出现新型量子纠错码、新型解码算法,只需要更新软件代码,不需要改动硬件,开发迭代成本远低于定制硬件解码器。从工程角度,该架构具备向海量逻辑比特场景扩展的潜力,适配量子中心超算的发展方向。
当然,现阶段工作仍属于原型验证。实验使用FPGA模拟量子控制系统,尚未直接接入真实QPU;多机架和超大规模集群能力主要由体系结构设计及单跳增量时延结果支撑,还需要在大规模并发流量下进一步验证。不同逻辑量子比特之间的负载波动、交换网络拥塞、尾部时延以及异构节点调度,也会成为后续工程问题。
后续团队计划将架构迁移验证到量子低密度奇偶校验码(qLDPC),同时面向异构算力集群开发自适应负载均衡机制,解决不同计算节点算力差异带来的任务调度问题。
总体来看,THQLink架构实现了专用低时延互连连接量子控制系统与通用高性能计算资源,再通过并行编码软件释放集群算力。如果真实量子处理器接入、大规模网络验证和多逻辑量子比特调度能够继续推进,实时量子纠错就有望从“单节点能跑”,逐步转向“集群规模可扩展”。
https://arxiv.org/abs/2608.03948
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.