国产 THQLink 架构 2.944 微秒量子纠错实时解码延迟——比英伟达 NVQLink 快 23%,把容错量子从「单机能跑」推到「集群可扩展」

8 月 18 日,国防科技大学团队在 arXiv 上线论文 2608.03948,提出 THQLink 架构—...

8 月 18 日,国防科技大学团队在 arXiv 上线论文 2608.03948,提出 THQLink 架构——一套基于国产 TH-Express 高速互连网络的量子-经典异构解码架构。实测整套互连链路平均往返时延为 2.944 微秒,对比英伟达 NVQLink 的 3.839 微秒降低 23.3%;并且 NVQLink 仅完成网络回环测试、尚未实现完整闭环实时解码验证,THQLink 已经完成了码距 19 表面码的端到端 1 微秒实时解码演示。

THQLink 架构的核心命题很具体:把通用高性能计算集群作为解码引擎,通过高速互连网络与量子控制系统紧耦合,避开「专用 FPGA/ASIC 解码器算法固化」与「通用 CPU/GPU 网络时延高」之间的两难。三个层次的组件构成了这套体系:量子控制系统侧的 FPGA 实现 TH-Express 物理层与链路层协议,并集成综合征到数据包的转换逻辑;TH-Express 交换机构建无阻塞、全线速的交换矩阵;HPC 侧的通用计算节点运行解码算法,并处理通信、任务调度、纠正映射等前后处理工作。

可扩展性是这套架构最大的工程亮点:每多连一个计算节点,仅带来 130 纳秒的增量时延开销。这意味着当未来量子硬件需要接入数百、数千逻辑比特的解码集群时,通信带来的额外时间开销依旧可控——传统 PCIe 直连方案被机箱空间限制,英伟达 NVQLink 被完整以太网协议栈的开销拖累,而 THQLink 借助并行窗口解码策略与国产高速网络,把「实时解码」从「单机能跑」换轨到「集群可扩展」。

并行窗口解码策略为什么能压码距

传统全局解码一次性处理全部时空维度的症候数据,计算量随纠错轮次指数级上涨;THQLink 团队采用的并行窗口策略把完整症候流切分为 A 类与 B 类窗口——A 窗口并行执行、解析核心区域,边界无法判定的缺陷转化为「人工边界缺陷」传给 B 窗口;B 窗口并行处理接缝处的边界缺陷。只要集群算力充足,解码总耗时不会随纠错轮数膨胀。在物理错误率 0.1%、10 倍码距纠错轮次的测试条件下,并行窗口方案可以完成码距 19 表面码的 1 微秒实时解码,同等条件下全局解码仅能做到码距 11——这是 8 倍以上的码距扩展能力。

与英伟达 NVQLink 的对位优势

NVQLink 是英伟达面向量子-超算耦合推出的基于 RoCE 以太网的解决方案,公开测试平均往返时延为 3.839 微秒,但保留了以太网完整协议栈带来的额外开销,且仅完成网络回环测试。THQLink 在 2.944 微秒往返时延、端到端闭环实时解码(码距 19 表面码)、跨机箱横向扩展(每跳 +130 纳秒)三个维度都跑出了更好的数据。同时这套架构不绑定特定解码算法——MWPM、并查集、机器学习解码器都可以直接部署运行,且适配超导、中性原子、离子阱等不同技术路线的量子硬件。

当前局限与下一步

现阶段工作仍属原型验证。实验使用 AMD Virtex UltraScale+ FPGA 模拟量子控制系统,尚未直接接入真实 QPU;多机架和超大规模集群能力主要由体系结构设计与单跳增量时延结果支撑,需要在大规模并发流量下进一步验证。不同逻辑量子比特之间的负载波动、交换网络拥塞、尾延迟以及异构节点调度,将成为后续工程问题。团队计划将架构迁移验证到量子低密度奇偶校验码(qLDPC),并面向异构算力集群开发自适应负载均衡机制。

它改变了什么

THQLink 把量子纠错实时解码从「依赖专用硬件且难以扩展」的窄路,推向「通用 HPC 集群 + 国产高速网络 + 并行软件栈」的宽路。这条宽路对应的不只是单一论文的工程增量,而是中国在量子-超算耦合栈上第一次拿出了对位英伟达的硬件级解决方案。当量子比特数从「几十」向「几千」推进时,实时解码的扩展性会比量子比特本身更早成为瓶颈——THQLink 这条路线走通,意味着容错量子计算的「中间层」不再只有英伟达一家。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1