1. 量子计算基准测试概述

量子计算基准测试是评估量子处理器性能的关键工具,它帮助我们理解不同硬件平台在实际应用场景中的表现差异。当前NISQ(噪声中尺度量子)时代的量子设备存在显著的性能差异,这使得标准化基准测试变得尤为重要。

在传统计算领域,我们使用FLOPS(浮点运算每秒)来衡量计算速度。而在量子计算领域,我们引入了CLOPS(量子层操作每秒)这一创新指标,它专门用于测量量子处理器执行并行层操作的吞吐量。CLOPS的核心价值在于它隔离了纯粹的量子执行时间,排除了经典队列和作业调度等外部因素的干扰。

关键提示:CLOPS测试使用固定参数:N=100量子比特,L=100层,M=1000电路,S=100次测量。这种标准化配置确保了结果的可比性。

2. CLOPS基准测试深度解析

2.1 CLOPS测试原理与技术实现

CLOPS基准测试的核心思想是测量量子设备执行并行量子操作的能力。测试电路由多层量子操作组成,每层包含一组可以并行执行的门操作。通过精确计时这些层的执行过程,我们可以计算出设备每秒能够完成的量子层操作数量。

测试中使用的关键参数包括:

  • 量子比特数(N):固定为100,确保测试规模足够大
  • 层数(L):每轮测试执行100层操作
  • 电路数(M):每次测试运行1000个独立电路
  • 测量次数(S):每个电路执行100次测量

测试流程如下:

  1. 初始化量子寄存器
  2. 执行多层并行量子操作
  3. 测量量子态
  4. 记录总执行时间
  5. 计算CLOPS值:CLOPS = (L × M) / 总执行时间

2.2 IBM量子设备CLOPS性能对比

我们对多款IBM量子处理器进行了CLOPS测试,结果如下表所示:

设备名称 CLOPS得分 相对于Torino的性能提升
ibm_boston 360,573 +4.3%
ibm_fez 368,905 +6.7%
ibm_kingston 362,371 +4.8%
ibm_marrakesh 353,641 +2.3%
ibm_pittsburgh 358,612 +3.7%
ibm_torino 345,669 基准值

从测试结果可以看出,当前IBM量子处理器的CLOPS性能集中在350,000-370,000范围内,各设备间性能差异在7%以内。这种相对一致的性能表现说明IBM在量子处理器架构和控制系统方面已经实现了较高的成熟度。

2.3 CLOPS测试的局限性与改进方向

虽然CLOPS是一个有价值的性能指标,但它也存在一些局限性:

  1. 宽度固定问题 :当前CLOPS测试固定在100量子比特规模,无法反映设备在不同规模下的性能变化。未来需要研究CLOPS随量子比特数变化的规律。

  2. 平台差异 :不同量子计算平台(超导、离子阱等)的固有门速度存在数量级差异,这使得直接比较CLOPS绝对值意义有限。更适合用于跟踪同一平台的性能演进。

  3. 时间测量精度 :部分平台的API无法提供精确的量子执行时间隔离,可能包含队列等待等非计算时间。需要更精细的时间测量接口。

未来改进方向包括:

  • 开发多尺度CLOPS测试套件
  • 推动各平台提供更精确的执行时间数据
  • 研究适用于不同硬件架构的标准化方法

3. 量子机器学习(QML)内核基准测试

3.1 QML内核测试原理

量子机器学习内核测试评估量子处理器在执行机器学习相关量子电路时的性能表现。测试核心是计算量子核矩阵元素:

k(xi, xj) = |⟨Φ(xi)|Φ(xj)⟩|²

其中|Φ(x)⟩ = U(x)|0⟩^⊗n是通过特征映射U(x)将经典数据x嵌入到量子态的结果。

测试使用能量高效的特征映射电路设计:

  1. 每量子比特应用Hadamard门
  2. 应用参数化的Rz旋转门
  3. 执行两层纠缠操作:
    • 第一层:量子比特对(0,1), (2,3),...间的CNOT+Rz
    • 第二层:量子比特对(1,2), (3,4),...间的CNOT+Rz

这种设计在保持较强纠缠能力的同时,尽可能减少电路深度,适合当前NISQ设备。

3.2 QML内核测试实施细节

测试配置示例:

{
  "benchmark_name": "QML Kernel",
  "num_qubits": 50,
  "shots": 1000
}

测试流程:

  1. 随机生成参数向量x ∈ [0, 2π]^n
  2. 构建特征映射电路U(x)
  3. 构建内积电路U(x)^†U(x)
  4. 执行电路并测量全零态概率
  5. 重复多次统计准确率

理想情况下,当xi = xj时,应测得全零态概率为1。实际设备由于噪声影响,该概率会降低,其值即为QML内核准确率。

3.3 跨平台QML内核性能对比

我们在多种量子处理器上运行了QML内核测试,结果如下表所示:

设备名称 10量子比特准确率 20量子比特准确率 30量子比特准确率 50量子比特准确率 QMLK总分
quantinuum_h2_2 0.959 0.913 0.864 0.783 0.845
ibm_boston 0.866 0.742 0.588 0.159 0.446
ibm_kingston 0.826 0.600 0.460 0.201 0.401
ibm_pittsburgh 0.678 0.435 0.392 0.223 0.349
iqm_garnet 0.478 0.068 - - 0.056
rigetti_anka_3 0.256 0.037 0 0 0.030

从结果可以看出几个关键趋势:

  1. 所有设备的准确率都随量子比特数增加而下降
  2. 离子阱系统(quantinuum)表现最好,在50量子比特时仍保持78.3%准确率
  3. IBM Heron架构(如kingston)比Eagle架构设备表现更好
  4. 超导量子处理器在20量子比特以上时准确率快速下降

3.4 QML内核测试的技术价值

QML内核测试具有独特的价值:

  1. 应用相关性 :直接评估设备在真实机器学习任务中的表现
  2. 噪声敏感性 :对量子噪声和退相干效应高度敏感
  3. 结构复杂性 :需要设备正确处理参数化旋转和结构化纠缠
  4. 可扩展性 :测试可以灵活调整量子比特数和测量次数

测试结果显示,当前量子硬件在小规模(10-20量子比特)时可以达到较好的内核计算精度,但随着规模扩大,性能迅速下降。这表明在NISQ时代,我们需要:

  • 开发更紧凑的量子特征映射
  • 改进错误缓解技术
  • 优化编译器效率

4. 其他重要量子基准测试

4.1 虫洞启发的隐形传态(WIT)测试

WIT测试灵感来自全息对偶性和AdS/CFT对应关系中的虫洞动力学。测试电路包含:

  1. 准备三个Bell对
  2. 模拟全息哈密顿量演化
  3. 信息插入步骤(重置或SWAP)
  4. 时间反演演化
  5. 关键RZZ(π/2)门
  6. 测量Pauli-Z期望值

测试结果显示不同设备的期望值表现:

设备名称 期望值 等效两量子门保真度
quantinuum_h2_2 0.981 99.9%
ibm_pittsburgh 0.913 99.6%
ibm_boston 0.897 99.5%
rigetti_anka_3 0.463 96.8%

WIT测试对量子相干性和门操作精度提出了极高要求,是评估设备量子模拟能力的有效工具。

4.2 线性斜坡量子近似优化算法(LR-QAOA)

LR-QAOA是QAOA的变体,使用固定线性参数斜坡而非经典优化。测试配置:

{
  "benchmark_name": "Linear Ramp QAOA",
  "graph_type": "1D",
  "num_qubits": 10,
  "shots": 1000,
  "trials": 10,
  "qaoa_layers": [10],
  "delta_beta": 0.3,
  "delta_gamma": 0.6
}

测试结果显示不同设备在解决MaxCut问题时的有效近似比:

设备名称 10量子比特 20量子比特 50量子比特 100量子比特 LR-QAOA总分
ibm_boston 0.683 0.664 0.687 0.673 0.677
ibm_pittsburgh 0.671 0.626 0.683 0.647 0.656
quantinuum_h2_2 0.764 0.740 0.802 - 0.347

4.3 量子傅里叶变换(QFT)测试

QFT测试评估设备执行结构化量子算法的能力。测试结果:

设备名称 QFT-4 QFT-8 QFT-12 QFT-20 QFT总分
quantinuum_h2_2 0.991 0.973 0.937 0.152 0.592
ibm_boston 0.862 0.420 0.038 0.000 0.165
ibm_pittsburgh 0.828 0.368 0.004 0.000 0.143

5. 基准测试成本分析

量子基准测试的实际成本是研究中的重要考量因素。下表展示了不同平台运行基准测试的成本指标:

测试项目 AWS(iqm_emerald) Quantinuum(h2_2) IBM(torino)
QML Kernel(10量子比特) 109 HQC 1.14 BSEQ 1.92 分钟
QML Kernel(50量子比特) 565 HQC 1.27 BSEQ 2.92 分钟
WIT(7量子比特) 504 HQC 2.92 BSEQ 3.59 分钟
LR-QAOA(50量子比特) 11,950 HQC 4.91 BSEQ 72.00 分钟

成本提示:不同平台使用不同的计费模式,AWS使用硬件量子信用(HQC),Quantinuum使用基本序列等价(BSEQ),IBM使用设备运行时间。实际成本会根据机构与供应商的具体合同条款而变化。

6. 量子基准测试的未来发展

量子基准测试领域仍面临多个挑战和发展方向:

  1. 跨平台标准化 :需要统一的时间测量接口和性能指标定义
  2. 多尺度测试 :开发能够评估设备在不同量子比特规模下性能的测试套件
  3. 应用相关性 :增加更多真实应用场景的基准测试,如量子化学、优化问题等
  4. 错误缓解评估 :开发专门评估不同错误缓解技术效果的测试方法
  5. 逻辑量子比特测试 :为未来容错量子计算准备逻辑量子比特性能测试标准

随着量子硬件的发展,我们预期基准测试的重点将从物理量子比特性能逐渐转向逻辑量子比特性能,届时将需要新的指标如QLOPS(量子逻辑操作每秒)来评估容错量子计算的性能。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐