电源纹波监测中的"非相干时钟"生成:原理、实现与取舍(2015—2022)
面向片上电源噪声(Power-Supply Noise, PSN,即"电源纹波")的在片监测,采样时钟必须与待测噪声"非相干"(uncorrelated / incoherent),否则自相关法测出的功率谱会被"时钟-噪声相关"污染。本文从测量原理出发,逐层拆解 2015 年以来两篇代表性论文给出的非相干时钟产生电路——Intel 的数字随机相位噪声累积、UESTC 的 PRBS 非均匀采样(NUS)时钟——并给出关键公式、电路图、实现注意事项与 trade-off,目标是只看这一篇就能理解并复现其设计思路。
目录
- 为什么必须"非相干":问题定义
- 测量原理:亚采样平均 + 自相关/自协方差
- 方法一:数字随机相位噪声累积(Intel, JSSC 2015)
- 方法二:PRBS 非均匀采样时钟(UESTC, ISSCC 2020 / JSSC 2022)
- 信号链:VCO 型量化器与多切片并行
- 对比、注意事项与 trade-off
- 总结
- 参考文献
1. 为什么必须"非相干":问题定义
片上 PSN 的频谱测量,主流做法是亚采样平均(subsampled averaging)+ 自相关/自协方差:用低分辨率 VCO 型量化器对电源电压在时间窗内积分,再扫描两条采样路径之间的时间差 ,从而重构出噪声的等效时间波形与功率谱。
这套方法的数学前提是:待测噪声是宽平稳(Wide-Sense Stationary, WSS)随机过程——即均值与自相关函数与绝对时间无关。而要正确采到统计量,采样时钟必须与待测噪声不相关、且在噪声波形上"随机取点"。
问题恰恰出在 in-situ 场景:能拿到的参考时钟往往就是片内系统时钟,而系统时钟本身就是最大的噪声源(它驱动 PDN 上几乎所有数字电路翻转)。于是采样时钟与噪声频率/相位同步,采样点永远落在噪声波形的同一些相位上——平稳性被破坏,自相关结果出现幅度失真与噪声本底抬高。

这就是本文的核心命题:如何在"只能拿到与噪声相关的系统时钟"的前提下,人为造出与噪声不相关的采样时钟。2015 年后形成两条清晰的电路路线。
2. 测量原理:亚采样平均 + 自相关/自协方差
2.1 等效时间(亚采样)采样
被测信号(周期性电源噪声)与采样时钟同步,但采样频率远低于信号频率。每次采样只在信号周期的某一个固定相位取一个统计点,累积大量采样点后取平均,即得到该相位上的电压期望;再把采样相位逐步平移 ,就能"拼"出整个噪声波形。等效采样带宽由最小时间步 决定:
取 ,即得 ——这是先进工艺片上 PSN 监测的目标带宽。

2.2 自相关 vs 自协方差
自相关函数定义为
实际中更常用自协方差(先去直流):
自协方差的好处是:去除残余直流偏移,并大幅抑制量化器自身引入的杂散(spur)——因为与采样时钟相关的杂散在去掉均值后变成"直流分量"而被消除。

2.3 量化器为何用 VCO
用 VCO 把电源电压转成振荡频率、再在时间窗 内对输出边沿计数,相当于对电压做了一个"积分-平均"滤波,其 带宽 。这样做省掉了采样保持(S&H)电路,能工作在很高的等效带宽上。核心增益是 VCO 增益 (Hz/V): 越大,量化灵敏度越高。
3. 方法一:数字随机相位噪声累积(Intel, JSSC 2015)
T.-C. Hsueh, F. O'Mahony, M. Mansuri, B. Casper, "An On-Die All-Digital Power Supply Noise Analyzer With Enhanced Spectrum Measurements," IEEE JSSC, vol. 50, no. 7, pp. 1711–1721, Jul. 2015.
3.1 核心思想
在数字域"仿造"一个自由振荡 VCO 的相位噪声,把它叠加到采样时钟的相位上,从而把采样时钟与(时钟同步的)噪声之间的确定性相关关系"打散"(scramble)。
由于等效采样要求"每次取点的相位确定",自相关测量又要求"采样时钟与噪声不相关",Intel 的做法是在保持两条路径相位差 恒定的同时,让两路采样时钟的绝对相位一起随机游走。
3.2 电路实现

关键实现点:
- 多相延迟线 + 相位旋转器:开环数字延迟线把参考时钟 (约 )展成 64 个相位,单位延迟 (即 )。两个 PSMUX 分别选出 。
- 自相关时延变量由两部分构成: 其中 为延迟计数器之差, 为 PSMUX 选择之差。
- 随机相位噪声累积:10 阶 PRBS 产生 10 位随机整数 ,同时加到两个相位选择信号上: 这样两路的相位差 保持恒定,而绝对相位随机游走。采样时刻变为
- 增量式累积 + 模回绕(modulo rollover):相位旋转器只有 50 个可选相位,于是把 的累加拆成 个 周期逐周期完成,超过阈值就取模。这样在有限相位资源上实现了**"无限相位噪声累积"**(等价于相位随时间无界漂移)。
3.3 为什么要"无毛刺"相位切换
相位切换若发生在时钟边沿附近,会产生毛刺(glitch),在采样时钟上引入错误边沿。Intel 用一个**无毛刺相位切换 MUX(glitch-free PSMUX)**解决:只在两个候选时钟边沿之外的时刻切换。

3.4 效果与边界
- 效果:在"系统时钟与噪声同步"的恶劣条件下,打开相位噪声累积后, 噪声源的功率谱被正确恢复(与不相干参考时钟的结果误差 )。
- 边界(重要!):打散能力受相位旋转器分辨率 ()限制,对高于约 的时钟同步噪声无效;但这远超 PDN 带宽(几百 MHz),因此足以覆盖整个 PDN 带宽。
3.5 注意事项 / trade-off
- ✅ 纯数字标准单元实现,面积/功耗极小,可多位置布点。
- ✅ 无需独立干净的参考时钟。
- ⚠️ 需要相位旋转器的预校准(确定 )。
- ⚠️ 相位差 在整个平均过程中必须保持恒定,否则相关性计算失真。
- 🔁 trade-off:数字复刻 vs. 模拟自由振荡 VCO——前者省掉了独立振荡器/干净电源,代价是"打散带宽"被 封顶。
4. 方法二:PRBS 非均匀采样时钟(UESTC, ISSCC 2020 / JSSC 2022)
P. Zhai et al., "A Scalable 20GHz On-Die Power-Supply Noise Analyzer with Compressed Sensing," IEEE ISSCC 2020, paper 25.4. P. Zhai et al., "An On-Chip Power-Supply Noise Analyzer With Compressed Sensing and Enhanced Quantization," IEEE JSSC, vol. 57, no. 1, Jan. 2022.
4.1 核心思想
把"非相干"从"相位噪声累积"推进到非均匀采样(Non-Uniform Sampling, NUS):用两路 PRBS 同时干两件事——
- 采样时刻随机化:让采样时钟相对时钟同步噪声随机化(免疫时钟同步噪声);
- NUS 压缩感知:把 的均匀步进调制成随机步进,构成随机传感矩阵(与 DFT 基天然不相干),从而用压缩感知大幅缩短测量时间。

4.2 40 相时钟发生器:两级开环相位插值(免校准)
2022 方案要在片内、只凭一个外部参考,稳定造出间隔 的 40 个相位,且免校准。它用**两级开环相位插值(PI)**完成,核心技巧是"延迟补偿"。
为什么不能直接插值:若拿原始 差分时钟直接插值,插值器要跨越 (半个周期)去插入中间相位,翻转变慢、输出时钟偏斜(skew)很大,插不出精确的 。
延迟补偿怎么做:在差分 之后先串一组延迟单元,把待插值的相位差压到 ;每个 PI 单元再通过控制尾电流源的分配比(division ratio of tail current sources)在相邻两相之间插值;插值结果用相应级数的延迟单元补偿回来。文中严格证明:只要延迟单元彼此一致,它们的绝对延迟、以及 PI 单元自身的延迟,都不影响插值精度——这就是它能免校准的理论依据。

两级分解:
- 粗插值(CPI):对延迟补偿后的相位插值,产生 10 个间隔 的时钟;
- 细插值(FPI):把 直接细分成 4 份,得到 间隔。共 10 个 PI 阵列 × 每阵列 4 个 PI 单元 = 40 相。
免校准的代价: 失配怎么处理:延迟单元 / PI 单元的失配不可避免,会让 非均匀 → 的分布非线性 → 频谱失真。文中仿真分析(Fig. 9)给出结论:均匀采样时刻时失真明显;但只要采样时刻被随机化,每个 就会"看到"不同的 ,再经大量样本(如 400 点)平均,失配失真被抹平。所以"随机化"不只是用来免疫时钟同步噪声,也是免校准方案能成立的另一半前提。
4.3 时钟控制:共模 PRBS 随机化 + 独立 NUS 控制
时钟控制要同时满足三条硬性要求:① 采样时刻随机化(免疫时钟同步噪声 + 吸收 失配);② 两路之间的时延 要非均匀(NUS,供压缩感知);③ 平均点数 可配(精度-速度权衡)。整个控制器是一个有限状态机(FSM)。


T 路:只做随机化。 用一个 **2-bit PRBS()**叠加在上一次的选择值上、对 40 取模:
即采样相位每次随机跳 个 ,实现采样时刻随机化。
τ 路:同一条 + 一条独立 。 这里有个很优雅的设计:τ 路的采样相位也叠加同一条 ,再叠加一个由**独立 (4-bit)**累积得到的偏移 :
于是两路相位差
因为 是"共模"的,它在差值里自动抵消: 只管把两路采样时刻一起随机化(免疫时钟同步噪声),完全不扰动 ;而 只由 决定, 又由独立的 给出非均匀步进,正好构成压缩感知所需的随机传感矩阵。一个机制、两个目的、互不干扰——这是相对 2015 方案最关键的简化(2015 必须专门用增量累加 + 模回绕来维持 )。
一个时序细节:当 超过一次采样持续时长时,两路的随机化必须用同一条 独立触发,否则会出时序错误——上面"共模"结构正好保证了这一点。

4.4 关键公式
量化器方差与本底(并行量化 个切片时):
其中 为量化结果均值, 为 VCO 增益, 为量化时间窗, 为并行切片数, 为平均点数。可见提升 、、、 都能降本底,但 受带宽限制、 影响测量时间。
压缩感知的两条前提——稀疏性 + 不相干性(incoherence):
越小(越不相干),越少测量点即可无失真恢复。随机矩阵与任意固定基(含 IDFT)天然不相干——这就是用 PRBS 产生随机采样时钟的根本理由。
测量点数与测量时间:
为压缩比(可配 1/2/4/8)。 越大、 越高,测量越快。
4.5 注意事项 / trade-off
- ⚠️ 相位间隔失配:靠"随机化 + 平均"抑制,因此随机化不是可选项而是必需项。
- ⚠️ PRBS 序列同步:T 路与 τ 路必须用同序列触发,否则 漂移。
- ⚠️ 时钟发生器是功耗大头(约占整机 52%),面积也主要来自它。
- 🔁 trade-off:压缩比 越高越快,但本底会退化(实测 时本底饱和在 ,主要由电路噪声决定);平均点数 是精度-速度的基本权衡。
- ✅ 只用一个外部时钟参考,免校准,适合 in-situ。
4.6 与 2015 方案的系统级对比:优化点与 trade-off
2022 方案与 2015 方案解决的是同一个问题(在片内、非相干地测 PSN 频谱),但系统实现路线截然不同。先看逐维度对比:
| 维度 | Intel JSSC 2015 | UESTC JSSC 2022 |
|---|---|---|
| 统计量 | 自相关 | 自协方差(去直流 + 抑制量化器自杂散) |
| 量化器 | 1-bit VCO 型 ADC | 6 电平 VCO 相位量化器 |
| 量化器 | ||
| 低(1-bit 边沿检测) | ||
| 并行 | 单路 | 8 切片并行量化 |
| 采样率 | (MHz 级) | |
| 非相干手段 | 数字随机相位噪声累积(PRBS + 增量累加器,数字复刻自由振荡 VCO) | 共模 PRBS 采样时刻随机化 + 独立 PRBS_CS 做 NUS |
| 时基 / 时钟发生 | 64 相延迟线 + 相位旋转器 | 40 相两级开环相位插值(CPI+FPI,延迟补偿) |
| 校准 | 需相位旋转器预校准 | 免校准 |
| 压缩感知 | 无 | 有(NUS), |
| 重建 | 直接平均 | 片外凸优化(MATLAB)+ DFT |
| 测量时间 | 小时级(每样本 次平均) | 亚秒级(同本底 vs ) |
| 精度 / 本底 | 分辨率 | |
| 功耗 / 面积 | 数百逻辑门,可忽略 | ,时钟发生器占 52%, |
它相对 2015 具体优化了什么(逐条):
- 量化器:1-bit → 6 电平。2015 用 1-bit VCO 型 ADC 检测边沿, 且 受限;2022 用 6 个比较器把振荡周期分成 6 个区、读出相位差(0~5), 提到 , 做到 (较传统量化器约 6 倍),直接压低量化误差( 公式的分母里含 )。
- 并行化:单路 → 8 切片。利用各切片 VCO 相位噪声不相关,把等效平均点数放大 倍 → 本底下降。
- 采样率: → ,配合上两条,单位时间积累的平均点数大增。
- 压缩感知:无 → 有。2015 靠纯平均、每样本要 次累积,测一次要几十分钟到几小时;2022 利用 PSN 稀疏性 + NUS 随机采样, 最高 8,把同精度下的测量时间压到亚秒级。
- 自协方差取代自相关:去直流、并抑制量化器自身的周期性杂散( 不变时它们等效为直流被消掉),进一步压本底。
- 时钟发生器免校准:2015 要预校准相位旋转器的单位延迟;2022 用延迟补偿的两级开环插值,"延迟单元一致则绝对延迟无关",片上直接生成、免校准。
- 非相干机制更"轻"且不扰动 :2015 的相位噪声累积要精心维持 (增量累加 + 模回绕);2022 用"共模 PRBS",在 的差值里自动抵消——随机化与 设定解耦,还能顺手吸收 失配。
代价与 trade-off(每条优化都不是免费的):
| 优化 | 收益 | 代价 |
|---|---|---|
| 6 电平量化 | 、精度 | 需 6 个比较器 + 6-bit 加法器,面积 / 功耗 |
| 8 切片并行 | 本底 | 8 倍量化器面积 / 功耗 |
| 高 / 大 | 精度 | 反向限制带宽(带宽-精度基本权衡) |
| 压缩感知(NUS) | 速度快数量级 | ① 本底退化();② 需片外凸优化重建,不再是简单平均 |
| 免校准 40 相插值 | 无需外部校准 | 时钟发生器占整机功耗 52%、面积主导 |
| 单一 参考 | 便于 in-situ | 高 对 PVT 更敏感 |
一句话总结:2015 的核心是"用尽量少的数字逻辑把时钟漂白成非相干,再靠海量平均换精度"——省电、省面积,但慢;2022 的核心是"把量化、并行、压缩感知三条腿一起加速"——快且准,代价是时钟发生器与量化器阵列的功耗/面积,以及片外重建的复杂度。二者是"慢而省"与"快而费"的典型取舍。
5. 信号链:VCO 型量化器与多切片并行
非相干时钟解决了"何时采样",量化器决定"采得准不准"。
5.1 六电平 VCO 相位量化器(相对 2015 的 1-bit ADC)
传统做法为什么受限。 传统 VCO 量化器用 DFF 去采样各相位电平、检测边沿。DFF 的建立/保持时间较长,限制了可检测的最高振荡频率 ;一旦 内出现多于一个边沿,检测就会出错。结论是 —— 上不去, 就上不去,量化精度也就受限(这正是 2015 方案要用海量平均来补偿的原因)。
2022 的做法:6 个比较器做相位量化。 不用 DFF 采样电平,而用 6 个电压比较器两两比较相邻相位的信号,把一个完整振荡周期分成 6 个"相位区"。在一个 内读出起始与结束的区号,就能算出相位差。例如起始落在区 "100"、结束落在区 "010",相位差为 4 → 量化结果 ; 取 0~5 共 6 个电平。于是
较传统量化器显著提高,从而允许更高的 (实测 )。
比较器的细节:电压比较由一个 preamp-and-latch 级完成,带正反馈增强的再生(positive-feedback enhanced regeneration);DFF 只用来"再采样"比较结果,回避了建立/保持时间的约束。因此亚稳态更低、 提升约 6×,量化器可跑到 (而早期设计只有 )。

5.2 多切片并行量化降本底

由于各切片 VCO 的相位噪声不相关,其初始相位随机独立:
即方差(本底的主要来源)随切片数 下降。该方法以 的本底、 的测量时间达到当时最优。

6. 对比、注意事项与 trade-off
6.1 三种"非相干时钟"方案对比
| 维度 | 数字随机相位噪声累积 (Intel JSSC 2015) |
PRBS 非均匀采样时钟 (UESTC ISSCC 2020 / JSSC 2022) |
自由振荡 VCO (Alon 2005/2009,基线) |
|---|---|---|---|
| 时钟来源 | 片内系统时钟 | 单个 外部参考 | 独立自由振荡 VCO |
| 非相干手段 | PRBS+累加器把相位随机游走化 | 采样时刻随机化 + NUS 随机步进 | 天然异步(不锁相) |
| 是否支持压缩感知 | 否 | 是(随机传感矩阵) | 否 |
| 免校准 | 否(需相位旋转器预校准) | 是(延迟补偿两级插值) | — |
| 相位资源 | 64 相延迟线() | 40 相两级插值() | 连续相位 |
| 主要代价 | 打散带宽受 封顶 | 时钟发生器功耗 ~52% | 需干净电源/独立时钟 |
| 代表指标 | 20 GHz BW,1 mV 分辨率 | 20 GHz BW,2 MHz 分辨率, | — |
6.2 实现注意事项清单(Checklist)
- 相位间隔 失配:不可避免 → 用"采样时刻随机化 + 大样本平均"抑制,所以随机化是刚需。
- 时钟同步噪声免疫:只要噪声与时钟同频/同相,就必须随机化采样时刻。
- 恒定:T 路与 τ 路的随机化必须用同序列、且 在平均过程中保持不变。
- 打散带宽 vs PDN 带宽:相位打散带宽要覆盖 PDN 带宽(几百 MHz), 太小/太大都不行。
- 采样时钟抖动:PDN 带宽低(几百 MHz)时,采样时钟抖动带来的失真可忽略——这是能简化时钟设计的前提。
- 、、、:是精度、速度、功耗、面积的四向权衡旋钮。
- 压缩感知的代价: 越高越快,但本底退化;且需要外部做凸优化重建。
6.3 反向对照:把时钟"相干化"来抑制噪声
同一枚硬币的另一面是注入锁定(Injection-Locked Oscillator, ILO):让主 VCO 与从 ILO 锁定到同一频率,可在系统级抵消电源噪声(VCO 型 ADC 的 PSNR 改善 )。它把时钟相干化以抑制噪声——与 PSN 监测里"把时钟非相干化以测量噪声"正好相反,二者共同说明:时钟与噪声之间的相干性,是片上电源噪声电路设计的核心控制变量。
7. 总结
2015 年之后,PSN(电源纹波)监测中"非相干采样时钟"的产生方法形成一条清晰主线:
- 数字随机相位噪声累积(Intel 2015)——用 PRBS 驱动的相位累加器,在数字域复刻自由振荡 VCO 的相位噪声,把与噪声相关的系统时钟"漂白"成非相干采样时钟;核心是无毛刺相位切换 + 增量式无限累积。
- PRBS 非均匀采样(NUS)时钟(UESTC 2020/2022)——用两路 PRBS 同时实现"采样时刻随机化"与"压缩感知随机步进",只需一个外部参考、免校准,把测量时间从小时级压到亚秒级。
- 二者的共同基线是自由振荡 VCO 的天然非相干性;注入锁定则从反方向印证了相干性这一核心矛盾。
设计者落地时的取舍始终是:在"只用片内/单一时钟"与"获得真正非相干采样"之间,用多少数字开销去换取多少相位随机性。
参考文献
- T.-C. Hsueh, F. O'Mahony, M. Mansuri, and B. Casper, "An On-Die All-Digital Power Supply Noise Analyzer With Enhanced Spectrum Measurements," IEEE J. Solid-State Circuits, vol. 50, no. 7, pp. 1711–1721, Jul. 2015.
- P. Zhai, X. Zhou, Y. Cai, Z. Zhu, F. Zhang, and Q. Li, "A Scalable 20 GHz On-Die Power-Supply Noise Analyzer with Compressed Sensing," IEEE ISSCC Dig. Tech. Papers, paper 25.4, Feb. 2020.
- P. Zhai, Z. Zhu, X. Zhou, Y. Cai, F. Zhang, and Q. Li, "An On-Chip Power-Supply Noise Analyzer With Compressed Sensing and Enhanced Quantization," IEEE J. Solid-State Circuits, vol. 57, no. 1, Jan. 2022.
- P. Zhai et al., "A Multi-Slice VCO-based Quantizer for On-Chip Power Supply Noise Analysis Achieving Noise Floor," IEEE ASSCC, Nov. 2019.
- E. Alon, V. Stojanovic, and M. Horowitz, "Circuits and Techniques for High-Resolution Measurement of On-Chip Power Supply Noise," IEEE J. Solid-State Circuits, vol. 40, no. 4, pp. 820–828, Apr. 2005.
- E. Alon, V. Abramzon, B. Nezamfar, and M. Horowitz, "On-Die Power Supply Noise Measurement Techniques," IEEE Trans. Adv. Packag., vol. 32, no. 2, pp. 248–259, May 2009.
- K. M. Al-Tamimi, K. El-Sankary, and Y. Fouzar, "VCO-Based ADC With Built-In Supply Noise Immunity Using Injection-Locked Ring Oscillators," IEEE Trans. Circuits Syst. II, vol. 66, no. 7, Jul. 2019.