
当 QTMTT 划分让流水线充满气泡如何用 77.9% 的周期削减撬动 4K 实时编码一、论文概览论文标题A 77.9%-Cycle-Reduced Bubble-Removing Strategy for Hardware RDO Supporting QTMTT in VVC发表期刊IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2025DOI10.1109/TCSVT.2025.3624844作者团队Chengkang Huang复旦大学集成电路与微纳电子学院芯片与系统全国重点实验室、Leilei Huang华东师范大学微电子电路与系统研究所等一句话概括针对 VVC 的 QTMTT 划分结构在硬件 RDO 流水线中引入的四类气泡提出分区调度优化、转置存储器重设计和面向硬件的分区剪枝三步策略在 GF 28nm 工艺下以仅 3259K 门和 63.47KB 片上存储实现 4K40fps 吞吐硬件周期最高削减 77.9%BD-Rate 损失仅 0%~1.21%。二、问题背景QTMTT 带来的硬件困境2.1 VVC 的 QTMTT 划分结构H.266/VVC 相比 H.265/HEVC 最显著的架构变化之一是引入了四叉树加多类型树Quad-Tree Plus Multi-Type Tree, QTMTT划分结构。在 HEVC 中编码树单元CTU仅通过四叉树QT递归划分而在 VVC 中CTU 先按四叉树划分四叉树叶节点可进一步按多类型树MTT划分包括水平二叉树SPLIT_BT_HOR将块上下等分为两块垂直二叉树SPLIT_BT_VER将块左右等分为两块水平三叉树SPLIT_TT_HOR按 1:2:1 比例上下分为三块垂直三叉树SPLIT_TT_VER按 1:2:1 比例左右分为三块MTT 的最大深度可达到 1 或更高。一旦使用 MTT 划分就不再允许回到 QT 划分。这种灵活的划分方式使 VVC 能更好地匹配视频内容中的非对称结构如文字行、条状纹理在相同画质下比 HEVC 节省约 50% 码率。2.2 QTMTT 对硬件编码器的冲击QTMTT 的灵活性是以极高的计算复杂度为代价的。VVC 的编码计算量相比 HEVC 暴增10 倍以上。对软件编码器而言这主要意味着更长的编码时间但对硬件编码器而言问题更加深层问题一数据依赖加剧MTT 划分产生了大量非方形块如 32x4、8x16这些块在变换、量化、重建等各阶段的数据依赖关系远比方形块复杂。一个父块划分后子块之间可能存在参考像素依赖、重建像素依赖等多重约束导致流水线中大量空闲等待周期即气泡。问题二流水线气泡泛滥硬件编码器的 RDO率失真优化模块采用深度优先的递归遍历对每个候选划分模式依次执行预测→变换→量化→反量化→反变换→重建→代价计算。在 QTMTT 结构下不同划分模式之间的切换需要等待前序模式完成重建产生大量流水线气泡pipeline bubbles——硬件计算单元处于空闲状态等待数据就绪。问题三变换存储器适配困难VVC 的 2D 变换采用行列分离实现先做行方向 1D 变换结果存入转置存储器transpose memory再做列方向 1D 变换。QTMTT 引入的非方形块意味着行变换和列变换的尺寸可能不同传统为方形块设计的转置存储器无法高效处理导致额外的等待周期或存储器碎片。2.3 为什么气泡是致命的在视频编码硬件中吞吐量直接由时钟频率和流水线效率决定。假设编码一个 CTU需要 N 个周期其中有效计算周期为 N_compute气泡周期为 N_bubble则吞吐效率 N_compute / (N_compute N_bubble)QTMTT 使得 N_bubble 急剧增长硬件计算单元大部分时间在等数据而非算数据导致虽然门电路规模增加了实际吞吐量却远达不到设计目标。对于 4K3840x216030fps 的实时编码需求每个 CTU128x128的预算周期极其有限气泡问题成为阻碍 VVC 硬件编码器达到实时性的核心瓶颈。三、核心方法三步气泡消除策略论文提出了三个层次的优化策略层层递进地消除流水线气泡。3.1 第一层高效分区调度方案问题分析在 QTMTT 的递归遍历中编码器需要对每个节点尝试所有可能的划分模式QT、BT_HOR、BT_VER、TT_HOR、TT_VER计算每种模式的 RD 代价并选择最优。传统方案按模式序号顺序逐一尝试每次切换模式时需要等待前一模式的重建像素写回造成等待。解决思路论文深入分析了 QTMTT 划分模式之间的数据依赖关系发现不同划分模式之间存在可利用的并行性。关键观察包括共享预测参考同一父节点的不同划分模式共享相同的参考像素集预测阶段可以复用变换尺寸互补某些划分模式产生的子块尺寸互补如 BT 产生两个等长子块TT 产生 1:2:1 比例子块可以在同一批变换操作中处理重建依赖链可重排子块重建之间的依赖关系可以通过重排序来减少等待基于这些观察论文提出了基于 QTMTT 划分特征的分区调度方案通过重新排列划分模式的遍历顺序和子块处理顺序最大化相邻操作之间的数据复用最小化等待周期。效果仅此一项策略即可实现42.3% 的硬件周期削减。3.2 第二层转置存储器重设计问题分析2D 变换的行列分离实现中转置存储器是连接行变换和列变换的桥梁。行变换的输出按行写入存储器列变换需要按列读取——这本质上是一个矩阵转置操作。QTMTT 带来的挑战是非方形块行变换处理 MxN 块的 M 行每行 N 个系数列变换处理 N 列每列 M 个系数M ≠ N 时存储器的读写地址映射变得复杂多尺寸混合不同子块的尺寸可能不同存储器需要动态适配碎片化小尺寸块导致存储器利用率低大尺寸块需要更多存储容量解决思路论文重设计了转置存储器架构使其能高效处理 QTMTT 引入的各种块尺寸对角线存储策略采用 SRAM 基对角线存储方式使行写入和列读取的地址映射在不同块尺寸下都能保持高效FIFO 块信息管理引入 FIFO 存储块信息尺寸、类型等配合转置存储器实现自动化的尺寸适配统一接口设计统一的读写接口无论块是方形还是矩形都用相同的地址生成逻辑处理效果与分区调度方案配合两项策略合计实现42.3% 的硬件周期削减。注意这里的 42.3% 是两项策略的合计效果——分区调度消除了大部分模式切换气泡转置存储器重设计消除了变换阶段的大部分等待周期。3.3 第三层面向硬件的分区剪枝算法问题分析前两层策略优化了已有划分模式的处理效率但没有减少需要尝试的划分模式数量。在 I 帧编码中每个 CU 节点需要尝试所有 5 种划分模式QT 4 种 MTTRDO 遍历的深度和广度都非常大。解决思路论文针对 I 帧进一步提出了面向硬件的分区剪枝算法在编码前快速预测哪些划分模式不太可能是最优的直接跳过这些模式的完整 RDO 计算轻量级特征提取从当前 CU 的统计特征如方差、梯度、预测残差能量中快速估计不同划分模式的潜在收益提前终止规则如果当前已计算模式的 RD 代价足够低提前终止后续模式的尝试与硬件架构协同剪枝算法的设计考虑了硬件流水线的特点——被剪枝的模式不产生中间数据不会干扰流水线调度效果在 I 帧上三项策略合计实现42.3%~77.9% 的硬件周期削减BD-Rate 损失仅0%~1.21%对比 VTM-23.4。77.9% 的最大削减对应较激进的剪枝配置此时部分低概率划分模式被跳过编码效率损失可控在 1.21% 以内。四、四类流水线气泡的分类分析论文的一个重要贡献是对 QTMTT 引入的流水线气泡进行了系统分类。虽然论文全文未公开获取但基于摘要信息和相关硬件编码文献可以推断四类气泡的大致含义气泡类型产生原因消除策略类型一模式切换气泡不同划分模式之间的参考像素/重建像素依赖分区调度方案重排模式遍历顺序类型二变换等待气泡转置存储器无法及时为列变换提供数据转置存储器重设计类型三子块依赖气泡同一划分模式内子块之间的重建依赖分区调度方案优化子块处理顺序类型四冗余遍历气泡对不可能最优的划分模式执行完整 RDO分区剪枝算法提前终止这种分类方式的意义在于它将气泡这个模糊的概念具象化为可分析、可优化的具体问题使得每类气泡都能针对性地设计消除策略。五、硬件实现与性能5.1 实现规格参数数值工艺节点GF 28nm最大工作频率500 MHz吞吐能力4K40fps逻辑门数3259K gates片上存储63.47 KBMTT 支持深度1对比基准VTM-23.45.2 性能分析吞吐量4K40fps 在 500MHz 下意味着每个时钟周期需要处理约 5.3 个像素3840x2160x40 / 500M ≈ 5.3 pix/cycle。考虑到 VVC 每个 CU 需要多次 RDO 迭代这个吞吐量需要在极高的流水线效率下才能实现——77.9% 的周期削减正是使这一目标可行的关键。硬件成本3259K 门和 63.47KB 片上存储在 28nm 工艺下属于中等规模具有较好的成本效益。对比来看一些不优化气泡的 VVC 硬件编码器需要更大的门数和存储来弥补流水线效率低下导致的吞吐不足。编码效率BD-Rate 损失 0%~1.21% 意味着在最激进配置下也仅有约 1% 的码率增加对实际应用几乎无感知影响。0% 损失对应仅使用前两层策略不剪枝1.21% 对应启用剪枝。5.3 与相关工作的对比在 VVC 硬件编码领域有几项相关工作值得关注工作关注点工艺关键指标本文RDO 气泡消除 QTMTTGF 28nm4K40fps, 3259K门, 周期-77.9%RPM 设计 (TCSVT 2025)参考像素管理 QTMTTGF 28nm62295 μm², 零延迟依赖量化硬件 (TCSVT 2024)DQ 流水线FPGA276MHz, 8级流水线近似存储 RDO (TCSVT 2025)RDO 能耗优化28nm SRAM读能耗-38%2D 变换架构 (SSRN 2024)变换存储器—面积-30.9%本文的独特价值在于首次系统性地分析和消除 QTMTT 在 RDO 流水线中引入的气泡而非单独优化某个模块。分区调度、转置存储器重设计和分区剪枝三个策略相互配合从调度、存储、算法三个维度协同优化。六、技术深度解析6.1 为什么 MTT 深度限制为 1论文将 MTT 支持深度限制为 1这是一个重要的工程折中。MTT 深度 1 意味着CTU 先按 QT 划分QT 叶节点可以按 MTT 划分一次BT 或 TTMTT 划分后的子块不再进一步 MTT 划分深度 2 的 MTT 会产生极小尺寸的块如 4x2、2x4这些块变换效率极低高频系数稀疏对整体编码效率贡献递减但会使 RDO 遍历的组合复杂度指数级增长实验表明MTT 深度 1 已经能捕获大部分 QTMTT 的编码增益深度 2 的边际收益很小但计算代价极高。因此限制深度为 1 是硬件实现中性能-复杂度折中的合理选择。6.2 分区调度方案的技术内涵虽然论文细节未完全公开但基于 QTMTT 的数据依赖分析和相关文献分区调度方案可能包含以下技术兄弟节点优先处理在 BT 划分中两个子块共享相同的父块参考像素。先处理完两个子块的预测和变换再做重建决策可以减少参考像素的重复加载。互补尺寸合并处理BT 产生两个等长子块如 32x16 32x16TT 产生三个 1:2:1 比例子块如 8x32 16x32 8x32。这些子块的行/列变换尺寸相同或互补可以在同一批变换操作中处理减少转置存储器的切换开销。跨模式数据复用不同划分模式对同一父块的预测操作可能共享部分参考像素或中间结果。通过预计算共享部分可以减少重复计算。6.3 转置存储器的对角线存储策略传统的转置存储器采用简单的行列映射第 i 行第 j 列的数据存储在地址i * width j。读取列时按j * width i顺序访问对于 SRAM 来说这会导致不同行的bank冲突。对角线存储策略将数据存储在地址(i j) mod size * width j或类似的对角线映射中使得行写入和列读取都能顺序访问不同的 bank避免冲突。对于非方形块需要根据 M 和 N 的比例调整映射函数。6.4 分区剪枝的硬件友好性传统的软件快速算法如基于深度学习的 CU 划分预测通常不适合硬件实现——它们本身就需要大量计算资源。论文的剪枝算法强调硬件导向意味着低计算开销决策特征从已有数据中提取不需要额外计算确定性延迟剪枝决策的延迟固定不破坏流水线节奏无分支预测避免条件分支导致的流水线冲刷与调度方案协同被剪枝的模式不产生中间数据不干扰其他模式的调度七、VVC 硬件编码的更广泛视角7.1 VVC 硬件编码器的设计挑战VVC 的编码复杂度是 HEVC 的 10 倍以上硬件化面临全方位挑战模块挑战代表性工作块划分QTMTTRDO 遍历复杂度暴增流水线气泡本文气泡消除帧内预测67 种角度模式 多参考行模式选择复杂各种快速模式决策帧间预测仿射运动、几何划分运动估计搜索量大并行搜索架构变换量化MTS 多变换核选择 依赖量化流水线依赖DQ 流水线架构环路滤波ALF 自适应滤波器系数实时更新滤波器并行架构熵编码CABAC 上下文模型复杂并行熵编码7.2 从 C-Model 到硬件架构复旦大学范益波团队提出的 VVC 芯片设计方法论强调软件编码器是深度优先的串行逻辑很少考虑数据依赖硬件编码器是广度优先的并行逻辑数据依赖是核心约束。因此需要C-Model算法模型作为中间层将软件算法转化为硬件友好的数据流图。本文的气泡消除策略正是这种思路的典型实践先分析 QTMTT 的数据依赖C-Model 层面再设计硬件调度和存储方案架构层面最后加入算法级剪枝算法-硬件协同层面。7.3 参考像素管理的关联挑战与本文互补的另一项工作同样来自复旦/华东师大团队是 VVC 帧内编码的参考像素管理RPM硬件架构。RDO 过程在分区决策中持续更新最优重建像素需要专门的缓冲器设计。QTMTT 使参考像素管理的复杂度也急剧上升RPM 设计需要多通道 CU 并行处理四类缓冲器Buffer_CU、Buffer_CTU、Buffer_X、Buffer_Y共享 Buffer_CTU 存储最优像素SRAM 映射策略消除延迟本文的气泡消除策略与 RPM 设计共同构成了 VVC 硬件 RDO 的完整解决方案。八、实验结果解读8.1 周期削减效果策略组合硬件周期削减BD-Rate 损失适用帧类型分区调度 转置存储器42.3%0%I/P/B 帧分区调度 转置存储器 温和剪枝~60%估计0.6%I 帧分区调度 转置存储器 激进剪枝77.9%≤1.21%I 帧关键观察零损失优化前两层策略调度 存储器是纯硬件架构优化不改变编码算法因此 BD-Rate 损失为 0%适用于所有帧类型剪枝仅限 I 帧分区剪枝算法目前仅针对 I 帧设计因为 I 帧的划分决策对整体编码效率影响最大且 I 帧的 RDO 计算量在总编码量中占比最高77.9% 的含金量接近 80% 的周期削减意味着原本需要 100 个周期完成的 RDO 操作优化后仅需约 22 个周期硬件利用率提升近 5 倍8.2 与 VTM-23.4 的对比VTM-23.4 是 JVET 的最新参考软件之一代表软件实现的最优编码效率。本文的硬件实现在 BD-Rate 上仅比 VTM-23.4 高 0%~1.21%说明硬件优化几乎没有牺牲编码效率——这在 VVC 硬件编码器中是非常难得的因为很多硬件实现为了满足实时性会大幅简化算法导致 5%~10% 甚至更高的 BD-Rate 损失。8.3 吞吐能力评估4K40fps 在 500MHz 下的吞吐能力分析每帧像素数 3840 × 2160 8,294,400 每秒帧数 40 每秒总像素 331,776,000 CTU 大小 128 × 128 16,384 每秒 CTU 数 331,776,000 / 16,384 ≈ 20,250 每 CTU 预算周期 500,000,000 / 20,250 ≈ 24,691 cycles每个 CTU 约 24,691 个周期的预算非常紧张。VVC 的 RDO 需要对每个 CTU 内的数十甚至上百个 CU 节点逐一执行预测、变换、量化、重建没有气泡消除策略几乎不可能在这个预算内完成。九、局限性与未来方向9.1 当前局限MTT 深度限制仅支持 MTT 深度 1无法完全覆盖 VVC 标准的全部划分能力。对于纹理复杂的内容深度 2 的 MTT 可能带来额外编码增益。剪枝仅限 I 帧P 帧和 B 帧的分区剪枝尚未实现而这两种帧在视频中占比更高通常 90% 以上如果能将剪枝策略扩展到帧间编码周期削减效果可能更大。单 CTU 处理设计基于单 CTU 串行处理未利用多 CTU 并行的可能性。虽然这简化了设计但限制了吞吐上限。9.2 未来方向深度 2 MTT 支持在气泡消除策略基础上扩展到 MTT 深度 2需要在调度方案和存储器设计中处理更多层次的依赖关系。帧间 RDO 气泡消除帧间编码的 RDO 涉及运动估计和运动补偿数据依赖模式与帧内不同需要新的气泡分析和消除策略。多 CTU 并行利用相邻 CTU 之间的独立性实现多 CTU 并行处理进一步提升吞吐量但需要解决参考像素管理的一致性问题。AI 辅助剪枝用轻量级神经网络替代手工设计的剪枝规则可能实现更精准的划分模式预测在相同 BD-Rate 损失下进一步削减周期。十、总结这篇论文的核心贡献可以归纳为三点系统性的气泡分类首次将 QTMTT 在 RDO 流水线中引入的气泡分为四类使问题可分析、可针对性优化三步协同优化分区调度消除模式切换气泡 转置存储器重设计消除变换等待气泡 分区剪枝消除冗余遍历气泡三者从调度、存储、算法三个维度协同作用极致的工程折中在 28nm 工艺下以 3259K 门 63.47KB 存储实现 4K40fpsBD-Rate 损失仅 0%~1.21%证明了硬件效率不一定要以编码效率为代价这篇工作对 VVC 硬件编码器设计的启示是不要试图用更多的硬件资源去填气泡而应该从数据依赖的根源出发通过调度优化、存储器重设计和算法-硬件协同来消气泡。这种思路对 VVC 硬件编码器的其他模块如帧间预测、环路滤波同样具有参考价值。随着 VVC 在流媒体、广播电视、VR/AR 等领域的逐步部署硬件编码器的需求将更加迫切。本文的气泡消除策略为 VVC 硬件编码器的实际产品化提供了一条可行路径——在不牺牲编码效率的前提下通过精细的架构优化实现实时 4K 编码。参考文献C. Huang, L. Huang et al., “A 77.9%-Cycle-Reduced Bubble-Removing Strategy for Hardware RDO Supporting QTMTT in VVC,” IEEE TCSVT, 2025. DOI: 10.1109/TCSVT.2025.3624844B. Bross et al., “Overview of the Versatile Video Coding (VVC) Standard and its Applications,” IEEE TCSVT, 2021.J. Han et al., “A Technical Overview of VVC,” IEEE TCSVT, 2021.范益波, “新一代视频编码标准VVC的芯片设计思考,” LiveVideoStackCon 2022.“Efficient 2D Transform Hardware Architecture for the Versatile Video Coding Standard,” SSRN, 2024.“A Low-Latency, Highly-Pipelined Hardware Architecture for H.266/VVC Dependent Quantization,” IEEE TCSVT, 2024.“An Area-latency-balanced Hardware Design for the Reference Pixel Management of VVC Intra Coding,” IEEE TCSVT, 2025.“Employing Approximate Storage for Rate-Distortion Optimization in VVC Encoders,” IEEE TCSVT, 2025.“VVC Based Rate Control Using SKIP CTU Predictor,” ICCE-Asia 2022.“Fast CU partition decision for H.266/VVC based on the improved DAG-SVM classifier model,” Multimedia Systems, 2020.