VVC (H.266) 视频编解码标准最新研究进展:2025-2026 前沿论文与标准提案介绍

📅 2026/8/5 21:45:44
VVC (H.266) 视频编解码标准最新研究进展:2025-2026 前沿论文与标准提案介绍
本文系统梳理了 2025-2026 年间 VVC (H.266/Versatile Video Coding) 视频编解码标准在帧内预测、帧间编码、环路滤波、硬件加速、码率控制以及 Beyond VVC 等方向的最新论文与标准化提案结合 VVC 核心技术背景分析编解码效率提升与复杂度优化之间的技术博弈并展望下一代视频编码标准的演进趋势。一、引言为什么 VVC 仍是视频编码研究的焦点视频数据已占全球互联网流量的 82% 以上。从 2003 年的 H.264/AVC到 2013 年的 H.265/HEVC再到 2020 年正式发布的 H.266/VVC每一代标准都在相同主观质量下实现约 50% 的码率节省。VVC 由 ITU-T VCEG 与 ISO/IEC MPEG 的联合视频专家组 (JVET) 共同制定目标应用涵盖 4K/8K 超高清广播、VR/AR 沉浸式媒体、屏幕内容编码 (SCC)、低延迟直播流媒体等广泛场景。然而VVC 在编码效率上的巨大飞跃以指数级增长的编码复杂度为代价——其参考软件 VTM 在 All-Intra 模式下的编码复杂度约为 HEVC 的18 倍其中 QTMT (四叉树加多类型树) CU 划分占据了编码总时间的97% 以上。这一核心矛盾驱动了学术界和工业界在 2025-2026 年间持续围绕 VVC 的快速算法、硬件加速、AI 增强等方向展开密集研究。与此同时JVET 并未止步于 VVC 标准的完成。自 2021 年起JVET 启动了 Beyond VVC 探索工作建立了增强压缩模型 (ECM) 和神经网络视频编码 (NNVC) 两条并行技术路线并在 2025 年发布了超越 VVC 能力的证据征集 (Call for Evidence, CfE)。下一代标准 (暂称 H.267) 预计将于 2028 年底完成中国企业如字节跳动、腾讯、华为等在 ECM 和 NNVC 的专利贡献中占据主导地位。本文将从以下六个方向对 2025-2026 年间的 VVC 相关论文和标准提案进行全面深度分析帧内预测与划分优化帧间编码与运动估计优化环路滤波与质量增强硬件加速与复杂度优化码率控制与流媒体应用Beyond VVC 与前沿综述二、VVC 核心技术背景在深入分析最新论文之前有必要回顾 VVC 的核心技术特性这些特性正是后续优化研究的出发点。2.1 QTMT 块划分结构VVC 最显著的架构变化是引入了四叉树加多类型树 (Quad-Tree plus Multi-Type Tree, QTMT)划分结构。在 HEVC 中编码树单元 (CTU) 仅通过四叉树 (QT) 递归划分VVC 在 QT 叶节点基础上进一步允许水平二叉树 (BT_H)上下等分垂直二叉树 (BT_V)左右等分水平三叉树 (TT_H)按 1:2:1 比例上下三分垂直三叉树 (TT_V)按 1:2:1 比例左右三分一旦进入 MTT 划分便不再允许回到 QT 划分。这种灵活的划分方式使 VVC 能更好地匹配视频内容中的非对称结构如文字行、条状纹理但也导致编码器需要通过穷举式 RDO (率失真优化) 搜索所有可能的划分组合编码复杂度急剧增加。2.2 帧内预测增强VVC 将亮度角度预测模式从 HEVC 的 33 种扩展至65 种加上 Planar 和 DC 模式共 67 种。此外引入了MIP (Matrix-weighted Intra Prediction)基于矩阵权重的帧内预测适用于不规则纹理MRL (Multi-Reference Line)多参考行帧内预测允许使用上方或左侧多行参考样本ISP (Intra Sub-Partitions)帧内子分区预测将 CU 分为多个子分区分别预测CCLM (Cross-Component Linear Model)跨分量线性模型利用亮度预测色度2.3 帧间预测创新VVC 在帧间预测方面引入了多项突破性技术仿射运动补偿 (Affine Motion Compensation)支持 4 参数和 6 参数仿射模型通过控制点运动矢量插值生成子块 MV有效处理旋转、缩放等复杂运动AMVR (Adaptive Motion Vector Resolution)自适应运动矢量分辨率支持 1/4、1/2、1、4 像素等多种 MV 精度BDOF (Bi-directional Optical Flow)双向光流优化对双向预测块进行亚像素级光流估计GPM (Geometric Partitioning Mode)几何划分模式用一条直线将 CU 分为两个非矩形分区分别进行单向预测后混合MMVD (Merge Mode with Motion Vector Difference)带运动矢量差的合并模式2.4 变换与量化MTS (Multiple Transform Selection)多变换选择从 DCT-II、DST-VII、DCT-VIII 等变换核中选择最适合当前残差块的变换LFNST (Low-Frequency Non-Separable Transform)低频不可分二次变换在主变换前对低频系数进行二次变换SBT (Sub-Block Transform)子块变换仅对残差能量较高的子块进行变换编码LMCS (Luma Mapping with Chroma Scaling)亮度映射与色度缩放在编码前优化像素值分布2.5 环路滤波体系VVC 的环路滤波处理链包括四层滤波工具全称功能定位LMCSLuma Mapping with Chroma Scaling亮度映射与色度缩放编码前预处理DBFDe-Blocking Filter去块效应滤波平滑块边界不连续性SAOSample Adaptive Offset样点自适应补偿消除振铃效应ALFAdaptive Loop Filter自适应环路滤波基于维纳滤波减少解码误差其中 ALF 是 VVC 相对 HEVC 新增的重要工具使用菱形中心对称滤波器模板亮度 7x7色度 5x5按 4x4 块的梯度方向对像素分类每类使用不同滤波器系数。2.6 屏幕内容编码 (SCC)VVC 在第一版即集成了屏幕内容编码工具包括IBC (Intra Block Copy)帧内块复制允许在同帧内搜索匹配块PLT (Palette Mode)调色板模式用少量代表色表示块内像素TSRC (Transform Skip Residual Coding)变换跳过残差编码ACT (Adaptive Color Transform)自适应颜色变换这些工具使 VVC 在屏幕内容场景下相比 HEVC-SCC 可节省约 19%-25% 的码率。三、帧内预测与划分优化帧内预测和 CU 划分是 VVC 编码复杂度的主要来源也是 2025-2026 年研究最密集的方向之一。以下论文从多候选推导、深度学习加速、统计学习决策等不同角度对该问题展开研究。3.1 Beyond VVC 帧内预测多候选推导论文Multiple Candidates Derivation of Dominant Intra Prediction Mode in Beyond VVC会议ISCAS 2026 |作者Lu Wang, Junyan Huo, Yanzhuo Ma 等西安电子科技大学技术原理最主导帧内预测 (Most Dominant Intra Prediction, MDIP) 是 ECM 中引入的帧内预测增强技术通过模板匹配选择最优预测模式。然而当模板区域包含较少相关样本时模板代价最小的模式未必是全局最优选择。创新点提出多候选选择方法——在原有最低模板代价的 MDIP 候选之外额外推导次低模板代价的第二 MDIP 候选模式并引入专用语法标志区分两个候选。编码器在 RDO 阶段对两个候选均进行代价评估选择更优者。实验结果该方法已集成至 VTM 和 Beyond VVC 平台 ECM在两者上均获得编码增益。由于其在模板质量不足场景下的鲁棒性已被批准在 Beyond VVC 探索实验 (EE) 中正式研究。分析这项工作体现了 Beyond VVC 研究的一个重要趋势——通过增加少量语法开销换取预测精度的提升。多候选策略在模板匹配类技术中具有普适性其思路可推广至帧间预测的模板匹配合并模式等场景。3.2 基于亮色度特征与深度学习的快速帧内编码论文Fast VVC Intra Coding Algorithm Based on Luminance-Chrominance Feature and Deep Learning会议CNML 2026 |作者Shicheng Xu, Lei Chen 等北京邮电大学技术原理VVC 帧内预测模式决策需要遍历 67 种亮度模式和多种色度模式计算量巨大。该论文观察到亮度 (Y) 和色度 (U, V) 分量之间存在强相关性——当亮度块纹理简单时色度通常也简单且最优预测模式往往一致。创新点构建 Y/U/V 三通道联合特征表示通过多通道融合策略训练神经网络由网络直接预测当前 CU 的最优帧内预测模式子集从而跳过大量不可能最优的模式遍历。实验结果在 Class A/B 序列上模式预测精度提升约5%有效降低了帧内编码时间。分析该工作突破了传统快速算法仅利用亮度特征的局限首次系统性地利用亮色度联合特征指导模式决策。北邮团队的研究表明跨分量相关性不仅可用于色度预测 (如 CCLM)在模式决策加速方面同样具有潜力。3.3 高效帧内划分与复杂度感知阈值决策论文Efficient VVC Intra Partitioning with Shared Feature Extraction and Complexity-Aware Threshold Decision期刊IEEE TMM 2026技术原理VVC 的 QTMT 划分需要递归尝试五种划分模式 (QT、BT_H、BT_V、TT_H、TT_V) 并选择 RD 代价最小者。传统快速算法为每种划分模式独立提取特征存在大量重复计算。创新点提出共享特征提取框架——对不同划分模式和不同深度级别的 CU 提取一次通用特征如纹理复杂度、梯度方向、方差等供多个决策节点复用。同时引入复杂度感知阈值决策机制根据当前编码序列的整体复杂度动态调整提前终止阈值在简单序列上更激进地跳过划分在复杂序列上保留更多划分尝试。分析共享特征提取的思路对降低快速算法自身的计算开销有重要意义。复杂度感知阈值则解决了传统固定阈值在不同内容适应性差的问题实现了编码效率与编码质量的动态平衡。3.4 基于级联 LDA 的快速 CU 划分论文Fast CU Partitioning Algorithm of VVC Based on Cascaded LDA期刊Signal, Image and Video Processing 2026技术原理线性判别分析 (LDA) 是一种经典的统计分类方法通过最大化类间方差与类内方差的比值来寻找最优投影方向。该论文将 CU 划分决策建模为多级分类问题——每个 CU 深度级别对应一个分类节点判断是否继续划分以及选择哪种划分模式。创新点采用级联 LDA架构在不同 CU 深度级别使用不同的 LDA 分类器每个分类器针对该深度下最常见的划分模式组合进行优化。级联结构允许浅层决策结果指导深层决策形成从粗到细的决策链。分析相比深度学习方法LDA 的优势在于推理速度极快、模型体积小、可解释性强。该工作证明了传统统计学习方法在 VVC 快速划分中仍具竞争力尤其适合资源受限的编码场景。3.5 三元树划分快速决策论文Fast Decision Mechanism for Ternary Tree Partitioning in VVC Intra Coding期刊PLOS ONE 2025技术原理统计表明VVC 帧内编码中三元树 (TT) 划分仅占所有划分决策的一小部分但编码器仍需为每个 CU 计算 TT 划分的 RD 代价。创新点针对 TT 划分设计专用快速决策机制通过分析 CU 的纹理特征和空间分布在 RD 评估前预判 TT 划分是否可能成为最优选择从而在不影响编码质量的前提下跳过大部分不必要的 TT 评估。分析TT 划分在 VVC 中的使用频率较低但计算开销不可忽略针对特定划分模式设计专用快速决策是一种有效的研究策略。该工作与 3.6 中针对整个 QTMT 结构的加速方法形成互补。3.6 轻量级参数条件动态路由加速 QTMT 划分论文Accelerating QTMT Partitioning in VVC Using Lightweight Parameter-Conditioned Dynamic Routing会议ChinaMM 2025推荐论文技术原理动态路由 (Dynamic Routing) 源自 Capsule Network允许网络根据输入动态选择计算路径。该论文将此思想应用于 QTMT 划分——根据当前 CU 的参数尺寸、深度、纹理特征等动态选择最优的决策路径。创新点设计轻量级参数条件动态路由机制相比传统深度学习快速算法大幅减少了模型参数和推理开销。通过条件路由简单 CU 走快速路径直接决策复杂 CU 走精细路径进行更多分析实现了计算资源的自适应分配。分析动态路由是深度学习快速编码算法的一个重要进展。传统方法对所有 CU 使用固定网络结构导致简单 CU 过度计算、复杂 CU 计算不足。动态路由解决了这一矛盾在保持预测精度的同时显著降低推理延迟。四、帧间编码与运动估计优化帧间编码占据了视频编码时间的最大比例VVC 新引入的仿射运动补偿、GPM 等工具进一步增加了帧间编码复杂度。4.1 VVC 帧间编码划分加速论文Optimized Partitioning Acceleration for VVC Inter Coding会议ICASSP 2026技术原理帧间编码的 CU 划分决策与帧内编码有所不同——帧间编码中运动估计 (ME) 和运动补偿 (MC) 的计算量随 CU 尺寸和参考帧数量变化划分决策需要综合考虑预测精度和运动搜索开销。创新点针对 VVC 帧间编码的划分过程提出优化加速方案利用帧间编码特有的时域相关性如前一帧相同位置的划分结果和运动一致性来指导当前帧的划分决策减少不必要的划分模式遍历。分析帧间编码划分加速相比帧内编码有一个重要优势——可以利用时域信息。前一帧的划分结构和运动信息为当前帧的划分决策提供了强有力的先验这是帧内编码无法利用的。4.2 基于划分图的快速块划分论文Partition Map-Based Fast Block Partitioning for VVC Inter Coding期刊IEEE TMM 2025技术原理划分图 (Partition Map)是指对已编码帧记录的 CU 划分结构。该论文观察到在连续视频帧中场景运动通常具有局部一致性——相邻帧中相同位置的 CU 往往采用相似的划分结构。创新点构建划分图指导机制通过运动补偿将参考帧的划分图映射到当前帧为当前帧的 CU 划分提供初始建议。对于运动一致性高的区域直接采用参考帧的划分结构或仅做少量调整对于运动复杂区域再进行完整的 RDO 搜索。分析划分图复用是一种非常实用的帧间编码加速策略。其核心假设——相邻帧划分结构的相关性——在大多数视频场景中成立尤其在监控视频、视频会议等背景稳定的场景中效果显著。该方法与 4.1 的时域相关性利用思路一致但更加系统化。五、环路滤波与质量增强环路滤波是 VVC 压缩质量的最后一道保障也是深度学习介入视频编码最深入的领域。2025-2026 年的研究呈现出从 CNN 向 Transformer、扩散模型、SNN 等更多样化架构发展的趋势。5.1 脉冲-小波融合网络增强 VVC 360° 视频论文SWFNet: A Spiking-Wavelet Fusion Network for Frame-Level Quality Enhancement of VVC-Compressed 360-Degree Video期刊IEEE TCSVT 2026 |作者Ziyi Cao, Haibing Yin 等杭州电子科技大学技术原理360° 全景视频经过 VVC 压缩后在球面投影 (ERP) 格式下会产生极区拉伸导致的非均匀失真。传统 CNN 滤波器难以同时处理全局结构信息和局部高频细节恢复。创新点提出首个面向全景视频质量增强的混合 SNN-ANN 架构SWFNet。受 M-P 双流理论启发设计双路径处理全局路径采用 Transformer-SNN 提取结构先验利用脉冲神经网络 (SNN) 的事件驱动特性高效处理大范围上下文局部路径利用残差小波融合块恢复高频细节通过小波变换将信号分解为多尺度分量分别处理仅148 万参数、10.3 GFLOPs实现了 SOTA 恢复性能。分析该工作在多个维度上具有突破性——首次将 SNN 用于 VVC 质量增强、首次面向 360° 视频的帧级增强、以及 SNN-ANN 混合架构的编解码应用。SNN 的事件驱动特性使其在功耗敏感的 VR/AR 设备上具有独特优势小波融合则提供了多尺度信号处理的理论基础。5.2 扩散模型后处理论文Beyond CNN Filters: Diffusion-Based Post-Processing for VVC Intra Coding会议DCC 2026技术原理扩散模型 (Diffusion Model) 通过逐步去噪过程生成高质量图像在图像生成领域已取得突破性进展。该论文将扩散模型应用于 VVC 帧内编码的后处理——将压缩伪影视为噪声通过条件扩散过程逐步恢复原始信号。创新点超越传统 CNN 滤波器的范式将后处理建模为条件生成问题。扩散模型能够学习更复杂的信号分布理论上可以恢复 CNN 难以处理的纹理细节。分析扩散模型在视频编码后处理中的应用是一个前沿探索方向。其优势在于生成能力和对复杂分布的建模能力但挑战也很明显——推理速度慢需要多步迭代、计算量大。该工作选择帧内编码后处理作为切入点是合理的因为帧内编码不涉及时序约束对实时性要求相对宽松。未来如何通过快速采样、蒸馏等技术降低扩散模型的推理开销是将其实用化的关键。5.3 ResNet-Transformer 交互式环路滤波论文RTINet: A Learned In-Loop Filter in VVC Using Interaction of ResNet and Transformer期刊Signal Processing: Image Communication 2026技术原理CNN (如 ResNet) 擅长提取局部特征Transformer 擅长建模长距离依赖。视频压缩伪影既包含局部块效应也包含跨区域的全局失真单一架构难以兼顾。创新点设计 ResNet 与 Transformer 的交互式架构 RTINet——不是简单的串联或并联而是在特征提取的多个层级上让 CNN 局部特征与 Transformer 全局注意力进行信息交换实现局部-全局特征的协同增强。分析CNN-Transformer 混合架构是 2025-2026 年学习型环路滤波的主流方向之一。关键设计挑战在于如何在交互中平衡两种架构的贡献——过多的 Transformer 注意力会增加计算量过多的 CNN 卷积会限制全局建模能力。RTINet 的交互式设计提供了一种有价值的探索。5.4 整数运算跨平台低操作点环路滤波论文Cross-Platform Low Operation Point In-Loop Filter for VVC Using Integer Operations会议ISCAS 2026技术原理深度学习环路滤波器通常使用浮点运算但不同硬件平台CPU、GPU、DSP、ASIC的浮点精度不一致导致编解码不匹配。此外浮点运算在资源受限的嵌入式设备上开销较大。创新点将整个神经网络滤波器的运算转换为纯整数运算消除浮点依赖实现跨平台一致性。针对 VVC 低操作点 (Low Operation Point, LOP) 场景即较高 QP、较大压缩比的编码配置进行优化因为此场景下压缩伪影更严重滤波增益更大。分析整数运算是神经网络视频编码走向硬件部署的必经之路。VVC 标准化过程中编解码一致性是硬性要求——编码端和解码端必须产生完全相同的重建结果。浮点运算的跨平台不一致性一直是 NNVC 标准化面临的核心障碍之一该工作通过整数化提供了一种可行解决方案。5.5 过参数化训练与可变通道配置的低操作点滤波论文Low Operation Point In-loop Filter for VVC Based on Over-parameterized Training and Variable Channel Configurations期刊IEEE Access 2026技术原理过参数化 (Over-parameterization) 是指在训练阶段使用比推理阶段更宽、更深的网络结构训练完成后通过剪枝或蒸馏得到轻量推理模型。这种策略结合了大模型的训练优势和轻量模型的推理效率。创新点采用过参数化训练策略同时支持可变通道配置——同一训练模型可根据部署平台的计算能力动态调整网络通道数在高端设备上使用全通道获得最佳质量在低端设备上减少通道数以降低延迟。分析可变通道配置解决了学习型环路滤波器在不同设备上的部署适配问题。这与 VVC 标准的设计理念一致——VVC 通过多种编码工具和配置级别支持从高端服务器到移动设备的广泛场景。可变通道滤波器使得同一标准参考实现可以适配不同平台降低了部署成本。5.6 时空 Transformer GAN 感知增强论文CAST-GAN: Compression-Aware Spatio-Temporal Transformer GAN for Perceptual Enhancement of VVC-compressed Video期刊Multimedia Tools and Applications 2026技术原理传统环路滤波器以 PSNR 等客观指标为优化目标但人眼对压缩伪影的感知与客观指标不完全一致。生成对抗网络 (GAN) 通过判别器驱动生成器学习人眼感知友好的纹理但传统 GAN 滤波器多基于 CNN难以建模时序一致性。创新点CAST-GAN 结合时空 Transformer与 GAN在时空维度上同时建模压缩伪影的分布规律。判别器不仅评估单帧质量还评估时序一致性避免帧间闪烁。生成器利用 Transformer 的长距离注意力恢复被压缩破坏的纹理细节。分析感知质量增强是视频编码研究的一个重要分支。VVC 的 ALF 已使用维纳滤波器优化 MSE但 MSE 最优不等于感知最优。GAN 驱动的感知增强可以在不改变码率的前提下显著提升主观质量但需要解决训练稳定性和时序一致性问题。CAST-GAN 的时空 Transformer 设计为解决后者提供了新思路。六、硬件加速与复杂度优化VVC 的编码复杂度使其在纯软件实现下难以满足实时编码需求硬件加速成为 VVC 走向大规模商用的关键。6.1 8K UHD 硬件友好加速算法论文Hardware-Friendly Algorithm Optimization and Acceleration for 8K UHD Image and Video Broadcasting期刊IEEE Transactions on Broadcasting 2026 |作者Hang Yuan, Wei Gao北京大学技术原理8K UHD (7680x4320) 视频的实时编码对硬件吞吐率要求极高。传统 VVC 编码器的迭代决策过程 (RDO) 需要多次遍历候选模式无法直接映射到硬件流水线。创新点提出One-Pass框架替代迭代决策过程基于 Map-Reduce 模型设计梯度与直方图差特征计算——在单次数据扫描中同时提取多种特征供划分决策使用。Map 阶段并行计算各子区域的局部特征Reduce 阶段汇总为全局决策依据。实验结果在 Xilinx VU440 FPGA 200MHz 上单路径支持8K45fps多路径并行可达135fps达到 VVC 标准下硬件友好 CU 划分加速的 SOTA。分析One-Pass 框架的核心思想是用特征驱动的快速决策替代 RD 代价遍历这在精度上有所牺牲但大幅提升了吞吐率。Map-Reduce 模型天然适合 FPGA 的并行计算架构是该工作在硬件效率上取得突破的关键。8K 广播是 VVC 的重要目标应用该工作为 VVC 在广播级的硬件部署提供了可行方案。6.2 硬件 RDO 气泡消除策略论文A 77.9%-Cycle-reduced Bubble-Removing Strategy for Hardware RDO Supporting QTMTT in VVC期刊IEEE TCSVT 2025技术原理VVC 的 QTMTT 划分在硬件 RDO 流水线中引入了四类气泡 (Bubble)——即流水线中的空闲等待周期。这些气泡源于 MTT 划分产生的非方形块如 32x4、8x16在变换、量化、重建等阶段的数据依赖关系复杂导致流水线频繁停顿等待。创新点提出三步气泡消除策略分区调度优化重新设计划分模式的评估顺序将数据依赖强的模式安排在相邻流水级减少跨级等待转置存储器重设计针对非方形块的转置操作设计专用存储器结构避免通用转置存储器的地址冲突面向硬件的分区剪枝在硬件层面实现分区模式剪枝跳过明显次优的候选模式实验结果在 GF 28nm 工艺下仅用 3259K 门和 63.47KB 片上存储实现 4K40fps 吞吐硬件周期最高削减77.9%BD-Rate 损失仅 0%-1.21%。分析这是目前 VVC 硬件 RDO 加速领域最系统性的工作之一。气泡问题是 QTMTT 硬件实现的核心瓶颈——HEVC 的方形块划分天然适合规则流水线而 VVC 的非方形块破坏了这一规则。该工作从调度、存储、剪枝三个层面综合解决气泡问题为 VVC 硬件编码器的实际部署扫清了重要障碍。6.3 多级帧间并行化 VVC 编码器论文Multi-level Inter-Frame Parallelization in an Open Optimized VVC Encoder会议ACM 2025技术原理VVC 的帧间编码存在帧级依赖——B 帧的编码需要依赖其参考帧的重建结果。传统帧级并行只能在无依赖的帧组之间进行并行度有限。创新点在开源优化 VVC 编码器中实现多级帧间并行化——不仅在帧组级别并行还在帧内分片 (Tile/WPP) 级别和 CU 级别实现并行形成帧级-片级-CU 级的三级并行架构。通过精细的依赖管理使得有依赖关系的帧也能部分并行编码。分析多级并行是软件编码器提升吞吐率的主要手段。该工作的价值在于在开源 VVC 编码器中实现了系统性的多级并行化为社区提供了可复用的并行编码框架。随着多核 CPU 和 GPU 的普及软件并行编码器在性价比上仍有竞争力。七、码率控制与流媒体应用码率控制决定了 VVC 在实际流媒体场景中的带宽利用效率是连接编码标准与商业应用的桥梁。7.1 人机视觉协作码率控制论文Human-Machine Vision Collaboration Based Rate Control Scheme for VVC期刊IEEE Signal Processing Letters 2025技术原理传统码率控制以人眼感知质量为唯一优化目标。但在实际应用中视频不仅被人观看还被机器视觉系统分析如目标检测、人脸识别。为机器分析分配过多码率会浪费带宽仅优化人眼质量会降低机器分析精度。创新点提出人机视觉协作的码率控制方案——在码率分配时同时考虑人眼感知质量和机器视觉任务的准确率。对于机器视觉感兴趣的区域如人脸、车辆分配更多比特对于背景区域适当压缩。通过联合损失函数在人眼质量和机器分析精度之间寻找最优平衡。分析该工作反映了视频编码的一个重要趋势——从为人眼编码到为人眼和机器共同编码。JVET 内部已设立机器视觉编码 (VCM) 专题组研究这一方向。人机协作码率控制在智能监控、自动驾驶等场景中有直接应用价值。7.2 VVC 低延迟直播流媒体码率阶梯预测论文LiveCH-VVC: Latency-Aware Dynamic Bitrate Ladder Prediction for VVC/LL-DASH Live Streaming期刊Signals 2026 |作者Reka Watthage, Anil Fernando英国斯特拉斯克莱德大学技术原理ABR (Adaptive Bitrate) 流媒体使用码率阶梯 (Bitrate Ladder)——同一内容编码为多个码率级别供客户端根据网络条件选择。传统方法使用固定阶梯无法适应内容复杂度变化。对于直播场景编码延迟是另一个关键约束。创新点面向 VVC/LL-DASH (Low-Latency DASH) 直播场景提出动态码率阶梯预测框架LiveCH-VVC集成四个核心组件双路径 CNN教师-学生蒸馏约 5M 参数预测最优码率级别场景切换检测器检测直播中的场景变化触发阶梯重新计算XGBoost 多标签分类器根据内容特征分类最优编码配置在线自适应引擎根据实时反馈调整预测模型实验结果在 81 条 UHD 序列上BD-Rate 仅 0.68%编码时间节省73.3%。分析这是 VVC 在流媒体应用层面最系统化的工作之一。LL-DASH 是低延迟直播的主流协议VVC 的高压缩效率使其成为 LL-DASH 的理想编码器。该工作的核心贡献在于将内容感知的码率阶梯预测与 VVC 编码器的配置优化结合在近乎无损的质量下大幅降低编码时间——这对直播场景至关重要因为编码延迟直接影响端到端延迟。7.3 VVC 多视角扩展论文VVC-MV-CM: A Complexity-Managed Multiview Extension for VVC with Adaptive Inter-View Prediction期刊Applied Sciences 2026技术原理多视角视频 (Multiview Video) 用于 3D 显示、自由视角回放等应用需要同时编码多个视角的视频流。多视角编码的核心是利用视角间相关性——相邻视角的同一时刻帧之间存在高度相似性。创新点为 VVC 提出复杂度管理的多视角扩展VVC-MV-CM支持自适应视角间预测——根据视角间的实际相关性强弱动态决定是否进行视角间预测避免在相关性弱时浪费计算资源。复杂度管理机制允许在编码效率与计算复杂度之间进行可控权衡。分析多视角视频是 VVC “多功能” (Versatile) 定位的重要应用场景。VVC 标准在制定之初就考虑了多视角扩展的可能性该工作将这一设想变为现实。自适应视角间预测解决了传统多视角编码在弱相关场景下效率下降的问题。八、Beyond VVC 与前沿综述8.1 超越 VVC 的学习增强视频压缩论文Learning-enhanced Video Compression with Capability Beyond VVC会议ISCAS 2026技术原理JVET 在 2025 年发布了超越 VVC 能力的证据征集 (Call for Evidence, CfE)征集能够显著超越 VVC 压缩能力的技术方案。该论文提出了基于 ECM 的学习增强方案。创新点在 ECM 中集成两个优化的学习型编码工具CV-DRF (Cost Volume-based Deep Reference Frame)基于代价体的深度参考帧生成利用基于代价体的视频帧插值网络合成时间一致的虚拟参考帧增强帧间预测TTA-NNLF (Test Time Augmentation-enhanced Neural Network Loop Filter)基于测试时增强的神经网络环路滤波采用 Transformer 架构抑制压缩伪影实验结果在 RA 配置下相对于 CfE 锚点 VTM-23.11在 SDR RA UHD、SDR RA HD、UGC RA 测试序列上分别实现 Y/U/V 分量平均 BD-Rate 节省32.02%/36.15%/38.39%。分析这一结果具有重要意义——它提供了具体证据表明将 ECM 与现代学习模块混合可以在 Beyond VVC 方向上实现显著的压缩增益。CV-DRF 与 JVET-AM0175 (武汉大学陈震中团队提出的深度参考帧生成方法已被 NNVC 采纳为首个帧间编码工具) 的思路一致表明深度参考帧生成是 Beyond VVC 最有前景的方向之一。8.2 ECM 中的帧内模板匹配工具背景补充ECM (Enhanced Compression Model) 是 JVET 为 Beyond VVC 探索建立的传统编码参考软件。截至 2025 年ECM 已发展到 15.0 版本集成了大量超越 VVC 的编码工具。ECM 在帧内预测方面的重要进展包括NN-Intra (Neural Network-based Intra Prediction)使用全连接神经网络进行帧内预测已从 NNVC 迁移至 ECM。研究表明其预测性能显著优于传统角度预测模式Intra Fusion Prediction融合多种角度预测模式的结果突破单一模式的局限RIPM (Recurrent Intra Prediction Mode)循环帧内预测模式利用相邻和非相邻区域的循环空间纹理信息进行自适应模式推导MDIP (Most Dominant Intra Prediction)最主导帧内预测通过模板匹配选择最优模式 (见 3.1)RR-IBC (Reconstruction Reordered IBC)重建重排帧内块复制利用屏幕内容的对称性翻转重建块在 Class F 和 TGM 序列上分别实现 1.61% 和 3.90% 的 Y 分量 BD-Rate 节省已被 ECM 采纳8.3 ECM 帧间预测增强ECM 在帧间预测方面的关键扩展包括GPM 扩展扩展几何划分模式包括 GPM-Affine (几何划分仿射预测支持仿射运动补偿) 和 GPM 高效信令。GPM-Affine 在富含仿射运动的序列上可实现约 1% 的编码增益Inter CCP Merge Mode帧间跨分量预测合并模式改善色度帧间编码性能在 LDB 配置下色度分量 BD-Rate 节省 2.31%-2.38%ETMVP (Enhanced Temporal Motion Vector Prediction)增强时域运动矢量预测允许子块级运动继承8.4 NNVC 标准化进展NNVC (Neural Network-based Video Coding) 是 JVET 探索 AI 驱动视频编码的另一条路线。截至 2025 年的进展包括三大核心工具NN 环路滤波 (LOP In-loop Filter)、NN 帧内预测 (NN-Intra)、NN 帧间预测 (NN-Inter)组合测试结果LOP NN-Intra NN-Inter 三者组合在 VTM-11.0_NNVC-10.0 基础上实现 Y/U/V 分量 BD-Rate 节省11.74%/19.57%/18.76%首个帧间编码工具采纳武汉大学陈震中团队的深度参考帧生成提案 (JVET-AM0175) 在 2025 年第 39 次 JVET 会议上被采纳到 NNVC 参考软件标志着深度帧间预测标准化的重要突破腾讯的贡献腾讯在 NNVC 环路滤波赛道中实现最高编码性能并保持较低复杂度其单模型滤波器设计思想被采纳为标准下一阶段环路滤波统一方案的起点8.5 下一代标准 (H.267) 的专利格局根据 GreyB 的分析报告Beyond VVC (H.267) 的专利布局呈现以下特征3,916 个专利家族和1,357 项 JVET 贡献涉及 ECM 和 NNVC 技术中国占比 53.8%超过一半的相关专利来自中国公司字节跳动以 645 个专利家族位居第一提交 251 项 JVET 贡献腾讯以 468 个专利家族紧随其后同时是 AOMedia (AV1/AV2) 的创始成员其他重要贡献者包括快手、华为、OPPO、阿里巴巴以及西安电子科技大学等学术机构H.267 版本 1 预计将于2028 年底完成8.6 深度学习滤波综述论文Deep Learning-based Filtering for Video Coding: A Survey on Architectures, Algorithms, and Complexity Analysis期刊IEEE Transactions on Consumer Electronics 2026综述内容系统性综述深度学习滤波 (DLF) 技术提出三维分类法编码集成方案环路内集成 vs. 后处理全帧级 vs. CTU 级在线训练 vs. 离线训练编码信息利用利用 QP、划分结构、预测模式、运动信息等编码侧信息作为网络输入网络设计策略CNN、Transformer、GAN、扩散模型等架构选择综述分析了 RD 性能与硬件可行性的折中涵盖 JVET 在 NNVC 方面的最新标准化活动是理解学习型滤波技术全貌的重要参考文献。8.7 帧内模式决策复杂度降低综述论文Reducing Complexity on Intra Mode Decision in Video Coding: A Review期刊IEEE Access 2026综述内容综述视频编码中帧内模式决策复杂度降低的方法覆盖从 HEVC 到 VVC 的技术演进。综述将方法分为统计学习类 (SVM、决策树、LDA)、深度学习类 (CNN、RNN) 和启发式规则类三大方向分析了各方向的优势和局限并展望了未来研究方向。九、技术趋势与展望综合以上分析2025-2026 年 VVC 研究呈现出以下核心趋势9.1 AI 与传统编码的深度融合从AI 辅助编码走向AI 嵌入编码——深度学习不再仅用于后处理滤波而是深入到预测 (NN-Intra, NN-Inter)、变换 (Transform Set Merging)、划分决策 (动态路由、CNN 预测) 等编码核心环节。NNVC 的组合测试已证明 LOP NN-Intra NN-Inter 可实现双位数 BD-Rate 节省Beyond VVC 的 CfE 结果更显示 ECM 学习模块可实现 30% 的增益。9.2 复杂度优化的多层策略VVC 的编码复杂度优化形成了从算法到硬件的多层策略算法层统计学习 (LDA)、深度学习 (CNN/Transformer)、启发式规则的快速划分和模式决策架构层共享特征提取、动态路由、多级并行化硬件层One-Pass 框架、气泡消除、整数运算、可变通道配置9.3 从人眼编码到人机协作编码视频编码的优化目标正在扩展——从单纯的人眼感知质量到人眼 机器视觉的联合优化。JVET 的 VCM (Video Coding for Machines) 专题组和人机协作码率控制研究反映了这一趋势。未来视频编码标准可能内建语义感知工具在编码阶段即提取并保护机器视觉关键信息。9.4 Beyond VVC 的双轨竞争ECM (传统编码增强) 和 NNVC (神经网络编码) 构成 Beyond VVC 的双轨路线。当前 ECM 占据更多研发投入 (3000 专利家族)但 NNVC 在环路滤波和帧间预测方向展现出突破性潜力。最终标准可能是两者的混合方案——在传统框架的关键模块中嵌入神经网络工具在保持标准确定性的同时获得 AI 带来的性能提升。9.5 中国力量的崛起在 Beyond VVC 的专利和贡献格局中中国企业占据主导地位。字节跳动、腾讯、华为、OPPO、快手等企业在 ECM 的帧内预测、帧间预测、环路滤波等核心领域处于领先位置。学术机构如西安电子科技大学、北京大学、武汉大学、北京邮电大学、杭州电子科技大学等在前沿研究中贡献突出。这一格局与中国庞大的视频应用市场 (短视频、直播、超高清广播) 密切相关。9.6 应用驱动的标准化VVC 的研究不再局限于编码效率提升而是深入到具体应用场景8K 广播硬件友好加速算法 (6.1)低延迟直播动态码率阶梯预测 (7.2)360°/VR 视频SNN-小波融合增强 (5.1)屏幕内容RR-IBC、软上下文形成多视角视频VVC-MV-CM 扩展 (7.3)智能监控人机协作码率控制 (7.1)这种应用驱动的标准化使得 VVC 真正成为其名字所暗示的多功能编码标准。十、总结2025-2026 年是 VVC 研究从标准完善迈向深度优化与超越的关键时期。在帧内预测方向多候选推导、深度学习加速和动态路由等技术持续压缩 QTMT 划分的计算开销在帧间编码方向划分图复用和时域相关性利用为帧间加速提供了新思路在环路滤波方向SNN、扩散模型、Transformer-GAN 等多样化架构拓展了质量增强的边界在硬件加速方向One-Pass 框架和气泡消除策略为 8K 实时编码铺平了道路在码率控制方向人机协作和动态码率阶梯将 VVC 带入智能流媒体时代。更重要的是Beyond VVC 的探索已取得实质性进展——ECM 集成了 NN-Intra、RR-IBC 等创新工具NNVC 实现了首个帧间编码工具的标准化采纳CfE 结果证明了学习增强方案可实现 30% 的超越 VVC 增益。下一代标准 H.267 预计 2028 年完成中国企业在专利和贡献中的主导地位预示着全球视频编码技术格局的深刻变化。VVC 的故事远未结束。在传统混合编码框架日益成熟、单工具边际收益递减的今天深度学习与编码理论的深度融合正在打开新的可能性空间。从手工设计工具到数据驱动学习从为人眼编码到为人机协作编码视频编码领域正经历一场深刻的范式变革。参考文献按文中出现顺序Lu Wang et al., “Multiple Candidates Derivation of Dominant Intra Prediction Mode in Beyond VVC,” ISCAS 2026.Shicheng Xu et al., “Fast VVC Intra Coding Algorithm Based on Luminance-Chrominance Feature and Deep Learning,” CNML 2026.“Efficient VVC Intra Partitioning with Shared Feature Extraction and Complexity-Aware Threshold Decision,” IEEE TMM 2026.“Fast CU Partitioning Algorithm of VVC Based on Cascaded LDA,” Signal, Image and Video Processing 2026.“Fast Decision Mechanism for Ternary Tree Partitioning in VVC Intra Coding,” PLOS ONE 2025.“Accelerating QTMT Partitioning in VVC Using Lightweight Parameter-Conditioned Dynamic Routing,” ChinaMM 2025.“Optimized Partitioning Acceleration for VVC Inter Coding,” ICASSP 2026.“Partition Map-Based Fast Block Partitioning for VVC Inter Coding,” IEEE TMM 2025.Ziyi Cao et al., “SWFNet: A Spiking-Wavelet Fusion Network for Frame-Level Quality Enhancement of VVC-Compressed 360-Degree Video,” IEEE TCSVT 2026.“Beyond CNN Filters: Diffusion-Based Post-Processing for VVC Intra Coding,” DCC 2026.“RTINet: A Learned In-Loop Filter in VVC Using Interaction of ResNet and Transformer,” Signal Processing: Image Communication 2026.“Cross-Platform Low Operation Point In-Loop Filter for VVC Using Integer Operations,” ISCAS 2026.“Low Operation Point In-loop Filter for VVC Based on Over-parameterized Training and Variable Channel Configurations,” IEEE Access 2026.“CAST-GAN: Compression-Aware Spatio-Temporal Transformer GAN for Perceptual Enhancement of VVC-compressed Video,” Multimedia Tools and Applications 2026.Hang Yuan, Wei Gao et al., “Hardware-Friendly Algorithm Optimization and Acceleration for 8K UHD Image and Video Broadcasting,” IEEE Transactions on Broadcasting 2026.“A 77.9%-Cycle-reduced Bubble-Removing Strategy for Hardware RDO Supporting QTMTT in VVC,” IEEE TCSVT 2025.“Multi-level Inter-Frame Parallelization in an Open Optimized VVC Encoder,” ACM 2025.“Human-Machine Vision Collaboration Based Rate Control Scheme for VVC,” IEEE Signal Processing Letters 2025.Reka Watthage, Anil Fernando et al., “LiveCH-VVC: Latency-Aware Dynamic Bitrate Ladder Prediction for VVC/LL-DASH Live Streaming,” Signals 2026.“VVC-MV-CM: A Complexity-Managed Multiview Extension for VVC with Adaptive Inter-View Prediction,” Applied Sciences 2026.“Learning-enhanced Video Compression with Capability Beyond VVC,” ISCAS 2026.“Deep Learning-based Filtering for Video Coding: A Survey on Architectures, Algorithms, and Complexity Analysis,” IEEE Transactions on Consumer Electronics 2026.“Reducing Complexity on Intra Mode Decision in Video Coding: A Review,” IEEE Access 2026.Jiaye Fu et al., “Recurrent Intra Prediction Mode for Future Video Coding,” IEEE 2025. (ECM RIPM)“Reconstruction Reordered Intra Block Copy for Screen Content Coding,” IEEE TIP 2025. (ECM RR-IBC)“Geometric Partitioning Mode with Affine Prediction in Video Coding,” DCC 2024. (ECM GPM-Affine)“Inter Cross-Component Prediction Merge Mode for Video Coding beyond VVC,” DCC 2024. (ECM Inter CCP)“Combination Test of NNVC Tools and NN-Inter In VVC,” IEEE 2025. (NNVC 组合测试)JVET-AM0175, “EE1-3.2: Deep Reference Frame Generation for Inter Prediction Enhancement,” JVET 39th Meeting, 2025. (NNVC 首个帧间编码工具)“Transform Set Merging for Neural Network-Based Intra Prediction in beyond VVC,” IEEE 2025. (ECM NN-Intra 变换集合并)“Efficient signaling of extended GPM modes in ECM,” SPIE 2025.“Template Matching Based Temporal Motion Vector Refinement for the Next Generation of AVS,” VCIP 2025.GreyB, “Beyond VVC: Patent and Contribution Landscape Analysis,” 2025.