2天时间,聊今年最热的 Agent、上下文工程、AI 产品创新等话题。2025 年最后一场~ 了解详情
写点什么

突破视频编码模式级压缩瓶颈:一种基于长短期相关性建模的帧内模式编码方法

李俊儒,张莉

  • 2023-03-04
    北京
  • 本文字数:2215 字

    阅读完需:约 7 分钟

突破视频编码模式级压缩瓶颈:一种基于长短期相关性建模的帧内模式编码方法

视频压缩的核心在于去除视频信号中的冗余信息,而其中对于空域冗余的去除通常使用帧内预测的方式来实现。比如,大多数的自然场景的图像内容变化平缓,相邻像素间表现出较强的相似性,因此可以利用周边已编码的信息通过特定的映射和插值实现对当前编码单元的帧内预测。这种帧内预测方式已经在标准领域得到广泛的应用。


在 H.264/AVC  标准 [1] 中,帧内预测利用左侧或上侧邻近已重构像素组成参考像素组,根据特定的映射来预测当前编码单元。对于编码单元尺寸为 4×4 的编码单元,有 9 种预测模式可供选择,其中包括 8 种角度模式和 DC 模式;编码单元尺寸为 16×16 的编码单元,则仅支持 4 种预测模式。 H.265/HEVC 标准 [2] 中扩展了帧内预测的方向,支持多达 33 种角度预测模式,以及直流( DC )预测模式和平面( Planar )预测模式。


为了更精细地预测视频中可能出现的任意方向的结构或纹理,新一代视频编码标准 H.266/VVC AVS3 ,分别将帧内预测模式的数量扩充到 67 和 66 种。此外, VVC 采纳了多行预测( Multi Reference Line , MRL ),扩充帧内预测的参考像素区域。 MRL 支持使用更远处的重构像素预测当前编码单元,进一步利用像素间的相关性去除空域冗余。帧内预测的发展进程如下图所示。


图 1. 帧内预测演进示意图


如上所述,在视频编码标准发展中,为了适应多样的纹理内容,帧内预测技术基于多假设的理论支持了更多高效的帧内预测模式。最优的预测模式需要通过率失真优化( Rate Dirstion Optimization , RDO )代价决策,其二值化索引则传递到解码端用于视频的解码重建。虽然细粒度的帧内预测设计可以为帧内编码带来性能增益,但帧内模式的传递代价却随之增大。在相同码率下,更丰富的预测模式使得预测模式的表达位占用的带宽也越来越高。因此,帧内预测模式的编码方式至关重要。若以等长编码为例,每个编码块使用 4 比特则足以表达对于 H.264/AVC 中的 9 种编码模式。当编码模式扩展到 67 个时,则需要使用 7 比特来编码帧内预测模式的索引。实际中,帧内模式的编码会通过构建最可能模式列表( Most Probable Mode , MPM )的方式,为出现概率较高的模式分配较短的码字,提高帧内模式编码的效率。在 AVC 标准中,针对 9 个预测模式设计了 1 个 MPM 的编码方式。


HEVC 标准采用 MPM 列表可包含 3 个最可能的帧内模式,以便更高效地表示 35 种预测模式。 VVC 标准则进一步扩展了帧内预测模式的编码方式, MPM 列表中包含 6 个候选项。最可能模式列表通常基于邻近编码单元(如左上方、左侧、左下方、上方、右上方)的帧内预测模式来构建,并使用一个标志位来区分当前预测模式是否为最可能预测模式。然而,仅利用空域邻近编码单元的预测模式信息来消除模式间的冗余,一定程度上限制了最可能模式预测的准确性。


根据信息论——为概率较大的符号分配较短的码字,对概率较小的符号分配较长的码字——能降低整体信源符号编码的平均码长。为进一步提升帧内模式编码的性能,我们针对新一代视频编码标准 VVC 和 AVS3 提出一种基于长期与短期相关性建模的帧内模式编码方法 [3] 。所提出的方案可以充分利用长期帧内模式的统计特性并结合短期帧内预测模式,高效构建最可能模式列表,打破传统帧内模式编码时仅考虑空域邻近帧内模式的局限性。帧内预测的长期模式级相关性体现在非邻近的相似纹理结构倾向于选用相同的帧内模式进行编码,如图 2 所示。


图 2. 局部区域内的帧内预测模式。浅蓝色为模式 66,粉色为模式 34,红色为 Planar 模式


具体来说,在编码和解码的过程中动态维护长期模式列表 以及 短期模式列表


长期模式列表 的构建是基于已编码帧内模式编码的统计,长期模式列表的具体构建与更新过程如图 3 所示。首先,根据当前帧内预测模式 Mi 对模式的频率 FnMi 进行更新,模式 Mi 更新后的频率为 Fn+1Mi 。其次,根据更新后的频率表中的频率值对频率表重新排序,频率高的排在靠前的位置。最后,按照频率高低导出更新后的模式表,模式表中最前面的模式对应的频率是最高的,出现频率最高的帧内模式将优先选入长期模式列表中。


图 3. 长期模式列表构建与更新示意图


短期模式 列表则基于纹理方向的空域延续性,主要由空域邻近编码单元的帧内模式构成。最终 MPM 列表的构建将通过预先训练的条件随机场模型来决策长期模式以及短期模式的组合方式, MPM 的构建过程如图 4 所示。


图 4. MPM 列表构建示意图


所提出的帧内模式编码可为 VVC 带来 1.4% 的性能增益且编解码复杂度几乎不变。部分屏幕内容测试序列在全 I 帧配置下可实现超过 6% 的 BD-Rate 节省。所提出的方法也可为 AVS3 软件平台带来明显的压缩性能提升,已被 AVS3 标准采纳。


参考文献


[1] T. Wiegand, G. J. Sullivan, G. Bjontegaard, and A. Luthra, “Overview of the H.264/AVC video coding standard,” IEEE Transactions on Circuits and Systems for Video Technology, vol. 13, pp. 560–576, July 2003.

[2] G. J. Sullivan, J. Ohm, W. Han, and T. Wiegand, “Overview of the high efficiency video coding (HEVC) standard,” IEEE Transactions on Circuits and Systems for Video Technology, vol. 22, pp. 1649–1668, Dec 2012.

[3] J. Li, M. Wang, L. Zhang, K. Zhang, H. Liu, S. Wang, S. Ma and W. Gao, “Unified intra mode coding based on short and long range correlations,” IEEE Transactions on Image Processing, vol. 29, pp. 7245-7260, June 2020.

2023-03-04 18:547881
用户头像
鲁冬雪 GMI Cloud Head of China Marketing

发布了 371 篇内容, 共 327.7 次阅读, 收获喜欢 304 次。

关注

评论

发布
暂无评论
发现更多内容

AI 赋能应用开发,容器技术护航落地

xuyinyin

启信宝电影行业洞察:广东蝉联“双冠王”,票房与企业数量全国第一

合合技术团队

人工智能 大数据 算法

超越监控:将国外社交媒体数据转化为商业战略的咨询服务

沃观Wovision

沃观Wovision 舆情监测系统 海外舆情监测 社交媒体监控

海外达人营销策略框架:从目标设定到复盘优化的六步法

Wolink

海外社媒营销 海外营销推广 海外推广 沃链Wolink 达人营销

审计syslog设备活动

运维有小邓

日志监控 日志审计 Syslog日志管理

破解增长瓶颈:海外推广如何为企业的业务打开新市场?

Wolink

跨境电商 出海企业 海外营销推广 海外社媒推广 沃链Wolink

预算有限?如何为业务选择ROI最高的海外推广渠道

Wolink

跨境贸易 跨境电商 出海企业 品牌出海 达人营销

三大场景揭秘:运维自动化如何提升效率与安全

智象科技

运维自动化 ITSM ITSM解决方案 一体化智能运维 自动化运维系统

探索无限可能:生成式推荐的演进、前沿与挑战【AI业务应用方向】

京东科技开发者

预算有限,如何玩转海外红人营销?

Wolink

跨境电商 海外营销推广 海外社媒推广 达人营销

如何用国外社交媒体监控工具快速发现品牌危机与商机

沃观Wovision

社交媒体 沃观Wovision 海外舆情监测 社交媒体监控

Comate Zulu实测:不会编程也能做软件?AI程序员现状令人震惊

Comate编码助手

AI 编程 文心快码Zulu AI编程助手

海外APP外包开发流程

北京木奇移动技术有限公司

APP开发 软件外包公司 APP外包公司

五大最有效的海外营销方式

Wolink

社媒营销 海外营销推广 海外推广 达人营销

广告敏感词图文检测微信小程序:高效合规检测解决方案

微擎应用市场

百度百舸 4 天跑完 LLaVA-OneVision-1.5 预训练,刷新多模态大模型纪录!

新消费日报

CMDB报表体系如何驱动智能运维

智象科技

CMDB 一体化运维 一体化运维平台 自动化运维系统

Scrum 与 Kanban 对比:如何用好这两种方法

ShineScrum

Scrum 敏捷 Kanban Kanban管理 看板系统

一体化运维平台:当下运维体系的核心支柱

智象科技

ITSM ITSM软件 ITSM解决方案 一体化智能运维

ML-Summit2025|从游戏AI到工程机械,具身智能的实践与应用

网易伏羲

网易伏羲 游戏AI 具身智能 工程机械 网易灵动

业内首发|iOS熄屏导航+红绿灯倒计时上线!

高德开放平台

导航 高德地图 高德开放平台 两轮车

企业海外营销团队如何搭建与管理?

Wolink

跨境电商 出海企业 海外营销推广 达人营销

AI人工智能学生综合素养评估系统:用技术看见每一个孩子的成长潜力

上海拔俗

一佳旅游票务系统:旅游行业数字化一体化解决方案

微擎应用市场

宠物去哪啦小程序系统:智能宠物管理与定位解决方案

微擎应用市场

AI应用软件开发的技术架构

北京木奇移动技术有限公司

AI技术开发 软件外包公司 AI应用开发

轻帆云ITAM:将IT资产从成本中心转变为战略动能

云智慧AIOps社区

AIOPS 智能化运维 IT资产管理 一体化智能运维平台 itam

把算法焊死在模型上系列-后端眼中的RAG平台架构

京东科技开发者

云栖实录|Hologres 4.0全新发布:AI时代的一站式多模态分析平台

阿里云大数据AI技术

阿里云 hologres 多模态分析

企业出海的步骤与关键决策点

Wolink

跨境贸易 跨境电商 出海服务商 出海企业 品牌出海

企业出海服务商合作全流程

Wolink

跨境电商 出海服务商 出海企业 品牌出海

突破视频编码模式级压缩瓶颈:一种基于长短期相关性建模的帧内模式编码方法_语言 & 开发_InfoQ精选文章