面试准备:XM多媒体研发

Posted by yZhang on May 13, 2025

1.视频编码八股

1.1 VVC中的码控

码控的核心是通过动态调整编码参数(如量化参数 QP、帧率、分辨率等),来控制编码后的比特率。
码率控制的关键技术:

  • R-D(Rate-Distortion)优化
    • 在码率和失真之间进行权衡,选择最优的编码参数与模式。
    • 通过拉格朗日乘数法优化目标函数:J = D + λ * R,其中 D 是失真,R 是码率,λ 是拉格朗日乘数。
  • QP(Quantization Parameter)调整
    • 通过调整量化参数(QP)来控制码率。
    • QP 值越大,压缩率越高,但失真也越大。
  • 比特分配模型
    • 基于帧或块的复杂度(如运动强度、纹理细节)分配比特数。
    • 复杂度高的区域分配更多比特,复杂度低的区域分配较少比特。
  • 缓冲区管理
    • 使用虚拟缓冲区模型,确保码率波动不会导致缓冲区溢出或下溢。
    • 动态调整帧级或块级的比特分配。

1.2 多媒体业务的质量评价指标

  • 平均意见得分(MOS, Mean Opinion Score)
    • 定义:用户对媒体质量的主观评分,通常分为 1(最差)到 5(最好)五个等级。
  • 峰值信噪比(PSNR, Peak Signal-to-Noise Ratio)
    • 定义:衡量原始视频与处理视频之间的像素级误差,单位为 dB。
    • 公式:
      $PSNR = 10 \cdot \log_{10}\left(\frac{MAX^2}{MSE}\right)$
      其中,MAX 为像素最大值(如 255),MSE 为均方误差。
  • 结构相似性(SSIM, Structural Similarity Index)
    • 定义:衡量原始视频与处理视频在亮度、对比度和结构上的相似性,范围为 [-1, 1],1 表示完全一致。
    • 优点:与人类感知相关性较强。
  • 视频多方法评估融合(VMAF, Video Multi-Method Assessment Fusion)
    • 定义:结合多种视频质量评价方法(如 PSNR、SSIM 等),通过机器学习模型预测主观质量评分。
    • 优点:准确性高,广泛应用于流媒体业务。
  • 块效应指数(Blockiness Index)
    • 定义:衡量视频压缩后块效应的程度
      • 块效应的定义:当视频编码将图像分割为多个固定大小的块(如 16x16 像素的宏块或 8x8 的子块)进行独立压缩时,由于块间编码参数不匹配或量化导致的高频信息丢失,相邻块的边界会出现不连续的像素突变,形成肉眼可见的 “块状边界”。这种现象称为块效应,会显著降低视频的主观视觉质量。
      • 产生原因:分块编码机制,量化导致的高频信息丢失,运动补偿误差累积
      • 典型特征:图像中出现规则的矩形块状边界。
      • 抑制方法:去块滤波,更小的分块尺寸,改进预测模式,自适应量化
  • 帧率(Frame Rate)
    • 定义:视频每秒的帧数(FPS),影响流畅度。
  • 码率(Bitrate)
    • 定义:视频每秒传输的比特数,影响清晰度和带宽占用。

1.3 编码标准对比

265比264压缩效率提高约50%,266比265提高约40%-50%

1.4 帧内重要技术性能

VVC-All intra

1.5 266新技术

划分 多叉划分
帧内 多参考行 更多的角度模式 mip cclm 亮度分量的MPM 色度分量的亮度派生模式(DM)

MIP(Matrix Weighted Intra Prediction)
>- MIP(矩阵加权帧内预测):是首个将神经网络技术引入到视频编码标准(帧内预测)里的工具。
>- 实现过程:MIP采用离线训练神经网络的方法,提前得到多个固定数值的权重矩阵,将其写到一个C/C++头文件中,然后编码过程中利用这些权重矩阵来计算像素预测值。
>- 参考链接:MIP解析

帧间 多帧间 mmvd gpm ciip hmvp 成对平均mvp smvd
变换 MTS LFNST SBT
量化 DQ(依赖量化)
环路滤波 db(去块滤波)、sao(样本自适应偏移)、alf(自适应环路滤波)、lmcs(亮度映射与色度缩放)

1.6 cu划分尺寸

标准 最大编码单元尺寸 (亮度) 最小编码单元尺寸 (亮度) 划分结构
H.264 16×16 (宏块) 4×4 (子宏块) 宏块及固定子宏块划分
H.265 64×64 8×8 四叉树 (QT)
H.266 64×64 4×4 四叉树 (QT)、二叉树 (BT)

1.7 采样格式

● 444:在 4:4:4 采样格式中,亮度和两个色度分量在水平和垂直方向上的采样频率相同。也就是说,对于每一个亮度样本,都有对应的 Cb 和 Cr 样本。
● 422:在水平方向上,每 4 个亮度样本对应 2 个 Cb 样本和 2 个 Cr 样本;在垂直方向上,亮度和色度的采样频率相同。这意味着色度分量在水平方向上的采样频率是亮度分量的一半。
● 420:在水平和垂直方向上,色度分量的采样频率都是亮度分量的一半。即每 4 个亮度样本对应 1 个 Cb 样本和 1 个 Cr 样本。

1.8 比特深度

1.8.1 什么叫比特深度?

  • 像素种类(色域):
    • 指颜色空间的覆盖范围(如 sRGB、P3、Rec.2020),决定了可表示的颜色范围(如广色域能显示更鲜艳的红色)。
  • 比特深度:
    • 决定每个颜色在色域内的量化精度(如同一红色可细分为 65536 个不同亮度 / 饱和度级别);
    • 比特深度通过提升单个颜色分量的量化精度,实现更平滑的色彩过渡和更细腻的细节表现。

1.8.2 H.265 (HEVC)

  • 支持的比特深度范围
    支持 8 位、10 位和 12 位。比特深度决定每个像素可表示颜色数量,越高则色彩层次越丰富,过渡越平滑。
  • 应用场景
    • 8 位:常见,用于消费级视频内容,如网络视频、电视广播等。可表示 (2^8 = 256) 个不同亮度或色度值,满足一般观看需求。
    • 10 位和 12 位:用于专业视频制作、高端影视及色彩精度要求高场景。10 位可表示 (2^{10} = 1024) 个值,12 位可表示 (2^{12} = 4096) 个值,提供更细腻色彩和更宽动态范围。

1.8.3 H.266 (VVC)

  • 支持的比特深度范围
    除 8 位、10 位、12 位外,还支持 16 位。更高比特深度利于处理丰富色彩信息,在 HDR 和 WCG 视频编码表现更佳。
  • 应用场景
    • 8 - 12 位:与 H.265 类似,用于不同层次视频内容,涵盖消费级到专业级。
    • 16 位:针对色彩精度要求极高特殊应用,如高端电影制作、科学研究、医学影像等。可表示 (2^{16} = 65536) 个值,捕捉呈现细微色彩变化。

1.9 VMAF

面对不同特征的视频源、编码失真以及失真程度,每个衡量指标各有优劣,Netflix通过使用机器学习算法(回归因子(Support Vector Machine,SVM))将基本的指标“融合”为一个最终指标,然后为每个指标分配一定的权重,这样就可以保留每个基本指标的评价优势, 最终得到更精确的分数,这就是VMAF(Video Multimethod Assessment Fusion,视频多方法评估融合)。

1.10 HDR和SDR

HDR(高动态范围)和SDR(标准动态范围)是描述视频或图像亮度范围、色彩精度和对比度的两种技术标准,核心区别体现在对 “光” 的还原能力上。

对比项 HDR(High Dynamic Range,高动态范围) SDR(Standard Dynamic Range,标准动态范围)
动态范围 动态范围大,可同时展现亮部和暗部细节,亮度范围常达 1000 尼特甚至更高,适合高对比度场景 动态范围小,亮度和对比度表现有限,亮度范围通常在 100 尼特左右,难以同时呈现极亮和极暗细节
色彩表现 支持更广色域(如 Rec.2020 ),色彩深度常为 10 位或更高,可显示超 10 亿种颜色,减少色彩断层 色域较窄(如 Rec.709 ),色彩深度通常为 8 位,只能显示约 1670 万种颜色
亮度和对比度 峰值亮度高,高光细节更真实,对比度高,暗部细节清晰,画面层次感强 亮度低,难以表现极亮高光细节,对比度有限,暗部细节易丢失

2.面试问题