本发明涉及视频编码技术,具体涉及基于通道上下文的全i帧(all-intra)视频压缩方法,属于图像通信领域。
背景技术:
1、近年,高清视频应用的普及以及新兴视频形式的出现使得视频数据量增长到了前所未有的高度。此外,得益于移动互联网的迅速发展,用户可以随时随地上传高清视频,这进一步给视频传输和存储系统造成了严峻的挑战。由于人们对视觉内容的需求持续增长,对图像和视频压缩的研究逐渐引起研究人员的重视。现有的编码标准,图像压缩的jpeg、jpeg2000、bpg和用于视频压缩的avc/h.264、hevc/h.265、vvc/h.266,都是与块相关的,每个块也是按顺序执行的。传统图像和视频压缩方法通过精细设计的人工技术和复杂的处理获得了良好的性能,但是采用混合框架提高压缩效率引入了分块效应。虽然每个模块通常都是独立设计和优化的,这也因为局部优化而限制了压缩性能,不能以端到端的方式进行联合优化。近年来,随着深度学习技术的再次兴起及其在计算机视觉领域的广泛成功,视频编码技术开启了端到端自动建模的研究新领域。与传统的视频编码压缩标准不同,基于学习的视频压缩方法可以在避免造成块类伪影的同时,更高效的提取和利用数据的特征,从而获得更好的重建帧质量。
2、最近,各种基于学习的图像压缩模型被提出,取得了显著的性能。这些模型大多基于变分自编码器,遵循变换、量化、熵编码和逆变换过程。熵编码在提高模型性能方面起着重要作用。一个强大而准确的熵模型通常会产生更少的比特。最先进的图像压缩模型通常将超先验模型和上下文结合起来估计条件熵,并使用条件概率进行编码。然而,这些图像压缩中的熵值模型未能考虑潜在特征中不同通道之间的依赖关系,从而阻碍了熵模型的准确估计。以前的研究都集中在图像和视频压缩方面,但很少有研究分析基于学习的全i帧(all-intra)视频编码。帧内压缩除了影响当前帧的编码质量,由于使用帧内预测的关键帧会被帧间压缩参考,对帧间压缩影响也极为关键。因此,帧内压缩的效率和准确性十分重要。
3、传统的深度视频编码方法主要通过分析深度视频的内容特性建立相应的模型,进而提高深度视频编码效率。近年来,随着以卷积神经网络(convolutional neuralnetwork, cnn)为代表的深度学习相关理论不断发展和快速进步,通过机器自主学习最优处理方法成为了视频编码领域的新兴研究方向。与传统图像或视频编码方法不同,基于卷积神经网络的方法根据所涉及的具体问题,有针对性地设计深度神经网络结构,通过恰当的训练策略使网络完成编码体系内某一特定目标。相关研究表明,基于卷积神经网络的方法能够处理更为复杂的任务,获得更优的性能。受其启发,研究如何将卷积神经网络融入到深度视频编码体系中,通过其优异的学习特性提高编码效率,具有重要的研究意义和广阔的应用前景。
技术实现思路
1、帧内压缩的主要目的是通过帧内压缩算法对帧内编码帧进行压缩编码,在解码端生成在一定码率下更高质量解码帧。本发明首先系统的研究和总结了深度学习压缩技术关键算法和其改进,采用了基于变分自编码器的网络结构,设计一个全i帧视频压缩框架。针对图像质量损失问题,增加了后处理模块,采用级联的残差网络来减小当前帧在压缩过程中产生的信息损失。
2、本发明所提出了一种基于变分自编码器并结合跨通道上下文和超先验信息的全i帧视频压缩方法。首先通过引入变分自编码器结构,采用深层残差学习的方式,通过对不同层级的特征层采用不同的注意力机制实现更好的特征强化效果,引入超先验信息编码结构,实现更符合针对图像内像素条件高斯分布的采样,同时对上下文网络进行改进,得到潜在信息更精确的概率模型参数,本发明的整体框架如附图1所示。
3、主要包括以下操作步骤:
4、(1)输入帧首先被发送到主编码器网络(), x被转换成潜在特征y;
5、(2)结合(1)得到的潜在特征y并对其进行量化和熵编码,量化的潜在表示用表示;
6、(3)超先验模型被引入,y经过超先验编码器网络(处理,超先验网络中的模块获得隐含信息,然后将其变换表示为新的中间信息;
7、(4)中间信息被量化为 之后进入算数编码器,获得比特流,超先验解码器网络(重构超先验信息,得到熵模型估计参数;
8、(5)根据已知的概率分布参数恢复,然后将输入主解码器网络()以生成重建帧;
9、(6)重建后的帧再经过质量增强模块,输出深度学习下重建的帧。
10、具体地,在变换编码过程中,输入帧的压缩过程可以用公式(1)表示为:
11、
12、其中,和分别是主编码器网络和主解码器网络中需要优化的参数,q表示量化过程,e表示质量增强模块。
13、引入超先验,利用边信息z来捕获元素之间的空间依赖性,其表达式为:
14、
15、其中和是和对应的优化参数,是模型估计。
16、在基于学习的端到端图像压缩编码中,可以利用上下文模块对图像压缩的过程进行优化。然而,现有的潜在表示熵模型不能充分利用其空间和通道方面的相关性,我们在熵模型中考虑潜在特征通道间的相关性并结合上下文,提出基于跨通道的上下文模型如附图2所示来改善熵模型的性能。首先将潜在特征按通道划分为两组特征和,然后特征通过一个掩膜卷积得到特征,特征通过跨通道搜索模型生成特征,将解码后的特征与超先验输出相结合,掩膜2d卷积和跨通道搜索模块被用来融合超先验和自回归先验,以进行准确的熵估计。跨通道搜索模块在第二组的潜在特征上进行搜索,找到与第一组潜在特征中的目标潜在特征最相似的相关潜在特征。我们使用内积来估计两个特征块之间的相关性,从而建立它们之间的相关性。内积越大,两个特征块之间的相关性越大,可以迁移的特征信息也就越多。相反,内积更小。
17、步骤(1)中的编码器网络由两种变换块组成如附图3所示:残差下采样层和残差增强层。残差下采样层包括双层卷积,此外前层采用 leakyrelu 作为激活函数,后层则是gdn。如附图4所示,采用一种轻量化残差块(lrb)实现前层特征的学习并结合注意力特征,轻量化残差块较通常残差块拥有更少的参数量以及相当的感受野,同样减少拟合难度。基于轻量化残差块,在编码网络中间引入基于池化的注意力模块(pooling-basedattention)实现对非局部域的特征增强。在编码器最后,有一个下采样卷积层和不同于pooling-based attention的轻量级的非局部残差注意层如附图5所示,以增加感受野。解码网络与编码网络拥有相似的结构,即特征编码的逆过程。如附图3(3)所示,残差上采样层中的上采样模块(up-sample)由一个卷积层和 pixelshuffle上采样方法串联构成,该上采样方法在增大特征图尺寸的同时,减小相应通道数量。
18、受图像质量增强网络的成功启发,我们增加了轻量级的residual dense network(rdn)作为我们的后处理网络。
19、本发明训练算法的率失真函数为:
20、
21、d(·) 表示重构图像和原始图像之间的失真测量值。根据模型的最终性能指标不同,采用不同的失真函数。峰值信噪比(psnr)经常用作图像压缩等领域中信号重建质量的测量方法,它常简单地通过均方差(mse)进行定义,并且由于psnr与mse呈负相关的函数关系,在以 psnr 作为率失真评价中的图像失真评价时,则 mse 作为损失函数中的失真项。而采用另一种图像评价的失真函数多尺度结构相似性(ms-ssim)时,由于ms-ssim 越高则代表两张图像质量越好,故而采用1-ms-ssim作为率失真损失函数的失真项。,分别表示量化后潜在特征和超先验信息的码率估计值。通过调整拉格朗日常数λ可以得到不同压缩条件下的压缩图像,在本发明中,当用mse计算失真项时令,用ms-ssim计算失真项时令。
22、本发明与现有技术相比所具有的优点及有益技术效果:
23、(1)本发明提出一种基于通道上下文的全i帧视频压缩方法,该方法从基于学习的图像压缩方法汲取灵感,研究基于学习的全i帧视频压缩方法,充分考虑潜在特征不同通道间的相关性并结合超先验信息进行熵估计。
24、(2)本发明联合利用二维掩码卷积和通道之间的依赖关系来进行更准确的熵估计。在本方法中,全i帧压缩和质量增强模块被联合训练和优化,以最小化损失函数。
25、(3)实验结果表明,该方法不管是在客观指标层面还是主观效果层面都可以获得更好的压缩效果。
1.一种基于通道上下文的全i帧视频压缩方法其特征在于考虑潜在特征通道间的相关性并结合超先验信息,其步骤如下:
