本发明属于深度学习的图像处理领域,更具体地,涉及一种基于扩散模型的人脸照片转素描生成模型训练方法、生成方法、系统及计算机可读存储介质。
背景技术:
1、人脸素描是数字娱乐领域中最受欢迎和最基本的肖像画风格之一,然而艺术家绘制面部素描的过程是比较费时费力的,这也导致了现有的人脸素描数据集的规模非常小,特别是在当今的大数据时代,可用的最大人脸照片素描数据集仅包含数千张图像。同时受限于艺术家作画风格和水平问题,所作的作画可能与实际人脸差别较大难以辨识,现有的不少人脸照片素描数据集中,素描所画形象与原照片在相似度上有一定差距。考虑到人工创建人脸素描的负担,研究自动处理人脸照片转素描的技术是必要的,现有的人脸照片转素描生成研究工作主要研究将照片直接转化为相应素描的工作,它可以扩大现有的人脸素描数据集,用于未来的研究。
2、如今许多人脸素描生成工作,如peng等人2023年的研究工作“hifisketch:highfidelityface photo-sketch synthesis and manipulation”等,都已经取得了不错的成果。但所用方法的生成能力仍然是有限的,需要大量的数据进行训练。虽然能够得到不错的生成效果,但也意味着相应训练成本的增加。对于素描领域这种需要大量时间和人力成本才可获得一定数量的训练数据集则更是有许多负担。同时受训练数据集的影响,虽然生成效果能做到和训练数据集保持相近的作画质量和风格,但是如果训练数据集本身的作画质量就有限时,模型产生的素描也难以保持和原照片极高的相似度。因此探索出能够节约训练成本、提高效率,辨识度更佳的新方法尤为关键。
3、现有技术公开号为cn117745521a的发明专利提出了图像风格转换方法、装置、电子设备及存储介质,该方法包括:获取待处理图像;对所述待处理图像进行编码,得到第一特征图;对所述待处理图像进行特征提取,得到至少一个第二特征图,其中,每个第二特征图用于表征所述待处理图像中的一个显性特征;将所述第一特征图与所述至少一个第二特征图进行融合,以对所述待处理图像进行风格转换,得到目标图像。该方案存在训练速度慢,作画质量不高的问题。
技术实现思路
1、本发明为克服现有技术中训练速度慢,作画质量不高,需要大量的数据进行训练的问题,提供一种基于扩散模型的人脸照片转素描生成模型训练方法。
2、本发明第一方面提供了一种基于扩散模型的人脸照片转素描生成模型训练方法,包括如下步骤:
3、初始化预训练的扩散模型的时间步、训练次数阈值和文本指令,获取人脸照片及其素描画像组成样本对数据集,选用其中一对样本作为训练集,其余作为测试集;
4、利用所述训练集、文本指令在预训练的扩散模型上进行图像重建过程,过程中使用预设策略训练文本指令,得到训练后的文本指令;
5、利用所述训练后的文本指令作为输入,与训练集一同输入到所述扩散模型中重复上述文本训练过程,直到训练次数达到训练次数阈值时,输出优化过的文本指令;
6、利用所述扩散模型和优化过的文本指令将测试集的人脸照片转化成人脸素描画像,测试过程中可以把额外信息嵌入到所述优化过的文本指令中,标记所述的额外信息为需要特别关注的部分以更加灵活地控制输出的效果。
7、进一步地,所述在预训练的扩散模型上进行图像重建过程是在不微调模型的情况下进行的。
8、进一步地,所述训练文本指令的预设策略是通过利用图像重建策略和利用clip确定的编辑方向进行训练的策略相结合,利用两种策略的总损失函数结合梯度下降算法来对文本指令进行训练,梯度下降算法的公式为:
9、
10、其中,γ表示学习率,是损失函数关于ct的梯度。
11、进一步地,所述采用图像重建策略具体方法是:
12、对素描样本对{x,y}进行编码获得潜在变量zx和zy,其中,x为人脸图像,y为x对应的素描图像;
13、对zy在时间步t下进行加噪,将图片逐步变成噪声图片;
14、将文本指令ct,zx,时间步t,所述噪声图片输入至预训练的去噪网络,在时间步t下进行去噪,得到去噪变量
15、重建过程中通过损失函数不断优化文本指令,损失函数的公式为:
16、
17、其中,ε为编码器,∈为高斯噪声,∈θ为去噪网络。
18、进一步地,所述利用clip确定的编辑方向进行训练的策略具体方法是:
19、通过将人脸照片和素描图片编码至嵌入空间,计算图片之间的clip嵌入的距离;
20、利用所述距离根据损失函数优化文本指令ct,选用余弦相似度作为损失函数,损失函数的公式为:
21、
22、其中,对于给定的训练集素描样本对{x,y},计算x和y的clip嵌入的距离,记为δedit,即δedit=clipimage(y)-clipimage(x)。
23、进一步地,所述总损失函数的公式为:
24、
25、其中,λrec和λedit为超参数。
26、本发明第二方面提供了一种基于扩散模型的人脸照片转素描生成方法,所述方法采用上述训练得到的模型,利用所述模型对待转素描的图片转素描,得到转素描后的图像。
27、本发明第三方面提供了一种基于扩散模型的人脸照片转素描生成模型训练系统,其特征在于,该系统包括:存储器、处理器,所述存储器中包括基于扩散模型的人脸照片转素描生成模型训练方法程序,所述基于扩散模型的人脸照片转素描生成模型训练方法程序被所述处理器执行时实现如下步骤:
28、初始化预训练的扩散模型的时间步、训练次数阈值和文本指令,获取人脸照片及其素描画像组成样本对数据集,选用其中一对样本作为训练集,其余作为测试集;
29、利用所述训练集、文本指令在预训练的扩散模型上进行图像重建过程,过程中使用预设策略训练文本指令,得到训练后的文本指令;
30、利用所述训练后的文本指令作为输入,与训练集一同输入到所述扩散模型中重复上述文本训练过程,直到训练次数达到训练次数阈值时,输出优化过的文本指令;
31、利用所述扩散模型和优化过的文本指令将测试集的人脸照片转化成人脸素描画像,测试过程中可以把额外信息嵌入到所述优化过的文本指令中,标记所述的额外信息为需要特别关注的部分以更加灵活地控制输出的效果。
32、进一步地,所述利用训练集在预训练的扩散模型上进行图像重建过程是在不微调模型的情况下进行的。
33、本发明第四方面提供了一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中包括基于扩散模型的人脸照片转素描生成模型训练方法程序,所述基于扩散模型的人脸照片转素描生成模型训练方法程序被处理器执行时,实现所述的一种基于扩散模型的人脸照片转素描生成模型训练方法的步骤。
34、与现有技术相比,本发明技术方案的有益效果是:
35、将扩散模型应用到人脸素描生成工作,仅用一组素描样本对模型进行训练,得益于扩散模型强大的生成能力,生成素描可以克服训练数据集本身的作画质量问题,与原图像保持极高相似度,易于辨识,相较于以往的人脸素描生成技术,本方法运行速度大幅加快,大幅节省训练成本,效率高,可适应不同风格作画。
1.一种基于扩散模型的人脸照片转素描生成模型训练方法,其特征在于,包括如下步骤:
2.根据权利要求1所述的一种基于扩散模型的人脸照片转素描生成模型训练方法,其特征在于,所述在预训练的扩散模型上进行图像重建过程是在不微调模型的情况下进行的。
3.根据权利要求1所述的一种基于扩散模型的人脸照片转素描生成模型训练方法,其特征在于,所述训练文本指令的预设策略是通过利用图像重建策略和利用clip确定的编辑方向进行训练的策略相结合,利用两种策略的总损失函数结合梯度下降算法来对文本指令进行训练,梯度下降算法的公式为:
4.根据权利要求3所述的一种基于扩散模型的人脸照片转素描生成模型训练方法,其特征在于,所述采用图像重建策略具体方法是:
5.根据权利要求3所述的一种基于扩散模型的人脸照片转素描生成模型训练方法,其特征在于,所述利用clip确定的编辑方向进行训练的策略具体方法是:
6.根据权利要求3所述的一种基于扩散模型的人脸照片转素描生成模型训练方法,其特征在于,所述总损失函数的公式为:
7.一种基于扩散模型的人脸照片转素描生成方法,所述方法采用权利要求1-6训练得到的模型,利用所述模型对待转素描的图片转素描,得到转素描后的图像。
8.一种基于扩散模型的人脸照片转素描生成模型训练系统,其特征在于,该系统包括:存储器、处理器,所述存储器中包括基于扩散模型的人脸照片转素描生成模型训练方法程序,所述基于扩散模型的人脸照片转素描生成模型训练方法程序被所述处理器执行时实现如下步骤:
9.根据权利要求8所述的一种基于扩散模型的人脸照片转素描生成模型训练系统,其特征在于,所述利用训练集在预训练的扩散模型上进行图像重建过程是在不微调模型的情况下进行的。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中包括基于扩散模型的人脸照片转素描生成模型训练方法程序,所述基于扩散模型的人脸照片转素描生成模型训练方法程序被处理器执行时,实现如权利要求1至6中任一项所述的一种基于扩散模型的人脸照片转素描生成模型训练方法的步骤。
