本发明涉及机器学习领域,具体来说涉及机器学习领域的多元时间序列应用领域,更具体地说,涉及一种面向非完整多元时间序列预测的学习方法。
背景技术:
1、多元时间序列是由两个或多个相关时间序列组成的数据集,这些时间序列可以是同一主题下的不同指标,如经济、气象、医疗等领域的多个相关数据指标。多元时间序列预测是预测分析和数据科学领域的一个重要方向,它涉及到同时使用多个时间序列变量来预测未来的值,能够帮助企业和政府部门在有限的信息下做出更准确的决策。与单变量时间序列预测相比,多元时间序列预测利用了各个变量之间的相互关系,能够提供更为准确和全面的预测结果。然而,由于时间序列自身的非线性以及不同时间序列之间存在复杂的空间依赖关系,预测的准确性一直是学术界和工业界的难点问题。
2、主流的多元时间序列预测技术通常可以分为统计学方法、机器学习方法和深度学习方法。其中,统计学方法依赖于将时间序列建模过程用先验知识形式化为数学公式,这一手段在处理规律性较强的平稳数据时相对有效;但是,对于非平稳数据,该方法往往无法充分利用专家经验来分析数据的动态变化。而机器学习方法,例如:支持向量机和随机森林是通过非线性建模的思想来增强对时间序列历史数据的分析以及未来趋势的预测能力,但是机器学习方法主要是针对单变量时间序列预测设计的,未能有效地解析多个时间序列之间的交互作用。
3、相较于统计学方法和机器学习方法,深度学习方法因其出色的非线性建模能力和对空间关系的深入分析而受到了广泛关注。经典的深度学习模型,如递归神经网络和卷积神经网络分别通过序列建模和卷积层技术,有效地挖掘出多元时间序列之间的时空依赖。除此之外,随着计算资源的不断扩大,时空图神经网络以及基于注意力的transformer模型进一步加强了上下文信息的利用以及空间关系的建模,使得深度学习模型得到了广泛应用。
4、虽然深度学习模型取得了令人满意的结果,但是它们所使用的评测数据集通常都是较为完整的且被清洗过的。然而,在现实生活中,多元时间序列预测任务通常面临一个重要的挑战,即数据缺失问题,这通常是由于数据采集器发生问题所导致的。当数据采集器受到恶劣天气或自然灾害的影响时,根据自然灾害发生的时间和位置的不同,数据采集器通常会在不同的时段发生故障,这导致数据在时间和空间维度都发生随机性的缺失。综合来说,数据采集器的异常会导致多元时间序列存在非完整的问题,发生故障的传感器会在一段时间或多段时间无法输出有效值,导致原始的时间序列被破坏。而且,当部分传感器发生故障时,获取的多元时间序列中只有部分正常的数据采集器收集到的数据,发生故障的传感器对应的数据位为0。
5、现有模型应用在数据缺失率较大的数据集上时,模型通常难以产生令人满意的预测结果,除此之外,数据的缺失率通常是随时间不断变化的,而现有的工作通常需要针对不同的缺失率训练多个模型,这限制了模型的鲁棒性。
6、需要说明的是:本背景技术仅用于介绍本发明的相关信息,以便于帮助理解本发明的技术方案,但并不意味着相关信息必然是现有技术。在没有证据表明相关信息已在本发明的申请日以前公开的情况下,相关信息不应被视为现有技术。
技术实现思路
1、因此,本发明的目的在于克服上述现有技术的缺陷,提供一种面向非完整多元时间序列预测的学习方法。
2、本发明的目的是通过以下技术方案实现的:
3、根据本发明的第一方面,提供了一种训练学生模型的方法,所述方法包括:获取第一训练集,其包括多个未经缺失处理的原始样本和每个原始样本对应的标签,所述原始样本为历史观测值,所述标签为对应历史观测值之后观测到的真实值;获取利用原始样本和标签训练得到教师模型,其包括用于从原始样本提取教师表征的特征提取器以及用于根据教师表征得到教师预测结果的回归层;利用多种缺失率对第一训练集中的每个原始样本进行缺失处理,得到对应的缺失样本,所有缺失样本以及对应的标签组成第二训练集;获取学生模型,其包括用于从缺失样本提取学生表征的特征提取器以及用于根据学生表征得到学生预测结果的回归层;利用所述第二训练集、教师表征和教师预测结果对学生模型进行训练,其中,训练时,基于预设的总损失函数更新学生模型的参数,得到经训练的学生模型,所述总损失函数包括以下损失函数的加权求和:表征损失函数,用于确定教师表征和学生表征间的损失;预测结果损失函数,用于确定教师预测结果和学生预测结果间的损失;对比损失函数,用于确定同一原始样本对应的不同缺失样本的学生表征间以及不同原始样本对应的缺失样本的学生表征间的对比损失;绝对误差损失函数,用于确定学生预测结果和对应标签间的损失。
4、在本发明的一些实施例中,所述总损失函数为:
5、
6、其中,表示表征损失函数,表示预测结果损失函数,表示对比损失函数,表示绝对误差损失函数,α、β、γ和λ分别表示表征损失函数、预测结果损失函数、对比损失函数和绝对误差损失函数对应的权值。
7、在本发明的一些实施例中,所述表征损失函数为:
8、
9、其中,n表示原始样本的数量,m表示缺失率的数量,表示第n个原始样本的教师表征,表示第n个原始样本对应的第i个缺失样本的学生表征,mean(·)表示张量的均值。
10、在本发明的一些实施例中,所述预测结果损失函数为:
11、
12、其中,n表示原始样本的数量,m表示缺失率的数量,表示第n个原始样本的教师预测结果,表示第n个原始样本对应的第i个缺失样本的学生预测结果,mean(·)表示张量的均值。
13、在本发明的一些实施例中,所述对比损失按照以下方式确定:获取所有缺失样本对应的学生表征,并将每一个缺失率对应的所有缺失样本的学生表征作为一个表征样本集;将每两个表征样本集组成样本组,从每个样本组中确定锚定样本、正样本和负样本,其中,正样本与锚定样本为来源于同一原始样本但缺失率不同的缺失样本所对应的学生表征,负样本与锚定样本为来源于不同原始样本的缺失样本所对应的学生表征;根据每个锚定样本对应的正样本和负样本计算该锚定样本的子损失;根据每个样本组中所有样本的子损失确定各个样本组的子对比损失;基于预设的对比损失函数根据所有样本组的子对比损失确定对比损失。
14、在本发明的一些实施例中,所述对比损失函数表示为:
15、
16、其中,m表示缺失率的数量,pq表示第p个表征样本集和第q个表征样本集组成的样本组,lpq表示样本组pq的子对比损失。
17、在本发明的一些实施例中,所述学生模型为气象预测模型时,所述历史观测值为不同位置下的气象数据构成的多元时间序列,所述标签为对应历史观测值之后观测到的气象真实值;或者,所述学生模型为交通流预测模型时,所述历史观测值为多个路口的交通流数据构成的多元时间序列,所述标签为对应历史观测值之后观测到的交通流数据真实值。
18、根据本发明的第二方法,提供了一种利用本发明的第一方面所述方法得到的经训练的学生模型实现预测的方法,其包括:获取历史观测值;将所述历史观测值输入所述经训练的学生模型进行预测,得到预测结果。
19、与现有技术相比,本发明的优点在于:
20、通过设置多种缺失率对原始样本进行缺失处理,以模拟实际应用场景中采集到的缺失数据,使得根据原始样本的表征和缺失样本的表征确定的表征损失函数、原始样本的预测结果和缺失样本的学生预测结果确定的预测结果损失函数、缺失样本的表征确定的对比损失函数以及缺失样本的预测结果和对应标签确定的绝对误差损失函数进行加权求和得到总损失函数,不仅能够减小缺失样本的表征与原始样本的表征之间的差异,以及缺失样本的预测结果与原始样本的预测结果之间的差异,还能够拉近属于同一原始样本的不同缺失率的缺失样本间的距离,拉远不属于同一原始样本的缺失样本间的距离;使得根据总损失函数更新后的学生模型具有更好的泛化能力,无论是对完整数据的预测还是缺失数据的预测,其预测结果都更为准确,尤其是对缺失数据的预测,对不同缺失率下的数据都具有很好的预测精度,其模型的预测性能也更加稳定,解决了现有模型无法对多种缺失率数据进行预测且预测精度不高的问题,使得通过该方法得到的模型更具有实际应用价值。
1.一种训练学生模型的方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述总损失函数为:
3.根据权利要求2所述的方法,其特征在于,所述表征损失函数为:
4.根据权利要求3所述的方法,其特征在于,所述预测结果损失函数为:
5.根据权利要求2所述的方法,其特征在于,所述对比损失按照以下方式确定:
6.根据权利要求5所述的方法,其特征在于,所述对比损失函数表示为:
7.根据权利要求1-6之一所述的方法,其特征在于,
8.一种利用如权利要求1-7之一所述方法得到的经训练的学生模型实现预测的方法,其包括:
9.一种计算机可读存储介质,其特征在于,其上存储有计算机程序,所述计算机程序可被处理器执行以实现权利要求1至8之一所述方法的步骤。
10.一种电子设备,其特征在于,包括:
