本发明涉及自然语言处理及计算机视觉领域,尤其涉及一种多模态方面级情感分析方法及系统。
背景技术:
1、随着社交媒体的快速发展,包含文本、图片、视频、音频等多种模态的多媒体数据在社交平台上广泛传播,如facebook和twitter。多模态情感分析(multimodal sentimentanalysis, msa)正是在这一背景下兴起,通过分析不同模态的数据,自动识别和捕捉用户的情感倾向或态度。这项技术在帮助企业判断用户对产品的满意度、协助政府了解公众对热点问题的意见等方面具有广泛的应用价值。然而,在实际应用中,人们通常在一条推文或评论中表达多个不同方面的观点。例如,在“虽然服务很差,但食物很好吃”这样的评论中,“食物”和“服务”两个方面的情感极性分别为正面和负面。因此,识别并分析多模态数据中不同方面实体的情感极性,已成为多模态情感分析领域中的一个关键挑战。
2、为了解决这一挑战,基于方面的多模态情感分析(aspect-based multimodalsentiment analysis, abmsa)作为一种新兴方法应运而生。abmsa旨在从多模态数据(通常是文本-图片对)中精确识别每个方面实体的情感极性。随着移动设备和社交网络的普及,用户越来越倾向于将图片与文字结合来表达情感或观点,这使得abmsa在个性化广告、情感跨模态检索、意见挖掘、决策支持等领域展现出了广阔的应用前景。
3、鉴于abmsa的较为广泛的应用前景,当前研究人员已提出众多的多模态方面级情感分析模型。然而,以往的方法主要依赖于数据级或决策级的粗粒度融合机制,存在以下四个不足:(1)忽略了视觉信息中可能存在的噪声。(2)各模态特征之间尚未实现精确对齐,且受到不同模态之间语义差异的影响。(3)忽略语境信息对情感分析的互补作用,即同一对象或同一词在不同语境中可能引发不同的情感。(4)在输出层之前,未对提取的高级特征进行进一步的过滤和融合,导致特征冗余。
技术实现思路
1、发明目的:本发明所要解决的技术问题是针对现有技术的不足,提供一种多模态方面级情感分析方法及系统。
2、所述方法包括如下步骤:
3、步骤1,获取多模态数据集,所述多模态数据集中的每条样本包含一组文本、一张关联图片和一个方面词序列,其中所述方面词序列为文本的子序列;使用特殊标志替换文本中的方面词序列,并将替换后的文本与方面词序列进行连接,使用bert的优化版robustly optimized bert approach(roberta)进行编码,获得文本特征表示;在图片特征编码方面,采用快速区域卷积神经网络faster region-based convolutional neuralnetwork(faster r-cnn)获得图片的区域特征表示,然后将图片的区域特征表示通过transformer模型以增强对区域视觉对象间的建模,从而获取图片的区域级视觉特征;
4、步骤2,通过跨模态transformer层对步骤1得到的文本特征表示和区域级视觉特征之间的交互进行建模,结合文本特征和区域级视觉特征,获得图片文本关系,然后生成视觉过滤矩阵对区域级视觉特征进行去噪;
5、步骤3,基于跨模态注意力机制,通过对步骤2去噪后的区域级视觉特征执行单词级注意力操作,从而识别出与每个视觉区域最匹配的文本信息,在特征嵌入空间中实现对图片区域与文本单词的对齐;
6、步骤4,利用区域和单词自适应门去控制区域词对的特征融合,以消除不匹配区域词对的影响,从而得到更有效的特征;
7、步骤5,结合全局信息对步骤4得到的特征进行补充,按照图片文本关系对补充后的特征进行选择,并利用门控机制对多模态特征进行过滤融合,再经过输出层得到情感分类结果;使用交叉熵损失函数计算模型损失,优化训练网络参数,得到训练完成的多模态情感分析模型。
8、步骤1包括:
9、步骤1.1,对文本模态进行编码:对于每条样本中的文本s,使用特殊标志替换该文本中的方面词序列,并将替换后的文本与方面词序列连接,作为文本输入,采用文本预训练模型roberta获得文本特征表示:
10、
11、其中,是文本特征的隐藏维度,是输入长度,表示实数空间;
12、步骤1.2,对图片进行编码:对于输入图片,采用快速区域卷积神经网络fasterr-cnn检测对象提议,根据对象类别检测概率对提议进行排序,并保留前x1(一般取值为100)个对象提议的区域表示作为图片的区域特征表示:
13、
14、其中,是区域特征表示v的隐藏维度,是区域个数;将区域特征表示v通过线性层转换为与文本特征相同的隐藏维度d,以实现文本和视觉特征在维度上的对齐,随后通过transformer模型获取对象级别的区域级视觉特征:
15、
16、其中,和是可学习参数。
17、步骤2包括:
18、步骤2.1,采用跨模态transformer层将文本特征表示作为查询,并将区域级视觉特征作为键和值,如下所示:
19、
20、其中是文本中每个词相关的区域级视觉特征;
21、所述跨模态 transformer层具体实现如下:
22、
23、
24、
25、
26、其中、、分别为线性变换后的查询向量、键向量、值向量;、、是可学习参数;是缩放因子,;表示跨模态操作;t表示矩阵转置;
27、对文本中每个词相关的区域级视觉特征使用最大池化操作得到,以得到最重要的特征用于关系分类;基于,使用sigmoid函数得到图片文本关系预测概率,具体公式为:
28、
29、
30、其中表示与图片文本关系任务相关的最显著特征,,是最大池化操作;表示图片文本关系的类别,是模型预测样本的图片文本关系的类别为的概率,为一个在 [0, 1] 范围内的标量,和是可学习参数;
31、采用交叉熵损失来优化图片文本关系任务:
32、
33、其中是图片文本关系任务的损失函数,是多模态数据集的样本数,表示第u个样本的图片文本关系分类的实际类别,表示模型预测第u个样本的图片文本关系类别为的概率;
34、使用图片文本关系预测概率分数构造一个视觉掩码矩阵,视觉掩码矩阵r中的所有元素都等于图片文本关系预测概率分数,通过视觉掩码矩阵r获得去噪后的区域级视觉特征:
35、
36、其中;为逐元素乘法。
37、步骤3包括:
38、步骤3.1,给定去噪后的区域级视觉特征集合和文本特征表示集合,其中表示去噪后的第个区域级视觉特征,表示文本经过分词后的第个单词的特征;计算区域视觉和单词级文本注意矩阵,将注意矩阵缩放和归一化为区域单词注意矩阵,使用区域单词注意矩阵聚合关于每个视觉区域所匹配的所有单词特征,公式为:
39、
40、
41、
42、其中和是可学习参数,表示第i个视觉区域与第j个词之间的关系,;是缩放因子,;矩阵的第行表示第个视觉区域所匹配的文本特征;
43、步骤3.2,对提取的矩阵进行如下处理:
44、
45、
46、
47、其中和是可学习的参数;表示区域单词对之间的关系分数矩阵,;表示矩阵进行缩放和归一化之后的矩阵,是缩放因子,;表示进一步提取后的区域单词对特征。
48、步骤4包括:
49、步骤4.1,给定去噪后的区域级视觉特征和区域单词对特征,计算自适应门去评估对齐匹配的程度:
50、
51、
52、
53、
54、其中表示第i个区域单词对特征,代表第i个区域级视觉特征,表示衡量区域单词对特征对齐程度的自适应门控值;是融合后的特征;是可学习的参数,relu是线性整流函数;最终得到融合后的特征,表示修正融合后的第个区域单词对特征,,隐含了区域和单词对之间的对齐信息。
55、步骤5包括:
56、步骤5.1,将去噪后的区域级视觉特征、文本特征表示与步骤4得到的特征分别进行连接,将连接后的特征经过全连接层得到线性变换后的特征,公式为:
57、
58、
59、其中表示区域级视觉特征与结合后的融合特征,表示文本特征与结合后的融合特征,、、、是可学习的参数,表示连接操作;
60、第一种情况,如果图片文本关系的预测概率表明图片和文本之间的关系为“无关系”的概率大于“有关系”的概率,则先计算和的关系矩阵,然后使用经过文本特征补充的加上与关系矩阵相乘的,作为最终的特征集合:
61、
62、
63、其中表示图片文本无关系情况下和的关系矩阵;表示图片文本无关系情况下融合后的最终特征集合,、为可学习参数;
64、第二种情况,如果图片文本关系的预测概率表明图片和文本之间的关系为“有关系”的概率大于“无关系”的概率,则先计算和的关系矩阵,然后使用经过区域级视觉特征补充的加上与关系矩阵相乘的,作为最终特征集合:
65、
66、
67、其中分别表示图片文本有关系情况下和的关系矩阵,表示图片文本有关系情况下融合后的最终特征集合,、为可学习参数;
68、步骤5.2,将步骤5.1提取后的最终特征集合或视为特征集合,将特征集合输入到softmax层,预测最终的情感:
69、
70、其中是预测情感类别为的概率,,为可学习的参数;
71、使用交叉熵损失优化基于方面词的多模态情感分析任务,通过情感监督表示来实现:
72、
73、其中是多模态方面级情感分类任务的损失函数,是多模态数据集的样本数,表示第q个样本情感分类的实际类别,表示模型预测第q个样本的情感分类类别为的概率;
74、然后得到最终的损失函数。
75、步骤5.2中,最终的损失函数表示为:
76、
77、其中为超参数。
78、本发明还提供了一种基于所述的方法实现的多模态方面级情感分析系统,包括:
79、图片文本关系模块,获取多模态数据集,所述多模态数据集中的每条样本包含一组文本、一张关联图片和一个方面词序列,其中所述方面词序列为文本的子序列。使用特殊标志$t$替换文本中的方面词序列,并将替换后的文本与方面词序列进行连接,使用bert的优化版roberta进行编码,获得文本特征表示;在图片特征编码方面,采用快速区域卷积神经网络faster r-cnn获得图片的区域特征表示,然后将图片的区域特征表示通过transformer模型以增强对区域视觉对象间的建模,从而获取图片的区域级视觉特征;通过跨模态transformer层对文本特征表示和区域级视觉特征之间的交互进行建模,结合文本特征和区域级视觉特征,获得图片文本关系,然后生成视觉过滤矩阵对区域级视觉特征进行去噪;
80、跨模态对齐修正模块,基于跨模态注意力机制,通过对去噪后的区域级视觉特征执行单词级注意力操作,从而识别出与每个视觉区域最匹配的文本信息,在特征嵌入空间中实现对图片区域与文本单词的对齐。由于学习到的区域单词对并不都是完美匹配的,不匹配的区域单词对特征会降低性能。因此,本发明利用区域和单词自适应门去控制区域词对的特征融合,以消除不匹配区域词对的影响,从而得到更有效的特征;
81、特征融合模块,结合全局信息对跨模态对齐修正模块得到的特征进行补充,按照图片文本关系对补充后的特征进行选择,并利用门控机制对多模态特征进行过滤融合,再经过输出层得到情感分类结果。
82、本发明还提供了一种电子设备,包括处理器和存储器,所述存储器存储有程序代码,当所述程序代码被所述处理器执行时,使得所述处理器执行所述的方法的步骤。
83、本发明还提供了一种存储介质,存储有计算机程序或指令,当所述计算机程序或指令在计算机上运行时,执行所述的方法的步骤。
84、与现有技术相比,本发明具有以下有益效果:
85、 (1) 本发明利用图片文本关系模块生成视觉掩码矩阵,有效去除视觉噪声,避免干扰,提高模型准确性和鲁棒性。
86、 (2) 通过引入跨模态对齐修正模块,捕捉区域级视觉特征与文本单词的对应关系,并通过自适应门控机制融合有效的区域单词对,消除不匹配区域词对的影响,增强多模态特征融合,提升交互效果。
87、 (3) 本发明充分考虑语境对情感分析的影响,通过深度过滤和融合特征,有效去除冗余,准确识别不同语境下的情感倾向。
88、 (4)本发明所提出的方法在twitter2015和twitter2017取得了具有竞争力的性能效果。
1.一种多模态方面级情感分析方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的方法,其特征在于,步骤1包括:
3.根据权利要求2所述的方法,其特征在于,步骤2包括:
4.根据权利要求3所述的方法,其特征在于,步骤3包括:
5.根据权利要求4所述的方法,其特征在于,步骤4包括:
6.根据权利要求5所述的方法,其特征在于,步骤5包括:
7.根据权利要求6所述的方法,其特征在于,步骤5.2中,最终的损失函数表示为:
8.一种基于如权利要求1~7任一项所述的方法实现的多模态方面级情感分析系统,其特征在于,包括:
9.一种电子设备,其特征在于,包括处理器和存储器,所述存储器存储有程序代码,当所述程序代码被所述处理器执行时,使得所述处理器执行如权利要求1至7中任一项所述的方法的步骤。
10.一种存储介质,其特征在于,存储有计算机程序或指令,当所述计算机程序或指令在计算机上运行时,执行如权利要求1至7中任一项所述的方法的步骤。
