本发明涉及计算机视觉领域,特别涉及基于语义图的轻量级多视角三维人体姿态估计方法及系统。
背景技术:
1、传统的三维人体姿态估计方法通常依赖于单视角图像数据,导致在关键信息捕捉上面临深度不确定性的问题,人体的三维结构的准确性和完整性难以保障。这使得基于单视角的姿态估计方法在复杂场景下的姿态估计表现不尽如人意,尤其是在公共安全、运动分析等应用场景中,限制了模型在实际应用中的有效性。随着深度学习和计算机视觉技术的发展,针对多视角信息的融合方法逐渐成为研究热点。深度学习的引入为姿态特征的动态学习和融合提供了新的可能性,能够有效结合人体关节位置信息、空间结构和骨骼边缘特征,从而显著增强姿态特征的表示能力。然而,如何构建一个有效的多视角时空特征融合框架,使其能够减轻在单视角条件下的深度不确定性,仍然是一个亟待解决的难题。此外,不同边缘设备在数据收集中的固有差异,例如摄像头视角、动态范围和数据模态的多样性,也给三维姿态估计带来了挑战。这些因素会导致模型在不同设备间表现的显著差异,从而影响整体准确性。同时,目前高精确的三维姿态估计模型往往需要大量的计算资源和存储空间,这对许多资源受限的设备(如移动设备和嵌入式系统)来说,难以实现实时的姿态估计。现有多视角三维姿态估计技术中,普遍依赖于相机参数的精确性以及模型资源消耗过大的问题,这些技术在实际应用中往往面临着计算效率低下和部署难度大的挑战,限制了其在实时场景中的应用。因此,在设计与实施多视角三维人体姿态估计方法时,如何在兼顾时空信息的完整性与模型轻量化的同时,合理并准确地进行跨视角空间特征融合是当前研究面临的重要挑战。
技术实现思路
1、针对以上问题,本发明提出了基于语义图的轻量级多视角三维人体姿态估计方法及系统,通过构建出基于语义图的轻量级的三维人体姿态估计模型,增加了不同场景中的适应性;且本发明不依赖于相机参数,显著提升了多视角三维姿态估计的准确性和效率。
2、一方面,一种基于语义图的轻量级多视角三维人体姿态估计方法,具体步骤如下:
3、s1,获取多视角二维人体姿态数据;
4、s2,构建三维人体姿态估计模型;所述三维人体姿态估计模型包括若干空间位置嵌入块、若干动态修剪块、若干语义图变换器编码器、多视角空间融合块、多视角时空融合块和回归层;
5、一个空间位置嵌入块、一个动态修剪块和一个语义图变换器编码器为一组,每组的输入来自同一个多视角二维人体姿态数据的不同视角的单视角二维人体姿态数据;
6、所述空间位置嵌入块,使用节点位置嵌入函数和空间图嵌入函数对单视角二维人体姿态数据进行处理,得到节点位置嵌入和空间图嵌入,并将节点位置嵌入和空间图嵌入拼接成输入标记;
7、所述动态修剪块,对输入标记进行池化操作和剪枝操作,获得代表性标记;
8、所述语义图变换器编码器,提取输入的代表性标记中的节点特征作为输出;
9、所述多视角空间融合块,将所有语义图变换器编码器输出的节点特征进行多视角空间融合,获得多视角空间融合特征;
10、所述多视角时空融合块,对输入的多视角空间融合特征进行多视角跨通道融合,再进行多视角时空融合,获得多视角时空融合特征;
11、所述回归层,将输入的多视角时空融合特征转换为三维姿态坐标作为三维人体姿态估计模型的输出;
12、s3,基于获取的多视角二维人体姿态数据对三维人体姿态估计模型进行训练,得到训练好的三维人体估计模型;
13、s4,使用训练好的三维人体姿态估计模型进行三维人体姿态估计。
14、优选的,所述节点位置嵌入函数表示为:
15、
16、其中,表示节点位置嵌入;表示单视角二维人体姿态数据中第帧的第个关节的位置坐标;表示特征转换函数,将输入特征映射到维空间;表示将所有的整合成一个表征;t表示帧数;j表示关节数。
17、优选的,所述空间图嵌入函数表示为:
18、
19、其中,表示空间图嵌入;表示第阶的权重矩阵;表示引入自连接和对称归一化后的第阶的邻接矩阵;表示非线性激活函数;表示种全局到局部图特征的连接。
20、优选的,所述对输入标记进行池化操作和剪枝操作,获得代表性标记,具体如下:
21、对输入标记通过空间平均池化,生成池化标记;对应用密度峰值聚类算法,获取代表性标记,并丢弃其余池化标记。
22、优选的,所述密度峰值聚类算法基于k近邻算法,根据池化标记的特征相似性分组聚类,并将聚类中心作为代表性标记,具体如下:
23、对于第个池化标记,对应的密度表示为:
24、
25、其中,表示池化标记的k近邻;表示用于计算局部密度的个最近邻的数量;表示和之间的欧氏距离,表示和之间的欧氏距离的平方;
26、使用表示池化标记与其他池化标记的距离;如果存在一个池化标记的密度大于池化标记的密度,那么为池化标记到所有这些密度更高的池化标记之间的最小欧氏距离;如果不存在一个池化标记的密度大于,那么为池化标记到所有其他池化标记之间的最大欧氏距离;计算公式如下:
27、
28、其中,表示对应的密度;
29、将池化标记的聚类中心得分表示为;
30、最后,选择得分最高的前个池化标记作为聚类中心,其余的池化标记被分配给密度更高的最近聚类中心;将聚类中心作为代表性标记;其中,表示超参数。
31、优选的,所述语义图变换器编码器通过语义注意力深入挖掘隐藏在代表性标记中的语义信息;语义注意力表示如下:
32、
33、
34、
35、
36、其中,表示语义注意力;表示语义注意力的query参数;表示语义注意力的key参数;表示语义注意力的value参数;、和表示线性层;表示特征维度;表示代表性标记中的剪枝后的节点位置嵌入;表示代表性标记中的剪枝后的空间图嵌入;作为位置特征的偏置项,表示关节空间和位置知识的结合;表示的转置;表示归一化操作。
37、优选的,采用多头语义注意力进一步增强剪枝后的节点位置嵌入的特征,表示为:
38、
39、其中,表示多头语义注意力;表示个注意力头的连接;表示第h个注意力头的;表示第h个注意力头的;表示第h个注意力头的。
40、优选的,所述将所有语义图变换器编码器输出的节点特征进行多视角空间融合,获得多视角空间融合特征,具体如下:
41、首先,生成最终融合特征输出,公式如下:
42、
43、
44、
45、其中,、和表示线性层;表示视角输出的节点特征;表示视角输出的节点特征;表示多头注意力机制,作为多头注意力的query参数,作为多头注意力的key参数,作为多头注意力的value参数;表示融合节点特征;表示归一化操作;mlp表示多层感知机;表示最终融合特征输出;
46、最后,将与和连接,生成多视角融合空间特征,表示为:
47、
48、其中,表示多个特征向量进行连接操作。
49、优选的,所述对输入的多视角空间融合特征进行多视角跨通道融合,再进行多视角时空融合,获得多视角时空融合特征,具体如下:
50、将多视角空间融合特征输入多视角跨通道融合块生成多视角跨通道融合特征;将得到的多视角跨通道融合特征进行多视角时空融合,得到多视角时空融合特征;多视角时空融合特征计算公式如下:
51、
52、其中,表示多头交叉注意力;ln表示归一化操作;表示可学习的时间位置嵌入;作为多头交叉注意力的query参数,作为多头交叉注意力的key参数和value参数。
53、另一方面,一种基于语义图的轻量级多视角三维人体姿态估计系统,包括如下:
54、数据获取模块,用于获取多视角二维人体姿态数据;
55、模型构建模块,用于构建三维人体姿态估计模型;所述三维人体姿态估计模型包括若干空间位置嵌入块、若干动态修剪块、若干语义图变换器编码器、多视角空间融合块、多视角时空融合块和回归层;
56、一个空间位置嵌入块、一个动态修剪块和一个语义图变换器编码器为一组,每组的输入来自同一个多视角二维人体姿态数据的不同视角的单视角二维人体姿态数据;
57、所述空间位置嵌入块,使用节点位置嵌入函数和空间图嵌入函数对单视角二维人体姿态数据进行处理,得到节点位置嵌入和空间图嵌入,并将节点位置嵌入和空间图嵌入拼接成输入标记;
58、所述动态修剪块,对输入标记进行池化操作和剪枝操作,获得代表性标记;
59、所述语义图变换器编码器,提取输入的代表性标记中的节点特征作为输出;
60、所述多视角空间融合块,将所有语义图变换器编码器输出的节点特征进行多视角空间融合,获得多视角空间融合特征;
61、所述多视角时空融合块,对输入的多视角空间融合特征进行多视角跨通道融合,再进行多视角时空融合,获得多视角时空融合特征;
62、所述回归层,将输入的多视角时空融合特征转换为三维姿态坐标作为三维人体姿态估计模型的输出;
63、模型训练模块,用于基于多视角的二维人体姿态数据对三维人体姿态估计模型进行训练,得到训练好的三维人体估计模型;
64、三维人体姿态估计模块,用于使用训练好的三维人体姿态估计模型进行三维人体姿态估计。
65、与现有技术相比,本发明具有如下有益效果:
66、本发明构建了三维人体姿态估计模型,将多视角二维人体姿态数据输入空间位置嵌入块生成姿态标记,并利用动态修剪块生成保留高语义多样性的代表性标记,去除冗余信息;通过模型中的语义图变换器编码器生成增强的特征表示;并融合了时间知识与空间数据,兼顾了时空信息的完整性;该轻量级模型增加了不同场景下的适用性;此外,本发明不依赖于相机参数,显著提升了多视角三维姿态估计的准确性和效率,为相关应用提供了更加高效和实用的解决方案;
1.一种基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,所述节点位置嵌入函数表示为:
3.根据权利要求2所述的基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,所述空间图嵌入函数表示为:
4.根据权利要求1所述的基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,所述对输入标记进行池化操作和剪枝操作,获得代表性标记,具体如下:
5.根据权利要求4所述的基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,所述密度峰值聚类算法基于k近邻算法,根据池化标记的特征相似性分组聚类,并将聚类中心作为代表性标记,具体如下:
6.根据权利要求1所述的基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,所述语义图变换器编码器通过语义注意力深入挖掘隐藏在代表性标记中的语义信息;语义注意力表示如下:
7.根据权利要求6所述的基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,采用多头语义注意力进一步增强剪枝后的节点位置嵌入的特征,表示为:
8.根据权利要求1所述的基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,所述将所有语义图变换器编码器输出的节点特征进行多视角空间融合,获得多视角空间融合特征,具体如下:
9.根据权利要求1所述的基于语义图的轻量级多视角三维人体姿态估计方法,其特征在于,所述对输入的多视角空间融合特征进行多视角跨通道融合,再进行多视角时空融合,获得多视角时空融合特征,具体如下:
10.一种基于语义图的轻量级多视角三维人体姿态估计系统,包括如下:
