一种3D点云重建方法、装置、电子设备及存储介质与流程

专利2026-07-20  8


本技术涉及3d点云重建,尤其涉及一种3d点云重建方法、装置、电子设备及存储介质。


背景技术:

1、pix2vox网络模型在2d图像特征提取部分使用的是较为老旧和结构简单的vgg16模型,vgg16模型应对简单场景可以取得不错的特征提取效果,但是当遇到较为复杂场景,例如城市公开道路,室内仓库环境时可能难以达到理想效果,无法充分全面的提取2d图像特征,导致最后基于提取特征进行3d点云重建的效果并不理想。


技术实现思路

1、有鉴于此,本技术的目的在于至少提供一种3d点云重建方法、装置、电子设备及存储介质,通过swin transformer网络模型作为整个pix2vox点云重建模型中进行2d图像特征提取的编码器,增强3d图像特征提取能力,提高后续点云重建的准确性。

2、本技术主要包括以下几个方面:

3、第一方面,本技术实施例提供一种3d点云重建方法,应用于预设点云重建模型,预设点云重建模型包括编码器、解码器、上下文感知融合模块和细化器,编码器由swintransformer网络模型搭建形成,其中,方法包括:利用编码器提取二维输入图像对应的目标特征图;利用解码器对目标特征图进行不同粗糙程度的3d体素转换处理,得到不同粗糙程度的3d体素;利用上下文感知融合模块,自适应地基于不同粗糙程度的3d体素进行3d重建,得到融合3d体素;基于细化器通过跳跃连接优化融合3d体素,生成二维输入图像对应的三维重建结果。

4、在一种可能得实施方式中,swin transformer网络模型包括第一阶段处理模块、第二阶段处理模块、第三阶段处理模块和第四阶段处理模块,其中,通过以下方式提取二维输入图像对应的目标特征图:将二维输入图像输入第一阶段处理模块,得到第一特征提取图;将第一特征提取图输入第二阶段处理模块,得到第二特征提取图;将第二特征提取图输入第三阶段处理模块,得到第三特征提取图;将第三特征提取图输入第三阶段处理模块,得到目标特征图。

5、在一种可能得实施方式中,第一阶段处理模块包括块划分层、第一线性嵌入层和第一特征网络提取层,第一特征网络提取层包括多个串联连接的swin transformer特征提取网络,其中,第一阶段处理模块通过以下方式得到第一特征提取图:将二维输入图像输入块划分层进行分割处理,得到图片尺寸为第一预设尺寸、特征维度为第一特征维度的多个第一图片块;将每个第一图片块输入第一线性嵌入层进行维度变换处理,得到与每个第一图片块对应的第一特征向量,第一特征向量对应的特征维度为第二特征维度;针对每个第一特征向量,将该特征向量输入第一特征网络提取层进行特征提取,得到与该第一特征向量对应的第一输出图片块,第一输出图片块对应的图片尺寸为第一预设尺寸、特征维度为第二特征维度;由多个第一输出图片块,形成第一特征提取图。

6、在一种可能得实施方式中,第二阶段处理模块包括第一融合层、第二线性嵌入层和第二特征网络提取层,第二特征网络提取层包括多个串联连接的swin transformer网络;其中,第二阶段处理模块通过以下方式确定第二特征提取图:将第一特征提取图输入第一融合层,以对第一特征提取图中相邻的2×2个第一输出图片块进行合并,得到多个第二图片块,第二图片块对应的图片尺寸为第二预设尺寸,特征维度为第三特征维度;将多个第二图片块输入第二线性层进行降维处理,以得到每个第二图片块对应的第二特征向量,第二特征向量对应的特征维度为第三特征维度的二分之一、图片尺寸为第二预设尺寸;将多个第二特征向量输入第二特征网络提取层,得到多个第二输出图片块,第二输出图片块对应的图片尺寸和特征维度与第二特征向量相同;由多个第二输出图片块形成第二特征提取图。

7、在一种可能得实施方式中,第三阶段处理模块包括第二融合层、第二线性嵌入层和第三特征网络提取层,第三特征网络提取层包括多个串联连接的swin transformer网络;其中,第三阶段处理模块通过以下方式确定第三特征提取图:将第二特征提取图输入第二融合层,以对第二特征提取图中相邻的2×2个第二输出图片块进行合并,得到多个第三图片块,第三图片块对应的图片尺寸为第三预设尺寸,特征维度为第四特征维度;将多个第三图片块输入第三线性嵌入层进行降维处理,以得到每个第三图片块对应的第三特征向量,第三特征向量对应的特征维度为第四特征维度的二分之一、图片尺寸为第三预设尺寸;将多个第三特征向量输入第三特征网络提取层,得到多个第三输出图片块,第三输出图片块对应的图片尺寸和特征维度与第三特征向量相同;由多个第三输出图片块形成第三特征提取图。

8、在一种可能得实施方式中,第四阶段处理模块包括第三融合层、第四线性嵌入层和第四特征网络提取层,第四特征网络提取层包括多个串联连接的swin transformer网络,其中,第四阶段处理模块通过以下方式确定目标特征图:将第三特征提取图输入第三融合层,以对第三特征提取图中相邻的2×2个第三输出图片块进行合并,得到多个第四图片块,第四图片块对应的图片尺寸为第四预设尺寸,特征维度为第五特征维度;将多个第四图片块输入第四线性嵌入层进行降维处理,以得到每个第四图片块对应的第四特征向量,第四特征向量对应的特征维度为第五特征维度的二分之一、图片尺寸为第四预设尺寸;将多个第四特征向量输入第四特征网络提取层,得到多个第四输出图片块,第四输出图片块对应的图片尺寸和特征维度与第四特征向量相同;由多个第四输出图片块形成目标特征图。

9、在一种可能得实施方式中,swin transformer网络包括至少两个标准化层、自注意力计算层和多层感知机,标准化层分别设置在自注意力计算层和多层感知机之前,其中,swin transformer网络通过以下方式得到第一输出图片块:将第一特征向量输入其中一标准化层,以多第一特征向量进行标准化处理,得到标准化处理后的第一特征向量;将标准化处理后的第一特征向量输入自注意力计算层,以在不重叠的窗口内进行自注意力计算,捕捉上下文特征信息,得到特征处理向量;将特征处理向量输入另一标准化层,得到标准化处理后的特征处理向量;将标准化处理后的特征处理向量输入多层感知机进行特征变换,得到对应的第一输出图片块。

10、第二方面,本技术实施例还提供一种3d点云重建装置,应用于预设点云重建模型,预设点云重建模型包括编码器、解码器、上下文感知融合模块和细化器,编码器由swintransformer网络模型搭建形成,装置包括:特征提取模块,用于利用编码器提取二维输入图像对应的目标特征图;转换模块,用于利用解码器对目标特征图进行不同粗糙程度的3d体素转换处理,得到不同粗糙程度的3d体素;体素融合模块,用于利用上下文感知融合模块,自适应地基于不同粗糙程度的3d体素进行3d重建,得到融合3d体素;重建模块,用于基于细化器通过跳跃连接优化融合3d体素,生成二维输入图像对应的三维重建结果。

11、第三方面,本技术实施例还提供一种电子设备,包括:处理器、存储器和总线,存储器存储有处理器可执行的机器可读指令,当电子设备运行时,处理器与存储器之间通过总线进行通信,机器可读指令被处理器运行时执行上述第一方面或第一方面中任一种可能的实施方式中的3d点云重建方法的步骤。

12、第四方面,本技术实施例还提供了一种计算机可读存储介质,计算机可读存储介质上存储有计算机程序,计算机程序被处理器运行时执行上述第一方面或第一方面中任一种可能的实施方式中的3d点云重建的步骤。

13、本技术实施例提供的一种3d点云重建方法、装置、电子设备及存储介质,应用于pix2vox点云重建模型,pix2vox点云重建模型包括编码器、解码器、上下文感知融合模块和细化器,编码器由swin transformer网络模型搭建形成,方法包括:利用编码器提取二维输入图像对应的目标特征张量;利用预设解码器对目标特征张量进行不同粗糙程度的3d体素转换处理,得到不同粗糙程度的3d体素;利用上下文感知融合模块,自适应地基于不同粗糙程度的3d体素进行3d重建,得到融合3d体素;基于细化器通过跳跃连接优化融合3d体素,生成二维输入图像对应的三维重建结果。本技术通过swin transformer网络模型作为整个pix2vox点云重建模型中进行2d图像特征提取的编码器,增强3d图像特征提取能力,提高后续点云重建的准确性。

14、为使本技术的上述目的、特征和优点能更明显易懂,下文特举较佳实施例,并配合所附附图,作详细说明如下。


技术特征:

1.一种3d点云重建方法,其特征在于,应用于预设点云重建模型,所述预设点云重建模型包括编码器、解码器、上下文感知融合模块和细化器,所述编码器由swin transformer网络模型搭建形成,

2.根据权利要求1所述的方法,其特征在于,所述swin transformer网络模型包括第一阶段处理模块、第二阶段处理模块、第三阶段处理模块和第四阶段处理模块,

3.根据权利要求2所述的方法,其特征在于,所述第一阶段处理模块包括块划分层、第一线性嵌入层和第一特征网络提取层,所述第一特征网络提取层包括多个串联连接的swintransformer特征提取网络,

4.根据权利要求2所述的方法,其特征在于,所述第二阶段处理模块包括第一融合层、第二线性嵌入层和第二特征网络提取层,所述第二特征网络提取层包括多个串联连接的swin transformer网络;

5.根据权利要求2所述的方法,其特征在于,所述第三阶段处理模块包括第二融合层、第三线性嵌入层和第三特征网络提取层,所述第三特征网络提取层包括多个串联连接的swin transformer网络;

6.根据权利要求2所述的方法,其特征在于,所述第四阶段处理模块包括第三融合层、第四线性嵌入层和第四特征网络提取层,所述第四特征网络提取层包括多个串联连接的swin transformer网络,

7.根据权利要求3所述的方法,其特征在于,所述swin transformer网络包括至少两个标准化层、自注意力计算层和多层感知机,标准化层分别设置在自注意力计算层和所述多层感知机之前,

8.一种3d点云重建装置,其特征在于,应用于预设点云重建模型,所述预设点云重建模型包括编码器、解码器、上下文感知融合模块和细化器,所述编码器由swin transformer网络模型搭建形成,

9.一种电子设备,其特征在于,包括:处理器、存储器和总线,所述存储器存储有所述处理器可执行的机器可读指令,当电子设备运行时,所述处理器与所述存储器之间通过所述总线进行通信,所述机器可读指令被所述处理器运行时执行如权利要求1至7任一所述的3d点云重建方法的步骤。

10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机程序,所述计算机程序被处理器运行时执行如权利要求1至7任一所述的3d点云重建方法的步骤。


技术总结
本申请提供了一种3D点云重建方法、装置、电子设备及存储介质,应用于预设点云重建模型,方法包括:利用编码器提取二维输入图像对应的目标特征张量;利用预设解码器对目标特征张量进行不同粗糙程度的3D体素转换处理,得到不同粗糙程度的3D体素;利用上下文感知融合模块,自适应地基于不同粗糙程度的3D体素进行3D重建,得到融合3D体素;基于细化器通过跳跃连接优化融合3D体素,生成二维输入图像对应的三维重建结果。本申请通过Swin Transformer网络模型作为预设点云重建模型中进行2D图像特征提取的编码器,增强2D图像特征提取能力,提高后续点云重建的准确性。

技术研发人员:李红中,刘博,黄金中
受保护的技术使用者:武汉远舢智能科技有限公司
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-32762.html