本申请涉及大数据处理,尤其涉及一种数据文件处理方法、装置、设备、存储介质及程序产品。
背景技术:
1、在大数据场景中,数据湖作为全量数据集中存储的存储场所会存在大量的数据文件,因此提出了能够合并小文件优化文件布局的聚类表服务功能,聚类表服务功能的主要工作流程是读小文件、合并排序、输出大文件和清理旧文件。
2、而目前相关技术采用文件合并和清理串行执行的方式执行聚类功能,将文件合并和清理的过程耦合,会将文件合并产生的大量元数据存储在内存中,合并后的文件删除耗时较长导致内存无法及时释放,进而导致整个聚类功能执行失败。
3、上述内容仅用于辅助理解本申请的技术方案,并不代表承认上述内容是现有技术。
技术实现思路
1、本申请的主要目的在于提供一种数据文件处理方法、装置、设备、存储介质及程序产品,旨在解决相关技术数据湖数据文件合并和清理间的耦合导致聚类功能无法稳定执行的技术问题。
2、为实现上述目的,本申请提出一种数据文件处理方法,所述方法应用于数据湖,包括:
3、读取若干待合并数据文件;
4、通过预设的聚类表服务功能,对所述若干待合并数据文件进行文件合并,得到合并元数据文件;
5、通过预设的离线清理功能,对所述合并元数据文件对应的数据文件进行离线清理,所述离线清理功能为针对于所述聚类表服务功能独立部署的。
6、在一实施例中,所述通过预设的聚类表服务功能,对所述若干待合并的数据文件进行文件合并,得到合并元数据文件的步骤之前,还包括:
7、获取初始聚类表服务功能;
8、基于预设异步清理函数的父类抽象富函数,对所述初始聚类表服务功能进行功能重写,得到聚类表服务功能。
9、在一实施例中,所述初始聚类表服务功能包括初始聚类提交输出算子,所述初始聚类提交输出算子为继承所述异步清理函数得到,
10、所述基于预设异步清理函数的父类抽象富函数,对所述初始聚类表服务功能进行功能重写,得到聚类表服务功能的步骤,包括:
11、通过所述初始聚类提交输出算子重新继承所述异步清理函数的父类抽象富函数,得到重新继承后的聚类提交输出算子;
12、基于所述重新继承后的聚类提交输出算子,对所述初始聚类表服务功能相应的功能函数接口进行功能重写,得到聚类表服务功能。
13、在一实施例中,所述通过预设的聚类表服务功能,对所述若干待合并数据文件进行文件合并,得到合并元数据文件的步骤,包括:
14、对所述若干待合并数据文件进行文件合并,得到目标合并数据文件;
15、通过所述聚类表服务功能的聚类提交输出算子,对所述若干待合并数据文件和所述目标合并数据文件进行信息统计,生成合并元数据文件。
16、在一实施例中,所述通过预设的离线清理功能,对所述合并元数据文件对应的数据文件进行离线清理的步骤,包括:
17、读取所述合并元数据文件中的元数据信息,所述元数据信息至少包括文件名、文件状态和文件路径;
18、根据所述元数据信息创建离线定时调度任务;
19、当系统时间满足所述离线定时调度任务的预设调度周期时,通过所述离线定时调度任务对所述合并元数据文件对应的数据文件进行离线清理。
20、在一实施例中,所述通过所述离线定时调度任务对所述合并元数据文件对应的数据文件进行离线清理的步骤,包括:
21、对所述合并元数据文件的元数据信息进行解析,得到待清理数据文件的文件信息;
22、调用文件系统的接口,通过所述文件系统的接口,根据所述文件信息对所述文件系统中对应的待清理数据文件进行离线清理。
23、此外,为实现上述目的,本申请还提出一种数据文件处理装置,所述数据文件处理装置包括:
24、文件读取模块,用于读取若干待合并数据文件;
25、文件合并模块,用于通过预设的聚类表服务功能,对所述若干待合并数据文件进行文件合并,得到合并元数据文件;
26、离线清理模块,用于通过预设的离线清理功能,对所述合并元数据文件对应的数据文件进行离线清理,所述离线清理功能为针对于所述聚类表服务功能独立部署的。
27、此外,为实现上述目的,本申请还提出一种数据文件处理设备,所述设备包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述计算机程序配置为实现如上文所述数据文件处理方法的步骤。
28、此外,为实现上述目的,本申请还提出一种存储介质,所述存储介质为计算机可读存储介质,所述存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现如上文所述数据文件处理方法的步骤。
29、此外,为实现上述目的,本申请还提供一种计算机程序产品,所述计算机程序产品包括计算机程序,所述计算机程序被处理器执行时实现如上文所述数据文件处理方法的步骤。
30、本申请提供了一种数据文件处理方法,本申请首先读取多个需要合并的数据文件,以确定文件合并的对象;利用预设的聚类表服务功能将多个需要合并的数据文件合并,得到合并元数据文件,使得聚类表服务功能进行单一的文件合并操作;利用预先针对聚类表服务功能独立部署的离线清理功能,离线删除合并元数据文件对应的数据文件,以将数据文件聚类的合并和清理的过程分离,避免了数据文件清理所需元数据导致对内存的长期占用,从而提高了数据文件聚类功能执行的稳定性。
31、综上可知,本申请通过数据湖聚类表服务的文件合并和独立部署的文件离线清理,解决了相关技术数据湖数据文件合并和清理间的耦合导致聚类功能无法稳定执行的问题,避免了数据湖聚类表服务的文件清理串行执行对内存的占用,提高了数据文件聚类功能执行的稳定性。
1.一种数据文件处理方法,其特征在于,所述方法应用于数据湖,包括:
2.如权利要求1所述方法,其特征在于,所述通过预设的聚类表服务功能,对所述若干待合并的数据文件进行文件合并,得到合并元数据文件的步骤之前,还包括:
3.如权利要求2所述方法,其特征在于,所述初始聚类表服务功能包括初始聚类提交输出算子,所述初始聚类提交输出算子为继承所述异步清理函数得到,
4.如权利要求1所述方法,其特征在于,所述通过预设的聚类表服务功能,对所述若干待合并数据文件进行文件合并,得到合并元数据文件的步骤,包括:
5.如权利要求1所述方法,其特征在于,所述通过预设的离线清理功能,对所述合并元数据文件对应的数据文件进行离线清理的步骤,包括:
6.如权利要求5所述方法,其特征在于,所述通过所述离线定时调度任务对所述合并元数据文件对应的数据文件进行离线清理的步骤,包括:
7.一种数据文件处理装置,其特征在于,所述装置包括:
8.一种数据文件处理设备,其特征在于,所述设备包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述计算机程序配置为实现如权利要求1至6中任一项所述数据文件处理方法的步骤。
9.一种存储介质,其特征在于,所述存储介质为计算机可读存储介质,所述存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现如权利要求1至6中任一项所述数据文件处理方法的步骤。
10.一种计算机程序产品,其特征在于,所述计算机程序产品包括计算机程序,所述计算机程序被处理器执行时实现如权利要求1至6中任一项所述数据文件处理方法的步骤。
