本发明属于数据处理,尤其涉及一种动态结构化数据分类方法和装置、系统、存储介质。
背景技术:
1、数据分类分级是数据管理和保护的基础,旨在根据数据的敏感程度和重要性将其划分为不同级别,以便采取相应的保护措施。准确地对数据进行分类分级,为后续的数据保护、访问控制、合规性管理等提供基础。
2、现有的结构化数据分类方法是针对元数据管理,收集和组织关于数据的上下文信息,如数据来源、所有权、创建日期等,辅助分类或者通过预设定义敏感关键字、正则表达式等识别敏感数据并分类。
3、而结构化数据分类过程可能受到人为因素影响,不同人对同一数据的敏感性和重要性的判断可能存在差异,导致分类结果不一致;或者因为缺乏对业务上下文的深入理解而误分类。例如,某些关键词脱离上下文可能被错误地标记为敏感信息。数据分类只有与业务结合、与业务上下文理解结合才能提高数据分类准确性。这也是目前数据分类准确率始终无法提高的原因。
技术实现思路
1、本发明要解决的技术问题是,提供一种动态结构化数据分类方法和装置、系统、存储介质,解决结构化数据分类结果不准确的问题。
2、为实现上述目的,本发明采用如下的技术方案:
3、一种动态结构化数据分类方法,包括:
4、步骤s1、根据结构化数据,得到结构化字段属性;
5、步骤s2、形成数据分类细分规则;
6、步骤s3、对结构化字段属性和数据分类策略细则进行匹配,得到匹配成功的结构化数据字段和未匹配成功的结构化数据字段;同时对匹配成功的结构化数据字段进行数据分类打标;
7、步骤s4、将匹配成功的结构化数据字段训练决策树模型;
8、步骤s5、根据训练好的决策树模型,对未匹配成功的结构化数据字段进行分类打标。
9、作为优选,步骤s1包括:
10、从结构化数据中提取元数据信息、注释及业务属性值作为该字段的属性;
11、将结构化字段与其属性建立关联关系,得到结构化字段属性。
12、作为优选,步骤s2包括:
13、将数据分类策略作为样本进行自动化标注,形成训练数据;
14、将训练数据通过deepke进行训练预测;
15、对行业的行业标准文件、业务知识文件中的语句进行预测,得到已分类的关键词,形成数据分类策略细分规则。
16、作为优选,步骤s3中,遍历结构化字段属性找到与其语义相似度最高的数据分类细分规则并为其打标,得到匹配成功的结构化数据字段和未匹配成功的结构化数据字段。
17、本发明公开一种动态结构化数据分类装置,包括:
18、第一处理模块,用于根据结构化数据,得到结构化字段属性;
19、第二处理模块,用于形成数据分类细分规则;
20、匹配模块,用于对结构化字段属性和数据分类策略细则进行匹配,得到匹配成功的结构化数据字段和未匹配成功的结构化数据字段;同时对匹配成功的结构化数据字段进行数据分类打标;
21、训练模块,用于将匹配成功的结构化数据字段训练决策树模型;
22、分类模块,用于根据训练好的决策树模型,对未匹配成功的结构化数据字段进行分类打标。
23、作为优选,匹配模块遍历结构化字段属性找到与其语义相似度最高的数据分类细分规则并为其打标,得到匹配成功的结构化数据字段和未匹配成功的结构化数据字段。
24、本发明还提供一种动态结构化数据分类系统,包括:存储器和处理器,所述存储器上存储有由所述处理器运行的计算机程序,所述计算机程序在被所述处理器运行时执行动态结构化数据分类方法。
25、作为优选,本发明还提供一种存储介质,所述存储介质上存储有计算机程序,所述计算机程序在运行时执行动态结构化数据分类方法。
26、利用深度学习技术,对数据分类策略进行细化,将分类标准中较粗略的数据分类策略内容同行业、业务相关联具体化。方便后面在将数据同分类策略进行映射分类,减少了人为分类的错误率。同时,深度学习技术便于新增和修改数据分类,能够随着数据集的增长和变化灵活调整分类体系,保证分类的时效性和准确性。通过工具细分数据分类策略后,再通过自然语言nlp方法计算待分类数据和分类策略的语义相似度,得到语义相似度最高的规则即为数据的分类标签。语义相似度分析能够更深入地理解词语和句子背后的意义,从而提高文本分类任务的准确性。通过决策树方法通过多次反复的优化,对结构化数据特性进行判断,降低了过拟合风险,提高了分类的稳定性。
27、进一步,本发明能够根据不同行业数据的变化和上下文环境自动调整分类策略,确保分类结果的时效性和适应性,这对于处理实时数据流、社交网络数据、物联网数据等具有显著优势。能够根据数据流的实时变化动态调整分类策略,适应新数据特征,识别并归类新出现的数据类型,确保分类结果始终贴近实际情况,有效应对数据环境的动态性。
1.一种动态结构化数据分类方法,其特征在于,包括:
2.如权利要求1所述的动态结构化数据分类方法,其特征在于,步骤s1包括:
3.如权利要求2所述的动态结构化数据分类方法,其特征在于,步骤s2包括:
4.如权利要求3所述的动态结构化数据分类方法,其特征在于,步骤s3中,遍历结构化字段属性找到与其语义相似度最高的数据分类细分规则并为其打标,得到匹配成功的结构化数据字段和未匹配成功的结构化数据字段。
5.一种动态结构化数据分类装置,其特征在于,包括:
6.如权利要求5所述的动态结构化数据分类装置,其特征在于,匹配模块遍历结构化字段属性找到与其语义相似度最高的数据分类细分规则并为其打标,得到匹配成功的结构化数据字段和未匹配成功的结构化数据字段。
7.一种动态结构化数据分类系统,其特征在于,包括:存储器和处理器,所述存储器上存储有由所述处理器运行的计算机程序,所述计算机程序在被所述处理器运行时执行如权利要求1-4中的任一项所述的动态结构化数据分类方法。
8.一种存储介质,其特征在于,所述存储介质上存储有计算机程序,所述计算机程序在运行时执行如权利要求1-4中的任一项所述的动态结构化数据分类方法。
