基于人工智能的自适应静态数据脱敏方法及装置

专利2026-09-25  1


本技术涉及静态数据脱敏,具体而言,涉及一种基于人工智能的自适应静态数据脱敏方法及装置。


背景技术:

1、静态数据脱敏(static data masking, sdm)是一种数据安全技术,旨在保护敏感数据免受未授权访问和泄露的风险。随着信息技术的发展和数据量的激增,数据库中存储的敏感信息变得越来越多,包括个人身份信息、财务数据、健康记录等。这些数据如果未得到妥善保护,一旦泄露,可能导致严重的隐私侵犯和经济损失。

2、数据库安全已经成为信息安全领域的一个重点,尤其是在金融和医疗等行业,对数据的保密性和完整性有着严格的要求。为了遵守相关的数据保护法规和标准,如欧盟的通用数据保护条例(gdpr)和中国的个人信息保护法(pipl),企业必须采取有效措施保护敏感数据。

3、静态数据脱敏技术通过对敏感数据进行变形、屏蔽、替换、随机化或加密处理,将原始数据转换为看似真实但实际上是虚构的数据。这样处理后的数据可以安全地用于非生产环境,如开发、测试和培训,而不会暴露真实的敏感信息。静态脱敏通常在数据被移动或复制到另一个环境之前进行,确保脱敏数据的一次性大规模使用。

4、随着数据安全威胁的不断演变,静态数据脱敏技术也在不断进步,集成了自动化敏感数据发现、丰富的脱敏算法和灵活的策略配置,以适应更加复杂的数据使用场景和提高脱敏效率。此外,静态脱敏技术还能够保持数据的原始业务特征和关联性,确保脱敏后的数据仍然对业务分析和决策有用。

5、传统静态数据脱敏技术的隐私发现方法通常依赖于预定义的敏感数据模式,如社会安全号码、信用卡号等。这些方法可能包括正则表达式匹配、关键字搜索和专家规则。然而,这些方法存在几个局限性:手动定义敏感数据模式,需要专家预先定义哪些数据是敏感的,这不仅耗时耗力,而且可能无法覆盖所有潜在的敏感信息;忽略上下文敏感性,某些数据项在特定上下文中可能不敏感,但在其他情境下可能变得敏感,传统方法往往无法充分考虑数据的上下文依赖;难以适应新出现的敏感数据类型,随着数据类型的不断演化,新的敏感数据可能会出现,传统方法难以及时更新以识别这些新型敏感数据;处理大数据集的效率低下,在处理大规模数据集时,传统方法可能会因为计算复杂度高而效率低下。


技术实现思路

1、本技术实施例的目的在于提供一种基于人工智能的自适应静态数据脱敏方法及装置,用以解决现有静态脱敏方法存在的问题。

2、第一方面,本技术实施例提供了一种基于人工智能的自适应静态数据脱敏方法,包括:

3、获取静态数据,并对该数据进行预处理;

4、基于双向长短期记忆网络模型和注意力机制,从预处理后的静态数据中提取语义和上下文特征;

5、通过多层感知机模型对静态数据进行分类决策,判断每个数据片段是否包含敏感信息;

6、根据敏感信息的筛选结果对多层感知机模型进行优化。

7、在上述实现过程中,本技术实施例获取静态数据,并对该数据进行预处理;基于双向长短期记忆网络模型和注意力机制,从预处理后的静态数据中提取语义和上下文特征;通过多层感知机模型对静态数据进行分类决策,判断每个数据片段是否包含敏感信息;根据敏感信息的筛选结果对多层感知机模型进行优化;自动获取数据,保证了获取敏感信息的全面性,提高对敏感信息的识别精度;从预处理后的静态数据中提取语义和上下文特征,判断每个数据片段是否包含敏感信息,充分考虑数据的上下文依赖,实现实时数据流的监控和分析,及时发现新出现的敏感信息;人工智能技术处理和分析大规模数据集,并对模型进行优化,提高整体的处理效率。

8、进一步的,所述获取静态数据,并对该数据进行预处理,包括:

9、收集输入的静态数据并将该数据进行合并;

10、对静态数据进行质量评估、验证和处理;

11、对静态数据进行数据清洗、分词操作和词汇表构建。

12、在上述实现过程中,通过预处理,可以为基于人工智能的自适应静态数据脱敏方法提供高质量、准确分类和标记的数据,为后续的脱敏处理奠定坚实的基础,有效保护数据的安全和隐私,同时最大程度地保留数据的可用性和分析价值。

13、进一步的,所述基于双向长短期记忆网络模型和注意力机制,从预处理后的静态数据中提取语义和上下文特征,包括:

14、构建双向长短期记忆网络模型;

15、建立注意力机制;

16、对双向长短期记忆网络模型进行训练和优化;

17、从预处理后的静态数据中提取语义和上下文特征。

18、在上述实现过程中,利用双向长短期记忆网络模型和注意力机制可以有效地从数据中提取语义和上下文特征,为各种自然语言处理和文本分析任务提供有力的支持,提高任务的性能和效果。

19、进一步的,所述通过多层感知机模型对静态数据进行分类决策,判断每个数据片段是否包含敏感信息,包括:

20、对训练数据进行数据清洗,提取数据的特征并进行向量化;

21、构建mlp多层感知机模型;

22、训练mlp模型;

23、对mlp模型进行评估和优化;

24、将静态数据输入至mlp模型进行分类决策,判断每个数据片段是否包含敏感信息。

25、在上述实现过程中,利用mlp模型可以有效地对数据片段进行分类决策,判断其是否包含敏感信息,为数据安全和隐私保护提供有力的支持。在实际应用中,需要根据具体的数据类型和任务需求进行适当的调整和优化,以提高模型的性能和准确性。

26、进一步的,所述根据敏感信息的分类结果对多层感知机模型进行优化,包括:

27、根据敏感信息的分类结果对多层感知机模型进行去重;

28、合并分类结果的敏感信息片段;

29、根据定义规则对分类结果进行进一步筛选。

30、在上述实现过程中,对模型预测结果进行优化,如去重、合并相邻的敏感信息片段,以及基于规则的进一步筛选,提高结果的准确性和实用性。

31、进一步的,所述收集输入的静态数据并将该数据进行合并,包括:

32、针对不同类型的数据源,采用对应的连接接口和配置模块从数据源中抽取静态数据,并对抽取的静态数据进行数据转换;其中,抽取数据包括全量抽取和增量抽取;

33、将抽取和转换后的数据按照预定的规则进行合并,将合并后的数据存储在临时的数据存储区域;

34、其中,所述对静态数据进行质量评估、验证和处理,包括:

35、编写缺失值检测算法,遍历数据集中的每个字段,统计缺失值的数量和位置;

36、编写数据准确性检测程序,对数据集中的每个记录进行遍历,按照设定规则进行验证;

37、定义数据验证规则和约束条件,根据数据的类型和业务要求设定验证约束规则;

38、对于来自多个数据源或不同表的相同字段的数据,进行一致性比对,若存在数据不一致,分析原因并采取措施;

39、其中,所述对静态数据进行数据清洗、分词操作和词汇表构建,包括:

40、编写数据清洗脚本,根据数据类型选择对应的清洗方式进行数据清洗;

41、根据数据类型选择分词工具对静态数据进行分词处理;

42、基于设定规则对分词后的静态数据进行词汇表构建。

43、进一步的,所述构建双向长短期记忆网络模型,包括:

44、通过输入层接收预处理后的训练数据;

45、使用深度学习框架构建双向长短期记忆bi-lstm层;

46、将bi-lstm层最后一个时间步的前向和后向隐藏状态拼接起来;

47、其中,所述建立注意力机制,包括:

48、定义注意力函数,计算注意力权重;

49、使用注意力权重对bi-lstm的输出序列进行加权求和;

50、其中,所述对双向长短期记忆网络模型进行训练和优化,包括:

51、定义损失函数;

52、选择优化算法进行参数更新;

53、将标注好的数据分为训练集、验证集和测试集;

54、在训练集上进行模型的训练,根据输入数据和标签计算损失,通过反向传播算法计算梯度并更新模型的参数;

55、根据验证集的性能指标调整模型的超参数,其中,性能指标包括准确率和f1值;

56、其中,所述从预处理后的静态数据中提取语义和上下文特征,包括:

57、将预处理后的静态数据输入至bi-lstm模型;

58、提取语义和上下文特征,并根据特征应用至自然语言处理和文本分析任务。

59、进一步的,所述对训练数据进行数据清洗,提取数据的特征并进行向量化,包括:

60、根据数据类型选择对应的清洗方式进行训练数据的清洗;

61、根据数据类型选择对应的特征提取方式进行数据的特征提取和向量化;

62、其中,所述构建mlp多层感知机模型,包括:

63、将训练数据按照设定比例划分为训练集、验证集和测试集;

64、设计模型架构,确定层数、神经元数量和激活函数;

65、使用深度学习框架定义mlp模型;

66、其中,所述训练mlp模型,包括:

67、收集标注好的训练数据集 ,其中,每个数据片段都被标记为是否包含敏感信息;

68、定义模型参数,其中,模型参数包括激活函数和层大小;

69、定义损失函数和优化器;

70、通过调用损失函数,使用训练数据对mlp模型进行训练;

71、将训练数据输入到模型中,进行前向传播计算,得到模型的预测输出;

72、使用优化器进行反向传播,计算损失函数对模型参数的梯度;

73、重复前向传播、损失计算、反向传播和参数更新的步骤,进行多个训练轮次,直到模型收敛或达到预设的训练次数;

74、其中,所述对mlp模型进行评估和优化,包括:

75、选择评估指标,定期在验证集上评估模型的性能;

76、根据验证集的性能指标,调整模型的超参数,以优化模型的性能,其中,该超参数包括:学习率、批次大小、模型架构;

77、使用测试集对模型进行最终评估,计算模型在测试集上的损失值和各种性能指标,评估模型的泛化能力;

78、根据评估结果,选择性能最佳的模型进行保存;

79、其中,所述将静态数据输入至mlp模型进行分类决策,判断每个数据片段是否包含敏感信息,包括:

80、根据数据类型选择对应的清洗方式进行数据清洗;

81、将预处理后的数据输入到训练好的mlp模型中;

82、根据模型的判断结果进行分类决策处理,判断每个数据片段是否包含敏感信息;其中,该判断结果包括:计算指标和生成的混淆矩阵,计算指标包括准确率、召唤率和f1分数。

83、进一步的,所述根据敏感信息的分类结果对多层感知机模型进行去重,包括:

84、采用设定的数据结构,将模型预测为包含敏感信息的数据片段存储起来;

85、当新的数据片段被预测为包含敏感信息时,将其与已存储的数据片段进行比较,得到相似度;

86、若新的数据片段与已存储的数据片段的相似度大于相似度阈值,则认为是重复的敏感信息片段,进行去重处理;

87、其中,所述合并分类结果的敏感信息片段,包括:

88、根据数据类型确定相似关系;

89、判断相邻的数据片段是否属于同一类型的敏感信息;

90、若相邻的数据片段被判断为属于同一类型的敏感信息,进行合并处理;

91、其中,所述根据定义规则对分类结果进行进一步筛选,包括:

92、根据业务需求和敏感信息的特点,定义规则进一步筛选模型预测的结果;

93、将模型预测为包含敏感信息的数据片段逐一应用规则进行筛选;

94、对于每个数据片段,检查其是否满足所有的硬规则;

95、对于满足硬规则的数据片段,进一步应用软规则进行筛选;

96、在应用规则进行筛选的过程中,不断收集反馈信息,评估规则的有效性和准确性;

97、定期对规则进行更新和维护。

98、第二方面,本技术实施例提供一种基于人工智能的自适应静态数据脱敏装置,包括:

99、预处理模块,用于获取静态数据,并对该数据进行预处理;

100、特征提取模块,用于基于双向长短期记忆网络模型和注意力机制,从预处理后的静态数据中提取语义和上下文特征;

101、分类模块,用于通过多层感知机模型对静态数据进行分类决策,判断每个数据片段是否包含敏感信息;

102、后处理模块,用于根据敏感信息的筛选结果对多层感知机模型进行优化。

103、第三方面,本技术实施例提供一种电子设备,包括:

104、处理器、存储器和总线,所述处理器通过所述总线与所述存储器相连,所述存储器存储有计算机可读取指令,当所述计算机可读取指令由所述处理器执行时,用于实现如上所述的基于人工智能的自适应静态数据脱敏方法。


技术特征:

1.一种基于人工智能的自适应静态数据脱敏方法,其特征在于,所述方法包括:

2.根据权利要求1所述的基于人工智能的自适应静态数据脱敏方法,其特征在于,所述获取静态数据,并对该数据进行预处理,包括:

3.根据权利要求1所述的基于人工智能的自适应静态数据脱敏方法,其特征在于,所述基于双向长短期记忆网络模型和注意力机制,从预处理后的静态数据中提取语义和上下文特征,包括:

4.根据权利要求1所述的基于人工智能的自适应静态数据脱敏方法,其特征在于,所述通过多层感知机模型对静态数据进行分类决策,判断每个数据片段是否包含敏感信息,包括:

5.根据权利要求1所述的基于人工智能的自适应静态数据脱敏方法,其特征在于,所述根据敏感信息的分类结果对多层感知机模型进行优化,包括:

6.根据权利要求2所述的基于人工智能的自适应静态数据脱敏方法,其特征在于,所述收集输入的静态数据并将该数据进行合并,包括:

7.根据权利要求3所述的基于人工智能的自适应静态数据脱敏方法,其特征在于,所述构建双向长短期记忆网络模型,包括:

8.根据权利要求4所述的基于人工智能的自适应静态数据脱敏方法,其特征在于,所述对训练数据进行数据清洗,提取数据的特征并进行向量化,包括:

9.根据权利要求5所述的基于人工智能的自适应静态数据脱敏方法,其特征在于,所述根据敏感信息的分类结果对多层感知机模型进行去重,包括:

10.一种基于人工智能的自适应静态数据脱敏装置,其特征在于,包括:


技术总结
本申请实施例提供一种基于人工智能的自适应静态数据脱敏方法及装置,涉及静态数据脱敏技术领域,所述方法包括:获取静态数据,并对该数据进行预处理;基于双向长短期记忆网络模型和注意力机制,从预处理后的静态数据中提取语义和上下文特征;通过多层感知机模型对静态数据进行分类决策,判断每个数据片段是否包含敏感信息;根据敏感信息的筛选结果对多层感知机模型进行优化;自动获取数据,保证了获取敏感信息的全面性,提高对敏感信息的识别精度;充分考虑数据的上下文依赖,实现实时数据流的监控和分析,及时发现新出现的敏感信息;人工智能技术处理和分析大规模数据集,并对模型进行优化,提高整体的处理效率。

技术研发人员:崔琦,杜鹏,李晖,潘珂
受保护的技术使用者:西安电子科技大学
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-34726.html