一种私域知识保护方法和系统与流程

专利2026-07-13  7


本发明属于文本数据处理,特别涉及一种私域知识保护方法和系统。


背景技术:

1、在人工智能领域,大模型的应用已取得显著进展,这些模型能够处理各种复杂任务,并生成高质量的结果。大模型在许多领域的表现优越,但在涉及私域知识的应用时,现有技术面临一系列挑战。

2、现有技术中私域知识保护不足,传统方法将未加密的原始文档直接调取,并分析获取私域知识,然后融入模型训练和推理过程中,这样在预处理大量数据的过程中,可能导致敏感信息的泄露,造成隐私泄露。


技术实现思路

1、本发明的目的是提供一种私域知识保护方法和系统,解决了通过不同lora模型严格隔离,确保知识保护的精准性,在数据预处理阶段使用对称加密技术和对模型进行可信密钥加密,保护数据隐私的技术问题。

2、为实现上述目的,本发明采用以下技术方案:

3、一种私域知识保护方法和系统,包括如下步骤:

4、步骤1:建立数据输入层、数据预处理层、知识归纳与分类层、训练集构建与优化层、模型训练与加密保护层和用户访问控制层,

5、在数据输入层建立文档采集模块,文档采集模块从互联网获取文档;

6、步骤2:在数据预处理层建立预处理模块和加密模块,预处理模块使用多格式解析器对文档进行解析,将文档按段落进行文本抽取与识别,生成段落结构化数据;

7、加密模块对段落结构化数据使用对称加密方法进行加密;

8、步骤3:在知识归纳与分类层建立大模型分析模块和分类模块,大模型分析模块调取段落结构化数据,并对其进行解密后,通过私域下的大模型提取文档概要和关键词,并对其进行向量化处理,生成基于语义的高维向量;

9、分类模块根据根据向量化后的语义相似度,将文档分类到指定类别中,生成已分类的文档段落数据;

10、步骤4:在训练集构建与优化层建立要点归纳模块、引导性提问生成模块和扩展与清洗模块,要点归纳模块生成段落总结;

11、引导性提问生成模块进行引导性提问,并创建问答对;

12、扩展与清洗模块扩展和清洗问答对,最终生成优化后的训练集;

13、步骤5:在模型训练与加密保护层建立模型训练模块和可信密钥管理模块,模型训练模块通过优化后的训练集,采用lora方法对所述大模型进行训练,生成lora模型,针对私域知识集的核心特征进行优化,得到优化后的lora模型;

14、可信密钥管理模块对优化后的lora模型进行可信密钥加密,得到加密模型文件;

15、步骤6:在用户访问控制层建立鉴权控制模块和动态权限调整模块,鉴权控制模块通过rbac机制管理用户访问权限,根据对称加密技术保护加密模型文件的访问,动态权限调整模块调整访问权限。

16、优选的,在执行步骤1时,互联网的数据源包括本地文件、数据库、云存储,所述文档为知识文档,知识文档的格式包括文本、表格、列表或pdf。

17、优选的,在执行步骤2时,多格式解析器识别并保留文档的原始结构,完整提取文档的知识结构。

18、优选的,在执行步骤2时,具体包括如下步骤:

19、步骤2-1:预处理模块使用多格式解析器对文档进行解析,将文档按段落进行文本抽取和识别,生成段落结构化数据;

20、多格式解析器包括pdf解析器和文本解析器;

21、段落结构化数据的数据内容包含文档的段落文本和元数据,元数据包括段落编号和标题;

22、段落结构化数据的数据格式包括json格式或xml格式;

23、步骤2-2:采用对称加密算法aes-256,对段落结构化数据进行加密,生成一个对称加密密钥,用于加密和解密数据,具体包括如下步骤:

24、步骤2-2-1:将段落结构化数据转化为适合加密的字节流格式;

25、步骤2-2-2:生成一个随机的初始化向量,用于增强加密的安全性;

26、步骤2-2-3:使用aes-256算法对数据进行加密,得到密文;

27、步骤2-2-4:将密文保存为加密数据文件,即加密的段落结构化数据文件,并存储加密后的数据内容以及对称加密密钥。

28、优选的,在执行步骤3时,具体步骤如下:

29、步骤3-1:大模型分析模块调取段落结构化数据,使用对称加密密钥解密数据,恢复为可处理的结构化数据;

30、步骤3-2:大模型分析模块根据结构化数据,通过私域下的大模型提取文档的概要以及文件名描述;

31、步骤3-3:大模型分析模块生成文档的关键词,通过分析文档的核心概念和主题词,提取出代表性的关键词;

32、步骤3-4:大模型分析模块使用文本嵌入模型对文档概要和关键词进行向量化处理,生成基于语义的高维向量;

33、步骤3-5:分类模块基于向量化的语义相似度,将文档分类到指定的类别中,生成已分类的文档段落数据。

34、优选的,在执行步骤3-1时,使用对称加密的加密密钥解密数据的具体步骤如下:

35、步骤3-1-1:调取加密的段落结构化数据文件,使用之前生成并安全存储的对称加密密钥;

36、步骤3-1-2:从加密数据中提取初始化向量;

37、步骤3-1-3:使用aes-256算法和对称加密密钥对密文进行解密,具体为通过aes-256解密算法将密文转换回原始的段落结构化数据,得到的原始数据将被恢复为可处理的段落文本和元数据。

38、优选的,在执行步骤4时,具体包括如下步骤:

39、步骤4-1:要点归纳模块根据已分类的文档段落数据,对段落进行要点归纳,生成段落内容的简明总结;

40、步骤4-2:引导性提问生成模块进行引导性提问,生成与段落内容相关的问答对;

41、步骤4-3:扩展与清洗模块对生成的问答对进行指定类型的衍生扩展,以增强训练集的多样性;

42、步骤4-4:扩展与清洗模块对扩充的问答对进行清洗和评分,过滤低评分数据,得到优化后的训练集。

43、优选的,在执行步骤5时,具体包括如下步骤:

44、步骤5-1:将文档段落数据视为私域知识集;

45、步骤5-2:模型训练模块通过多样化训练集,采用lora方法,对大模型进行模型训练,具体包括如下步骤:

46、步骤5-2-1:在所述大模型基础上添加低秩矩阵a和低秩矩阵b;

47、步骤5-2-2:仅对低秩矩阵a和低秩矩阵b进行训练和优化,而保持原有的大模型参数不变;

48、步骤5-2-3:通过调整低秩矩阵a和低秩矩阵b来增强模型的功能,使其适应任务需求,得到lora模型;

49、步骤5-3:针对私域知识集的核心特征进行优化,得到优化后的lora模型;

50、步骤5-4:可信密钥管理模块对优化后的lora模型进行可信密钥加密,得到加密模型文件,可信密钥加密具体为利用硬件安全模块生成和管理加密密钥,具体通过对称加密加密实现。

51、优选的,在执行步骤6时,具体包括如下步骤:

52、步骤6-1:鉴权控制模块通过基于角色的访问控制rbac管理用户权限;

53、步骤6-2:鉴权控制模块通过对称加密技术保护模型访问,执行只有授权用户能够解密和使用模型;

54、步骤6-3:动态权限调整模块根据实际需求调整用户访问权限,对lora模型访问权进行下放或收回。

55、一种私域知识保护系统,包括数据输入层、数据预处理层、知识归纳与分类层、训练集构建与优化层、模型训练与加密保护层和用户访问控制层,包括数据输入层、数据预处理层、知识归纳与分类层、训练集构建与优化层、模型训练与加密保护层和用户访问控制层之间通过互联网相互通信;

56、数据输入层包括文档采集模块;

57、数据预处理层包括预处理模块和加密模块;

58、知识归纳与分类层包括大模型分析模块和分类模块;

59、训练集构建与优化层包括要点归纳模块、引导性提问生成模块和扩展与清洗模块;

60、模型训练与加密保护层包括模型训练模块和可信密钥管理模块;用户访问控制层包括鉴权控制模和动态权限调整模块。

61、本发明所述的一种私域知识保护方法和系统,解决了通过不同lora模型严格隔离,确保知识保护的精准性,在数据预处理阶段使用对称加密技术和对模型进行可信密钥加密,保护数据隐私的技术问题,本发明通过在数据预处理阶段应用对称加密技术(如aes-256),确保原始数据在整个处理流程中的隐私和安全性。这种方法有效防止了数据在预处理过程中被未经授权的访问或泄露,通过对模型采用可信密钥加密技术进行加密,确保模型确保只有授权用户或系统可以使用密钥进行加密和解密操作,保证了数据的安全采用了混合加密策略,在数据预处理阶段使用高效的对称加密技术,确保数据处理的效率;在模型训练阶段使用可信密钥加密技术,保证数据隐私和计算安全。这种分阶段加密策略能够充分发挥不同加密技术的优点,实现效率与安全性的平衡。


技术特征:

1.一种私域知识保护方法,其特征在于:包括如下步骤:

2.如权利要求1所述的一种私域知识保护方法,其特征在于:在执行步骤1时,互联网的数据源包括本地文件、数据库、云存储,所述文档为知识文档,知识文档的格式包括文本、表格、列表或pdf。

3.如权利要求1所述的一种私域知识保护方法,其特征在于:在执行步骤2时,多格式解析器识别并保留文档的原始结构,完整提取文档的知识结构。

4.如权利要求1所述的一种私域知识保护方法,其特征在于:在执行步骤2时,具体包括如下步骤:

5.如权利要求4所述的一种私域知识保护方法,其特征在于:在执行步骤3时,具体步骤如下:

6.如权利要求5所述的一种私域知识保护方法,其特征在于:在执行步骤3-1时,使用对称加密的加密密钥解密数据的具体步骤如下:

7.如权利要求1所述的一种私域知识保护方法,其特征在于:在执行步骤4时,具体包括如下步骤:

8.如权利要求1所述的一种私域知识保护方法,其特征在于:在执行步骤5时,具体包括如下步骤:

9.如权利要求1所述的一种私域知识保护方法,其特征在于:在执行步骤6时,具体包括如下步骤:

10.一种私域知识保护系统,应用于权利要求1-9任一项所述的一种私域知识保护方法,其特征在于:包括数据输入层、数据预处理层、知识归纳与分类层、训练集构建与优化层、模型训练与加密保护层和用户访问控制层,包括数据输入层、数据预处理层、知识归纳与分类层、训练集构建与优化层、模型训练与加密保护层和用户访问控制层之间通过互联网相互通信;


技术总结
本发明公开了一种私域知识保护方法和系统,属于文本数据处理技术领域,包括文档采集、文档解析、文档加密、文档分析、向量化处理、文档分类、要点归纳、引导性提问生成、扩展与清洗、模型训练、模型加密、鉴权控制和动态权限调整,解决了通过不同LoRA模型严格隔离,确保知识保护的精准性,在数据预处理阶段使用对称加密技术和对模型进行可信密钥加密,保护数据隐私的技术问题,本发明确保原始数据在整个处理流程中的隐私和安全性,有效防止了数据在预处理过程中被未经授权的访问或泄露,保证了数据的安全采用了混合加密策略,确保数据处理的效率;分阶段加密策略能够充分发挥不同加密技术的优点,实现效率与安全性的平衡。

技术研发人员:沈锦添
受保护的技术使用者:江苏大道云隐科技有限公司
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-32512.html