大模型攻击方法、装置、电子设备及存储介质与流程

专利2026-07-13  9


本申请涉及大模型攻击领域,具体涉及一种大模型攻击方法、装置、电子设备及存储介质。


背景技术:

1、现有的深度学习模型通常依赖于大量的数据进行训练,以提高其在实际应用中的性能。然而,在面对实际应用中的对抗攻击时,模型往往表现出较弱的鲁棒性。这种现象不仅影响模型的性能,也对模型的安全性构成威胁。在加固大模型安全性时,不可避免的需要能够有效攻击大模型的方法用于红队测试中,以提高目标模型的安全性与鲁棒性。


技术实现思路

1、本申请实施例提供一种大模型攻击方法、装置、电子设备及存储介质,通过对种子问题进行多次逐步改写和扩展,得到高攻击性的对抗样本进行模型攻击,从而提高待测试模型的鲁棒性。

2、第一方面,本申请提供一种大模型攻击方法,应用于红队攻击模型,所述方法包括:

3、获取针对待测试模型的第一种子问题,并对所述第一种子问题进行改写,得到多个变种的第二种子问题;

4、利用预设模型越狱模板和预设对抗样本对所述第二种子问题进行扩展,得到扩展后的对抗样本;

5、筛选出所述对抗样本中攻击性满足预设攻击性要求的目标对抗样本;

6、利用所述目标对抗样本对待测试模型进行攻击。

7、在一些可能的实施例中,所述获取针对待测试模型的第一种子问题,并对所述第一种子问题进行改写,得到多个变种的第二种子问题,包括;

8、获取针对所述待测试模型的第一种子问题,并利用指令微调模型和微调指令对所述第一种子问题进行改写,得到多个变种的第三种子问题;

9、筛选所述第三种子问题中具有攻击性的第四种子问题;

10、对所述第四种子问题进行二次改写,得到所述第二种子问题。

11、在一些可能的实施例中,所述筛选所述第三种子问题中具有攻击性的第四种子问题,包括:

12、利用所述第三种子问题攻击所述待测试模型,得到模型输出结果及所述模型输出结果对应的安全评价结果;

13、基于所述模型输出结果和所述安全评价结果,确定所述第三种子问题中具有攻击性的第四种子问题。

14、在一些可能的实施例中,在对所述第四种子问题进行二次改写,得到所述第二种子问题之后,所述获取针对待测试模型的第一种子问题,并对所述第一种子问题进行改写,得到多个变种的第二种子问题,还包括:

15、判断所述第二种子问题的数量是否达到预设种子问题数量阈值;

16、若所述第二种子问题的数量达到预设种子问题数量阈值,则对所述指令微调模型中的模型参数进行微调,得到微调后的新的指令微调模型;

17、利用新的微调指令模型和微调指令对所述第一种子问题进行改写及筛选,得到新的第二种子问题。

18、在一些可能的实施例中,所述筛选出所述对抗样本中攻击性满足预设攻击性要求的目标对抗样本,包括:

19、对所述对抗样本进行去重,得到去重后的对抗样本;

20、利用预设排序模型确定去重后的对抗样本各自的攻击性;

21、根据去重后的对抗样本各自的攻击性,对去重后的对抗样本进行排序,得到对抗样本序列;

22、在所述对抗样本序列中筛选攻击性满足预设攻击性要求的目标对抗样本。

23、在一些可能的实施例中,所述利用预设排序模型确定去重后的对抗样本各自的攻击性,包括:

24、在预设种子问题集种筛选针对所述待测试模型的训练种子问题;

25、对所述训练种子问题进行改写及扩展,得到扩展后的对抗训练样本;

26、利用所述对抗训练样本攻击所述待测试模型,得到模型输出结果及攻击有效性评价;

27、根据所述模型输出结果、所述攻击有效性评价对初始排序模型进行负采样训练,直至所述初始排序模型收敛,得到排序模型;

28、利用所述排序模型确定去重后的对抗样本各自的攻击性。

29、在一些可能的实施例中,所述方法还包括:

30、获取所述待测试模型被所述目标对抗样本攻击后的多维度评估指标;

31、根据所述多维度评估指标生成所述待测试模型的安全评估报告。

32、第二方面,本申请实施例提供一种大模型攻击装置,

33、所述大模型攻击装置包括:

34、问题改写模块,用于获取针对待测试模型的第一种子问题,并对所述第一种子问题进行改写,得到多个变种的第二种子问题;

35、问题扩展模块,用于利用预设模型越狱模板和预设对抗样本对所述第二种子问题进行扩展,得到扩展后的对抗样本;

36、对抗样本筛选模块,用于筛选出所述对抗样本中攻击性满足预设攻击性要求的目标对抗样本;

37、攻击模块,用于利用所述目标对抗样本对待测试模型进行攻击。

38、第三方面,本申请提供的电子设备,包括存储器和处理器,存储器存储有计算机程序,处理器用于运行存储器内的计算机程序,实现本申请所提供的大模型攻击方法中的步骤。

39、第四方面,本申请提供的计算机可读存储介质,存储有多条指令,该指令适于处理器进行加载,实现本申请所提供的大模型攻击方法中的步骤。

40、本申请提供一种大模型攻击方法、装置、电子设备及存储介质,该方法应用于红队攻击模型,包括获取针对待测试模型的第一种子问题,并对第一种子问题进行改写,得到多个变种的第二种子问题;利用预设模型越狱模板和预设对抗样本对第二种子问题进行扩展,得到扩展后的对抗样本;筛选出对抗样本中攻击性满足预设攻击性要求的目标对抗样本;利用目标对抗样本对待测试模型进行攻击。本申请通过对种子问题进行多次逐步改写,解决红队攻击模型冷启动困难的问题;同时得到高攻击性的对抗样本进行模型攻击训练,可有效提高模型攻击成功率,进而提高待测试模型的性能。



技术特征:

1.一种大模型攻击方法,其特征在于,应用于红队攻击模型,所述方法包括:

2.根据权利要求1所述的大模型攻击方法,其特征在于,所述获取针对待测试模型的第一种子问题,并对所述第一种子问题进行改写,得到多个变种的第二种子问题,包括;

3.根据权利要求2所述的大模型攻击方法,其特征在于,所述筛选所述第三种子问题中具有攻击性的第四种子问题,包括:

4.根据权利要求2所述的大模型攻击方法,其特征在于,在对所述第四种子问题进行二次改写,得到所述第二种子问题之后,所述获取针对待测试模型的第一种子问题,并对所述第一种子问题进行改写,得到多个变种的第二种子问题,还包括:

5.根据权利要求1所述的大模型攻击方法,其特征在于,所述筛选出所述对抗样本中攻击性满足预设攻击性要求的目标对抗样本,包括:

6.根据权利要求5所述的大模型攻击方法,其特征在于,所述利用预设排序模型确定去重后的对抗样本各自的攻击性,包括:

7.根据权利要求1所述的大模型攻击方法,其特征在于,所述方法还包括:

8.一种大模型攻击装置,其特征在于,所述大模型攻击装置包括:

9.一种电子设备,其特征在于,所述电子设备包括存储器和处理器,其中所述处理器通过调用所述存储器中存储的计算机程序,用于执行权利要求1-7任一项所述的大模型攻击方法中的步骤。

10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有多条指令,所述指令适于处理器进行加载,以执行权利要求1至7任一项所述的大模型攻击方法中的步骤。


技术总结
本申请提供一种大模型攻击方法、装置、电子设备及存储介质,该方法应用于红队攻击模型,包括获取针对待测试模型的第一种子问题,并对第一种子问题进行改写,得到多个变种的第二种子问题;利用预设模型越狱模板和预设对抗样本对第二种子问题进行扩展,得到扩展后的对抗样本;筛选出对抗样本中攻击性满足预设攻击性要求的目标对抗样本;利用目标对抗样本对待测试模型进行攻击。本申请通过对种子问题进行多次逐步改写,解决红队攻击模型冷启动困难的问题;同时得到高攻击性的对抗样本进行模型攻击训练,可有效提高模型攻击成功率,进而提高待测试模型的性能。

技术研发人员:请求不公布姓名,请求不公布姓名,请求不公布姓名
受保护的技术使用者:北京瑞莱智慧科技有限公司
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-32515.html