本发明属于专利挖掘,具体涉及一种基于元学习ipc分类的图网络专利检索方法。
背景技术:
1、专利申请量的增长,给整个专利体系带来了重要挑战。现实中,申请人提交专利申请后,专利审查员或专利专家需要根据提交的申请进行相关专利检索和调研,以检查申请的专利是否具有新颖性以及是否存在侵权等相关法律问题。手动执行该过程是一个复杂的问题。一方面,专利数据库庞大,人工检索很可能出现漏检等问题;另一方面,专利的技术复杂性使得审查员需要具备相关的专业知识,以理解技术信息,才能选择准确合理的关键词进行专利检索以及判定专利申请的新颖性。ipc分类号对于专利申请、审查、检索和分析都非常重要。然而,ipc分类号是一个复杂的5层的层次结构,确定与该专利申请相符合的领域,一方面需要大量跨领域的专业知识储备,另一方面,各层的类别数量逐级递进,在“大组”层共有7590个类别,到“小组”层共有70788个类别。显然,确定ipc分类号是一个费时费力的过程。面对上述问题,研究人员提出了诸多用于ipc分类和专利检索的模型。在ipc分类方面主要方法是基于专利文本词嵌入和深度神经网络学习专利表征到ipc代码的映射。在相关专利检索方面主要方法是将专利简化为关键词的集合,基于关键词的集合衍生出不同的方法评判集合的相似性。
2、与本发明最相似的现有技术实现方案如下:
3、1、申请号:cn202410069639.9,专利名称:一种基于图文多模态双曲嵌入的专利ipc分类方法及系统,与本发明之间的异同:
4、不同点:该发明提出了一种基于图文多模态双曲嵌入的ipc分类方法,该发明利用图文多模态双曲模型获得图片和文本的嵌入表示,将两种向量投影到多模态嵌入空间,进行ipc多标签分类。而本发明在ipc分类部分只需要使用标题、摘要、独立权利要求文本数据。该发明没有考虑ipc的层级结构信息,本发明采用元学习按照ipc层级结构进行层次分类。
5、相同点:该发明和本发明都使用了深度学习获得专利的嵌入表示,都用于实现自动确定ipc分类号。
6、2、申请号:cn202311310422.4,专利名称:一种基于自注意力机制的后交互专利检索方法及装置,与本发明之间的异同:
7、不同点:该发明提出一种基于自注意力机制的后交互专利检索方法,将查询文本和待检索专利文本通过bert编码获得查询向量和待检索专利向量,将二者拼接输入使用自注意力模型,输出查询向量与待检索专利的相似度,是以监督学习的方式进行的。本发明提出的基于图网络的相关专利检索通过构建名词短语的图,使用graphsage的无监督训练方式学习专利的表征,从而计算专利相似度,不需要标记数据集。
8、相同点:该发明和本发明都使用了bert获得文本的嵌入表示,使用深度学习的方式计算专利相似度以检索相关专利。
9、3、申请号:cn202311270171.1,专利名称:一种基于相似度的专利检索方法、检索系统及存储介质,与本发明之间的异同:
10、不同点:该发明提出的专利检索方法,从查询文本和存储的专利提取关键词组,计算每个关键词的tf-idf值,选取权重最高的若干关键词作为专利关键词组,计算检索关键词组与各专利关键词组之间的相似度。本发明着重于名词短语,而且是基于一整篇待审查专利自动生成关键词,基于名词短语构建图,通过专利的图表征计算专利之间的相似度,而不是各个分散的关键词的相似度。
11、相同点:该发明和本发明都着眼于提取关键词,在计算专利的相似度以检索相关专利的过程中都使用了关键词的词向量。
12、4、论文:deeppatent:patent classification with convolutional neuralnetworks and word embedding,与本发明之间的异同:
13、不同点:该论文使用skip-gram算法生成每个词的词嵌入,而本发明使用bert。该论文使用cnn直接学习专利文本词嵌入与ipc分类号三级600多个类别的映射,而本发明使用元学习致力于学习一个中间模型,该中间模型在训练的过程中一直是学习二分类问题,相较于直接学习600多分类更容易拟合。
14、相同点:该方法和本发明都是用了深度学习技术获得专利文本的词嵌入,并基于这些词嵌入使用深度神经网络学习词嵌入与ipc代码的映射。
技术实现思路
1、发明目的:针对日益繁多的专利申请,旨在提出一种基于元学习ipc分类的图网络专利检索方法。该方法采用元学习模式学习专利文本与ipc分类号的映射,预测专利文本可能的ipc分类号,利用预测的ipc分类号缩小相关专利检索的范围,采用图网络的方式捕获两篇专利的相似性,尽可能准确地检索相关专利。
2、技术方案:
3、本发明采用的具体技术方案为一种基于元学习ipc分类的图网络专利检索方法。专利文本中能体现技术特点的词基本是名词短语,因而将专利文本解析为名词短语构成的序列。由于ipc分类号的五层树形结构,越底层细分领域越多,越是难以判断,且各个ipc分类号的数据量差别较大,将每个ipc分类号的判定独立为一个0/1二分类问题,通过元学习的模式,一次学习多个ipc分类号的任务,以期元模型无论面对哪个ipc分类的任务都能以少量样本学会,训练得到的元模型即为各个ipc分类的共享先验。给定一篇待审查专利,训练好的元模型从ipc一级逐层往下判定待审查专利可能的ipc分类。通过元模型层级分类预测的可能的ipc分类能够缩小相关专利检索的范围。为了能够准确地判断专利的相关性,在使用名词短语的词嵌入的基础上,结合了短语的结构关联,以名词短语作为节点,名词短语是否共现于一句话构建边,将一篇专利以名词短语的图网络表示。让图以无监督方式学习节点嵌入,聚合邻居节点的表征。图的表征隐含了名词短语之间的结构关联,能更好地体现专利之间地关联性。具体包括以下步骤:
4、(1)预处理;
5、数据预处理是深度学习流程中的重要步骤,旨在清洗、转换原始数据,以便于后续建模。本模块的主要工作包括xml解析、句子依赖解析、数据的存储、异常值处理、文本转换为特征等。
6、数据来源于美国专利商标局(uspto)专利数据文件。美国专利商标局的专利数据以xml格式存储,每个xml文件包含了大量专利的详细信息,包括专利号、申请人、发明人、摘要、权利要求、图纸等。xml的结构化特性使得数据易于解析和处理,为研究人员、专利检索系统和其他利益相关者提供了丰富的信息资源。本方法使用elementtree解析专利xml文件,抽取各个专利的标题、摘要、独立权利要求以及ipc分类号等信息,考虑收集的专利数据中可能前几项权利要求是“被取消”的状态,因此权利要求书的部分只存储第一项有效的权利要求文本作为独立权利要求。
7、由于需要将专利的文本数据转换为数值向量,才能够输入模型计算。需要考虑用专利文本的哪些数据代表这一篇专利。专利文件通常使用特定领域的术语和专业术语来描述发明、技术或者方法,这些术语和名词短语能够精准地体现技术领域及其特点。因此,识别和理解专利中的名词短语对于了解专利的核心内容和技术细节至关重要。spacy提供了一套高效且准确的工具,能够执行文本的词法和句法分析,包括词性标注、命名实体识别和依存句法分析等功能。本方法利用spacy进行句法分析,以提取专利文献中的名词短语。并且对提取出的名词短语集合进行去重处理,以确保结果的精确性和唯一性。同时,去除一些误识别的与专利无关的停用词。使用这些名词短语的集合代表整篇专利。
8、使用预训练的bert模型将各个名词短语转换为向量表征。传统的词向量模型(如word2vec和glove)通常将每个词映射到固定的向量表示,而忽略了上下文的影响。bert能够根据上下文动态地生成词向量,因此能更好地捕捉词语在不同语境下的含义,在处理语义相似性、词语歧义等问题时更加有效。
9、对于一份专利doc,通过词法解析得到专利的名词短语集合p,p={p1,p2,……,pn},每个名词短语使用bert生成词嵌入每个名词短语都是768维的词向量。专利的名词短语词嵌入序列记为embed,embed={e1,e2……,en}。
10、(2)基于元学习的ipc分类;
11、确定专利的ipc分类号是一个复杂的任务。ipc分类号是从上到下的5层的分层结构,从上往下每层都是对上层的领域细分,由于学科领域的错综复杂,越接近底层类别数越多,某些ipc类别具有较大的样本数量,而其他类别样本数较少,这使得在少样本类别上的分类变得困难。为了解决该问题,将ipc分类任务视为小样本学习任务,采用元学习,将专利分类到ipc第三级。
12、元学习的目标是设计一种学习算法,使得学习器能够通过从一系列相关任务中学习,提取任务之间的共性和差异,面对新任务时,能够利用先前学习取得的经验快速适应新任务,以具有良好的泛化能力。
13、任务生成器构建的任务分为训练时任务和测试时任务两种。
14、训练时任务如下:对于ipc一至三级的各个类别,随机选择一个类别,如“g06f”,随机采样k+m个属于该类别的专利以及k+m个不属于该类别的专利,2k个样本作为supportset,2m个样本作为query set,support set和query set构成一个是否属于“g06f”这个类别的0/1二分类任务ti,包含2k+2m个样本。训练时每次采样的一批任务记为dtrain,dtrain={t1,t2,…,tb},其中ti={s,q},s即support set,q即query set,b为一批任务的数量。
15、测试时任务如下:对于一个ipc类别(无论层级),随机采样k个属于该类别的专利以及k个不属于该类别的专利,2k个样本构成support set,query set仅由测试样本构成,即query set样本数为1。support set和query set构成该类别的0/1二分类任务,包含2k+1个样本。测试时每次采样的任务记为dtest,dtest={t},其中t={s,q},q={(xtest,ytest)}。
16、元模型采用长短期记忆递归神经网络加全连接神经网络。元模型fθ拥有一个全局参数θ,θ会复制分发给一批待学习的任务,模型分别使用各个任务的support set的样本进行若干次内层梯度更新迭代模型参数,损失函数的计算基于交叉熵损失得到适应任务ti的模型参数θi′,将适应后的模型在query set计算交叉熵损失,记为在各个类似“g06f”这样的任务上得到的求和更新全局模型参数fθ。
17、
18、通过上述任务构建,模型可以学习多个类似的二分类问题。本方法将模型的训练分为三个阶段,第一阶段作用于ipc第一级“部”,其中每个元素表示ipc第一级的一个分类号。在第一级的各个类别构建上述类似的任务,训练模型,记为θ1。第一阶段训练完毕后,模型已经学习到第一级各个类别的共享先验,给出少数几个样本就能适应到各个类别的二分类问题判定。第二阶段作用于ipc第二级“大类”,其中每个元素表示ipc第二级的一个分类号。基于第一级训练完的全局模型,可以帮助学习第二级各个类别的分类,同样构建上述类似的二级任务,训练全局模型,训练后的模型记为θ2。第三阶段,使用第二级训练完的全局模型,作用于ipc第三级“子类”,其中每个元素表示ipc第三级的一个分类号。构建三级任务,训练模型,训练后的模型记为θ3。这样的训练方法综合考虑了全局模型在各个层级各个二分类任务上进行少数几次适应后执行任务的效果,希望最后训练得到的模型在给定一个新的任务的情况下,能够通过少数几次适应快速学会这个任务。同时,这些全局参数可以视为模型在整个数据集上学习到的共享特征。
19、在测试阶段,实行层级分类。给定一篇专利,将该专利经过预处理模块处理成名词短语词嵌入的序列,记为样本x。记当前层级为l,候选类别集z={cl,j|pred(parent(cl,j))=1},初始时l=1,z为ipc一级所有类别,即当l=2或3时,候选集中的ipc必须要求上一层ipc被模型预测为1。将训练后的模型在ipc第一级每个类别采样测试时任务进行更新,将x输入每个适应后的模型其中预测x是否属于该类别。记录输出为1的类别。在输出为1的类别的下属二级大类中采样测试时任务,例如一级a类预测为1,二级就会在a01~a24等ipc中采样任务。基于一级适应后的模型参数在这些二级任务上再做更新,再次输入x得到二级大类中输出为1的类别,即模型认为样本x属于的二级大类,如a01预测为1,更新后的模型参数为最后对于x属于的二级大类的下属三级小类,如a01g,a01n等,采样任务,基于上层模型适应,判定x属于的三级小类。按照ipc的树形结构从上至下逐层分类,获得预测的ipc三级分类结果其中c3,i为第3层的某个ipc分类号,pred为元模型对该专利是否属于某个ipc分类号的预测值。
20、(3)基于图表征的相关专利检索;
21、相关专利的检索是专利申请过程中非常重要的一步,通过确定待申请专利可能的ipc分类号,可以将相关专利检索的范围缩小到几个子领域。传统的方法主要基于关键词搜索,对专业知识背景是一个很高的要求,同时,受到主观意识和经验的影响,不同的人得到的关键词存在主观偏差。本方法提出了基于图表征的专利相似性判断方法,能够去除主观因素影响,不仅考虑了同义词、歧义等问题,还结合了关键词的结构信息。
22、专利对选择模块将数据库中在预测的ipc类别下的专利分别与待申请专利组成专利对。
23、图构建模块:专利文本中,技术性词语基本是名词或名词短语,基于这些名词短语能够判断两篇专利的相似性。由于存在一词多义和同义词等现象,直接判断出现的名词是否相同不足以准确地判定相似性,所以,本方法首先使用了bert词向量,两个不同的词,词向量相似,语义就相似。其次,两篇专利可能虽然存在重合的技术名词,但描述的技术重点以及主题并不相同,基于短语词向量相似度的方法不能很好地解决这个问题,因而,本方法提出以图的方式构建专利的整体的表征,在词嵌入的基础上结合短语结构信息,能够更准确地判断相关性。具体地,构建图g=(v,e),v是节点的集合,名词短语即为节点,e是边的集合,两个名词短语只要同时出现于一个句子中,两个节点之间就存在边,即occur函数。
24、e={(vi,vj)|occur(vi,vj)=1}
25、
26、名词短语的抽取需要先进行词性标注,如名词、动词、形容词等,再建立句子的句法依存树,依存树用于描述句子的语法结构,句子中的每个词都是树的一个节点,节点之间的边标识词与词之间的语法关系。基于生成的句法依存树,可以通过每个词的词性以及与其他词的语法关系识别名词短语。图g中节点特征是名词短语的bert词嵌入。
27、graphsage:在获得一篇专利构建的图后,需要使用图神经网络的方式学习图的整体表征。graphsage是一种用于图表示学习的框架,旨在处理图数据中节点的表示学习问题。graphsage的核心思想是通过采样和聚合节点的邻居节点的特征来生成节点的表征,从而在整个图上实现有效的特征学习和预测任务,并不局限于特定的神经网络。表示对节点v随机采样的部分邻居节点。u表示节点v的一个邻居节点。表示节点u在第k-1层的特征。aggregatek表示聚合函数。wk是第k层的可训练参数。在本发明中,聚合函数采用lstm聚合,将节点v的部分邻居节点的特征组成序列输入lstm,输出邻居节点的聚合特征。聚合特征与节点v的特征拼接,即concat函数,拼接后的特征输入一层全连接神经网络mlp做特征转换,对应wk,得到当前节点v的新特征。
28、
29、通过构建正负样本对来实现无监督学习。假设(v,u)是正样本对,即v,u之间存在边,(v,u′)是负样本对,即v,u′之间不存在边。q是负样本数量,pn(v)是负样本分布。目标是最大化正样本对的相似性,最小化负样本对的相似性。通过聚合学习后的节点特征相较于最初的词嵌入,融合了文档中名词短语之间的联系。专利图节点由学习转换成
30、不同的名词短语与专利主题的相关性不同,因而代表专利整体表征的图表征应该由不同名词短语的表征加权而得。在本发明中,采用tf-idf计算各个名词短语的权重。tf-idf是一种用于衡量一个词在文档集合中的重要程度的统计方法,常用于信息检索和文本挖掘中。nt,d是词t在专利d中出现的频次,∑knk,d是专利d中所有词出现的频次总和。|d|是数据库的专利总数,|{d:t∈d}|表示包含词语t的专利数。tf表示词在当前文档的频率,idf值越大,说明该词区分能力越强。tf-idf值大的词,与文档的主题相关性越高。
31、
32、tf-idf(t,d)=tf(t,d)·idf(t)
33、通过每个名词短语的tf-idf,加权获得图的整体表征hg。
34、hg=∑v∈vtf-idf(v)·hv
35、对于两篇专利,计算图g1和g2的整体表征之间的余弦相似度,衡量两篇专利的相关性。余弦相似度的取值范围在-1~1之间,越接近1表示向量越相似。
36、
37、筛选相似度大于阈值λ的专利作为相关专利。相关专利集合为
38、有益效果:
39、本发明利用ipc分类号的五层树形结构,采用元学习模式对各个ipc分类号进行0/1二分类问题的独立判定,使得元模型能够在面对不同ipc分类任务时快速适应并学习,提高了分类效率和准确性。通过逐层判定待审查专利可能的ipc分类,该方法显著缩小了相关专利检索的范围,提高了检索的精确度和效率。同时,将名词短语作为节点,利用名词短语共现构建边形成图网络,通过自监督方式学习节点嵌入并聚合邻居节点的表征,充分挖掘了名词短语之间的结构关联,增强了专利文本的表示能力。图网络的表征不仅能更好地反映专利之间的关联性,还能提高相关专利检索的准确度。
1.一种基于元学习ipc分类的图网络专利检索方法,其特征在于,在专利数据集上构建各个ipc类别的二分类任务,使用元学习的模式让元模型学习到这些任务的共享先验,模型只用少数样本就能适应到特定ipc类别的判定任务上;通过ipc一级向下的按顺序层级分类,逐层圈定需要确定的ipc类别;基于名词短语构建图,实现在语义的基础上融合结构信息,以满足准确判断专利相似性的需求;具体实施步骤包括:预处理、元模型的训练和使用、图表征相关专利检索。
2.根据权利要求1所述的一种基于元学习ipc分类的图网络专利检索方法,其特征在于,预处理包括:
3.根据权利要求2所述的一种基于元学习ipc分类的图网络专利检索方法,其特征在于,使用elementtree解析专利xml文件,抽取各个专利的标题、摘要、独立权利要求以及ipc分类号信息,其中,权利要求书的部分只存储第一项有效的权利要求文本作为独立权利要求。
4.根据权利要求3所述的一种基于元学习ipc分类的图网络专利检索方法,其特征在于,元模型的训练包括:
5.根据权利要求4所述的一种基于元学习ipc分类的图网络专利检索方法,其特征在于,所述构建训练时任务中,support set和query set构成一个是否属于某个类别的0/1二分类任务ti,包含2k+2m个样本;训练时每次采样的一批任务记为dtrain,dtrain={t1,t2,…,tb},其中ti={s,q},s即support set,q即queryset,xij即一篇专利的名词短语序列,yij即这篇专利的ipc分类号;所述构建测试时任务中,support set和query set构成该类别的0/1二分类任务,包含2k+1个样本;测试时每次采样的任务记为dtest,dtest={t},其中t={s,q},q={(xtest,ytest)};
6.根据权利要求5所述的一种基于元学习ipc分类的图网络专利检索方法,其特征在于,元模型的使用包括:
7.根据权利要求6所述的一种基于元学习ipc分类的图网络专利检索方法,其特征在于,图表征相关专利检索包括:
8.一种计算机存储介质,其特征在于,其上存储有计算机程序,所述计算机程序被处理器执行时实现如权利要求1至7任一所述方法的步骤。
9.一种电子设备,其特征在于,包括存储器、以及一个或多个处理器,所述存储器用于存储一个或多个程序;所述一个或多个程序被所述一个或多个处理器执行时,实现如权利要求1至7任一所述的方法。
