基于卷积神经网络的新污染物PBT预测方法

专利2026-02-14  17


本发明涉及新污染物风险识别,尤其涉及一种基于卷积神经网络的新污染物pbt预测方法。


背景技术:

1、新污染物是指新近发现或被关注,对生态环境或人体健康存在风险,但尚未纳入管理或者现有管理措施不足以有效防控其风险的污染物。新污染物种类繁多、来源广泛、效应隐蔽、持久性强、可生物富集、环境和健康风险大。据统计,目前在美国化学会登记的化学物质已超过2亿种,我国现有化学物质约4.5万余种,这些化学物质在其生产、使用、处理和处置的整个生命周期都可以通过直接或间接的方式进入受纳环境,此外化学物质进入环境后还会发生降解转化产物,从而形成海量的污染物。环境持久性(p,persistent)、生物蓄积性(b,bioaccumulative)和毒性(t,toxic)是新污染物风险管控的重要依据之一。新污染物在环境中存在生物/非生物降解转化,其部分转化产物的环境持久性、生物蓄积性和毒性甚至高于母体,因此,系统评估新污染物及转化产物的pbt属性,对新污染物的管控具有重要意义。

2、最传统的新污染物识别方法是通过实验方法获取新污染物及转化产物的pbt属性,存在效率低、周期长、成本高昂等特点。

3、得益于神经网络的发展,通过构建pbt属性预测模型来识别新污染物及转化产物成为可能。常见的基于定量构效关系(qsar)的方法在新污染物理化性质和毒性预测方面被广泛应用,但是该方法主要依据大量人为设计的分子描述符和分子指纹信息,需要使用多种工具/软件计算分子特征,因此预测结果易受到人为因素的干扰。且该方法体系受限于自身特点,需要大量的数据进行建模和评估,且对正负样本分布的要求较高,使得模型构建比较耗时。


技术实现思路

1、针对上述问题,本发明提出一种基于卷积神经网络的新污染物pbt预测方法,主要解决背景技术的问题。

2、为解决上述技术问题,本发明的技术方案如下:

3、一种基于卷积神经网络的新污染物pbt预测方法,包括以下步骤:

4、获取化合物的smiles数据,以及新污染物的pbt数据,其中,对所述smiles数据和所述pbt数据分别进行预处理,生成smiles字符嵌入向量和pbt属性指标;

5、以所述smiles字符嵌入向量作为自变量,所述pbt数据作为因变量构建卷积神经网络预测模型,采用所述卷积神经网络预测模型学习所述smiles字符嵌入向量与所述pbt数据之间的关联特征;

6、根据所述关联特征,预测smiles数据对应的pbt属性指标。

7、在一些实施方式中,所述smiles字符嵌入向量的预处理过程包括:

8、采用词向量模型对所述smiles数据进行处理,生成smiels字符词典,所述smiels字符词典的构建过程中,按照预定义规则对所述smiles数据进行字符切分和热独编码,获取对应的smiles字符嵌入向量。

9、在一些实施方式中,所述smiles字符嵌入向量包括对应的唯一字符信息、长度信息、字符到向量信息,以及向量到字符信息。

10、在一些实施方式中,所述pbt属性指标的预处理过程包括:

11、整理所述pbt属性数据,根据预设条件将所述pbt属性数据指标划分为1和0,用于表示新污染物的p和非p属性、b和非b属性,以及t和非t属性。

12、在一些实施方式中,所述卷积神经网络预测模型的训练过程包括:将所述pbt数据按照预设比例随机拆分为训练集和测试集,所述训练集用于训练获取所述关联特征,所述测试集评估所述卷积神经网络预测模型的预测效果。

13、本发明的有益效果为:将smiles数据作为文本语句输入,通过编码-解码过程,将一维字符信息映射到三维空间结构,转化为smiles字符嵌入向量,相对于分子描述符、分子指纹和分子图数据的获取,本方法分子信息获取效率较高,避免了人为因素对对分子标识信息的干扰,同时提高了模型预测能力,稳定性也较高。再有,由于本方案采用文本数据进行预测,因此只需要采用cpu进行运算,计算速度快,无需gpu资源参与,节约大量的成本投入。



技术特征:

1.一种基于卷积神经网络的新污染物pbt预测方法,其特征在于,包括以下步骤:

2.如权利要求1所述的基于卷积神经网络的新污染物pbt预测方法,其特征在于,所述smiles字符嵌入向量的预处理过程包括:

3.如权利要求1所述的基于卷积神经网络的新污染物pbt预测方法,其特征在于,所述smiles字符嵌入向量包括对应的唯一字符信息、长度信息、字符到向量信息,以及向量到字符信息。

4.如权利要求1所述的基于卷积神经网络的新污染物pbt预测方法,其特征在于,所述pbt属性指标的预处理过程包括:

5.如权利要求1所述的基于卷积神经网络的新污染物pbt预测方法,其特征在于,所述卷积神经网络预测模型的训练过程包括:将所述pbt数据按照预设比例随机拆分为训练集和测试集,所述训练集用于训练获取所述关联特征,所述测试集评估所述卷积神经网络预测模型的预测效果。


技术总结
本发明公开一种基于卷积神经网络的新污染物PBT预测方法,包括以下步骤:获取化合物的SMILES数据,以及新污染物的PBT数据,其中,对SMILES数据和PBT数据分别进行预处理,生成SMILES字符嵌入向量和PBT属性指标;以SMILES字符嵌入向量作为自变量,PBT数据作为因变量构建卷积神经网络预测模型,采用卷积神经网络预测模型学习SMILES字符嵌入向量与PBT数据之间的关联特征;根据关联特征,预测SMILES数据对应的PBT属性指标。本发明的有益效果是:分子信息获取效率较高,避免了人为因素对对分子标识信息的干扰,同时提高了模型预测能力,稳定性也较高。再有,由于本方案采用文本数据进行预测,因此只需要采用CPU进行运算,计算速度快,无需GPU资源参与,节约大量的成本投入。

技术研发人员:胡立新,赵敏宏,张晋娜,张芊芊,刘有胜,应光国
受保护的技术使用者:华南师范大学
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-29739.html