一种基于机器学习的吸毒预测方法

专利2026-08-09  1


本发明涉及临床诊断领域,具体涉及一种基于机器学习的吸毒预测方法。


背景技术:

1、毒品逐渐成为当今世界面临的重要社会问题之一,其不仅会导致使用者产生严重的健康问题,还会极大的危害社会安全稳定。目前针对毒品吸食者的检测主要通过对其毛发、尿液或血液进行采集并分析其中残留的毒品或毒品代谢物来判断是否存在吸毒行为。然而,毛发检测成本高昂,大部分社区医院没有相应的仪器设备。同时,尿检和血检又受限于毒品及其代谢物在吸食者体内停留的时间,有较高的时效性要求,很难及时对疑似吸食者进行吸毒检测。

2、因此,有必要寻找一种时效性要求不高、成本相对较低且检测样本容易获取的吸毒判断方法,实现初步筛查疑似吸食者,达到缩小精确检测范围的目的。同时,该方法不局限于单种毒品的检测,且能够在实际应用中保持较高准确率和有较好的适应性。


技术实现思路

1、针对背景技术中存在的问题,本发明的目的在于提供一种基于机器学习的吸毒预测方法。

2、为达到上述目的,本发明采用如下技术方案:

3、步骤1:对一批吸毒人员和非吸毒人员分别进行包含多个血液检查项目的检查,采集得到正负样本数量均衡的原始样本数据;

4、步骤2:对原始样本数据进行预处理,包括基于集中趋势分析的异常值处理、数据的离散化处理和基于众数填补的缺失值处理;

5、步骤3:对预处理后的样本数据与吸毒情况进行相关性分析,在去除不相关的血液检查项目后,得到相关性较强的血液检查项目样本数据,并制作数据集;

6、步骤4:采用基于基尼不纯度的随机森林机器学习模型对血液检查项目数据集进行分类训练和测试,得到训练好的随机森林分类模型;

7、步骤5:使用随机森林分类模型对待测样本进行吸毒情况预测;

8、进一步地,对原始样本数据采用基于集中趋势分析的异常值处理具体为:设原始样本数据为x∈rn x m;

9、

10、式中,列向量λ为包含所有样本的单个血液检查项目,xij为第i个样本中第j个血液检查项目的值,n为样本总数,m为单个样本中包含的血液检查项目总数;将原始样本数据中各血液检查项目λj中的每个样本值xij从小到大排序;将位置在25%、75%处的值作为第一四分位数点、第三四分位数点,并根据第一四分位数点和第三四分位数点计算各血液检查项目的上限值uifj和下限值lifj,计算公式如下:

11、uifj=qj3+1.5(qj3-qj1)

12、lifj=qj3-1.5(qj3-qj1)

13、式中,qj1为第一四分位数点,qj3为第三四分位数点,j=1,2,3,……,m;再将各样本中的每个血液检查项目值与其对应血液检查项目的上限值和下限值进行比较,若该样本中存在高于上限的值或低于下限的值,需结合该值对应的血液检查项目参考值类型进行异常值判断并进行处理,具体分为以下两种情况:1)该值对应项目的参考值为单一值的,则认定其为正常值,保留该值;2)该值对应项目的参考值为单一区间范围或多个区间范围的,则认定其为异常值,将该样本从原始样本数据中删除。

14、进一步地,数据的离散化处理具体为:对经过异常值处理后的样本数据按照各血液检查项目的参考值类型进行处理:

15、1)血液检查项目参考值为单一值的,设参考值为k,实际值为r,若r=k,则该血液检查项目为正常,将其值赋为3;否则该血液检查项目为非正常,将其值赋为5;

16、2)血液检查项目参考值为单一区间范围的,设参考区间为(k1,k2),实际值为r;若r∈[ak2,+∞),则该血液检查项目为过高,将其值赋为5;若r∈[k2,ak2),则该血液检查项目为偏高,将其值赋为4;若r∈[k1,k2),则该血液检查项目为正常,将其值赋为3;若r∈[bk1,k1),则该血液检查项目为偏低,将其值赋为2;若r∈[0,bk1),则该血液检查项目为过低,将其值赋为1;其中,a>1,0<b<1且a、b均为常量;

17、3)血液检查项目参考值为多个区间范围的,包括正常范围k、偏低范围kl、偏高范围kh,设实际值为r,若r高于偏高范围kh,则该血液检查项目为过高,将其值赋为5;若r∈kh,则该血液检查项目为偏高,将其值赋为4;若r∈k,则该血液检查项目为正常,将其值赋为3;若r∈kl,则该血液检查项目为偏低,将其值赋为2;若r低于偏低范围kl,则该血液检查项目为过低,将其值赋为1。

18、进一步地,基于众数填补的缺失值处理具体为:设经数据离散化后的样本数据为x∈rg x m:

19、

20、式中,列向量q为包含所有离散化样本的单个血液检查项目,m为单个样本中包含的血液检查项目总数,行向量p为包含所有血液检查项目的单个离散化样本,g为离散化样本总数,xij为第i个样本中第j个血液检查项目的值;

21、对各离散化样本数据pi中各血液检查项目的缺失值个数ni进行统计,删除ni>t的样本,再对各血液检查项目qj中的赋值情况进行统计,获取每个血液检查项目qj中用于赋值次数最多的离散数ij,将ij填补给qj中的所有缺失值;其中,t为设定的缺失值个数阈值,ij=1,2,3,4,5。

22、进一步地,相关性分析和数据集制作具体为:设预处理后的样本为x∈rh x m,h为预处理后的有效样本个数,将其中的各数据xij作为自变量,是否吸毒作为因变量y,y为1或0,计算皮尔逊相关系数ρj,其计算公式如下:

23、ρj=cov(qj,y)/σqjσy

24、式中,j=1,2,3,……,m,m为单一样本的血液检查项目总数,qj为第j个血液检查项目中包含的预处理样本数据,cov(qj,y)为qj与y的协方差,σqj为qj的标准差,σy为y的标准差;

25、再将|ρj|≥ρth的血液检查项目与吸毒情况分类标签制作为数据集,并将数据集中的样本按比例分为训练集与测试集;其中,ρth为设定的相关性阈值。

26、进一步地,基于基尼不纯度的随机森林机器学习模型具体为:

27、步骤41:设置随机森林决策树棵数为t,决策树叶子节点最小样本数为f,决策树最大深度为d,以{t,f,d}构成随机森林参数空间,并将基尼不纯度作为决策树各节点的分裂标准;

28、步骤42:将血液检查数据集均分为k份,随机取其中一份作为测试集,其余k-1份作为训练集,计算该模型在测试集上的均方误差mse1;

29、步骤43:不重复的从k份数据中选取一份作为测试集,其余k-1分作为训练集,并重复步骤42得到k次实验的均方误差msei,i=1,2,……,k,按下式取平均后得到k折交叉验证误差cv;

30、

31、步骤44:随机从随机森林参数空间中选择n组参数{tj,fj,dj},重复步骤43并计算各组参数的k折交叉验证误差cvj,其中j=1,2,……,n;

32、步骤45:使用随机森林分类模型并应用最小k折交叉验证误差所对应的一组参数,对血液检查项目训练集进行训练。

33、进一步地,决策树各节点的分裂按以下步骤实施:

34、步骤411:计算a节点分裂前的基尼不纯度gini(a);

35、

36、式中,c为总分类个数,pi为节点a中样本属于第i类的概率;

37、步骤412:轮流选择每个特征进行分裂并计算分裂后两个子节点的基尼不纯度之和gini(a∑);

38、

39、

40、式中,gini(aj)为节点a中各子节点的基尼不纯度,aj为a节点分裂后的左子节点或右子节点,pij为节点aj中样本属于第i类的概率,wj为两个子节点中对应个体或者群体在总体(节点a)中的占比;

41、步骤413:选择基尼不纯度减少量gini(aδ)最大的特征作为该节点的分裂特征;

42、gini(a)δ=gini(a)-gini(a∑)。

43、本发明的有益效果是:

44、(1)本发明使用随机森林机器学习模型,通过学习吸毒者和正常人的部分血液检查项目之间存在的差异,实现对受试者的吸毒情况进行判断,该方法具有相对低的成本与较低的时效性要求,且具有较高的预测准确率。

45、(2)本发明使用基于集中趋势分析的异常值处理方法,能够针对不同血液检查项目实现异常值筛查,并排除其对模型训练产生的干扰;再通过基于血液检查参考值的数据离散化操作,将参考值作为对照基准,削弱其他疾病对受试者血液产生的干扰,便于模型学习吸毒者与正常人群的血液差异,有利于提升吸毒预测的准确率。

46、(3)本发明使用随机森林机器学习算法,能够通过特征组合找到血液特征之间的交互作用,以更全面的学习吸毒者与正常人的血液之间存在的差异,获得更高的预测准确率;同时,使用k折交叉验证对随机森林参数进行调优,能够更全面地评估随机森林模型的泛化能力,减少过拟合风险,使得该方法在实际应用中有更好的抗干扰能力。


技术特征:

1.一种基于机器学习的吸毒预测方法,其特征在于:包括以下步骤:

2.根据权利要求1所述的一种基于机器学习的吸毒预测方法,其特征在于:

3.根据权利要求1所述的一种基于机器学习的吸毒预测方法,其特征在于:

4.根据权利要求1所述的一种基于机器学习的吸毒预测方法,其特征在于:

5.根据权利要求1所述的一种基于机器学习的吸毒预测方法,其特征在于:

6.根据权利要求5所述的一种基于机器学习的吸毒预测方法,其特征在于:


技术总结
本发明公开了一种基于机器学习的吸毒预测方法。对一批吸毒者与正常人分别进行包含多个血液检查项目的检查,得到原始样本数据;对数据进行异常值处理、离散化处理和缺失值处理等预处理后,使用皮尔逊相关系数对各血液检查项目进行相关性分析,筛选得到较强相关性的血液检查项目,并制作吸毒预测数据集;采用经过k折交叉验证参数调优的随机森林机器学习算法在数据集上进行训练,得到预测模型;使用预测模型可实现对待测样本的吸毒情况的预测。本发明通过随机森林机器学习算法学习吸毒者和正常人的部分血液检查项目之间的差异实现吸毒情况预测,在实际应用中有具有较低的时效性要求、较高的准确率和较强的泛化能力与抗干扰能力。

技术研发人员:沈寅初,叶波,蔡晋辉,徐玉,陈爱军
受保护的技术使用者:中国计量大学
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-33354.html