本发明针对研究生培养质量难以评价的问题,设计了一种数据和知识驱动的研究生培养质量分析方法,该发明既属于教育研究领域,又属于数据研究领域。
背景技术:
1、研究生培养的新政策新要求层出不穷,对高校信息化建设提出了严峻挑战。针对研究生规模快速增长、研究生类别多、管理难度增加、政策举措不到位等问题,研究生培养质量分析方法的持续性升级和改造、管理系统功能更新是解决问题的有效办法。随着研究生招生规模扩大,学位授予人数也逐年攀升。为进一步提高研究生培养质量,提升学位管理工作效率,实现学位评审系统由单一会议流程管理向学位数据监测共享转变,以数字方法赋能研究生学位工作,推动研究生教育高质量发展。要提升研究生教育质量,必须加强研究生培养质量保障体系建设,而构建研究生教育质量评价体系是其重要一环。
2、研究生培养质量评价是指导培养方案和教育高质量发展的重要指标。然而,研究生教育规模快速增长、管理难度越来越大、新政策执行不到位、监督管理浮于表面等,同时大数据分析和管理还远远不够。面对快速发展的研究生教育,如何不断创新提高管理效率以满足国家和社会对研究生培养质量的要求成为亟待解决的问题。因此,设计一种数据和知识驱动的研究生培养质量分析方法不仅可以提高研究生培养质量分析效率,保证研究生培养质量评价工作的科学客观、公平公正。
3、本发明通过分析研究生培养过程的特点,开发了研究生培养数据特征变量方法,设计了知识驱动的研究生培养质量评估模型,建立基于topsis的研究生培养质量评价机制,实现了科学客观的分析研究生培养质量。
技术实现思路
1、本发明提出了一种数据和知识驱动的研究生培养质量分析方法,实现了科学客观的分析研究生培养质量。该方法设计基于主成分分析挖掘研究生培养过程特征变量,设计知识驱动的研究生培养质量评估模型,建立基于topsis的研究生培养质量评价机制。
2、本发明采用了如下的技术方案及实现步骤:
3、1.一种数据和知识驱动的研究生培养质量分析方法,包括:
4、基于主成分分析挖掘研究生培养过程数据的特征变量,其中研究生培养过程数据需要进行数据预处理和归一化;设计知识驱动的研究生培养质量评估模型;建立基于topsis的研究生培养质量评价机制。
5、(1)基于主成分分析挖掘研究生培养过程数据的特征变量
6、对研究生培养过程数据进行预处理,以北京某高校2019级研究生培养数据为样本数据进行研究,包含研究生从入学到毕业的各个培养阶段的数据。
7、数据样本表示为
8、ω={x1,x2,...,x11} (1)
9、其中,ω为数据集,x1为学生基本信息,x2为入学成绩,x3为英语四六级成绩,x4为课程成绩,x5为学生开题信息,x6为学生论文盲审成绩,x7为发表论文成绩,x8为专利数量,x9为软著数量,x10为撰写专著数量,x11为获奖情况分数。
10、对数据的相关性进行分析,去除冗余数据。数据间相关性系数为:
11、
12、其中,xi为第i项数据,xj为第j项数据,cov(xi,xj)为xi和xj的协方差,dxi为xi的标准差,dxj为xj的标准差。η=0.8为相关性系数的阈值。x7和x11的相关性系数大于等于η,属于强相关关系,即冗余特征,剔除两项数据中和其他数据项相关性系数低的一项,即x11。其余数据间的相关性系数小于η,属于弱相关关系,保留数据。
13、对研究生培养过程数据进行归一化。使用的min-max标准化对原始数据进行归一化,将其特征值映射到区间[0,1],计算公式为:
14、
15、其中,ui,n为第i项数据的第n个样本,ui,max为该项数据的最大值,ui,min为该项数据的最小值。经归一化处理后,所有的样本处于[0,1]之间,数据样本表示成矩阵的形式为
16、
17、其中,xi,n为归一化后的第i项数据的第n个样本,i=10为样本数据项数,n为样本数量。
18、主成分分析方法用来挖掘研究生培养过程数据的特征变量。计算数据样本x的协方差矩阵为
19、
20、其中,c为数据样本x的协方差矩阵,rn,n为相关系数。
21、计算协方差矩阵c的特征值和对应的特征向量,表示为
22、c=vλvt (6)
23、其中,v为协方差矩阵的特征向量,λ为矩阵特征向量相关特征值组成的对角矩阵,表示为
24、
25、其中,λk为第k个特征值,k为λ的阶。lk为λk的特征向量。
26、按照从大到小的顺序对特征值进行排列,计算前m个特征值的累计贡献率为
27、
28、
29、其中,λm为第m个特征值,φm表示第m个特征值的贡献率,κ(m)表示m个特征值的累计贡献率,m的值由累计贡献率决定,当累计贡献率κ(m)大于等于85%时,选择其对应的特征向量组成变换矩阵qt,根据y=qtx计算前m个主成分,实现关键特征的提取。得到m=4。
30、(2)知识驱动的研究生培养质量评估模型
31、知识驱动的研究生培养质量评估模型的知识为规则知识。使用规则知识约束研究生培养质量评价:
32、课程成绩x4存在小于60分的,不予毕业;x5中开题时间和申请毕业时间不足学校规定时间的,不予毕业;学生论文盲审成绩x6低于60分的,不予毕业;发表论文成绩x7不满足学校要求的,不予毕业;学生学术成果重要性排序为:发表论文>专利>软著>撰写专著;对满足毕业条件的学生进行等级评价。
33、知识驱动的方法用来建立研究生培养质量评估模型。计算主成分载荷为
34、
35、其中,lkp∈lk为lk的第p维向量。通过分析主成分载荷值,与主成分1密切相关的为学生论文盲审成绩x6,与主成分2密切相关的为发表论文成绩x7,与主成分3密切相关的为专利数量x8,与主成分3密切相关的为软著数量x9。故选取x6,x7,x8和x9作为组成指标向量进行下一步的分析。
36、(3)建立基于topsis的研究生培养质量评价机制
37、topsis用来建立研究生培养质量评价机制。找到最优指标向量a*和最劣指标向量a-
38、
39、其中,x6*为最高学生论文盲审成绩,x7*为最高发表论文成绩,x8*为最高专利数量,x9*为最高专利数量,x6-为最低学生论文盲审成绩,x7-为最低发表论文成绩,x8-为最低专利数量,x9-为最低专利数量。
40、计算样本a到最优指标向量a*的欧式距离为
41、
42、其中,a=[x6,x7,x8,x9]为样本值,xi∈a为样本数据值,i=6,7,8,9,x6为学生论文盲审成绩,x7为发表论文成绩,x8为专利数量,x9为专利数量,为第m个特征值处理后的贡献率
43、
44、计算a到最劣指标向量a-的欧式距离为
45、
46、计算相对接近度,样本a对最优指标向量的相对接近程度计算公式如下所示
47、
48、其中,g为样本a的相对接近度值。g值与样本a对最优指标向量的相对接近程度呈正比关系,即g越大,样本a越靠近最优指标向量。
49、计算得出g的值即学生培养质量综合得分,g越大排序越靠前。排名前10%的研究生培养质量为“优秀”,排名前30%的研究生培养质量为“良好”,排名前70%的研究生培养质量为“中等”,排名前100%的研究生培养质量为“及格”,“不予毕业”的研究生培养质量为“不及格”。
1.一种数据和知识驱动的研究生培养质量分析方法,包括:
