背景技术:
1、本公开整体涉及基因分型,并且更具体地涉及用于对潜在地具有多个贡献者的生物样本进行反卷积分析的系统、设备和方法。
2、基因分型是从生物样本确定个体在特定遗传基因座处具有何种等位基因组合(特定dna序列变异)的过程。例如用于法医目的人类身份识别通常通过分析若干已知的短串联重复(str)基因座处的等位基因来进行。str区域具有短的dna重复序列。最常见的是四个碱基的重复序列(“重复单元”)。但是一些str基因座具有不同长度的重复单元,例如在2至7个碱基的范围内。特定基因座处的不同的str等位基因在该基因座处具有不同数量的重复单元。str基因座在个体间具有显著的变异性。尽管两个不同的个体可能在给定的str基因座处具有相同的基因型(即两个等位基因的相同组合),但当考虑若干str基因座时,两个个体在每个str基因座处具有完全相同的基因型的可能性非常小,即非常接近零。因此,分析若干str基因座处的基因型是从生物样本识别个体的可靠方式。
3、在法医调查中,常规使用十三个核心str基因座进行dna分型。13个核心str基因座包括例如tpox、vwa、amel、th01、fga、d3s1358等。用序列特异性引物靶向这些str基因座,并使用pcr扩增对应于这些基因座的片段。然后分离得到的dna片段并使用电泳进行检测。存在两种常见的分离和检测方法,即毛细管电泳(ce)和凝胶电泳,其中近年来ce更常见。下一代测序技术最近也已用于dna分型。
技术实现思路
1、在法医调查中,生物样本通常包含来自多个贡献者的dna。这些贡献者中的一些或全部贡献者的身份可能是未知的。此外,归属于每个贡献者的样本的比例也不一定是已知的。通常,给定生物样本的贡献者的确切数量也是未知的。在多贡献者样本中确定哪些贡献者具有什么基因型的过程称为反卷积分析。在执行反卷积分析之前,通常需要假设或估计样本的贡献者的数量。
2、现有的反卷积技术通常针对给定基因座处等位基因的每一个和每一种可想到的组合的证据谱来计算和分析理论谱。但是这些技术是耗时的,而且也没有必要对每一种可想到的场景都进行研究,效率也不高。因此,需要更智能的反卷积分析系统和方法。
3、本发明的实施方案通过智能地选择可能的短串联重复(str)等位基因组合的子集以使用从生物样本获得的证据谱和未识别贡献者的预期信号范围进行进一步反卷积分析来提高计算机效率。
4、在本发明的一些实施方案中,在每个基因座处,对于多个贡献率场景中的当前分析的贡献率场景,处理器通过从证据谱中减去所有已知贡献者(如果有的话)的计算的预期贡献来计算调整的证据谱。对于在针对多个贡献者的当前分析的贡献率场景中具有预定最高剩余贡献率的第一或下一未识别贡献者,处理器至少使用预定最高剩余贡献率、所选降解值和峰高比分布来计算预期峰高第一范围。
5、在一些实施方案中,对于所有其他剩余的未识别贡献者(如果有的话),处理器至少使用所有其他剩余的未识别贡献者的当前分析的贡献率场景中的预定贡献率、所选降解值和峰高比分布来计算预期峰高第二范围。处理器还使用所调整的证据谱以及第一范围和第二范围中的一者或多者来选择对应于该第一或下一未识别贡献者的一个或多个所选基因型以用于进一步反卷积分析。该一个或多个所选基因型包括比潜在地与一般群体中的当前基因座相关联的基因型的总数更少的基因型。
6、在本公开的一些实施方案中,提供了用于估计生物样本的贡献者数量(noc)的改进的方法和系统。在一些实施方案中,用于估计noc的改进的noc分析技术可以增强反卷积分析,使其更易处理、更快和有效地进行反卷积分析。估计生物样本的贡献者数量(noc)的现有技术使用单个模型来提供预测或简单地假定所有可能的贡献者数量。但是这些技术在所有情况下可能不是准确的,和/或如果考虑所有可能的贡献者数量则可能是非常耗时的。例如,通过考虑样本的所有可能的贡献者数量,反卷积分析可能需要为每个可能的贡献者数量计算许多可能的场景。因此,如果考虑所有可能的贡献者数量,则反卷积分析的计算工作可能大得令人望而却步或不切实际,并且耗时。考虑贡献者数量的每个可想到的场景也是不必要且低效的。因此,需要更智能的noc预测系统和方法。
7、本发明的实施方案通过使用多个模型(包括一个或多个基于机器学习的模型和/或一个或多个基于非机器学习的模型)的组合智能地预测生物样本的贡献者数量来提高计算机效率。模型的组合可以基于过去的分析结果、用户偏好、每个模型的准确度等来预先选择。将权重分配给所选模型中的每个所选模型,使得可以实现noc的更准确预测。
8、在本发明的一些实施方案中,提供了一种用于使用从生物样本获得的证据谱来预测与该生物样本相关联的贡献者数量以提高对至少一个贡献者进行基因分型的计算机效率的方法,该证据谱包括遗传信号数据。该方法包括使用一个或多个计算机处理器来执行处理,该处理包括:接收对用于估计与该生物样本相关联的贡献者数量的所选模型的组合的指示,以及基于证据谱生成预定数量的计算样本谱。该方法还包括:对于所选模型的组合中的每个所选模型,使用所选模型和计算样本谱来估计多个贡献者数量可能性的概率,以及使用基于所选模型的组合获得的多个noc可能性的估计概率来预测贡献者数量。
9、在一些实施方案中,提供了一种使用从生物样本获得的证据谱来预测与该生物样本相关联的贡献者数量以提高对至少一个贡献者进行基因分型的计算机效率的计算机实现的方法,该证据谱包括遗传信号数据。该方法包括:使用一个或多个计算机处理器来执行处理,该处理包括:接收预期最大贡献者数量,以及基于证据谱和预期最大贡献者数量来生成预定数量的计算样本谱。该方法还包括:对于小于或等于预期最大贡献者数量的每个可能的贡献者数量,确定具有对应可能的贡献者数量的每个计算样本谱的峰数量;基于具有对应可能的贡献者数量的每个计算样本谱的峰数量来获得预期峰计数分布;确定该证据谱中的峰总数;以及基于该预期峰计数分布和该证据谱中的峰总数,估计该多个noc可能性的概率。
10、下面更全面地描述这些和其他实施方案。
1.一种计算机实现的方法,所述方法选择可能的等位基因组合的子集以使用从生物样本获得的证据谱进行进一步反卷积分析来提高对所述生物样本的多个贡献者中的一个或多个未识别贡献者进行基因分型的计算机效率,所述证据谱包括对应于多个基因座中的每个基因座处的短串联重复(str)等位基因的遗传信号数据,所述方法包括:在每个基因座处,对于多个贡献率场景中的当前分析的贡献率场景,使用一个或多个计算机处理器来执行处理,所述处理包括:
2.根据权利要求1所述的计算机实现的方法,其中(d)包括:如果所调整的证据谱中的等位基因具有为所述第二范围的阈值的至少两倍的峰,则选择所述等位基因两次作为等位基因对中的所需等位基因,使得所述一个或多个所选基因型是单个纯合基因型。
3.根据权利要求1和2中任一项所述的计算机实现的方法,其中(d)包括:如果所调整的证据谱中的等位基因具有高于所述第二范围的阈值并且低于所述第二范围的所述阈值的两倍的峰,则为所述一个或多个所选基因型中的每个所选基因型选择所述等位基因作为等位基因对中的所需等位基因。
4.根据权利要求1至3中任一项所述的计算机实现的方法,其中(d)包括:如果所调整的证据谱中的等位基因具有为第一范围的阈值的至少两倍的峰,则为所述一个或多个所选基因型中的每个所选基因型选择所述等位基因两次作为两个可能的等位基因。
5.根据权利要求1至4中任一项所述的计算机实现的方法,其中(d)包括:如果所调整的证据谱中的等位基因具有高于所述第一范围的阈值但低于所述第一范围的所述阈值的两倍的峰,则为所述一个或多个所选基因型中的每个所选基因型选择所述等位基因作为等位基因对中的可能的等位基因。
6.根据权利要求1至5中任一项所述的计算机实现的方法,所述方法还包括:
7.根据权利要求1至6中任一项所述的计算机实现的方法,所述方法还包括使用一个或多个计算机处理器来执行处理,所述处理包括:
8.根据权利要求7所述的计算机实现的方法,所述方法还包括使用所述一个或多个计算机处理器来执行处理,所述处理包括:在针对所述下一未识别贡献者重复(a)-(d)之前:
9.根据权利要求7和8中任一项所述的计算机实现的方法,所述方法还包括使用所述一个或多个计算机处理器来执行处理,所述处理包括:在针对所述下一未识别贡献者重复(a)-(d)之前:
10.根据权利要求7和8中任一项所述的计算机实现的方法,所述方法还包括使用一个或多个计算机处理器来执行处理,所述处理包括:在针对所述下一未识别贡献者重复(a)-(d)之前:
11.根据权利要求7至10中任一项所述的计算机实现的方法,所述方法还包括使用一个或多个计算机处理器来执行处理,所述处理包括:
12.根据权利要求11所述的计算机实现的方法,其中对于所述未识别贡献者中的每个未识别贡献者的所述多个等位基因组合中的每个等位基因组合,计算对相应理论谱的理论贡献包括:对于相应未识别贡献者的相应等位基因组合:
13.根据权利要求11和12中任一项所述的计算机实现的方法,所述方法还包括使用一个或多个计算机处理器来执行处理,所述处理包括:
14.根据权利要求13所述的计算机实现的方法,其中确定所述证据谱与相应理论谱之间的匹配程度包括:对于与所述证据谱和所述相应理论谱相关联的每个对应箱:
15.根据权利要求14所述的计算机实现的方法,所述方法还包括:
16.根据权利要求15所述的计算机实现的方法,所述方法还包括:
17.根据权利要求16所述的计算机实现的方法,所述方法还包括:
18.根据权利要求1至17中任一项所述的计算机实现的方法,其中(b)包括:
19.根据权利要求1至18中任一项所述的计算机实现的方法,其中(c)包括:
20.一种非暂态计算机可读介质,所述非暂态计算机可读介质存储一个或多个指令,所述指令在由至少一个计算设备的一个或多个处理器执行时执行处理以选择可能的等位基因组合的子集以使用从生物样本获得的证据谱进行进一步反卷积分析来提高对所述生物样本的多个贡献者中的一个或多个未识别贡献者进行基因分型的计算机效率,所述证据谱包括对应于多个基因座中的每个基因座处的短串联重复(str)等位基因的遗传信号数据,所述处理包括:在每个基因座处,对于多个贡献率场景中的当前分析的贡献率场景:
21.一种系统,所述系统用于选择可能的等位基因组合的子集以使用从生物样本获得的证据谱进行进一步反卷积分析来提高对所述生物样本的多个贡献者中的一个或多个未识别贡献者进行基因分型的计算机效率,所述证据谱包括对应于多个基因座中的每个基因座处的短串联重复(str)等位基因的遗传信号数据,所述系统包括:
22.一种计算机实现的方法,所述方法使用从生物样本获得的证据谱来预测与所述生物样本相关联的贡献者数量,以提高对至少一个贡献者进行基因分型的计算机效率,所述证据谱包括遗传信号数据,所述方法包括使用一个或多个计算机处理器来进行处理,所述处理包括:
23.根据权利要求22所述的计算机实现的方法,其中所述所选模型的组合包括基于人工神经网络的模型、基于决策树的模型、基于随机森林算法的模型和峰计数分布模型中的两者或更多者。
24.根据权利要求22和23中任一项所述的计算机实现的方法,所述方法还包括基于所述证据谱获得上下文信息,其中基于所述证据谱生成所述预定数量的计算样本谱包括:
25.根据权利要求24所述的计算机实现的方法,其中所述上下文信息包括以下中的一项或多项:
26.根据权利要求22至25中任一项所述的计算机实现的方法,其中对于所述所选模型的组合中的每个所选模型,使用所述所选模型和所述计算样本谱来估计多个noc可能性的概率包括:
27.根据权利要求26所述的计算机实现的方法,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:
28.根据权利要求26所述的计算机实现的方法,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
29.根据权利要求26所述的计算机实现的方法,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
30.根据权利要求26所述的计算机实现的方法,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
31.根据权利要求26所述的计算机实现的方法,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
32.根据权利要求22至31中任一项所述的计算机实现的方法,所述方法还包括:
33.根据权利要求22至32中任一项所述的计算机实现的方法,其中对于所述所选模型的组合中的每个用户所选模型,使用所述所选模型和所述计算样本谱来估计多个noc可能性的概率包括:
34.根据权利要求22至33中任一项所述的计算机实现的方法,其中使用基于所述所选模型的组合获得的所估计的所述多个noc可能性的概率来预测与所述生物样本相关联的所述贡献者数量包括:
35.一种计算机实现的方法,所述方法使用从生物样本获得的证据谱来预测与所述生物样本相关联的贡献者数量,以提高对至少一个贡献者进行基因分型的计算机效率,所述证据谱包括遗传信号数据,所述方法包括使用一个或多个计算机处理器来进行处理,所述处理包括:
36.根据权利要求35所述的计算机实现的方法,所述方法还包括基于所述证据谱获得上下文信息,其中基于所述证据谱和所述预期最大贡献者数量来生成所述预定数量的计算样本谱包括:
37.根据权利要求36所述的计算机实现的方法,其中所述上下文信息包括以下中的一项或多项:
38.一种非暂态计算机可读介质,所述非暂态计算机可读介质存储一个或多个指令,所述指令在由至少一个计算设备的一个或多个处理器执行时执行处理以使用从生物样本获得的证据谱来预测与所述生物样本相关联的贡献者数量,以提高对所述贡献者中的至少一个贡献者进行基因分型的计算机效率,所述证据谱包括遗传信号数据,所述处理包括:
39.根据权利要求38所述的计算机可读介质,其中所述所选模型的组合包括基于人工神经网络的模型、基于决策树的模型、基于随机森林算法的模型和峰计数分布模型中的两者或更多者。
40.根据权利要求38和39中任一项所述的计算机可读介质,其中所述处理还包括基于所述证据谱获得上下文信息,其中基于所述证据谱生成所述预定数量的计算样本谱包括:
41.根据权利要求40所述的计算机可读介质,其中所述上下文信息包括以下中的一项或多项:
42.根据权利要求38至41中任一项所述的计算机可读介质,其中对于所述所选模型的组合中的每个所选模型,使用所述所选模型和所述计算样本谱来估计多个noc可能性的概率包括:
43.根据权利要求42所述的计算机可读介质,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:
44.根据权利要求42所述的计算机可读介质,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
45.根据权利要求42所述的计算机可读介质,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
46.根据权利要求42所述的计算机可读介质,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
47.根据权利要求42所述的计算机可读介质,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
48.根据权利要求38至47中任一项所述的计算机可读介质,其中所述处理还包括:
49.根据权利要求38至48中任一项所述的计算机可读介质,其中对于所述所选模型的组合中的每个用户所选模型,使用所述所选模型和所述计算样本谱来估计多个noc可能性的概率包括:
50.根据权利要求38至49中任一项所述的计算机可读介质,其中使用基于所述所选模型的组合获得的所估计的所述多个noc可能性的概率来预测与所述生物样本相关联的所述贡献者数量包括:
51.一种系统,所述系统用于使用从生物样本获得的证据谱来预测与所述生物样本相关联的贡献者数量,以提高对所述贡献者中的至少一个贡献者进行基因分型的计算机效率,所述证据谱包括遗传信号数据,所述系统包括:
52.根据权利要求51所述的系统,其中所述所选模型的组合包括基于人工神经网络的模型、基于决策树的模型、基于随机森林算法的模型和峰计数分布模型中的两者或更多者。
53.根据权利要求51和52中任一项所述的系统,其中所述过程还包括基于所述证据谱获得上下文信息,其中基于所述证据谱生成所述预定数量的计算样本谱包括:
54.根据权利要求53所述的系统,其中所述上下文信息包括以下中的一项或多项:
55.根据权利要求51至54中任一项所述的系统,其中对于所述所选模型的组合中的每个所选模型,使用所述所选模型和所述计算样本谱来估计多个noc可能性的概率包括:
56.根据权利要求55所述的系统,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:
57.根据权利要求56所述的系统,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
58.根据权利要求56所述的系统,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
59.根据权利要求56所述的系统,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
60.根据权利要求56所述的系统,其中确定所述计算样本谱的一个或多个特征以用于训练所述基于机器学习的模型或更新所述基于机器学习的模型的训练包括:对于所述计算样本谱的每个计算样本谱:
61.根据权利要求51至60中任一项所述的系统,其中所述过程还包括:
62.根据权利要求51至61中任一项所述的系统,其中对于所述所选模型的组合中的每个用户所选模型,使用所述所选模型和所述计算样本谱来估计多个noc可能性的概率包括:
63.根据权利要求51至62中任一项所述的系统,其中使用基于所述所选模型的组合获得的所估计的所述多个noc可能性的概率来预测与所述生物样本相关联的所述贡献者数量包括:
64.一种非暂态计算机可读介质,所述非暂态计算机可读介质存储一个或多个指令,所述指令在由至少一个计算设备的一个或多个处理器执行时执行处理以使用从生物样本获得的证据谱来预测与所述生物样本相关联的贡献者数量,以提高对所述贡献者中的至少一个贡献者进行基因分型的计算机效率,所述证据谱包括遗传信号数据,所述处理包括:
65.根据权利要求64所述的计算机可读介质,其中所述处理还包括基于所述证据谱获得上下文信息,其中基于所述证据谱和所述预期最大贡献者数量来生成所述预定数量的计算样本谱包括:
66.根据权利要求65所述的计算机可读介质,其中所述上下文信息包括以下中的一项或多项:
67.一种系统,所述系统用于使用从生物样本获得的证据谱来预测与所述生物样本相关联的贡献者数量,以提高对所述贡献者中的至少一个贡献者进行基因分型的计算机效率,所述证据谱包括遗传信号数据,所述系统包括:
68.根据权利要求67所述的系统,其中所述处理还包括基于所述证据谱获得上下文信息,其中基于所述证据谱和所述预期最大贡献者数量来生成所述预定数量的计算样本谱包括:
69.根据权利要求68所述的系统,其中所述上下文信息包括以下中的一项或多项:
70.一种在电子显示器上提供图形用户界面(gui)的计算机实现的方法,所述计算机实现的方法包括:
71.根据权利要求70所述的计算机实现的方法,所述方法还包括:
72.根据权利要求71所述的计算机实现的方法,其中所述两个或更多个视觉表示是以促进对应于第一最小峰值的第一视觉呈现与对应于第二最小峰值的第二视觉呈现的比较的方式相对于彼此显示的。
73.根据权利要求72所述的计算机实现的方法,其中所述两个或更多个视觉表示是水平地对齐并且一个在另一个之上显示的。
74.一种在电子显示器上提供图形用户界面(gui)的计算机实现的方法,所述计算机实现的方法包括:
75.根据权利要求74所述的计算机实现的方法,其中所述显示参数能够由用户经由所述gui输入。
