用于疫苗产生的蛋白质设计中的机器学习技术的制作方法

专利2026-08-29  1


本技术涉及机器学习技术在疫苗设计中的使用。


背景技术:

1、机器学习(ml)是对可以通过经验和使用数据来自动改进的计算机算法的使用。它被视为人工智能的一部分。机器学习算法基于样本数据(称为训练数据)构建模型,以便在没有明确编程的情况下进行预测或决策。机器学习算法广泛应用于如医学、电子邮件过滤、语音识别和计算机视觉等领域,在这些领域中,开发传统算法来执行所需的任务是困难或不可行的。

2、疫苗是一种生物制剂,其为特定传染病提供获得性免疫。疫苗典型地含有类似于致病微生物的物质,并且通常由弱化或杀伤形式的微生物、其毒素或其表面蛋白之一制成。该物质刺激身体免疫系统将该物质识别为威胁,破坏该物质,并且进一步识别并破坏其将来可能遇到的与该物质相关的任何微生物。疫苗可以是预防性的(以预防或改善天然或“野生”病原体的未来感染的影响)或治疗性的(以对抗已经发生的疾病,如癌症)。一些疫苗提供了完全的灭菌免疫力,其中完全预防了感染。


技术实现思路

1、用于季节性流感疫苗的毒株目前且几乎普遍地由公共卫生当局选择。基于对动物模型和人类研究中免疫反应的观察,每年进行这些选择。然而,使用公共卫生当局推荐的毒株的h3n2疫苗例如在过去5年中不足以在一般群体中引起广泛的保护。此外,在此时间框架期间,公共数据显示免疫相关性已分裂成不同的进化枝,其中每个进化枝对自身具有保护性,而对其他进化枝的保护可能是有限的。本披露提供了这个问题的解决方案。本披露中描述的实施方式提供了一种可以产生用作疫苗的流感(或其他)抗原的算法。在一个实施方式中,这可以包括:

2、1)通过机器学习(例如,变分自编码器架构)使用两个步骤为所有野生型血凝素序列生成降维空间:

3、a.可变地嵌入简约空间中,例如,模型预测来自输入序列的平均值和方差,嵌入式坐标选自具有预测的平均值和方差的正态分布。

4、b.然后,根据简约空间位置“自编码器”损失函数解码回原始序列,按输入和输出序列的相似性简化。

5、2)基于抗原(候选疫苗)和读出毒株(readout strain)(靶序列)在降维空间中的位置训练免疫反应预测模型[输入:由步骤1的模型嵌入的抗原和读出,输出:免疫反应的测量,如抗体效价]。

6、3)从简约空间对候选疫苗组分代表物进行取样,使用步骤2中描述的模型通过预测的针对靶序列的性能对候选疫苗组分代表物进行排名,以及鉴定顶部候选物。

7、4)将顶部候选代表物解码[使用来自步骤1b的模型],以产生在原始野生型集中可能观察到或可能未观察到的血凝素序列。

8、在示例实验中,使用该算法来优化h3血凝素的ha1序列(位置16至345),然后移植野生型信号肽和ha2区域以产生完整的血凝素序列。从a/新加坡/infimh-16-0019/2016开始的示例性经修饰抗原序列提供有以粗体指示的突变残基:

9、

10、

11、一台或多台计算机的系统可以被配置为通过安装在系统上的软件、固件、硬件或其组合来执行特定操作或动作,这些软件、固件、硬件或其组合在操作时导致系统执行这些动作。一个或多个计算机程序可以被配置为通过包括指令来执行特定操作或动作,这些指令在由数据处理设备执行时使该设备执行这些动作。一个一般方面包括一种用于生成氨基酸序列的降维方法,该方法由一个或多个计算机的系统执行。该方法包括接收定义多个野生型氨基酸序列的一个或多个数据对象。该方法还包括从一个或多个数据对象在降维空间中生成多个降维序列,在该降维空间中:每个降维序列含有野生型氨基酸序列中的至少一个的相应数据,该降维空间具有比野生型氨基酸序列更低的维度,并且该多个降维序列定义了沿着该降维空间的每个维度的值的分布。该方法还包括使用多个降维序列在降维空间中生成多个候选序列。该方法还包括接收定义病毒氨基酸序列的一个或多个数据对象。该方法还包括在降维空间中生成至少一个降维病毒序列。该方法还包括提供候选序列中的每个和降维病毒序列中的至少一个作为效价预测器的输入。该方法还包括接收每个候选序列的候选物得分作为从效价预测器的输出。该方法还包括从候选序列中选择至少一个候选序列。该方法还包括针对每个选择的候选序列生成至少一个新的氨基酸序列。该方法还包括提供生成的至少一个氨基酸序列。该方法还包括其中生成的氨基酸序列中的每个均适用于制造相应疫苗的操作,该相应疫苗可以包括可包含以下各项的组中的至少一种:i)由生成的氨基酸序列定义的蛋白质,ii)能够产生由生成的氨基酸序列定义的蛋白质的核酸,和iii)能够产生由生成的氨基酸序列定义的蛋白质的递送媒介物。此方面的其他实施例包括记录在一个或多个计算机存储装置上的相应计算机系统、设备和计算机程序,各自均被配置为执行这些方法的动作。

12、实施方式可以包括以下特征中的一个或多个。该方法包括以下操作,在这些操作中,生成多个降维序列可以包括使用预测输入数据的平均值和方差值的变分自编码器来创建野生型氨基酸序列的代表。每个降维序列包括相应的一组值,并且在降维空间中生成多个候选序列可以包括对多个降维序列的值的分布进行取样。效价预测器被配置为:接收i)降维空间中的第一序列和ii)降维空间中的第二序列作为输入;以及提供效价得分(作为候选物得分)作为输出,该效价得分定义了第一序列与第二序列之间的生物反应的量度。选择至少一个候选序列作为选择的候选序列可以包括选择具有最高候选物得分的n个候选序列。该方法包括其中n的值为1的操作,从而选择单个候选序列。该方法包括其中n的值大于1的操作,从而选择多个候选序列。选择至少一个候选序列作为选择的候选序列可以包括选择具有大于阈值的相应候选物得分的候选序列。每个生成的氨基酸序列均不同于任何野生型氨基酸序列。候选序列中的至少一个在多个降维序列中。相应疫苗针对的是可以包括以下各项的组中的一种:i)流感,ii)人鼻病毒,iii)hiv和iiiv)冠状病毒病。描述的技术的实施方式可以包括计算机可访问介质上的硬件、方法或过程、或计算机软件。

13、一个一般方面包括一种用于生成氨基酸序列的系统,该系统可以包括计算机存储器。该系统还包括一个或多个处理器。该系统还包括存储指令的计算机存储器,这些指令在由处理器执行时使处理器执行操作,这些操作可以包括:接收定义多个野生型氨基酸序列的一个或多个数据对象;从该一个或多个数据对象在降维空间中生成多个降维序列,其中:每个降维序列含有野生型氨基酸序列中的至少一个的相应数据,该降维空间具有比野生型氨基酸序列更低的维度,并且该多个降维序列定义沿着该降维空间的每个维度的值的分布,使用该多个降维序列在该降维空间中生成多个候选序列;接收定义病毒氨基酸序列的一个或多个数据对象;在该降维空间中生成至少一个降维病毒序列;提供这些候选序列中的每个和这些降维病毒序列中的至少一个作为效价预测器的输入;接收每个候选序列的候选物得分作为从效价预测器的输出;从候选序列中选择至少一个候选序列;针对每个选择的候选序列生成至少一个新的氨基酸序列;以及提供生成的至少一个氨基酸序列,其中生成的氨基酸序列中的每个均适用于制造相应疫苗,该相应疫苗包含由以下各项组成的组中的至少一种:i)由生成的氨基酸序列定义的蛋白质,ii)能够产生由生成的氨基酸序列定义的蛋白质的核酸,和iii)能够产生由生成的氨基酸序列定义的蛋白质的递送媒介物。此方面的其他实施例包括记录在一个或多个计算机存储装置上的相应计算机系统、设备和计算机程序,各自均被配置为执行这些方法的动作。

14、实施方式可以包括以下特征中的一个或多个。生成多个降维序列的系统可以包括使用预测输入数据的平均值和方差值的变分自编码器来创建野生型氨基酸序列的代表。每个降维序列包括相应的一组值,并且在降维空间中生成多个候选序列可以包括对多个降维序列的值的分布进行取样。效价预测器被配置为:接收i)降维空间中的第一序列和ii)降维空间中的第二序列作为输入;以及提供效价得分(作为候选物得分)作为输出,该效价得分定义了第一序列与第二序列之间的生物反应的量度。选择至少一个候选序列作为选择的候选序列可以包括选择具有最高候选物得分的n个候选序列。描述的技术的实施方式可以包括计算机可访问介质上的硬件、方法或过程、或计算机软件。

15、一个一般方面包括一种存储指令的非暂态计算机可读介质,这些指令在由一个或多个处理器执行时使一个或多个处理器执行操作,这些操作包括:接收定义多个野生型氨基酸序列的一个或多个数据对象;从该一个或多个数据对象在降维空间中生成多个降维序列,其中:每个降维序列含有野生型氨基酸序列中的至少一个的相应数据,该降维空间具有比野生型氨基酸序列更低的维度,并且该多个降维序列定义沿着该降维空间的每个维度的值的分布,使用该多个降维序列在该降维空间中生成多个候选序列;接收定义病毒氨基酸序列的一个或多个数据对象;在该降维空间中生成至少一个降维病毒序列;提供这些候选序列中的每个和这些降维病毒序列中的至少一个作为效价预测器的输入;接收每个候选序列的候选物得分作为从效价预测器的输出;从候选序列中选择至少一个候选序列;针对每个选择的候选序列生成至少一个新的氨基酸序列;以及提供生成的至少一个氨基酸序列,其中生成的氨基酸序列中的每个均适用于制造相应疫苗,该相应疫苗包含由以下各项组成的组中的至少一种:i)由生成的氨基酸序列定义的蛋白质,ii)能够产生由生成的氨基酸序列定义的蛋白质的核酸,和iii)能够产生由生成的氨基酸序列定义的蛋白质的递送媒介物。此方面的其他实施例包括记录在一个或多个计算机存储装置上的相应计算机系统、设备和计算机程序,各自均被配置为执行这些方法的动作。

16、实施方式可以包括以下特征中的一个或多个。生成多个降维序列的介质可以包括使用预测输入数据的平均值和方差值的变分自编码器来创建野生型氨基酸序列的代表。每个降维序列包括相应的一组值,并且在降维空间中生成多个候选序列可以包括对多个降维序列的值的分布进行取样。效价预测器被配置为:接收i)降维空间中的第一序列和ii)降维空间中的第二序列作为输入;以及提供效价得分(作为候选物得分)作为输出,该效价得分定义了第一序列与第二序列之间的生物反应的量度。描述的技术的实施方式可以包括计算机可访问介质上的硬件、方法或过程、或计算机软件。

17、本文还披露了包含本文所述方法生成的任意多个氨基酸序列的疫苗组合物。

18、还披露了包含根据本文所述方法产生的一种或多种肽和/或蛋白质的载体、融合蛋白和细胞。

19、本文还披露了引发受试者的免疫反应的方法,这些方法包括施用本文所述的一种或多种分离的核酸、肽和/或蛋白质,从而引发受试者的免疫反应。

20、在一个方面,本文披露了抑制病毒感染的方法,这些方法包括向受试者施用本文所述的一种或多种分离的核酸、肽和/或蛋白质中的任一种,或施用包含本文所述的任何分离的核酸、肽和/或蛋白质的任何疫苗。

21、本文还披露了使受试者对流感病毒免疫的方法,该方法包括向受试者施用免疫有效量的如本文所披露的疫苗组合物。本文还披露了用于在使受试者对病毒(例如,流感病毒)免疫的方法中使用的如本文所披露的疫苗组合物。本文还披露了用于制造用于在使受试者对病毒(例如,流感病毒)免疫的方法中使用的药剂的如本文所披露的疫苗组合物。在某些实施例中,方法使受试者预防病毒感染(例如,流感病毒感染),并且在某些实施例中,方法引起受试者的保护性免疫反应(例如,ha抗体反应和/或na抗体反应)。在某些实施例中,受试者是人,并且在某些实施例中,将疫苗组合物肌内、皮内、皮下、静脉内或腹膜内施用。

22、本披露的另一方面涉及一种减轻病毒感染(例如,流感病毒感染)的一种或多种症状的方法,该方法包括向受试者施用预防有效量的本文所披露的疫苗组合物。本文还披露了用于在减轻病毒感染(例如,流感病毒感染)的一种或多种症状的方法中使用的如本文所披露的疫苗组合物。本文还披露了用于制造用于在减轻感染(例如,流感病毒感染)的一种或多种症状的方法中使用的药剂的如本文所披露的疫苗组合物。

23、在各种实施例中,本文所披露的方法和组合物治疗或预防由季节性病毒株或大流行病毒株(例如,季节性流感毒株或大流行流感毒株)之一或两者引起的疾病。

24、在本文所披露的方法的某些实施例中,其中该受试者是人,人的年龄为6个月或更大、小于18岁、至少6个月且小于18岁、至少18岁且小于65岁、至少6个月且小于5岁、至少5岁且小于65岁、至少60岁或至少65岁。例如,受试者的年龄为6个月、8个月、10个月、12个月、14个月、16个月、18个月、20个月、22个月、24个月、3岁、4岁、5岁、6岁、10岁、12岁、15岁、18岁、20岁、21岁、25岁、30岁、35岁、40岁、50岁、60岁、70岁、75岁、80岁、85岁或90岁。在某些实施例中,本文所披露的方法包括以2-6周的间隔(例如4周的间隔)向受试者施用两剂量的疫苗组合物。

25、本披露中讨论的实施方式可以提供以下优点中的一个或多个。实施方式可以用于生成血凝素序列,这些序列有可能在接种疫苗后诱导广泛的流感感染保护。值得注意的是,实施方式可以用于产生抗原,这些抗原对含有设计的血凝素序列的功能性流感病毒具有比预期更高的治愈率。这些抗原被认为具有广泛的保护作用,大于动物模型中目前的护理标准抗原。实施方式可以用于生成广泛保护性的血凝素蛋白,以用作流感疫苗抗原。

26、通过将氨基酸序列转换到较低维空间并在这些氨基酸序列的代表中添加变异,可以生成新的非野生型氨基酸序列。这些新的氨基酸序列可以用于制造比其他方法更有效的新型疫苗。例如,可能存在这样的非野生型氨基酸序列,当受试者(例如人类)接触到含有非野生型氨基酸序列的蛋白质的疫苗时,会导致受试者产生更强烈的免疫反应,从而获得更好的保护和更健康。

27、本披露中提供的技术的另一个优点是,提高了为可以实际存在和被制造的蛋白质生成蛋白质序列数据的可能性。如将理解的是,可以描述由于几何形状、物理力等原因而无法存在的蛋白质序列。本文件中描述的过程可以有利地仅限于已知可制造或预期可制造的过程。

28、其他特征、方面和潜在优点将从随附的描述和附图中显而易见。


技术特征:

1.一种用于生成氨基酸序列的降维方法,该方法由一个或多个计算机的系统执行,并且该方法包括:

2.如权利要求1所述的方法,其中生成多个降维序列包括使用预测输入数据的平均值和方差值的变分自编码器来创建这些野生型氨基酸序列的代表。

3.如前一权利要求所述的方法,其中这些降维序列中的每个包括相应的一组值,并且在该降维空间中生成该多个候选序列包括对该多个降维序列的值的分布进行取样。

4.如任一项前述权利要求所述的方法,其中该效价预测器被配置为:

5.如任一项前述权利要求所述的方法,其中选择该至少一个候选序列作为选择的候选序列包括选择具有最高候选物得分的n个候选序列。

6.如权利要求5所述的方法,其中n的值为1,从而选择单个候选序列。

7.如权利要求5所述的方法,其中n的值大于1,从而选择多个候选序列。

8.如任一项前述权利要求所述的方法,其中选择该至少一个候选序列作为选择的候选序列包括选择具有大于阈值的相应候选物得分的候选序列。

9.如任一项前述权利要求所述的方法,其中这些生成的氨基酸序列中的每个均不同于这些野生型氨基酸序列中的任何一个。

10.如任一项前述权利要求所述的方法,其中这些候选序列中的至少一个在该多个降维序列中。

11.如任一项前述权利要求所述的方法,其中该相应疫苗针对的是由以下各项组成的组中的一种:i)流感,ii)人鼻病毒,iii)hiv和iv)冠状病毒病。

12.一种用于生成氨基酸序列的系统,该系统包括;

13.如权利要求12所述的系统,其中生成多个降维序列包括使用预测输入数据的平均值和方差值的变分自编码器来创建这些野生型氨基酸序列的代表。

14.如权利要求12-13中任一项所述的系统,其中这些降维序列中的每个包括相应的一组值,并且在该降维空间中生成该多个候选序列包括对该多个降维序列的值的分布进行取样。

15.如权利要求12-14中任一项所述的系统,其中该效价预测器被配置为:

16.如权利要求12-15中任一项所述的系统,其中选择该至少一个候选序列作为选择的候选序列包括选择具有最高候选物得分的n个候选序列。

17.一种存储指令的非暂态计算机可读介质,这些指令在由一个或多个处理器执行时使该一个或多个处理器执行操作,这些操作包括:

18.如权利要求17所述的介质,其中生成多个降维序列包括使用预测输入数据的平均值和方差值的变分自编码器来创建这些野生型氨基酸序列的代表。

19.如权利要求17-18中任一项所述的介质,其中这些降维序列中的每个包括相应的一组值,并且在该降维空间中生成该多个候选序列包括对该多个降维序列的值的分布进行取样。

20.如权利要求17-19中任一项所述的介质,其中该效价预测器被配置为:


技术总结
接收定义多个野生型氨基酸序列的一个或多个数据对象。从一个或多个数据对象在降维空间中生成多个降维序列。使用多个降维序列在降维空间中生成多个候选序列。接收定义病毒氨基酸序列的一个或多个数据对象。接收降维空间中的病毒序列。提供候选序列中的每个和降维病毒序列中的至少一个作为效价预测器的输入。接收每个候选序列的候选物得分作为从效价预测器的输出。从候选序列中选择至少一个候选序列。生成至少一个新的氨基酸序列。每个生成的氨基酸序列均适用于制造相应疫苗。

技术研发人员:P·戴维森,M·吉尔-莫洛尼,K·泽尔多维奇
受保护的技术使用者:赛诺菲巴斯德有限公司
技术研发日:
技术公布日:2024/12/17
转载请注明原文地址:https://xbbs.6miu.com/read-34030.html