一种基因组长序列的比对方法、系统、设备和存储介质

allin2026-10-01  8


本发明涉及基因序列比对,具体为一种基因组长序列的比对方法、系统、设备和存储介质。


背景技术:

1、基因组序列比对作为基于基因组测序技术研究的关键步骤,其敏感度和准确度将直接影响后续研究的效果。随着第三代测序技术的广泛应用,面向第三代测序技术的基因组长序列比对系统已成为基因组学研究的关键工具之一。提高基因组长序列比对系统的敏感度和准确度,进而提高变异检测等下游分析的效果已成为当前研究的热点。

2、目前常使用minimap2方法进行基因组测序比对,minimap2方法使用minimizer作为子序列(k-mer)采样方法并结合种子-扩展策略进行序列比对,极大降低了索引存储空间并提高了序列比对速度;然而该方法受到临近序列的干扰,可能会导致索引采样的minimizer序列在查询时被舍弃,进而降低比对敏感度,且该方法为提高比对效率舍弃了高度重复的minimizer序列,将影响基因组高度重复区域内的比对敏感度和准确度。


技术实现思路

1、本发明的目的是提供一种基因组长序列的比对方法、系统、设备和存储介质。

2、本发明技术方案如下:

3、一种基因组长序列的比对方法,其特征在于,包括如下操作:

4、s1、参考基因组序列经加权syncmer采样处理,得到若干个第一采样k-mer序列;若干个第一采样k-mer序列与在参考基因组序列中的对应位置,经哈希值转化处理,得到参考基因组索引;

5、s2、查询序列经加权syncmer采样处理,得到若干个第二采样k-mer序列;将第二采样k-mer序列中,seq序列在查询序列的位置,作为查询开始位置;将查询开始位置与k-mer序列长度的和,作为查询结束位置;将seq序列在参考基因组索引的位置,作为参考开始位置;将参考开始位置与k-mer序列长度的和,作为参考结束位置;所有查询结束位置和对应参考结束位置,以及k-mer序列长度,形成了候选位置集;

6、s3、候选位置集经成链法处理,得到比对基因序列位置链;

7、s4、基于比对基因序列位置链与查询开始位置、查询结束位置、参考开始位置、参考结束位置,得到基因组长序列比对结果。

8、s1中加权syncmer采样处理的操作具体为:获取参考基因组序列的每个位置的k-mer序列,判断每个k-mer序列中是否存在高频s-mer序列;若存在,将当前k-mer序列中的所有s-mer序列进行哈希值转化处理后分配权重,并调大高频s-mer序列的权重至对应权重阈值,得到每个s-mer序列的更新权重;每个s-mer序列的更新权重经哈希值转化处理后,根据哈希值由大到小进行排序;若排序最后的s-mer序列的排序位置与位置偏移量相同,则当前k-mer序列为第一采样k-mer序列;若不存在,将当前k-mer序列中的所有s-mer序列进行哈希值转化处理,若哈希值为最小值的s-mer序列在当前k-mer序列的位置与位置偏移量相同,则当前k-mer序列为第一采样k-mer序列。

9、高频s-mer序列为,参考基因组序列中出现频次大于频次阈值的s-mer序列;频次阈值是基于参考基因组序列中s-mer序列出现的总频次。

10、s3中成链法处理的操作具体为:基于候选位置集,构建横坐标为查询结束位置,纵坐标为参考结束位置的比对位置图;将在查询序列中位置为最后一个的查询结束位置,在比对位置图中的锚点,作为第一成链起始点;在第一成链区域内,将邻域范围内与第一成链起始点之间的成链分数最高的锚点,作为待成链锚点,与第一成链起始点进行连接,得到第一序列位置链;将待成链锚点作为第一序列位置链的起始点,得到第二成链起始点,在第二成链区域内执行基于成链分数进行连接的操作,得到第二序列位置链;以此类推,执行完最后一个锚点的连接,得到比对基因序列位置链。

11、成链分数是通过如下公式得到的:

12、,

13、 f(i)为第 i个锚点的成链分数,与第 j个成链起始点与第 i个锚点之间的成链分数相等, f(j)为第 j个成链起始点的成链分数,与第 j个成链起始点和前一个成链起始点的成链分数相等, α(j,i)为第 j个成链起始点与第 i个锚点之间的匹配碱基数, β(j,i)为空位罚分, k为k-mer序列的长度。

14、匹配碱基数的获取方法为:获取第j个成链起始点与第i个锚点的查询结束位置差和查询结束位置差,将查询结束位置差、查询结束位置差和k-mer序列的长度三者中的最小值,作为第j个成链起始点与第i个锚点之间的匹配碱基数。

15、若比对基因序列位置链为多个,则将位置链总分大于总分阈值的比对基因序列位置链,按照位置链总分从大到小的顺序,依次执行s4中的操作;位置链总分为比对基因序列位置链中最后一个成链的锚点的成链分数。

16、一种基因组长序列的比对系统,用于实现上述的基因组长序列的比对方法,包括:

17、参考基因组索引生成模块,用于参考基因组序列经加权syncmer采样处理,得到若干个第一采样k-mer序列;若干个第一采样k-mer序列与在参考基因组序列中的对应位置,经哈希值转化处理,得到参考基因组索引;

18、候选位置集生成模块,用于查询序列经加权syncmer采样处理,得到若干个第二采样k-mer序列;将第二采样k-mer序列中,seq序列在查询序列的位置,作为查询开始位置;将查询开始位置与k-mer序列长度的和,作为查询结束位置;将seq序列在参考基因组索引的位置,作为参考开始位置;将参考开始位置与k-mer序列长度的和,作为参考结束位置;所有查询结束位置和对应参考结束位置,以及k-mer序列长度,形成了候选位置集;

19、比对基因序列位置链生成模块,用于候选位置集经成链法处理,得到比对基因序列位置链;

20、基因组长序列比对结果生成模块,用于基于比对基因序列位置链与查询开始位置、查询结束位置、参考开始位置、参考结束位置,得到基因组长序列比对结果。

21、一种基因组长序列的比对设备,包括处理器和存储器,其中,处理器执行存储器中保存的计算机程序时实现上述的基因组长序列的比对方法。

22、一种计算机可读存储介质,用于存储计算机程序,其中,计算机程序被处理器执行时实现上述的基因组长序列的比对方法。

23、本发明的有益效果在于:

24、本发明提供的一种基因组长序列的比对方法,首先,分别对参考基因组序列和查询序列进行加权syncmer采样处理,筛选出更有价值的采样k-mer序列用于增强敏感度;然后,获取采样k-mer序列中seq序列在查询序列的查询开始位置和查询结束位置,界定需要在查询序列中关注的区域,并获取seq序列在参考基因组索引中的参考开始位置和参考结束位置,为查询序列与参考基因组序列的比对提供了准确的比对区间;接着,将基于查询结束位置和对应参考结束位置形成的候选位置集进行成链法处理,得到比对基因序列位置链,能够反映出在连续的基因区域中比对结果的变化情况,提高比对结果的准确性和直观性;最后,根据输出结果的不同需求,将比对基因序列位置链相关信息进行相应的比对结果输出,提高比对方法的灵活性;该方法运用在基因组长序列比对上,能够提高比对准确度、效率和灵活性。


技术特征:

1.一种基因组长序列的比对方法,其特征在于,包括如下操作:

2.根据权利要求1所述的基因组长序列的比对方法,其特征在于,所述s1中加权syncmer采样处理的操作具体为:

3.根据权利要求2所述的基因组长序列的比对方法,其特征在于,所述高频s-mer序列,为参考基因组序列中出现频次大于频次阈值的s-mer序列;频次阈值是基于参考基因组序列中s-mer序列出现的总频次。

4.根据权利要求1所述的基因组长序列的比对方法,其特征在于,所述s3中成链法处理的操作具体为:

5.根据权利要求4所述的基因组长序列的比对方法,其特征在于,所述成链分数是通过如下公式得到的:

6.根据权利要求5所述的基因组长序列的比对方法,其特征在于,匹配碱基数的获取方法为:

7.根据权利要求1所述的基因组长序列的比对方法,其特征在于,若比对基因序列位置链为多个,则将位置链总分大于总分阈值的比对基因序列位置链,按照位置链总分从大到小的顺序,依次执行s4中的操作;所述位置链总分为比对基因序列位置链中最后一个成链的锚点的成链分数。

8.一种基因组长序列的比对系统,用于实现权利要求1所述的基因组长序列的比对方法,其特征在于,包括:

9.一种基因组长序列的比对设备,其特征在于,包括处理器和存储器,其中,所述处理器执行所述存储器中保存的计算机程序时实现如权利要求1-7任一项所述的基因组长序列的比对方法。

10.一种计算机可读存储介质,其特征在于,用于存储计算机程序,其中,所述计算机程序被处理器执行时实现如权利要求1-7中任一项所述的基因组长序列的比对方法。


技术总结
本发明涉及基因序列比对技术领域,具体为一种基因组长序列的比对方法、系统、设备和存储介质;为解决现有技术中比对方法准确度较差的问题,本发明首先分别对参考基因组序列和查询序列进行加权syncmer采样处理;然后,明确采样k‑mer序列中seq序列分别在查询序列和参考基因组索引中的开始位置和结束位置,提供准确的位置比对区间;接着,将基于查询结束位置和参考结束位置形成的候选位置集进行成链法处理,得到比对基因序列位置链,反映出基因区域比对结果变化情况;最后,根据需求输出不同对比结果;该方法运用在基因组长序列比对上,能够提高比对准确度、效率和灵活性。

技术研发人员:权威,康金军,邓炎斐,刘壮,朱晓
受保护的技术使用者:烟台大学
技术研发日:
技术公布日:2024/10/31
转载请注明原文地址: https://www.8miu.com/read-31674.html

最新回复(0)