基于单倍型多样性隐马尔可夫模型的基因型错误检测
1. 引言
尽管基因分型技术和调用算法有了显著进步,但SNP基因型数据中仍存在明显的错误。一项对dbSNP基因型数据的研究发现,约2000万个多次分型的SNP基因型中,多达1.1%的结果存在不一致,这意味着至少在一个数据集中存在错误。当有相关个体的基因型数据时,一些错误可通过孟德尔不一致性(MIs)检测出来,但仍有很大比例(如在父母 - 孩子三人组基因型数据中高达70%)的错误无法通过孟德尔一致性分析检测到。
低水平的错误也可能导致连锁和关联研究的统计效力大幅下降,尤其是在基于单倍型的关联研究中,低至0.1%的错误率就可能使一些疾病关联的统计测试失效。处理基因分型错误的间接方法是在下游统计分析中明确建模,但这通常会导致复杂的统计模型和不切实际的运行时间。更实际的方法是在基因型调用后单独进行错误检测,将标记为潜在错误的SNP基因型排除在下游分析之外或重新分型。
目前广泛使用的系谱基因型数据分析软件包(如SimWalk2和Merlin)通过独立分析每个系谱并识别过度重组的位点来检测孟德尔一致的错误,但这些方法不适用于无关个体或小系谱(如父母 - 孩子三人组)的基因型数据,因为这些数据需要使用群体水平的连锁信息。
本文提出了新的基因型错误检测方法,扩展了Becker等人最近提出的似然比错误检测方法。我们专注于检测三人组基因型数据中的错误,但这些方法稍作修改后也可应用于无关个体和其他小系谱的基因型数据。与Becker等人采用基于窗口的方法并依赖创建每个窗口内的常见单倍型短列表不同,我们使用隐马尔可夫模型(HMM)来表示所有单倍型在分型位点上的频率。
超级会员免费看
订阅专栏 解锁全文

446

被折叠的 条评论
为什么被折叠?



