美文网首页数量遗传或生统进击的GATKNGS避坑指南
为什么我得到的VCF中Allele Depth(AD)比预期的低

为什么我得到的VCF中Allele Depth(AD)比预期的低

作者: 徐广惠_6f76 | 来源:发表于2019-03-20 17:00 被阅读85次

疑问:

当我想要通过VCF文件查看一个突变位点的变异reads支持数时,发现文件展示的DP (total depth) 和AD (allele depth)的数量对应不上是咋回事儿?比方说,ADs中记录的支持ref和alt的总reads数和DP中展示的总深度对应不起来,更奇怪的是,有时候一个位点的AD竟然是0,HaplotypeCaller为什么会把这样的变异call出来?有图有真相:

2  151214  .  G  A  673  .  77 .  AN=2;DP=10;FS=0.000;MLEAF=0.500;MQ=56.57;MQ0=0;NCC=0;SOR=0.693 GT:AD:DP:GQ:PL  0/1:0,0:10:38:702,0,38

能看出来,在FORMAT这列(最后一列)显示的支持ref和alt的AD都是0,但是INFO列和FORMAT列中的DP都是10。因为INFO列的DP是未经过过滤的total depth,FORMAT列的DP是经过过滤的total depth,因此可以推断这个位置上没有任何一个read被GATK内置的过滤程序过滤掉。再进一步查看“bamout”文件,就会发现确实在这个位置上有10个reads的覆盖。所以为什么VCF报告的AD值都是0?


原因:uninformative reads

其实这个并不能算一个bug,问题出在uninformative reads上。

当该read给出的most likely allele的可能性并没有显著大于second most likely allele时,这个read就被称为uninformative reads需要说明的是,该可能性转换为Phred格式(Phred scaled likelihoods)后需要大于0.2才会被软件认为是具有显著差异。换句话说,most likely allell可能性必须比second most likely allele的可能性大60%才行(因为0.2 = 10^0.2 = 1.585,约等于大60%)。

例如,我现在有两条reads和两个可能的等位基因,所有的reads都通过了HaplotypeCaller的过滤,这连个等位基因的可能性的值展示在下图中:

现在把上图中的值转换为Phred格式,即取log值:

现在,我们想看看read 1是否是imformative read,只需要看看most likely allele (A)和second most likely allele (T)的可能性差值,即-6.4122-(-6.4352)= 0.023,由于0.023少于0.2,read 1由此可判断为uninformative。同理可以判断出read 2 是informative。


小结:

所以,如果一个read 被判定为informative,它将记录在AD和DP中去。如果是uninformative,它只会记录在DP中,而不记录在AD中。AD实际上反应了究竟有多少reads支持了该位置基因型的判定,之所以没有把uninformative记录进去,就是因为这些read的提供的基因型判定证据不足。

参考:

https://software.broadinstitute.org/gatk/documentation/article?id=11096

相关文章

  • 为什么我得到的VCF中Allele Depth(AD)比预期的低

    疑问: 当我想要通过VCF文件查看一个突变位点的变异reads支持数时,发现文件展示的DP (total dept...

  • gatk VariantFiltration(Mutect2后)

    关于vcf文件的学习(所有的需要信息都在头文件中) FORMAT variants的格式,例如GT:AD:DP:G...

  • GWAS学习之路-名词辨析

    allele等位基因,allele frequency等位基因频率,minor allele frequency ...

  • 周检视2018.12.9

    一、目标检视 ① 目标: 我预期的结果是什么? 开启新的主题沙龙及学习 预期与现实有差异吗?为什么? 比预期好 有...

  • WES(全外显子)分析(下)

    续WES(全外显子)分析(中) 1. raw vcf filter 1.1 vcf snp过滤 1.2 vcf i...

  • vcf文件提取SNP位点

    测序得到VCF文件后,有时需要提取部分SNP位点,这里介绍的工具是VCFtools,安装以及基础功能见下贴:vcf...

  • Minimum Depth of Binary Tree

    LeetCode中的Maximum Depth of Binary Tree和Minimum Depth of B...

  • mark 2020-07-16

    记一下周期点。周期比预期的快。恐慌盘也比预想的厉害,收盘马后炮再看“低吸”操作有点早,新一轮建仓成本高过预期。虽然...

  • ALLHiC续: 如何构建Allele.ctg.table

    ALLHiC续: 如何构建Allele.ctg.table Allele.ctg.table是ALLHiC用于过滤...

  • 2月28复盘

    竞价结束,高标不及预期,中位分歧极端化,低位情绪较好。 收盘,高标日内修复预期,但低预期的过程决定了明日核...

网友评论

    本文标题:为什么我得到的VCF中Allele Depth(AD)比预期的低

    本文链接:https://www.haomeiwen.com/subject/slbflqtx.html