美文网首页
如何理解BAM文件的flags

如何理解BAM文件的flags

作者: 浩渺予怀 | 来源:发表于2020-03-26 11:16 被阅读0次

每次遇到BAM文件flag值都有一些困惑,时间越久越迷惑。
在此,针对BAM文件中的flag信息进行梳理和解释:

记录于BAM文件的第2列,以bwa软件比对结果为例

可以使用samtools查询:
samtools view test.bam | cut -f2 | uniq

1024
1040
1089
1097
1105
1107
1121
1123
113
1137
1145
1153
1161
1169
117
1171
1185
1187
1201
1209
121
129
133
137
145
147
16
161
163
177
181
185
65
69
73
81
83
97
99

问题来了,这些数字的意义是什么呢?
首先可以参考SAM/BAM文件的解释文档:
http://samtools.sourceforge.net/SAMv1.pdf
其中,对于FLAG有如下说明:
FLAG: bitwise FLAG. Each bit is explained in the following table:

| Bit | Description |
| 0x1 | template having multiple segments in sequencing |
| 0x2 | each segment properly aligned according to the aligner |
| 0x4 | segment unmapped |
| 0x8 | next segment in the template unmapped |
| 0x10 | SEQ being reverse complemented |
| 0x20 | SEQ of the next segment in the template being reversed |
| 0x40 | the first segment in the template |
| 0x80 | the last segment in the template |
| 0x100 | secondary alignment |
| 0x200 | not passing quality controls |
| 0x400 | PCR or optical duplicate |
| 0x800 | supplementary alignment |

上述0x1, 0x2, …是十六进制的数值与十进制的数字截然不同。

对应的十进制数值描述如下:

| 十进制 | 描述 |
| 1 | template having multiple segments in sequencing |
| 2 | each segment properly aligned according to the aligner |
| 4 | segment unmapped |
| 8 | next segment in the template unmapped |
| 16 | SEQ being reverse complemented |
| 32 | SEQ of the next segment in the template being reversed |
| 64 | the first segment in the template |
| 128 | the last segment in the template |
| 256 | secondary alignment |
| 512 | not passing quality controls |
| 1024 | PCR or optical duplicate |
| 2048 | supplementary alignment |

回过头来看,比如16和1024分别是比对到互补链的片段,对于1024指的是PCR重复片段。

那其他数字的含义呢,他们只是简单数字组合而已,例如:1040是1024 + 16,Read比对到反义链且是一个PCR重复,简单的数字相加而已。

也可以借助flag解释链接来解析上述数字的含义,如把1040输入到该网站会返回:
“read reverse strand”和“read is PCR or optical duplicate”。

不过,SAM说明文档中FLAG的代号均使用按位符号显示。bit是信息的基本单元且只有2个数值,1和0。
这谁能搞的懂啊?!

直接用linux bc转换吧:

#bam flag 1040
echo 'obase=2;1040' | bc
10000010000

按下表对10000010000从右到左依次读取:


图片.png

故BAM flag转换为元字符,轻松获取各种类型BAM flag值背后的信息。

参考资料
https://davetang.org/muse/2014/03/06/understanding-bam-flags/

相关文章

  • 如何理解BAM文件的flags

    每次遇到BAM文件flag值都有一些困惑,时间越久越迷惑。在此,针对BAM文件中的flag信息进行梳理和解释: 记...

  • 测序数据比对到基因组正负链?

    关于bam文件第二列的flags: 第一列代表的是二进制,我们在bam文件里看到的其实是十进制,下面有个例子,讲述...

  • bam文件的理解

      做生信分析的小伙伴们,相信大家对bam文件都不陌生,但具体到如何get到bam文件提供给我们的信息,却少有人真...

  • 计算bam文件中比对上基因组的reads以及合并多个bam文件

    参考文章:1.如何统计BAM文件中的reads数2.Samtools常用命令的总结 当你有很多个bam文件时,想知...

  • 如何快速查看bam文件染色体排序

    bam文件的排序方式针对不同的应用场景,如果不能了解它将会极大影响计算的效率,本文简单介绍如何快速查看bam文件的...

  • IGV的使用

    IGV需要的文件:比对文件为 bam和bam.bai文件 参考基因组文件...

  • 理解sam 与bam 文件

    参考:碱基矿工生信学苑 通常我们可能会看到.cram,.sam,.bam等多种序列比对的文件,其实他们的本质都源于...

  • 理解并操作BAM文件

    经过了第四节的长文,我想大家基本上已经知道了一个WGS流程该如何构建起来了吧。但在那一节中限于篇幅有两个很重要的文...

  • 生信实用工具:快速的多线程分割bam文件工具

    前言 如果对较大的bam文件进行操作时,往往相当耗时,所以将一个很大的bam文件分割为几个较小的bam文件,在并行...

  • samtools软件的使用

    常用samtools的命令: samtools view命令:查看sam,bam文件,进行sam及bam文件的转换...

网友评论

      本文标题:如何理解BAM文件的flags

      本文链接:https://www.haomeiwen.com/subject/fernactx.html