RNA-seq摸索：3.基因表达水平分析→featureCoun

作者: 没有猫但是有猫饼 | 来源:发表于2020-04-08 16:15 被阅读0次

RNA-seq摸索：3.基因表达水平分析→featureCoun
RNA-seq中的基因表达量计算和表达差异分析
R语言DESeq2基因差异表达分析
基因表达分析（中）-富集分析
1.Empirical assessment of analys
转录组分析中—用R语言画带基因名标签的PCA主成分分析图
基因共表达网络
Monocle2包学习笔记（四）：Differential Ex
Nature重磅综述 |关于RNA-seq，你想知道的都在这
转载--基因表达水平及差异表达分析

参考这篇：
💥💥💥我觉得学RNA-seq必看的文献！！💥💥💥
这篇写的特别好：RNAseq-workflow
本科生搞定RNA-seq上游数据分析
 RNA-seq一般流程

1. 下载gtf基因组注释文件

ftp://ftp.ensembl.org/pub/current_gtf/homo_sapiens/Homo_sapiens.GRCh38.99.gtf.gz
ftp://ftp.ebi.ac.uk/pub/databases/gencode/Gencode_human/release_29/gencode.v29.annotation.gtf.gz

2. 使用featureCounts进行alignment-based的定量

gtf="路径/Homo_sapiens.GRCh38.99.gtf.gz" 
featureCounts -T 5 -p -t exon -g gene_id  -a $gtf -o  all.id.txt  *.bam
cat all.id.txt | cut -f1,7- > counts.txt  #去除多余信息，保存表达矩阵为counts.txt

3. 差异表达分析

在R中

3.1 基因表达量的标准化方法及可视化

以下资料来源于：counts值，RPM,RPKM,FPKM,TPM的异同

标准化的主要目的是去除测序数据的技术偏差：测序深度和基因长度。

测序深度：同一条件下，测序深度越深，基因表达的read读数越多。

基因长度：同一条件下，不同的基因长度产生不对等的read读数，基因越长，该基因的read读数越高。

Counts值

对给定的基因组参考区域，计算比对上的read数，又称为raw count（RC）。

计数结果的差异的影响因素：落在参考区域上下限的read是否需要被统计，按照什么样的标准进行统计。

RPM (Reads per million mapped reads)

RPM

RPM方法：10^6标准化了测序深度的影响，但没有考虑转录本的长度的影响。

RPM适合于产生的read读数不受基因长度影响的测序方法，比如miRNA-seq测序，miRNA的长度一般在20-24个碱基之间。

RPKM/FPKM (Reads/Fragments per kilo base per million mapped reads)

RPKM/FPKM

RPKM/FPKM方法：10^3 标准化了基因长度的影响，10^6标准化了测序深度的影响。

FPKM方法与RPKM类似，主要针对双末端RNA-seq实验的转录本定量。在双末端RNA-seq实验中，有左右两个对应的read来自相同的DNA片段。在进行双末端read进行比对时，来自同一DNA片段的高质量的一对或单个read可以定位到参考序列上。为避免混淆或多次计数，统计一对或单个read比对上的参考序列片段（Fragment），来计算FPKM，计算方法同RPKM。