RNA-seq的counts值,RPM, RPKM, FPKM, TPM 的异同

昨天阅读量破万的注释:RNA-seq这十年(3万字长文综述)

提到了RPKM值被淘汰,很多粉丝留言表示不能理解,这里解释一下不同值的异同点。

现在常用的基因定量方法包括:RPM, RPKM, FPKM, TPM。这些表达量的主要区别是:通过不同的标准化方法为转录本丰度提供一个数值表示,以便于后续差异分析。

标准化的主要目的是去除测序数据的技术偏差:测序深度和基因长度。

测序深度:同一条件下,测序深度越深,基因表达的read读数越多。

基因长度:同一条件下,不同的基因长度产生不对等的read读数,基因越长,该基因的read读数越高。

Counts值

对给定的基因组参考区域,计算比对上的read数,又称为raw count(RC)。

计数结果的差异的影响因素:落在参考区域上下限的read是否需要被统计,按照什么样的标准进行统计。

RPM (Reads per million mapped reads)

RPM方法:10^6标准化了测序深度的影响,但没有考虑转录本的长度的影响。

RPM适合于产生的read读数不受基因长度影响的测序方法,比如miRNA-seq测序,miRNA的长度一般在20-24个碱基之间。

RPKM/FPKM (Reads/Fragments per kilo base per million mapped reads)

RPKM/FPKM方法:10^3标准化了基因长度的影响,10^6标准化了测序深度的影响。

FPKM方法与RPKM类似,主要针对双末端RNA-seq实验的转录本定量。在双末端RNA-seq实验中,有左右两个对应的read来自相同的DNA片段。在进行双末端read进行比对时,来自同一DNA片段的高质量的一对或单个read可以定位到参考序列上。为避免混淆或多次计数,统计一对或单个read比对上的参考序列片段(Fragment),来计算FPKM,计算方法同RPKM。

RPKM/FPKM与RPM的区别:考虑了基因长度对read读数的影响。

RPKM与FPKM的区别:RPKM值适用于单末端RNA-seq实验数据,FPKM适用于双末端RNA-seq测序数据。

RPKM/FPKM适用于基因长度波动较大的测序方法,如lncRNA-seq测序,lncRNA的长度在200-100000碱基不等。

TPM (Transcript per million)

TPM的计算方法也同RPKM/FPKM类似,首先使用式2计算每个基因的表达值,去除基因长度的影响。随后计算每个基因的表达量的百分比,最后再乘以10^6,TPM可以看作是RPKM/FPKM值的百分比。

(http://www.bio-info-trainee.com/2017.html)

相当于重新标准化的文库,保证每个样本中所有TPM的总和是相同的。

TPM与RPKM/FPKM的区别:从计算公式来说,唯一的不同是计算操作的顺序,TPM是先去除了基因长度的影响,而RPKM/FPKM是先去除测序深度的影响,具体可看这篇博文,有计算步骤的详细说明;TPM实际上改进了RPKM/FPKM方法在跨样品间定量的不准确性。

TPM的使用范围与RPKM/FPKM相同。

总结

raw count作为原始的read计数矩阵是一个绝对值,而绝对值的特点是规模不同(基因长度、测序深度),不可以比较。进行这些基因标准化方法的目的是将count矩阵转变为相对值,去除技术偏差的影响,使后续的差异分析具有统计学的意义。

参考资料

A comprehensive evaluation of normalization methods for Illumina high-throughput RNA sequencing data analysis

https://www.biostars.org/p/273537/

What the FPKM? A review of RNA-Seq expression units

http://www.rna-seqblog.com/rpkm-fpkm-and-tpm-clearly-explained/

(0)

相关推荐

  • Omics精进09|mRNA生信分析常规流程

    本文介绍「mRNA生信分析流程」 ❞ mRNA生信分析速览 mRNA生信分析主要包含以下各部分. mRNA分析详细步骤 数据质控及过滤 FastQC数据质控 关注测序数据的碱基质量.GC比等,见上图红 ...

  • 试图厘清热图相关的一些细节

    森严森语:生活中很多时候我都习惯于不知所以而为之,其结果通常坏.原因在于经常的盲目自信和偶尔不愿承认自己的无知.上篇推文介绍了利用Origin绘制热图的方法,推文一经发出,我就察觉到这是极其草率的.原 ...

  • 基因的counts矩阵转换为RPKM矩阵

    为什么要做这个计算 大家都知道在真核生物里面,一个基因有多个转录本,每个转录组又是由不同的外显子组合而成,以前老旧的RNA-seq分析流程比较喜欢用RPKM值来量化表达量.大家很容易可以搜索到RPKM ...

  • RNA seq汇总篇,一文掌握RNA seq

    RNA测序(RNA-seq)在过往十年里逐渐成为全转录组水平分析差异基因表达和研究mRNA差异剪接必不可少的工具.RNA-seq帮助大家对RNA生物学的理解会越来越全面:从转录本在何时何地转录到RNA ...

  • 转录组Count格式数据转化为FPKM/TPM格式

    很多时候我们得到的转录组格式为Count,例如在TCGA数据库下载的数据,如果我们想使用FPKM格式或者TPM,那么就需要转换,不过TCGA数据库也提供了FPKM的格式,貌似miRNA数据只有Coun ...

  • 10.​计算FPKM和RPKM

    有一些五六年前的学生们都成长为了各个生物信息学相关公司的小领导,而且他们都有了自己的公众号,知乎号,也算是一番人物.最近他们跟我反馈面试找不到或者说很难直接考核筛选到认真干活的生信工程师,挺有意思的. ...

  • 用OD值评判DNA和RNA质量

    用OD值评判DNA和RNA质量

  • RNA m6A甲基化测序(MeRIP Seq)是什么?

    m6A(N6-methyladenosine,6-甲基腺苷)是真核生物中最常见最丰富的RNA修饰,作为一种可逆修饰,RNA既可以在甲基化转移酶METTL3/14 等酶的作用下发生m6A甲基化修饰,又可 ...

  • RNA免疫共沉淀测序(RIP seq)是什么?

    RNA免疫共沉淀(RNA Immunoprecipitation,RIP )是研究细胞内RNA与蛋白结合情况的技术,是了解转录后调控网络动态过程的有力工具,能帮助我们发现miRNA的调节靶点. RIP ...

  • 初中数学19类最值问题全覆盖,收藏学习!

    春熙初中数学 25篇原创内容 公众号 初中数学解题思路 本号致力于初中数学学习的钻研和探索.全面覆盖初中数学典型题集.解题模型.动点最值.思路方法.超级易错.几何辅助线.压轴破解等方面,欢迎关注! 1 ...

  • 你买的公司值不值这个钱?杜邦分析法ROE,就看这三点

    你买的公司值不值这个钱?杜邦分析法ROE,就看这三点