RNA测序数据分析:Counts、FPKM和TPM的区别与应用

📅 2026/8/14 1:38:06
RNA测序数据分析:Counts、FPKM和TPM的区别与应用
在 RNA 测序数据分析中counts、FPKM、TPM是我们经常听到的概念。它们有什么区别为什么我们不仅要用counts还要用到FPKM和TPM呢今天我们就来侃侃这些表达量的计算和区别。Counts 值首先来说说counts。在 RNA 测序中counts是最原始的表达数据。我们把测序后比对到基因上的 reads 数量直接统计出来这些数值就叫做 counts。简单来说counts代表了每个基因在每个样本中的原始测序读数。counts值越高说明这个基因在样本中表达越活跃。我们看一下下面三个基因Gene A、Gene B、Gene C和两个样本Sample 1、Sample 2的计数矩阵counts表格如下Sample 1 Counts和Sample 2 Counts表示的是原始的 reads 计数值。基因长度表示的是每个基因的长度以千碱基为单位kb。有了Counts为什么还需要 FPKM 和 TPMcounts虽然是最原始的数值但它的缺陷也很明显——受基因长度和测序深度的影响。比如一个基因很长那么它捕获到的 reads 数可能会更多这样的counts值会偏高而另一个基因虽然短但表达很强反而可能因为长度原因捕获到的 reads 数比较少。这就让counts值不能直接反映基因的实际表达水平。另外测序深度也会影响counts值。不同样本的测序深度可能不一样测得多的样本总 counts 值更高看起来表达也会“虚高”。为了消除这些影响才提出了FPKM和TPM这些标准化的方法让我们能够更公平地比较基因的表达水平。FPKM 的计算方式FPKMFragments Per Kilobase of transcript per Million mapped reads是一种校正方法它的意思是“每千碱基的转录本在每百万 reads 中的片段数”。FPKM 的计算公式如下通过这个公式FPKM 值先考虑了基因的长度把 counts 除以基因的长度以千碱基为单位这样能让不同长度的基因具有可比性。接着FPKM 值又除以样本的总 counts以百万为单位来控制测序深度的影响。因此FPKM 能在一定程度上消除基因长度和测序深度的影响适合用于同一个样本内的基因表达比较。Sample 1 的总 counts 为100 200 50 350Sample 2 的总 counts 为150 180 120 450我们可以计算出每个基因在两个样本中的 FPKM 值结果如下为什么还需要 TPM虽然 FPKM 校正了基因长度和测序深度的影响但它并不适合用于不同样本间的比较。比如两个样本各自的 FPKM 值并不完全反映真实的相对表达水平。因此为了更精确地比较不同样本之间的基因表达我们需要用到 TPMTranscripts Per Million。TPM 其实和 FPKM 的思路类似但计算方式稍有不同。它首先对每个基因做长度归一化然后再把所有基因的标准化值相加使总数为一百万。这样得到的 TPM 可以更好地在不同样本之间进行比较。TPM 的计算方式TPMTranscripts Per Million 是指“每百万个转录本中的某基因的转录本数”。它的计算方式分为两步基因长度归一化先将每个基因的counts除以基因长度以千碱基为单位得到一个标准化的 counts 值。总标准化值归一化将所有基因的标准化值相加得到总标准化值。然后将每个基因的标准化值除以这个总值并乘以一百万得到 TPM 值。公式如下这样计算的 TPM 可以保证所有基因的 TPM 之和在每个样本中都是一百万因此更适合不同样本之间的直接比较。最后总结一下Counts原始的 reads 计数值受基因长度和测序深度影响无法直接比较。FPKM每千碱基的转录本在每百万 reads 中的片段数校正了基因长度和测序深度但不适合不同样本间的比较。TPM每百万转录本中的某基因转录本数校正了长度后标准化使得不同样本之间的表达量可以直接比较。在实际分析中如果是比较不同基因的相对表达量可以使用 FPKM如果需要比较不同样本之间的表达情况我们一般会选择TPM。关注我们更多生物信息学、转录组、单细胞分析提升您的科研效率我们提供一个无需编程写代码的在线分析平台支持单细胞转录组、TCGA转录组、通用Bulk转录组分析以及多种绘图功能。立即体验无需R环境配置。网站地址https://zc.bioinfosci.cn