Bulk RNA sequencing
Bulk RNA 测序
从独立生物学样本的 RNA 计数出发,理解样本整体转录状态如何变成可检验、可追溯且边界清楚的组间证据。
学完这一章,你应该能够
点击勾选不是“完成任务”,而是对自己的理解做一次承诺。
Bulk RNA-seq 测量的究竟是什么?
它把一个独立样本中的 RNA 汇总成组织或培养体系的平均转录状态,适合比较样本,而不直接解析细胞身份。
把每份组织想成一支合唱团。Bulk RNA-seq 记录整支合唱团的声音强弱,能比较两场演出是否不同,但不能仅凭录音指出是哪位成员改变了音量。
Bulk RNA-seq quantifies transcript abundance from pooled RNA within each biological sample. The independent sample—not each read—is the statistical unit.
每个基因得到一个组织平均表达量
适合比较样本与组别;不能单独定位变化来自哪类细胞。
独立生物学重复决定组间推断;增加 reads 不能替代增加独立样本。
一份组织,怎样变成可检验的差异表达结果?
点击任意节点,追踪它为什么存在、接收什么、产生什么,以及错误会怎样沿数据链传递。
Tissue
组织样本
研究问题必须首先对应到明确的人群、组织和比较。
研究问题必须首先对应到明确的人群、组织和比较。
患者或模型来源的组织
按纳排标准、时间点和组织区域采集并记录 metadata。
可追溯的生物学样本
同一个项目里,数据对象在不断变化
FASTQ、BAM、count matrix、design matrix 与 DE table 各自承载不同信息,不能互相替代。
Reads 与比对 QC:warning 不是自动失败
先明确指标对应哪一层过程,再结合建库类型、参考序列和组间分布解释异常。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
样本级 QC:寻找结构,而不是寻找可删的点
文库大小、检测基因数、相关性、PCA、批次与临床元数据要联合判断。
归一化解决可比性,design formula 定义比较
两者都发生在差异表达之前,但回答的是不同问题:如何比较数值,以及究竟比较什么。
离散计数保留抽样过程,适合 count-based DE 模型;文库深度尚不可直接比较。
同一患者治疗前后各有一个样本
配对设计:~ patient + time患者基线差异应作为配对结构控制,而不是把 20 个样本当作 20 个独立个体。
PCA 用于诊断全局结构,不是显著性检验
每个点必须代表独立生物学样本;颜色、形状和标签应同时编码 condition、batch 与关键协变量。
差异表达:效应量与不确定性必须一起读
P 值回答数据与零假设的相容程度;log2FC 回答变化方向和大小;FDR 控制大规模检验中的预期错误发现比例。
“显著”不能替代科学判断
同时检查效应量、FDR、独立样本一致性、表达丰度与预先定义的 contrast。
DESeq2 用负二项模型估计 count 数据的效应与离散度;大规模检验还需要控制 false discovery rate。
一张 Bulk RNA-seq Figure 是怎么读的?
依次选择 A–D Panel,先识别视觉编码,再反向追踪到设计、矩阵、FASTQ 与组织样本。
Transcriptomic signature of pulmonary fibrosis
MedResearch Atlas Teaching Dataset · 12 samples · Figure 3
八类常见 Bulk RNA-seq Figure
每张图只能回答一类问题;常见误读往往来自把探索图、统计结果和机制证据混为一谈。
Sample PCA
- 回答
- 哪些因素主导样本整体表达差异?
- 误读
- 视觉分离不是差异表达检验。
Sample Correlation
- 回答
- 样本整体表达模式是否一致或存在错标?
- 误读
- 高相关不代表没有系统偏差。
MA Plot
- 回答
- 效应量是否随平均表达水平出现系统偏倚?
- 误读
- 低表达区的大倍数变化通常不稳定。
Volcano Plot
- 回答
- 哪些基因同时有较大效应和统计证据?
- 误读
- 显著基因不是自动的机制基因。
Heatmap
- 回答
- 候选基因的模式是否跨独立样本一致?
- 误读
- 按行缩放的颜色不能比较基因间绝对表达。
GO / KEGG
- 回答
- 候选列表过度代表哪些已知功能?
- 误读
- 背景基因集错误会改变所有富集结论。
GSEA
- 回答
- 全基因排序中是否存在协调的通路变化?
- 误读
- 富集方向依赖 ranking 和表型编码。
Expression Boxplot
- 回答
- 预定义基因在每个样本中的分布如何?
- 误读
- 不能把 read 或技术重复当作生物学样本。
GO / KEGG 与 GSEA 使用的输入并不相同
前者通常从候选列表出发,后者从完整排序出发;两者都依赖注释数据库与明确的背景。
先定义候选基因列表
显著 DE genes 与可检测背景基因集比较,回答“列表是否过度包含某类注释”。
结果仍是注释关联
依赖候选阈值和背景基因集。 富集不是通路功能已被实验激活的证明。
GSEA 从完整排序列表检验 gene set 的集中趋势;富集结果仍是计算关联。
这一章最重要的参数与设计选择
参数不是软件默认值清单。打开每一项,检查调高、调低会改变什么,以及判断必须依赖哪些证据。
初学者最常见的 8 个错误
从 Error 到 Consequence,再到 Better Thinking,理解错误为什么会改变可解释的证据。
转录差异可以支持什么,不能证明什么?
把组织平均表达关联停在它能够到达的位置,再用细胞定位和功能实验推进证据层级。
结果可以支持什么?
疾病组与对照组在样本平均表达上存在差异
某些基因集与疾病状态呈协调关联
候选分子信号可在独立样本中复核
为单细胞定位或实验干预提出候选假设
不能单独证明什么?
差异基因来自哪一种细胞类型
某基因导致疾病发生
富集通路已经在功能上被激活
一个显著基因就是治疗靶点
组间差异已经排除所有混杂和批次
不要背流程,做五个科研判断
提交后不仅查看正确答案,还要解释其他选项为什么会破坏设计、输入或证据边界。
病例与对照样本完全分布在不同建库批次,最稳妥的判断是?
为什么 DESeq2 / edgeR 通常需要 raw counts,而不是 TPM?
PCA 中疾病组与对照组明显分开,最合理的下一步是?
GSEA 显示 ECM pathway 在疾病组正向富集,可以直接得出什么?
一个基因 FDR=0.001 但 log2FC=0.08,最稳妥的解释是?
把完整证据链压缩成一张图
回看 Data、Method、Figure 与 Evidence:任何结论都应该能够沿链条反向追溯。
Data
数据怎样产生与变化
Method
每一步为什么存在
Figure
结果怎样被看见
Evidence
结论能够走多远
参考与数据声明
本页全部数值与 Figure 均为固定种子生成的原创教学模拟,不承载真实患者或研究结论。未来引用真实论文 Figure 时必须记录开放许可、作者与原始链接。
参考文献与进一步阅读
References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。
核心方法与统计
支撑比对、差异表达、多重检验与基因集富集。
STAR: ultrafast universal RNA-seq aligner
Alexander Dobin et al.. Bioinformatics, 2013.
为什么推荐:splice-aware RNA-seq alignment。
DOI 10.1093/bioinformatics/bts635 PMID 23104886 PMC3530905 查看原文Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2
Michael I. Love, Wolfgang Huber, Simon Anders. Genome Biology, 2014.
为什么推荐:负二项差异表达模型。
DOI 10.1186/s13059-014-0550-8 PMID 25516281 PMC4302049 查看原文Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing
Yoav Benjamini, Yosef Hochberg. Journal of the Royal Statistical Society: Series B, 1995.
为什么推荐:FDR 控制的原始方法。
DOI 10.1111/j.2517-6161.1995.tb02031.x 查看原文Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles
Aravind Subramanian et al.. Proceedings of the National Academy of Sciences, 2005.
为什么推荐:基于排序列表的 gene-set enrichment。
DOI 10.1073/pnas.0506580102 PMID 16199517 PMC1239896 查看原文流程与实验设计
支撑从样本、QC 到建模与解释的整体方法。
A survey of best practices for RNA-seq data analysis
Ana Conesa et al.. Genome Biology, 2016.
为什么推荐:完整 RNA-seq 分析综述。
DOI 10.1186/s13059-016-0881-8 PMID 26813401 PMC4728800 查看原文How many biological replicates are needed in an RNA-seq experiment and which differential expression tool should you use?
Nicholas J. Schurch et al.. RNA, 2016.
为什么推荐:生物学重复与检测性能 benchmark。
DOI 10.1261/rna.053959.115 PMID 27022035 PMC4878611 查看原文