MedResearch Atlas临床科研图谱
METHOD · TRANSCRIPTOMICS · SAMPLE-LEVEL

Bulk RNA sequencing

Bulk RNA 测序

从独立生物学样本的 RNA 计数出发,理解样本整体转录状态如何变成可检验、可追溯且边界清楚的组间证据。
Beginner → IntermediateR / Linux8–14 h learningGene × sample count data
LEARNING OBJECTIVES

学完这一章,你应该能够

点击勾选不是“完成任务”,而是对自己的理解做一次承诺。

01 · THE QUESTION

Bulk RNA-seq 测量的究竟是什么?

它把一个独立样本中的 RNA 汇总成组织或培养体系的平均转录状态,适合比较样本,而不直接解析细胞身份。

零基础解释

把每份组织想成一支合唱团。Bulk RNA-seq 记录整支合唱团的声音强弱,能比较两场演出是否不同,但不能仅凭录音指出是哪位成员改变了音量。

专业解释

Bulk RNA-seq quantifies transcript abundance from pooled RNA within each biological sample. The independent sample—not each read—is the statistical unit.

TISSUE MIXTURE
EpithelialFibroblastMacrophageT cell
POOLED RNA

每个基因得到一个组织平均表达量

QUESTION疾病组织的整体转录状态发生了什么变化?

适合比较样本与组别;不能单独定位变化来自哪类细胞。

独立生物学重复决定组间推断;增加 reads 不能替代增加独立样本。

02 · CORE WORKFLOW

一份组织,怎样变成可检验的差异表达结果?

点击任意节点,追踪它为什么存在、接收什么、产生什么,以及错误会怎样沿数据链传递。

STEP 1 / 21

Tissue

组织样本

研究问题必须首先对应到明确的人群、组织和比较。

WHY

研究问题必须首先对应到明确的人群、组织和比较。

INPUT

患者或模型来源的组织

PROCESS

按纳排标准、时间点和组织区域采集并记录 metadata。

OUTPUT

可追溯的生物学样本

PARAMETERSsample size · ischemia time · replicate
QC组间来源、处理时间和批次是否平衡。
COMMON ERROR把多块技术切片当作独立生物学重复。
03 · DATA OBJECTS

同一个项目里,数据对象在不断变化

FASTQ、BAM、count matrix、design matrix 与 DE table 各自承载不同信息,不能互相替代。

04 · READ QUALITY

Reads 与比对 QC:warning 不是自动失败

先明确指标对应哪一层过程,再结合建库类型、参考序列和组间分布解释异常。

Q30Position in read

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

05 · SAMPLE QUALITY

样本级 QC:寻找结构,而不是寻找可删的点

文库大小、检测基因数、相关性、PCA、批次与临床元数据要联合判断。

S1S2S3S4S5S6S7S8S9S10S11S12PC1 · 35%PC2 · 18%
ControlFibrosisBatch 2 outline
06 · MODEL INPUT

归一化解决可比性,design formula 定义比较

两者都发生在差异表达之前,但回答的是不同问题:如何比较数值,以及究竟比较什么。

SAME BIOLOGY · DIFFERENT REPRESENTATION
4302118206313101144426342720241820631310488386342720241215141310488383322282024121514541042

离散计数保留抽样过程,适合 count-based DE 模型;文库深度尚不可直接比较。

DESIGN FORMULA IS PART OF THE QUESTION

同一患者治疗前后各有一个样本

配对设计:~ patient + time

患者基线差异应作为配对结构控制,而不是把 20 个样本当作 20 个独立个体。

07 · GLOBAL STRUCTURE

PCA 用于诊断全局结构,不是显著性检验

每个点必须代表独立生物学样本;颜色、形状和标签应同时编码 condition、batch 与关键协变量。

VST matrix适合样本间距离
Sample PCA观察主要变异轴
检查三类解释condition · batch · metadata
08 · INFERENCE

差异表达:效应量与不确定性必须一起读

P 值回答数据与零假设的相容程度;log2FC 回答变化方向和大小;FDR 控制大规模检验中的预期错误发现比例。

EFFECT SIZE × UNCERTAINTY

“显著”不能替代科学判断

COL1A1log2FC +2.8FDR 0.002候选关联
KRT19log2FC +2.1FDR 0.13证据不足
MMP7log2FC +1.9FDR 0.018候选关联
EPCAMlog2FC -1.2FDR 0.041候选关联
CXCL8log2FC +0.4FDR 0.001小效应

同时检查效应量、FDR、独立样本一致性、表达丰度与预先定义的 contrast。

DESeq2 用负二项模型估计 count 数据的效应与离散度;大规模检验还需要控制 false discovery rate。

09 · PAPER FIGURE

一张 Bulk RNA-seq Figure 是怎么读的?

依次选择 A–D Panel,先识别视觉编码,再反向追踪到设计、矩阵、FASTQ 与组织样本。

原创教学重绘 · 模拟数据ASample PCAS1S2S3S4S5S6S7S8S9S10S11S12PC1 · 37%PC2 · 16%BVolcano PlotCOL1A1EPCAMlog2 fold changeCExpression HeatmapCOL1A1COL3A1MMP7SPP1EPCAMPECAM1ControlFibrosisDGSEAECM organization · NES 1.94 · FDR 0.012Ranked genes
10 · FIGURE LANGUAGE

八类常见 Bulk RNA-seq Figure

每张图只能回答一类问题;常见误读往往来自把探索图、统计结果和机制证据混为一谈。

A每个点 = 1 个观测;位置 = 高维邻域的二维表示;颜色 = 当前分组
每个点 = 1 个观测;位置 = 高维邻域的二维表示;颜色 = 当前分组

Sample PCA

回答
哪些因素主导样本整体表达差异?
误读
视觉分离不是差异表达检验。
B图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Sample Correlation

回答
样本整体表达模式是否一致或存在错标?
误读
高相关不代表没有系统偏差。
C横轴 = 效应量;纵轴 = 统计证据
横轴 = 效应量;纵轴 = 统计证据

MA Plot

回答
效应量是否随平均表达水平出现系统偏倚?
误读
低表达区的大倍数变化通常不稳定。
D横轴 = 效应量;纵轴 = 统计证据
横轴 = 效应量;纵轴 = 统计证据

Volcano Plot

回答
哪些基因同时有较大效应和统计证据?
误读
显著基因不是自动的机制基因。
E行 = marker;列 = 群体;颜色 = 经过说明的相对表达
行 = marker;列 = 群体;颜色 = 经过说明的相对表达

Heatmap

回答
候选基因的模式是否跨独立样本一致?
误读
按行缩放的颜色不能比较基因间绝对表达。
F图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

GO / KEGG

回答
候选列表过度代表哪些已知功能?
误读
背景基因集错误会改变所有富集结论。
G图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

GSEA

回答
全基因排序中是否存在协调的通路变化?
误读
富集方向依赖 ranking 和表型编码。
H图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Expression Boxplot

回答
预定义基因在每个样本中的分布如何?
误读
不能把 read 或技术重复当作生物学样本。
11 · PATHWAY THINKING

GO / KEGG 与 GSEA 使用的输入并不相同

前者通常从候选列表出发,后者从完整排序出发;两者都依赖注释数据库与明确的背景。

先定义候选基因列表

显著 DE genes 与可检测背景基因集比较,回答“列表是否过度包含某类注释”。

COL1A1COL3A1MMP7SPP1TIMP1

结果仍是注释关联

依赖候选阈值和背景基因集。 富集不是通路功能已被实验激活的证明。

GSEA 从完整排序列表检验 gene set 的集中趋势;富集结果仍是计算关联。

12 · PARAMETER ATLAS

这一章最重要的参数与设计选择

参数不是软件默认值清单。打开每一项,检查调高、调低会改变什么,以及判断必须依赖哪些证据。

13 · BETTER THINKING

初学者最常见的 8 个错误

从 Error 到 Consequence,再到 Better Thinking,理解错误为什么会改变可解释的证据。

ERRORCONSEQUENCEBETTER THINKING
01把技术重复当作独立样本夸大有效样本量并低估不确定性。统计单位应对应独立患者、动物或培养重复。
02用 TPM 直接输入原始计数模型模型的均值—方差假设被破坏。保留 raw counts 用于 DE;TPM 用于适合的描述目的。
03FastQC 必须全部绿色对建库预期特征过度处理甚至损伤数据。结合建库类型、比对与下游结果解释 warning。
04PCA 分组分开就证明差异把探索性表示升级为统计推断。PCA 用于结构诊断;基因效应来自样本级模型。
05结果出来后反复调整 design formula增加研究者自由度和选择性报告。依据设计预先定义目标 contrast 与必要协变量。
06只按 P 值挑基因小而无实际意义的效应被过度解释。联合效应量、FDR、表达量和重复一致性。
07富集到通路就写成通路激活从注释关联跨越到功能机制。检查方向和 leading edge,并设计正交或干预验证。
08删除不符合预期的离群样本人为增强组间分离并引入选择偏倚。使用预定义、多指标且可记录的 QC 规则调查原因。
14 · EVIDENCE BOUNDARY

转录差异可以支持什么,不能证明什么?

把组织平均表达关联停在它能够到达的位置,再用细胞定位和功能实验推进证据层级。

结果可以支持什么?

疾病组与对照组在样本平均表达上存在差异

某些基因集与疾病状态呈协调关联

候选分子信号可在独立样本中复核

为单细胞定位或实验干预提出候选假设

不能单独证明什么?

差异基因来自哪一种细胞类型

某基因导致疾病发生

富集通路已经在功能上被激活

一个显著基因就是治疗靶点

组间差异已经排除所有混杂和批次

AssociationMechanismCausality
15 · RESEARCH DECISIONS

不要背流程,做五个科研判断

提交后不仅查看正确答案,还要解释其他选项为什么会破坏设计、输入或证据边界。

RESEARCH THINKING QUIZ0/5 已回答
Q1

病例与对照样本完全分布在不同建库批次,最稳妥的判断是?

Q2

为什么 DESeq2 / edgeR 通常需要 raw counts,而不是 TPM?

Q3

PCA 中疾病组与对照组明显分开,最合理的下一步是?

Q4

GSEA 显示 ECM pathway 在疾病组正向富集,可以直接得出什么?

Q5

一个基因 FDR=0.001 但 log2FC=0.08,最稳妥的解释是?

16 · ONE-PAGE SUMMARY

把完整证据链压缩成一张图

回看 Data、Method、Figure 与 Evidence:任何结论都应该能够沿链条反向追溯。

TissueRNALibraryFASTQBAM / QuantCount MatrixSample QCNormalizationDesignDEPathwayValidationBiological Question
01

Data

数据怎样产生与变化

02

Method

每一步为什么存在

03

Figure

结果怎样被看见

04

Evidence

结论能够走多远

参考与数据声明

本页全部数值与 Figure 均为固定种子生成的原创教学模拟,不承载真实患者或研究结论。未来引用真实论文 Figure 时必须记录开放许可、作者与原始链接。

REFERENCE INFRASTRUCTURE

参考文献与进一步阅读

References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。

6
EVIDENCE SOURCES

核心方法与统计

支撑比对、差异表达、多重检验与基因集富集。

EVIDENCE SOURCES

流程与实验设计

支撑从样本、QC 到建模与解释的整体方法。