Single-cell RNA sequencing
单细胞 RNA 测序
不再测量一块组织的“平均表达”,而是分别观察成千上万个细胞的转录状态。
学完这一章,你应该能够
点击勾选不是“完成任务”,而是对自己的理解做一次承诺。
一份组织,是怎么变成 UMAP 的?
点击任意节点,追踪它的输入、输出、参数、QC 和下一步。
QC
细胞质量控制
坏细胞和 doublet 也会进入矩阵,并可能制造假 cluster 或 marker。
坏细胞和 doublet 也会进入矩阵,并可能制造假 cluster 或 marker。
Gene × Cell Matrix
联合观察基因数、UMI、线粒体比例、doublet 与样本分布。
保留的高可信细胞
UMI:从 duplicate reads 回到原始分子计数
4 个最初被捕获的 RNA 分子;我们关心的计数从它们开始,而不是从测序仪输出开始。
先观察 4 个被捕获的 RNA 分子如何获得不同 UMI,再看 PCR 将每个模板复制成多条 reads,最后按 cell barcode、gene 与 UMI 的组合折叠候选技术重复。
原创教学交互 · 模拟数据 · 未复制论文 Figure解释 UMI 为什么能帮助识别同一捕获分子的 PCR copies,并说明 reads 计数与 UMI-collapsed count 的区别。
不能证明 UMI count 等于样本中的绝对 RNA 分子数;未捕获分子、UMI collision、测序错误与饱和仍会造成偏差。
PCR:为什么 reads 会指数增加,原始分子却没有增加
这是理想化的倍增示意。真实 PCR 会受到扩增效率、饱和与序列偏好和随机性影响,并不保证每轮精确翻倍。
理想化展示一个模板经过多轮 PCR 后形成 1→2→4→8→16→32 条 copies,并把 reads/copies 计数与原始 RNA 分子计数并列,突出两者的分叉。
原创教学交互 · 模拟数据 · 未复制论文 Figure解释 PCR amplification 如何从同一模板产生大量 reads,以及为何重复 reads 不能当作独立原始分子。
不能证明真实 PCR 每轮精确翻倍,也不能由 reads 数单独推出绝对表达量;扩增效率、饱和与序列偏好需要额外 QC。
为什么需要单细胞?
同一块组织中的细胞并不相同。首先理解 Bulk 与单细胞究竟在测量什么。
Bulk RNA-seq 像把一个班级所有人的声音混在一起录音;单细胞测序则尝试分别记录每个人说了什么。
Single-cell RNA sequencing quantifies transcript abundance in individual cells, enabling analysis of cellular heterogeneity that is obscured by pooled measurements.
所有细胞的信号被混合
“这一块组织发生了变化。”
每个细胞有独立表达谱
“究竟是哪一类细胞发生了变化?”
数据在不断变成什么?
同一个项目会依次产生文件、矩阵、图结构、标签和二维坐标;它们不是同一种东西。
从 到表达矩阵,数据对象的结构和能够回答的问题都在改变。
QC:哪些细胞应该留下?
质量控制不是套用三个阈值,而是判断哪些观测仍能可信代表生物学。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
QC 应结合分布、组织背景和多个指标判断,固定阈值不能跨数据集自动迁移。
Normalization → HVG → PCA
从 raw counts 到可比较的细胞表示,每一步都在处理一个具体问题。
不是差异表达基因,而是用于建立细胞表示的特征集合。
Raw Matrix
深浅同时受到真实表达与测序深度影响。
PCA → Neighbors → Cluster / UMAP
这是单细胞分析最容易被教程步骤掩盖、却最重要的结构关系。
同一个 neighbor structure,两种不同输出。 聚类回答“如何分组”,UMAP 回答“如何把局部关系画出来”。
UMAP 负责低维表示;Leiden 在邻居图上发现社区。两者共享上游表示,但回答的问题不同。
resolution 会改变什么?
不要只数 cluster:比较相邻档位的细胞去向、marker、样本组成与 QC 证据,判断新增切分是否值得保留。
0.8 → 1.2
选择右图中的 cluster,左图会定位其主要父群;下方同时更新 marker、样本组成、QC 与停止判断。
- 相邻分群 NMI
- 0.73标签一致性,不是生物学真值
- 发生显著拆分的父群
- 3子群占父群 ≥10%
- 保留在主去向的细胞
- 84%越低说明换群越剧烈
连线比例是细胞重叠,不是发育轨迹,也不代表真实时间方向。
- nFeature median
- 65
- nCount median
- 109
- percent.mt median
- 2.4%
停止提高并回退
这个新群主要呈现极小群或 QC 驱动特征;不能因为二维图上分开就命名为新细胞类型。
3 cells;极小群首先考虑不稳定切分。
IL7R: logFC 3.80,表达比例差 75%。
单一样本最高占比 67%。
模拟低质量细胞占比 0%,percent.mt 中位数 2.4%。
3 个主要父群;主父群贡献 33%。
什么时候应该停止继续提高 resolution?
不是达到某个固定数字就停止,而是新增切分不再带来稳定、可重复、能回答问题的证据时停止。
相邻档位、随机种子或重采样后,这个群还存在吗?
停止信号:轻微变化就消失、合并或大量换群。是否存在成套正/负 marker,并在独立样本复现?
停止信号:只有单个弱基因,或主要是 MT、核糖体、应激信号。新群是否由多个生物学重复共同贡献?
停止信号:几乎只来自单一样本、批次或低质量细胞。它是否改善身份、状态或组间比较的可解释性?
停止信号:只是看起来更细,却没有新的可检验问题或验证方案。从 Cluster 到 Cell Type
聚类只产生编号;细胞身份来自 marker、参考图谱、文献和组织背景的联合判断。
Reference atlas
Known markers
Literature + tissue
注释是证据整合,不是自动命名。 单个 marker 可能共享表达或只反映瞬时状态。
一张单细胞 Figure 是怎么读的?
选择 Panel,先读视觉编码,再追溯输入数据和证据边界。
Cellular landscape of pulmonary fibrosis
MedResearch Atlas Teaching Dataset · 2026 · Figure 2
真实数据通常具有不规则流形、群体大小差异、连续 QC 梯度和更拥挤的多 Panel 编排。以下原图不替代论文上下文。
真实论文 Figure · 保留原图与完整归属
这里用于训练读图,不把论文图改写成本站的研究结果。所有图片均来自 PMC Open Access Subset,并逐张核验 CC BY 4.0。
打开本地高清图本地副本与修改说明
- Publisher-provided large image saved locally
- Responsive display only; panel content was not altered
八类常见单细胞 Figure:如何读,何时停
逐类拆解视觉编码、读图顺序、可信趋势和失败信号;一张图只有通过样本重复、QC 与证据边界检查,才值得继续解释。
不要先看结论,先建立固定读图顺序
- 1 轴与编码
- 2 全局结构
- 3 组间趋势
- 4 重复与 QC
- 5 证据边界
主要细胞状态如何组织,样本与批次是否共同覆盖这些状态?
按这个顺序读,不要跳步
- 01先看图例确认颜色代表 cluster 还是 sample,确认是否展示全部细胞及各组细胞数。
- 02再看全局结构识别大群、连续过渡、稀有小群和离群岛,但暂不命名细胞类型。
- 03改按样本着色可信群体通常由多个生物学重复共同贡献;若一座岛几乎来自单一样本,先怀疑批次或样本特异质量。
- 04叠加 QC 与 marker检查小群是否高 percent.mt、低 nFeature,或是否拥有成套正 marker 与负 marker。
- 05回到邻居图聚类来自 neighbor graph,不在二维 UMAP 上按视觉距离手工圈群。
- 主要群体包含多个样本,样本在同一生物状态内充分混合,但已知真实条件差异不被强行抹平。
- 群体边界能被成套 marker、参考图谱和组织知识重复支持,而不只靠岛屿外形。
- 调整随机种子、邻居数或 UMAP 参数后,全局结论仍大体稳定。
- 稀有群具有足够细胞、跨重复出现,并且没有明显低质量或 doublet 特征。
- 不同样本各自形成独立岛屿,或某个 cluster 超过绝大多数细胞来自单一样本。
- 所谓新群同时呈现两种互斥谱系 marker,且 nCount 异常高,提示 doublet。
- 小岛只由少量高 percent.mt、低 nFeature 细胞构成,提示受损细胞或环境 RNA。
- 仅凭二维靠得近就推断细胞相互作用、发育先后或空间邻近。
支持描述数据中的表达状态结构、候选细胞群及其样本构成,并为 marker 和下游检验定位对象。
不能单独证明细胞谱系、组织空间距离、细胞通讯、疾病机制或因果关系。
什么时候应该停止解释?若把颜色切换为 sample 后群体结构完全被样本来源替代,先暂停生物学命名,回查批次、QC、整合策略与样本量。
不要只列指标:把证据放回一个判断情境
先用类比建立直觉,再把每项观察放回研究问题,最后决定结论应该停在哪里。
UMAP 像一张带图例的地图
地图不是目的地本身,它只把位置、方向和比例编码出来。读 UMAP 时,先确认每个视觉元素代表什么,再判断哪些趋势可以支持研究问题。
这张 UMAP 真正要回答什么?
情境:研究者用 预处理后的研究数据和样本 metadata 生成 UMAP,想回答“主要细胞状态如何组织,样本与批次是否共同覆盖这些状态?”。
问题:图中的趋势是否在正确的统计单位、样本和不确定性范围内成立?
观察:先观察整体结构,再核对图例、分母、重复和异常点;任何单一视觉趋势都必须回到生成它的数据对象。
先确认 先看图例 编码的是什么
确认颜色代表 cluster 还是 sample,确认是否展示全部细胞及各组细胞数。
主要群体包含多个样本,样本在同一生物状态内充分混合,但已知真实条件差异不被强行抹平。
不同样本各自形成独立岛屿,或某个 cluster 超过绝大多数细胞来自单一样本。
没有 先看图例 时,不能判断图形变化是生物学趋势还是编码、分母或样本差异造成的。
如果 先看图例 清楚且与其他层证据方向一致,UMAP 才能回答“主要细胞状态如何组织,样本与批次是否共同覆盖这些状态?”的一部分;不要跳过样本层复核。
先拆解编码,再看趋势,最后把趋势与样本、效应量和不确定性合并;图形美观不能替代统计与实验设计。
支持描述数据中的表达状态结构、候选细胞群及其样本构成,并为 marker 和下游检验定位对象。
不能单独证明细胞谱系、组织空间距离、细胞通讯、疾病机制或因果关系。
什么时候应该停止继续解释?
若把颜色切换为 sample 后群体结构完全被样本来源替代,先暂停生物学命名,回查批次、QC、整合策略与样本量。
- 不同样本各自形成独立岛屿,或某个 cluster 超过绝大多数细胞来自单一样本。
- 所谓新群同时呈现两种互斥谱系 marker,且 nCount 异常高,提示 doublet。
- 小岛只由少量高 percent.mt、低 nFeature 细胞构成,提示受损细胞或环境 RNA。
读图判断应回到生成图形的数据对象、样本重复和分析假设;低维结构本身不能替代统计检验与生物学验证。
完成 Cell Annotation 之后还能做什么?
高级分析不是“软件功能菜单”,每个分支都应由一个具体科研问题启动。
这一章最重要的参数
点击参数条目查看向上或向下调整的影响,以及真正应该结合哪些证据。
初学者最常见的 8 个错误
错误本身不可怕;关键是理解它会怎样改变结果,以及更好的判断方式是什么。
这个结果能证明什么?
科学解释的质量,取决于你是否知道结论应该停在哪里。
结果可以支持什么?
不同细胞群存在表达差异
某些基因富集于特定细胞类型
某些细胞状态与疾病状态相关
为机制实验形成可检验假设
不能单独证明什么?
某基因导致疾病
配体受体预测一定代表真实通讯
pseudotime 就是真实细胞演化时间
UMAP 中相邻 cluster 存在直接关系
差异表达基因就是治疗靶点
单细胞分析可以提出细胞状态、组成和通路关联,但机制与因果需要独立验证设计。
现在轮到你
把知识重新排列为一条能回答真实科研问题的数据链。
候选基因 X 主要由哪一类细胞表达?
请把分析步骤排列成一条能够回答问题的数据链。
科研思维 Quiz
这些题不考缩写,而是检查你能否选出证据边界内最合理的解释。
疾病组某个 fibroblast cluster 比例增加,哪个结论最合理?
为什么 raw counts 不应直接用于 UMAP?
PCA、Neighbors、Clustering 和 UMAP 的正确关系是?
提高 resolution 后出现更多 cluster,下一步最合理的是?
pseudotime 最稳妥的解释是?
把这一章压缩成一张图
从组织到问题,记住数据、方法、Figure 和证据四个维度。
Data
数据怎样产生与变化
Method
每一步为什么存在
Figure
结果怎样被看见
Evidence
结论能够走多远
本页图表为固定随机种子生成的原创模拟数据,只用于解释数据结构和分析关系,不承载真实生物学结论。具体实验与分析参数应结合组织、平台、样本质量与研究问题确定。
参考文献与进一步阅读
References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。
核心方法论文
支撑降维、聚类与主要分析框架的原始方法来源。
Comprehensive Integration of Single-Cell Data
Tim Stuart et al.. Cell, 2019.
为什么推荐:Seurat integration 与 anchor 框架。
DOI 10.1016/j.cell.2019.05.031 PMID 31178118 PMC6687398 查看原文SCANPY: large-scale single-cell gene expression data analysis
F. Alexander Wolf, Philipp Angerer, Fabian J. Theis. Genome Biology, 2018.
为什么推荐:Python 单细胞分析框架。
DOI 10.1186/s13059-017-1382-0 PMID 29409532 PMC5802054 查看原文UMAP: Uniform Manifold Approximation and Projection
Leland McInnes, John Healy, Nathaniel Saul, Lukas Großberger. Journal of Open Source Software, 2018.
为什么推荐:UMAP 的算法目标与可视化边界。
DOI 10.21105/joss.00861 查看原文From Louvain to Leiden: guaranteeing well-connected communities
Vincent A. Traag, Ludo Waltman, Nees Jan van Eck. Scientific Reports, 2019.
为什么推荐:基于邻居图的 Leiden 社区发现。
DOI 10.1038/s41598-019-41695-z PMID 30914743 PMC6435756 查看原文实验与软件官方文档
用于核对当前 pipeline、cell calling 与输出对象定义。
QC 与最佳实践
说明 QC、归一化、聚类和注释为什么必须依赖数据情境。
Current best practices in single-cell RNA-seq analysis: a tutorial
Malte D. Luecken, Fabian J. Theis. Molecular Systems Biology, 2019.
为什么推荐:教程型 best practices。
DOI 10.15252/msb.20188746 PMID 31217225 PMC6582955 查看原文miQC: An adaptive probabilistic framework for quality control of single-cell RNA-sequencing data
Ariel A. Hippen et al.. PLOS Computational Biology, 2021.
为什么推荐:真实 QC 联合分布、概率过滤与群体组成影响。
DOI 10.1371/journal.pcbi.1009290 PMID 34428202 PMC8415599 查看原文真实 Figure 来源
页面内嵌 CC BY 真实论文 Figure 的论文级来源与教学用途。
miQC: An adaptive probabilistic framework for quality control of single-cell RNA-sequencing data
Ariel A. Hippen et al.. PLOS Computational Biology, 2021.
为什么推荐:Fig. 1 与 Fig. 5:真实 QC 分布和不规则 UMAP。
DOI 10.1371/journal.pcbi.1009290 PMID 34428202 PMC8415599 查看原文