MedResearch Atlas临床科研图谱
METHOD · TRANSCRIPTOMICS · CELL-LEVEL

Single-cell RNA sequencing

单细胞 RNA 测序

不再测量一块组织的“平均表达”,而是分别观察成千上万个细胞的转录状态。
IntermediateR / Python10–20 h learningHigh-dimensional cell data
LEARNING OBJECTIVES

学完这一章,你应该能够

点击勾选不是“完成任务”,而是对自己的理解做一次承诺。

01 · CORE WORKFLOW

一份组织,是怎么变成 UMAP 的?

点击任意节点,追踪它的输入、输出、参数、QC 和下一步。

STEP 12 / 20

QC

细胞质量控制

坏细胞和 doublet 也会进入矩阵,并可能制造假 cluster 或 marker。

WHY

坏细胞和 doublet 也会进入矩阵,并可能制造假 cluster 或 marker。

INPUT

Gene × Cell Matrix

PROCESS

联合观察基因数、UMI、线粒体比例、doublet 与样本分布。

OUTPUT

保留的高可信细胞

PARAMETERSnFeature_RNA · nCount_RNA · percent.mt · doublet score
QC阈值应来自数据分布、组织和研究问题。
COMMON ERROR复制别人论文的固定阈值。
FIGURE 01A

UMI:从 duplicate reads 回到原始分子计数

MOLECULES → READS → MOLECULES
UMI-A
UMI-B
UMI-C
UMI-D

4 个最初被捕获的 RNA 分子;我们关心的计数从它们开始,而不是从测序仪输出开始。

先观察 4 个被捕获的 RNA 分子如何获得不同 UMI,再看 PCR 将每个模板复制成多条 reads,最后按 cell barcode、gene 与 UMI 的组合折叠候选技术重复。

原创教学交互 · 模拟数据 · 未复制论文 Figure
可以支持什么

解释 UMI 为什么能帮助识别同一捕获分子的 PCR copies,并说明 reads 计数与 UMI-collapsed count 的区别。

不能证明什么

不能证明 UMI count 等于样本中的绝对 RNA 分子数;未捕获分子、UMI collision、测序错误与饱和仍会造成偏差。

FIGURE 01B

PCR:为什么 reads 会指数增加,原始分子却没有增加

IDEALIZED PCR · ONE TEMPLATE DOUBLES EACH ROUND
R01
R12
R24
R38
R416
R532

这是理想化的倍增示意。真实 PCR 会受到扩增效率、饱和与序列偏好和随机性影响,并不保证每轮精确翻倍。

理想化展示一个模板经过多轮 PCR 后形成 1→2→4→8→16→32 条 copies,并把 reads/copies 计数与原始 RNA 分子计数并列,突出两者的分叉。

原创教学交互 · 模拟数据 · 未复制论文 Figure
可以支持什么

解释 PCR amplification 如何从同一模板产生大量 reads,以及为何重复 reads 不能当作独立原始分子。

不能证明什么

不能证明真实 PCR 每轮精确翻倍,也不能由 reads 数单独推出绝对表达量;扩增效率、饱和与序列偏好需要额外 QC。

02 · THE QUESTION

为什么需要单细胞?

同一块组织中的细胞并不相同。首先理解 Bulk 与单细胞究竟在测量什么。

零基础解释

Bulk RNA-seq 像把一个班级所有人的声音混在一起录音;单细胞测序则尝试分别记录每个人说了什么。

专业解释

Single-cell RNA sequencing quantifies transcript abundance in individual cells, enabling analysis of cellular heterogeneity that is obscured by pooled measurements.

BULK RNA-SEQ

所有细胞的信号被混合

Average expression组织平均
“这一块组织发生了变化。”
VS
scRNA-seq

每个细胞有独立表达谱

Fibroblast
Macrophage
T cell
Epithelial
“究竟是哪一类细胞发生了变化?”
03 · DATA OBJECTS

数据在不断变成什么?

同一个项目会依次产生文件、矩阵、图结构、标签和二维坐标;它们不是同一种东西。

到表达矩阵,数据对象的结构和能够回答的问题都在改变。

04 · QUALITY CONTROL

QC:哪些细胞应该留下?

质量控制不是套用三个阈值,而是判断哪些观测仍能可信代表生物学。

nFeature_RNA检测基因种类
nCount_RNA总 UMI / counts
percent.mt线粒体转录本比例
候选保留低质量可能Doublet 可能阈值线只是教学示意,不是推荐标准

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

QC 应结合分布、组织背景和多个指标判断,固定阈值不能跨数据集自动迁移。

05 · REPRESENTATION

Normalization → HVG → PCA

从 raw counts 到可比较的细胞表示,每一步都在处理一个具体问题。

不是差异表达基因,而是用于建立细胞表示的特征集合。

STEP 1

Raw Matrix

深浅同时受到真实表达与测序深度影响。

06 · RELATIONSHIP

PCA → Neighbors → Cluster / UMAP

这是单细胞分析最容易被教程步骤掩盖、却最重要的结构关系。

UMAP 负责低维表示;Leiden 在邻居图上发现社区。两者共享上游表示,但回答的问题不同。

07 · PARAMETER THINKING

resolution 会改变什么?

不要只数 cluster:比较相邻档位的细胞去向、marker、样本组成与 QC 证据,判断新增切分是否值得保留。

ADJACENT RESOLUTION COMPARISON

0.8 1.2

选择右图中的 cluster,左图会定位其主要父群;下方同时更新 marker、样本组成、QC 与停止判断。

相邻分群 NMI
0.73标签一致性,不是生物学真值
发生显著拆分的父群
3子群占父群 ≥10%
保留在主去向的细胞
84%越低说明换群越剧烈
BEFORE · 父群resolution 0.87 clusters
0123456
3 个来源
AFTER · 选择一个新群resolution 1.210 clusters
0123456789
CLUSTER LINEAGE选中的 C1 从哪里来?

连线比例是细胞重叠,不是发育轨迹,也不代表真实时间方向。

C01 cells占新群 33%
C31 cells占新群 33%
C61 cells占新群 33%
MARKER EVIDENCE这次切分是否产生独立表达程序?
geneavg logFCpct.in / pct.out
IL7R
3.80100% / 25%
GENE_021
3.50100% / 30%
TPSAB1
3.23100% / 38%
GENE_010
2.47100% / 43%
MS4A2
2.69100% / 48%
Marker 必须成套出现,并结合负 marker、效应量和独立样本复核;单个显著基因不等于新细胞类型。
SAMPLE COMPOSITION这个群来自几个独立样本?
Sample A 33%n=1Sample B 0%n=0Sample C 67%n=2
nFeature median
65
nCount median
109
percent.mt median
2.4%
SHOULD THIS SPLIT BE KEPT?

停止提高并回退

这个新群主要呈现极小群或 QC 驱动特征;不能因为二维图上分开就命名为新细胞类型。

群体大小

3 cells;极小群首先考虑不稳定切分。

CHECK
Marker 特异性

IL7R: logFC 3.80,表达比例差 75%。

PASS
跨样本支持

单一样本最高占比 67%。

CHECK
非 QC 驱动

模拟低质量细胞占比 0%,percent.mt 中位数 2.4%。

PASS
来源单一清楚

3 个主要父群;主父群贡献 33%。

CHECK
STOPPING RULE

什么时候应该停止继续提高 resolution?

不是达到某个固定数字就停止,而是新增切分不再带来稳定、可重复、能回答问题的证据时停止。

01稳定性

相邻档位、随机种子或重采样后,这个群还存在吗?

停止信号:轻微变化就消失、合并或大量换群。
02Marker 证据

是否存在成套正/负 marker,并在独立样本复现?

停止信号:只有单个弱基因,或主要是 MT、核糖体、应激信号。
03样本支持

新群是否由多个生物学重复共同贡献?

停止信号:几乎只来自单一样本、批次或低质量细胞。
04问题相关性

它是否改善身份、状态或组间比较的可解释性?

停止信号:只是看起来更细,却没有新的可检验问题或验证方案。
最终应同时报告相邻 resolution 的敏感性结果。UMAP 只负责显示,cluster 来自 PCA 邻居图;二维分离不能替代 marker、样本与验证证据。
GENERATED WITH RR / uwot + igraph LeidenR version 4.5.3 (2026-03-11 ucrt)
DATA3,200 cells × 160 genes固定种子模拟 counts · 无真实患者数据
DEPENDENCYPCA/kNN → Leiden · UMAP 仅展示内部图分辨率 1.500;不与 Seurat 数值直接等同
08 · EVIDENCE INTEGRATION

从 Cluster 到 Cell Type

聚类只产生编号;细胞身份来自 marker、参考图谱、文献和组织背景的联合判断。

CLUSTER 3
MARKER GENESCOL1A1COL3A1DCN
EVIDENCE INTEGRATION

Reference atlas

Known markers

Literature + tissue

Fibroblast成纤维细胞Confidence · High

注释是证据整合,不是自动命名。 单个 marker 可能共享表达或只反映瞬时状态。

09 · PAPER FIGURE

一张单细胞 Figure 是怎么读的?

选择 Panel,先读视觉编码,再追溯输入数据和证据边界。

原创教学重绘 · 模拟数据AUMAP 1UMAP 2BCOL1A1DCNEPCAMPECAM1CD3DMS4A1LST1FibroblastMacrophageT cellEpithelialEndothelialMastCC1C2C3PF1PF2PF3Cell proportionDNES = 1.82 · FDR = 0.018Ranked genes
FROM SYNTHETIC TEACHING TO REAL PAPERS先用可控模拟理解结构,再用真实 Figure 校准复杂度

真实数据通常具有不规则流形、群体大小差异、连续 QC 梯度和更拥挤的多 Panel 编排。以下原图不替代论文上下文。

10 · FIGURE LANGUAGE

八类常见单细胞 Figure:如何读,何时停

逐类拆解视觉编码、读图顺序、可信趋势和失败信号;一张图只有通过样本重复、QC 与证据边界检查,才值得继续解释。

FIGURE READING LAB

不要先看结论,先建立固定读图顺序

  1. 1 轴与编码
  2. 2 全局结构
  3. 3 组间趋势
  4. 4 重复与 QC
  5. 5 证据边界
A · UMAP

主要细胞状态如何组织,样本与批次是否共同覆盖这些状态?

A每个点 = 1 个观测;位置 = 高维邻域的二维表示;颜色 = 当前分组
每个点 = 1 个观测;位置 = 高维邻域的二维表示;颜色 = 当前分组
当前图形在示范什么主要群体包含多个样本,样本在同一生物状态内充分混合,但已知真实条件差异不被强行抹平。
02 · HOW TO READ

按这个顺序读,不要跳步

  1. 01先看图例确认颜色代表 cluster 还是 sample,确认是否展示全部细胞及各组细胞数。
  2. 02再看全局结构识别大群、连续过渡、稀有小群和离群岛,但暂不命名细胞类型。
  3. 03改按样本着色可信群体通常由多个生物学重复共同贡献;若一座岛几乎来自单一样本,先怀疑批次或样本特异质量。
  4. 04叠加 QC 与 marker检查小群是否高 percent.mt、低 nFeature,或是否拥有成套正 marker 与负 marker。
  5. 05回到邻居图聚类来自 neighbor graph,不在二维 UMAP 上按视觉距离手工圈群。
03A · CREDIBLE PATTERN什么趋势相对可信?
  • 主要群体包含多个样本,样本在同一生物状态内充分混合,但已知真实条件差异不被强行抹平。
  • 群体边界能被成套 marker、参考图谱和组织知识重复支持,而不只靠岛屿外形。
  • 调整随机种子、邻居数或 UMAP 参数后,全局结论仍大体稳定。
  • 稀有群具有足够细胞、跨重复出现,并且没有明显低质量或 doublet 特征。
03B · STOP SIGNALS什么结果不能直接往下讲?
  • 不同样本各自形成独立岛屿,或某个 cluster 超过绝大多数细胞来自单一样本。
  • 所谓新群同时呈现两种互斥谱系 marker,且 nCount 异常高,提示 doublet。
  • 小岛只由少量高 percent.mt、低 nFeature 细胞构成,提示受损细胞或环境 RNA。
  • 仅凭二维靠得近就推断细胞相互作用、发育先后或空间邻近。
04 · SCIENTIFIC JUDGEMENT从图形模式到科学结论,中间还缺一步判断
可以支持

支持描述数据中的表达状态结构、候选细胞群及其样本构成,并为 marker 和下游检验定位对象。

不能证明

不能单独证明细胞谱系、组织空间距离、细胞通讯、疾病机制或因果关系。

什么时候应该停止解释?若把颜色切换为 sample 后群体结构完全被样本来源替代,先暂停生物学命名,回查批次、QC、整合策略与样本量。
HOW TO COMBINE EVIDENCE

不要只列指标:把证据放回一个判断情境

先用类比建立直觉,再把每项观察放回研究问题,最后决定结论应该停在哪里。

01 · 先建立直觉

UMAP 像一张带图例的地图

地图不是目的地本身,它只把位置、方向和比例编码出来。读 UMAP 时,先确认每个视觉元素代表什么,再判断哪些趋势可以支持研究问题。

坐标、颜色、大小和分母分别承担不同信息;把它们合起来,才不会把“看起来分开”误写成“已经证明”。
02 · 教学模拟

这张 UMAP 真正要回答什么?

情境:研究者用 预处理后的研究数据和样本 metadata 生成 UMAP,想回答“主要细胞状态如何组织,样本与批次是否共同覆盖这些状态?”。

问题:图中的趋势是否在正确的统计单位、样本和不确定性范围内成立?

观察:先观察整体结构,再核对图例、分母、重复和异常点;任何单一视觉趋势都必须回到生成它的数据对象。

03 · 逐项合并证据
先看图例

先确认 先看图例 编码的是什么

怎么看

确认颜色代表 cluster 还是 sample,确认是否展示全部细胞及各组细胞数。

支持时

主要群体包含多个样本,样本在同一生物状态内充分混合,但已知真实条件差异不被强行抹平。

冲突时

不同样本各自形成独立岛屿,或某个 cluster 超过绝大多数细胞来自单一样本。

缺失时

没有 先看图例 时,不能判断图形变化是生物学趋势还是编码、分母或样本差异造成的。

在这个案例里

如果 先看图例 清楚且与其他层证据方向一致,UMAP 才能回答“主要细胞状态如何组织,样本与批次是否共同覆盖这些状态?”的一部分;不要跳过样本层复核。

04 · 合并后的判断
结合规则

先拆解编码,再看趋势,最后把趋势与样本、效应量和不确定性合并;图形美观不能替代统计与实验设计。

案例结论

支持描述数据中的表达状态结构、候选细胞群及其样本构成,并为 marker 和下游检验定位对象。

证据边界

不能单独证明细胞谱系、组织空间距离、细胞通讯、疾病机制或因果关系。

06 · STOPPING RULE

什么时候应该停止继续解释?

若把颜色切换为 sample 后群体结构完全被样本来源替代,先暂停生物学命名,回查批次、QC、整合策略与样本量。

  • 不同样本各自形成独立岛屿,或某个 cluster 超过绝大多数细胞来自单一样本。
  • 所谓新群同时呈现两种互斥谱系 marker,且 nCount 异常高,提示 doublet。
  • 小岛只由少量高 percent.mt、低 nFeature 细胞构成,提示受损细胞或环境 RNA。
下一步:回到原始数据对象、样本层统计和图例定义,补充重复、不确定性或正交验证后再继续解释。

读图判断应回到生成图形的数据对象、样本重复和分析假设;低维结构本身不能替代统计检验与生物学验证。

11 · AFTER ANNOTATION

完成 Cell Annotation 之后还能做什么?

高级分析不是“软件功能菜单”,每个分支都应由一个具体科研问题启动。

Annotated Cells带细胞身份与样本信息的表达对象
12 · PARAMETER ATLAS

这一章最重要的参数

点击参数条目查看向上或向下调整的影响,以及真正应该结合哪些证据。

13 · BETTER THINKING

初学者最常见的 8 个错误

错误本身不可怕;关键是理解它会怎样改变结果,以及更好的判断方式是什么。

ERRORCONSEQUENCEBETTER THINKING
01直接复制别人论文的 QC threshold可能删除真实细胞群,或保留自己数据中的低质量细胞。先看分布、组织特性、样本重复和研究问题。
02resolution 越高越好产生不稳定、无 marker 或无生物学意义的小群。同时检查稳定性、marker、样本构成和可解释性。
03先画 UMAP 再理解聚类把可视化坐标误认为聚类算法的直接输入。沿 PCA → Neighbors → Cluster / UMAP 理解关系。
04只用一个 marker 注释细胞共享或瞬时表达会造成错误身份。整合正负 marker、参考图谱、文献和组织背景。
05合并样本后忽略样本来源单个样本可能驱动所谓疾病差异。检查每个 cluster 的样本构成并使用适当统计单位。
06把每个细胞当独立生物学重复夸大有效样本量与显著性。区分 cell-level observation 与 patient/sample-level replication。
07只看 P 值挑 marker微小或缺乏一致性的差异被过度解释。联合效应大小、表达比例、FDR 与重复一致性。
08把通讯预测当成真实通讯配体受体共表达被错误升级为功能机制。把预测当作候选机制,并设计空间或干预验证。
14 · EVIDENCE BOUNDARY

这个结果能证明什么?

科学解释的质量,取决于你是否知道结论应该停在哪里。

结果可以支持什么?

不同细胞群存在表达差异

某些基因富集于特定细胞类型

某些细胞状态与疾病状态相关

为机制实验形成可检验假设

不能单独证明什么?

某基因导致疾病

配体受体预测一定代表真实通讯

pseudotime 就是真实细胞演化时间

UMAP 中相邻 cluster 存在直接关系

差异表达基因就是治疗靶点

AssociationMechanismCausality

单细胞分析可以提出细胞状态、组成和通路关联,但机制与因果需要独立验证设计。

15 · APPLY THE CHAIN

现在轮到你

把知识重新排列为一条能回答真实科研问题的数据链。

YOUR TURN · PULMONARY FIBROSIS

候选基因 X 主要由哪一类细胞表达?

请把分析步骤排列成一条能够回答问题的数据链。

1FeaturePlot
2QC
3Clustering
4Normalization
5Group Comparison
6Annotation
16 · RESEARCH DECISIONS

科研思维 Quiz

这些题不考缩写,而是检查你能否选出证据边界内最合理的解释。

RESEARCH THINKING QUIZ0/5 已回答
Q1

疾病组某个 fibroblast cluster 比例增加,哪个结论最合理?

Q2

为什么 raw counts 不应直接用于 UMAP?

Q3

PCA、Neighbors、Clustering 和 UMAP 的正确关系是?

Q4

提高 resolution 后出现更多 cluster,下一步最合理的是?

Q5

pseudotime 最稳妥的解释是?

17 · ONE-PAGE SUMMARY

把这一章压缩成一张图

从组织到问题,记住数据、方法、Figure 和证据四个维度。

TissueCellRNAFASTQMatrixQCPCANeighborsClustersCell TypeBiological Question
01

Data

数据怎样产生与变化

02

Method

每一步为什么存在

03

Figure

结果怎样被看见

04

Evidence

结论能够走多远

REFERENCES & TEACHING NOTE

本页图表为固定随机种子生成的原创模拟数据,只用于解释数据结构和分析关系,不承载真实生物学结论。具体实验与分析参数应结合组织、平台、样本质量与研究问题确定。

下一步建议回到 Pipeline,从任意 Figure 反向说出它需要哪些数据对象。
REFERENCE INFRASTRUCTURE

参考文献与进一步阅读

References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。

9
EVIDENCE SOURCES

核心方法论文

支撑降维、聚类与主要分析框架的原始方法来源。

[3]
COREoriginal methodCC BY 4.0

UMAP: Uniform Manifold Approximation and Projection

Leland McInnes, John Healy, Nathaniel Saul, Lukas Großberger. Journal of Open Source Software, 2018.

为什么推荐:UMAP 的算法目标与可视化边界。

DOI 10.21105/joss.00861 查看原文
LIBRARY →
EVIDENCE SOURCES

实验与软件官方文档

用于核对当前 pipeline、cell calling 与输出对象定义。

[5]
COREofficial doc

Cell Ranger Algorithms Overview

10x Genomics. 10x Genomics Documentation, 2026.

为什么推荐:版本敏感内容应回到官方文档。

查看原文
LIBRARY →
EVIDENCE SOURCES

QC 与最佳实践

说明 QC、归一化、聚类和注释为什么必须依赖数据情境。

EVIDENCE SOURCES

真实 Figure 来源

页面内嵌 CC BY 真实论文 Figure 的论文级来源与教学用途。