MedResearch Atlas临床科研图谱
METHOD · EPIGENOMICS · REGULATORY DNA

ATAC sequencing

ATAC 染色质可及性测序

从组织、细胞核和 Tn5 插入出发,理解开放染色质如何变成 peaks、差异可及区域、motif 与有边界的调控假设。
Beginner → IntermediateR / Python / Linux10–16 h learningPeak × sample count data
LEARNING OBJECTIVES

学完这一章,你应该能够

点击勾选不是“完成任务”,而是对自己的理解做一次承诺。

01 · THE QUESTION

ATAC-seq 测量的究竟是什么?

它寻找 Tn5 更容易接近的基因组区域,用于描绘染色质可及性;它不直接测量 RNA、蛋白或调控元件功能。

零基础解释

DNA 像一本被蛋白质折叠和遮挡的书。ATAC-seq 记录哪些书页更容易被“插入书签”,提示哪些区域更开放。

专业解释

ATAC-seq profiles accessible chromatin by sequencing DNA fragments generated where loaded Tn5 transposase can access native chromatin.

CHROMATIN STATE
Tn5Tn5Tn5Tn5Tn5

Tn5 更容易接近裸露 DNA,产生更多插入片段。

MEASUREMENT哪些基因组区域更容易被接近?

ATAC-seq 测量 accessibility;不直接测量 RNA、蛋白或增强子功能。

ATAC-seq 的原始方法将 Tn5 转座、开放染色质、DNA-binding proteins 与核小体位置放在同一测量框架中。

02 · MEASUREMENT

Tn5 插入信号为什么不是“基因表达量”?

ATAC signal 的基本单位是落在基因组坐标上的 DNA fragments;开放只是可接近性的测量结果。

Native chromatin核小体与蛋白占据
Loaded Tn5切割 + 接头插入
DNA fragments端点提示可接近位置
Accessibility map不是 RNA abundance

Omni-ATAC 通过优化核制备和反应体系降低背景,并扩展到冻存组织等样本。

03 · CORE WORKFLOW

一份组织,怎样变成候选调控区域?

点击 22 个节点中的任意一步,追踪输入、输出、参数、QC、错误传播与下一步。

STEP 1 / 22

Tissue / Cells

组织或细胞样本

染色质可及性高度依赖细胞类型、状态与取样过程,样本定义决定后续信号代表谁。

WHY

染色质可及性高度依赖细胞类型、状态与取样过程,样本定义决定后续信号代表谁。

INPUT

独立生物学样本与完整 metadata

PROCESS

按预先设计采集、分组并尽快低温处理

OUTPUT

可追溯的新鲜、冻存组织或细胞

PARAMETERSbiological replicates · input amount · ischemia time
QC检查样本身份、细胞活性或组织保存、组间批次平衡。
COMMON ERROR把技术重复当作独立样本。
04 · DATA OBJECTS

从 reads 到 regions:数据对象一直在变化

FASTQ、BAM、fragments、peaks、count matrix、DAR table 和 tracks 不能互相替代。

05 · LIBRARY QC

片段长度记录了文库结构,但不是质量判决书

paired-end fragments 常呈现 nucleosome-free、mono- 和 di-nucleosome 周期;核制备和转座过度都会改变这条曲线。

FRAGMENT LENGTH · SAME AXISNFRmono-nucleosomedi-nucleosome

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

06 · SIGNAL QUALITY

TSS enrichment、FRiP、线粒体比例要一起看

任何单一指标都只观察质量的一部分;参考注释、peak 集和计算实现也会改变数值。

FRAGMENT LENGTH · SAME AXISNFRmono-nucleosomedi-nucleosome

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

ENCODE 将 TSS enrichment 定义为 TSS 聚合信号相对远端背景的 signal-to-noise,并将 FRiP 定义为落在 called peaks 内的 usable reads 比例。

07 · REGIONS

Peak calling 与 consensus peaks 回答不同问题

前者在单个样本中寻找局部富集,后者建立跨样本统一的可比较特征空间。

SAME GENOMIC AXIS

Consensus peak universe

S1
S2
S3
S4
S5
S6
CONSENSUS

保留跨重复稳定或预定义组别支持的 regions。

MACS 通过局部背景模型识别富集区域;peak 的统计富集与区域的功能身份必须分开解释。

08 · SAMPLE STRUCTURE

PCA 诊断样本结构,不检验某个 peak

每个点是一个独立患者、动物或培养重复;颜色和形状应同时展示 condition、batch、donor 与 QC。

Peak count matrix相同 consensus regions
Transform / normalize声明尺度假设
Sample PCA观察主要变异轴
Check metadatacondition · batch · TSS · donor
09 · INFERENCE

差异可及性必须回到独立样本

Peak × Sample raw counts、design formula、效应量和 FDR 共同定义可解释结果。

PEAK EFFECT × SAMPLE-LEVEL EVIDENCE

差异可及区域不是“显著增强子”清单

chr17:50.18MCOL1A1log2FC +2.3FDR 0.004候选 DAR
chr11:35.6MPDGFDlog2FC +1.9FDR 0.16证据不足
chr2:128.4MCOL3A1log2FC +1.7FDR 0.018候选 DAR
chr8:116.7MTRPS1log2FC -0.9FDR 0.006小效应
chr1:20.1Munknownlog2FC +0.21FDR 0.001小效应

把 peak coordinates、独立样本分布、效应量、FDR 与后续 annotation 分开保存。

bulk ATAC 差异分析会受到样本量、批次和统计策略影响;normalization 的选择也可能改变生物学解释。

10 · REGULATORY HYPOTHESES

Motif 与 peak-to-gene 是两条候选证据链

motif 从序列出发,peak-to-gene 从区域与基因的联系出发;两者都不能一步跨到真实调控机制。

candidate peak
COL1A1距 COL1A1 TSS 0.4 kb
AVAILABLE EVIDENCE

Promoter peak

同组重复可见可及性与 COL1A1 表达同向启动子注释
可以支持
COL1A1 启动子附近存在与表达一致的候选调控变化。
仍不能证明
该 peak 是表达变化的必要原因。

距离或 motif 只能提出候选连接,不能替代物理联系和扰动证据。

motif enrichment 依赖候选区域与匹配背景的比较;序列模式不能替代 TF 结合或扰动证据。

11 · PAPER FIGURE

一张 ATAC-seq Figure 是怎样做出来的?

切换 A–D Panel,分别理解文库 QC、TSS 聚合、差异区域和 locus 调控假设。

原创教学重绘 · 模拟数据AFragment Length QCNFRmonodiBTSS EnrichmentTSSscore 11.8CDifferential AccessibilityCOL1A1 distalpeak log2FCDLocus + MotifC1C2C3F1F2F3COL1A1AP-1 motif
12 · FIGURE LANGUAGE

八类常见 ATAC-seq Figure

先识别数据单位与输入,再判断它是 QC、探索、统计推断还是候选机制。

A图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Fragment Length

回答
文库是否呈现 nucleosome-free 与核小体周期?
误读
周期清晰不代表所有 peaks 都可靠。
B点面积 = 表达比例;颜色 = 平均表达;二者不可互换COL1A1EPCAMCD3DMS4A1LST1
点面积 = 表达比例;颜色 = 平均表达;二者不可互换

TSS Enrichment

回答
开放启动子附近的聚合信号是否高于背景?
误读
不同 genome annotation 与实现的分数不能直接比较。
C图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

FRiP

回答
usable reads 有多少落在当前 peak 集内?
误读
FRiP 会被 peak 数量和宽度改变。
D每个点 = 1 个观测;位置 = 高维邻域的二维表示;颜色 = 当前分组
每个点 = 1 个观测;位置 = 高维邻域的二维表示;颜色 = 当前分组

Sample PCA

回答
哪些技术或生物变量主导整体可及性?
误读
PCA 分离不是差异检验。
E横轴 = 效应量;纵轴 = 统计证据
横轴 = 效应量;纵轴 = 统计证据

DAR Volcano

回答
哪些区域同时具有较大可及性差异和统计证据?
误读
显著区域不是自动的功能增强子。
F行 = marker;列 = 群体;颜色 = 经过说明的相对表达
行 = marker;列 = 群体;颜色 = 经过说明的相对表达

Peak Heatmap

回答
候选区域信号是否跨独立样本一致?
误读
排序和筛选后的整齐图形不构成独立验证。
G点面积 = 表达比例;颜色 = 平均表达;二者不可互换COL1A1EPCAMCD3DMS4A1LST1
点面积 = 表达比例;颜色 = 平均表达;二者不可互换

Motif Enrichment

回答
候选区域中哪些序列模式被过度代表?
误读
motif 存在不等于 TF 结合、表达或活性。
H图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Genome Browser Track

回答
候选区域在基因组与邻近注释中呈现什么信号?
误读
邻近基因不是已经证实的靶基因。
13 · PARAMETER ATLAS

参数改变的是数据生成或判断边界

打开参数时同时检查调高、调低、判断依据、风险和对应方法来源。

14 · BETTER THINKING

ATAC-seq 最常见的 8 个错误

从 Error 到 Consequence,再到 Better Thinking,理解错误怎样沿 regions 与调控解释传播。

ERRORCONSEQUENCEBETTER THINKING
01用固定 TSS/FRiP 阈值跨项目判生死忽略参考注释、组织、流程和 peak universe 的差异。同一实现下联合 fragment、TSS、FRiP、复杂度和重复一致性。
02把 read length 当作 fragment length误读核小体周期和文库结构。用 paired-end 两端恢复插入片段长度。
03把所有样本 peaks 简单取并集噪声样本贡献大量单样本 features。预先定义重复支持与 consensus 策略并记录来源。
04每个 fragment 都当独立重复夸大样本量并低估组间不确定性。患者、动物或独立培养物才是主要统计单位。
05PCA 分开就证明调控改变把探索性样本结构升级为正式推断。检查 batch 和 QC 后,用样本级模型估计预定义 contrast。
06一个 peak 最近哪个基因就归给哪个基因远端调控和三维染色质关系被错误简化。整合距离、共变、表达、3D contact 与扰动证据。
07motif 富集等于 TF 活性增加序列可能性被升级为结合、蛋白活性和因果机制。结合 TF 表达/蛋白、footprint、ChIP/CUT&Tag 与 perturbation。
08浏览器只展示最漂亮的 locus产生选择性报告且隐藏重复不一致。使用统一尺度,展示所有独立样本并说明候选选择规则。
15 · EVIDENCE BOUNDARY

开放染色质可以支持什么,不能证明什么?

Region、motif、gene link、mechanism 和 causality 是不同证据层级。

结果可以支持什么?

特定细胞群或组织中的染色质区域存在可及性信号

不同条件的独立样本在某些区域呈现可及性差异

候选区域富集某类转录因子 motif

为候选调控元件、TF 程序和靶基因连接提出可检验假设

不能单独证明什么?

开放区域一定是功能性增强子

motif 对应的转录因子已真实结合并被激活

最近的基因就是该 peak 的靶基因

可及性变化导致基因表达或疾病表型

单个基因组轨迹已经排除批次、细胞组成与选择偏倚

AssociationMechanismCausality

开放染色质是调控表观基因组的重要线索,但 accessibility 与功能调控元件、TF 活性和基因表达并不等价。

16 · RESEARCH DECISIONS

用五个判断题检查调控证据思维

重点不是记住软件名,而是判断 QC、统计单位、peak universe、motif 和基因连接。

RESEARCH THINKING QUIZ0/5 已回答
Q1

某样本 FRiP 较低,但 TSS enrichment、fragment periodicity 和 replicate concordance 尚可,最稳妥的处理是?

Q2

一个 distal peak 含有 AP-1 motif,能够直接支持什么?

Q3

病例与对照 ATAC-seq 的正确统计单位通常是什么?

Q4

为什么建立 consensus peak set 后再形成 Peak × Sample matrix?

Q5

疾病组某 peak 可及性升高且附近基因表达升高,最合适的结论是?

17 · ONE-PAGE SUMMARY

把组织、区域与调控假设压缩成一条证据链

任何 ATAC 结论都应该能够沿 Figure → Analysis → Peak Matrix → Fragments → FASTQ → Nuclei → Tissue 反向追溯。

TissueNucleiTn5LibraryFASTQBAMFragmentsPeaksConsensusPeak MatrixQCPCADARMotif / LinkValidationBiological Question
01

Data

数据怎样产生与变化

02

Method

每一步为什么存在

03

Figure

结果怎样被看见

04

Evidence

结论能够走多远

参考与数据声明

本页片段、TSS 曲线、peaks、矩阵、差异区域、motif 和基因组轨迹均为固定种子的原创教学模拟,不承载真实患者或研究结论。QC 范围只用于解释指标,实际项目必须结合组织、实验体系、参考版本、同批分布和研究问题。

REFERENCE INFRASTRUCTURE

参考文献与进一步阅读

References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。

10
EVIDENCE SOURCES

核心技术与实验方法

支撑 Tn5 测量原理、Omni-ATAC 制备与完整工作流。

EVIDENCE SOURCES

官方 QC 与处理规范

TSS enrichment、FRiP 和 replicated data 必须以相同实现与参考定义解释。

[4]
COREofficial doc

ATAC-seq Data Standards and Processing Pipeline

ENCODE Project Consortium. ENCODE Data Standards, 2020.

为什么推荐:ENCODE ATAC-seq data standards 与 pipeline。

查看原文
LIBRARY →
[5]
RECOMMENDEDofficial doc

ENCODE Terms and Definitions

ENCODE Project Consortium. ENCODE Data Standards.

为什么推荐:TSS enrichment 与 FRiP 的计算定义。

查看原文
LIBRARY →
EVIDENCE SOURCES

Peak、差异与 Motif

支撑 peak calling、差异可及性与 motif enrichment 的算法解释。