MedResearch Atlas临床科研图谱
FOUNDATION · SEQUENCING · DATA GENERATION

Sequencing Basics

从组织到数字

理解一个生物样本如何变成 reads、FASTQ、比对记录、特征矩阵与论文 Figure,并在每一步区分测量质量、独立样本和生物学证据。
BeginnerNo code required / R / Python concepts6–10 h learningSample → Library → Reads → Matrix
LEARNING OBJECTIVES

学完这一章,你应该能够

点击勾选不是“完成任务”,而是对自己的理解做一次承诺。

01 · THE MEASUREMENT CHAIN

测序仪没有直接读到疾病,它只读到了文库中的分子

从患者到 Figure 的每一次转换都会选择、压缩或重新定义信息。只有知道当前对象是什么,才能判断结果可以回答哪一层问题。

零基础解释

把样本想成一本书:建库决定复印哪些页,测序仪只看到许多短句,软件再把短句放回参考书,最后统计哪些章节出现得更多。

专业解释

Sequencing observes library-derived fragments. Base calling, alignment, feature assignment and statistical modeling successively transform signals into inferential objects.

STEP 7 / 12

Reads

测序读段

read 是对文库片段的有限长度观测;它可能包含 insert、adapter、barcode、UMI 和错误。

WHY

read 是对文库片段的有限长度观测;它可能包含 insert、adapter、barcode、UMI 和错误。

INPUT

逐 cycle 碱基信号

PROCESS

base caller 将信号转换为 A/C/G/T/N,并为每个碱基估计错误概率。

OUTPUT

sequence + per-base quality 的 read 记录

PARAMETERSread 1/2 · cycle · base quality
QC检查不同 cycle、read mate、碱基组成和 tile 的质量模式。
COMMON ERROR把 read 当作完整基因、完整转录本或原始分子本身。
02 · UNIT OF INFERENCE

5000 万条 reads 不等于 5000 万个样本

临床研究最常见的统计单位通常是患者、动物或独立培养物;reads、cells 和 spots 往往嵌套在这些单位内部。

INDEPENDENT BIOLOGICAL UNITPatient / animal / independent culture

用于估计个体间变异、效应与不确定性。

NESTED TECHNICAL OBSERVATIONSFragments → reads → bases

增加样本内测量精度,但不自动增加独立样本量。

03 · LIBRARY DESIGN

Library 是第一次决定‘哪些分子能够被看见’

建库不是把样本原样装进测序仪。富集、片段化、接头、barcode、UMI 和 PCR 会定义后续数据的可见范围与偏倚。

组织总 RNA / mRNASelection + adaptersgene / transcript counts per sample
PRESERVES样本平均转录丰度与样本身份
DOES NOT PRESERVE单细胞来源和原始空间位置
BEST FOR独立样本间整体转录差异

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

04 · READ ANATOMY

Read、fragment、barcode、UMI 和 adapter 分别是什么?

read 是对文库片段的一端或两端进行有限长度读取的结果;不同 assay 会把技术标签和生物序列安排在不同位置。

5′3′
05 · BASE QUALITY

Phred score 是错误概率模型,不是研究总评分

FASTQ quality string 为每个碱基编码一个质量估计。Q 值每增加 10,模型错误概率下降 10 倍。

PHRED MODEL

Q = −10 log₁₀(Perror)

Q30≈ 1 error / 1,000 bases
ACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGTACGT

FASTQ 将序列与逐碱基质量编码放在同一记录中;Phred score 表示估计的 base-call error probability。

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

06 · PREPROCESSING

什么时候需要 trimming,而不是把它当成固定仪式?

短 insert、真实 adapter、低质量末端和 assay 结构决定是否需要处理;任何剪切都应记录前后 reads、长度和定位变化。

READ LENGTH = 150 bp

短 insert 才会让 read 进入 adapter

biological insert · 112 bpadapter · 38 bp
read 超过真实 insert,末端包含 adapter;应识别具体接头并验证 trimming 前后比对表现。

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

07 · REFERENCE MAPPING

Alignment 的结果不是‘成功/失败’,而是 reads 去向的分解

同一条 read 可能唯一定位、对应多个位置、无法定位或因规则被过滤;总 mapping rate 会隐藏这些不同含义。

SAM/BAM 记录 reads 的定位、flags、CIGAR 与附加标签;“已比对”不是单一质量结论。

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

08 · FEATURE DEFINITION

Reference genome 告诉你‘在哪里’,annotation 告诉你‘算作什么’

FASTA 定义参考序列和坐标;GTF/GFF 定义 gene、transcript、exon 等 feature。两者版本都能改变最终矩阵。

REFERENCE FASTAchr1: 100–220
ACGTGCTAGCTAGGCTAACG…

提供序列和坐标系

+
GTF / GFFgene → transcript → exon

定义哪些坐标属于哪些 feature

COUNTING RULEread / fragment → gene
GENE_X 1284

产生可建模的 feature count

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

09 · DATA OBJECTS

同一项目中的文件和矩阵回答不同问题

从物理样本到数值矩阵,每一步的对象类型、shape、分母和科学含义都在变化。

10 · DEPTH & COMPLEXITY

更深测序什么时候仍有收益,什么时候主要是在重复?

测序深度、文库复杂度、低丰度目标和独立样本数共同决定资源配置;不存在跨 assay 的万能 reads 数。

080 M readsunique molecules

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

多样本 QC 应寻找跨 sample、lane 和 run 的结构,而不是只看单个绿色或橙色图标。

11 · PAPER FIGURE

一张 Sequencing QC Figure 应怎样被逆向阅读?

切换 A–D Panel,从每周期质量、adapter、reads 去向和 count matrix 反向追踪到 FASTQ、文库与独立样本。

原创教学重绘 · 模拟数据APer-cycle qualitycycleQ30BAdapter contentcycleCAlignment outcomes82.1% uniqueUniqueMultiUnmappedDCount matrix overviewCOL1A1EPCAMPECAM1CD3DLST1ACTBS1S2S3S4S5S6S7S8S9S10S11S12Per-cycle Base QualityAdapter ContentAlignment OutcomesCount Matrix Overview
12 · PARAMETER ATLAS

测序参数必须放回 assay、样本与下游目标中判断

read length、insert size、Q30、深度、重复、mapping 与注释版本都没有脱离上下文的唯一正确值。

13 · BETTER THINKING

测序基础最常见的 8 个推理错误

问题往往不是软件没运行,而是把技术观测、独立样本、特征定义和生物学结论混在了一起。

ERRORCONSEQUENCEBETTER THINKING
01把 reads 数写成样本量产生伪重复并极度低估总体不确定性。区分患者/动物/独立培养物与嵌套其中的分子、reads、cells 和 spots。
02Q30 高就宣称研究质量高从 base calling 跨越到样本设计、建库代表性和结论真实性。把 Q score 限定为碱基层质量,并继续检查样本、文库、比对、矩阵和统计。
03盲目固定长度 trimming丢失有效序列、缩短定位上下文,并可能人为改变不同样本的 reads。先识别真实 adapter、位置分布和 downstream 工具行为,再记录前后影响。
04只报告总 mapping rate多重比对、污染、rRNA 或参考不匹配被一个漂亮百分比掩盖。拆分 unique、multi-mapped、unmapped 与 feature assignment,并记录参考和注释。
05所有重复 reads 都直接删除真实高丰度信号可能被误删,且不同 assay 的重复含义被混同。结合 UMI、坐标、输入量、复杂度曲线和 assay 决定去重规则。
06参考基因组对了就忽略 GTFfeature 定义和 gene ID 变化无法复现,跨数据集矩阵不可比。同时记录 genome build、FASTA、GTF/GFF、索引和生成日期。
07为了更深测序减少生物学样本测量更精细但总体推断仍不稳定,批次与个体差异无法估计。用饱和/复杂度和功效问题平衡深度与独立样本。
08矩阵一生成就直接画结论图raw/normalized 状态、样本身份、批次和统计单位都可能不清楚。先验证数据对象、metadata、QC、设计公式和分母,再生成 Figure。
14 · EVIDENCE BOUNDARY

Sequencing QC 可以支持什么,不能证明什么?

高质量 reads 是可靠分析的必要条件之一,却从来不是研究设计、机制或因果成立的充分条件。

结果可以支持什么?

样本已经产生可读取且可追溯的序列数据

特定 cycle 的 base calling 质量与错误概率估计

文库片段长度、接头、复杂度和重复模式

reads 相对指定 reference 与 annotation 的定位结果

从 FASTQ 到 feature matrix 的计算转换和数据损失

为特定 assay 的下游分析提供质量与可用性依据

不能单独证明什么?

患者分组没有偏倚或混杂

建库无偏地保留了样本中的所有真实分子

高测序深度等于高独立样本量

高 Q30 或高 mapping rate 等于生物学结论正确

检测到某个序列就证明其具有机制或因果作用

一次测序 run 可以替代独立实验和正交验证

AssociationMechanismCausality
15 · RESEARCH DECISIONS

用五道判断题检查测序科研思维

重点是判断统计单位、质量层级、reads 去向、深度收益和 reference/annotation,而不是背软件参数。

RESEARCH THINKING QUIZ0/5 已回答
Q1

某研究有 4 位患者,每位获得约 5000 万条 reads。进行组间推断时,最合理的独立样本量理解是什么?

Q2

一个样本 Q30 为 94%,最稳妥的结论是什么?

Q3

总 mapping rate 为 96%,下一步最重要的追问是什么?

Q4

增加测序深度时新检测到的分子迅速减少,duplicate rate 持续上升,最合理的下一步是什么?

Q5

同一批 FASTQ 使用不同 GTF 后基因计数发生变化,最合理的解释是什么?

16 · ONE-PAGE SUMMARY

把样本、reads、矩阵和证据压缩成一条可追溯链

任何 Figure 都应能反向追到统计结果、矩阵、比对记录、FASTQ、文库和独立样本。

PatientSampleMoleculeLibraryReadsFASTQAlignmentMatrixStatisticsFigureBiological Question
01

Data

数据怎样产生与变化

02

Method

每一步为什么存在

03

Figure

结果怎样被看见

04

Evidence

结论能够走多远

参考与数据声明

本页全部 reads、质量、比对比例、矩阵与复杂度曲线均为固定规则生成的原创教学模拟,不代表真实患者或测序 run。不同平台、物种、建库策略和 assay 的预期分布不同,应以对应实验方案和官方技术文档为准。

REFERENCE INFRASTRUCTURE

参考文献与进一步阅读

References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。

7
EVIDENCE SOURCES

文件格式与质量模型

支撑 FASTQ、Phred、SAM/BAM 和多样本 QC 的正式定义。

[2]
COREoriginal method

Base-calling of automated sequencer traces using phred. II. Error probabilities

Brent Ewing, Phil Green. Genome Research, 1998.

为什么推荐:Phred error probability。

PMID 9521922 查看原文
LIBRARY →
EVIDENCE SOURCES

官方规范与文档

格式、QC 模块和公共归档规则随版本变化,应优先查官方来源。

[5]
COREofficial doc

FastQC: A Quality Control Tool for High Throughput Sequence Data

Simon Andrews, Babraham Bioinformatics. Official project documentation.

为什么推荐:FastQC 模块的官方解释。

查看原文
LIBRARY →
[6]
ADVANCEDofficial doc

GA4GH SAM/BAM and Related Specifications

Global Alliance for Genomics and Health, SAM/BAM Format Specification Working Group. Official format specifications.

为什么推荐:SAM/BAM/CRAM 等正式规范。

查看原文
LIBRARY →