Sequencing Basics
从组织到数字
理解一个生物样本如何变成 reads、FASTQ、比对记录、特征矩阵与论文 Figure,并在每一步区分测量质量、独立样本和生物学证据。
学完这一章,你应该能够
点击勾选不是“完成任务”,而是对自己的理解做一次承诺。
测序仪没有直接读到疾病,它只读到了文库中的分子
从患者到 Figure 的每一次转换都会选择、压缩或重新定义信息。只有知道当前对象是什么,才能判断结果可以回答哪一层问题。
把样本想成一本书:建库决定复印哪些页,测序仪只看到许多短句,软件再把短句放回参考书,最后统计哪些章节出现得更多。
Sequencing observes library-derived fragments. Base calling, alignment, feature assignment and statistical modeling successively transform signals into inferential objects.
Reads
测序读段
read 是对文库片段的有限长度观测;它可能包含 insert、adapter、barcode、UMI 和错误。
read 是对文库片段的有限长度观测;它可能包含 insert、adapter、barcode、UMI 和错误。
逐 cycle 碱基信号
base caller 将信号转换为 A/C/G/T/N,并为每个碱基估计错误概率。
sequence + per-base quality 的 read 记录
5000 万条 reads 不等于 5000 万个样本
临床研究最常见的统计单位通常是患者、动物或独立培养物;reads、cells 和 spots 往往嵌套在这些单位内部。
用于估计个体间变异、效应与不确定性。
增加样本内测量精度,但不自动增加独立样本量。
Library 是第一次决定‘哪些分子能够被看见’
建库不是把样本原样装进测序仪。富集、片段化、接头、barcode、UMI 和 PCR 会定义后续数据的可见范围与偏倚。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
Read、fragment、barcode、UMI 和 adapter 分别是什么?
read 是对文库片段的一端或两端进行有限长度读取的结果;不同 assay 会把技术标签和生物序列安排在不同位置。
Phred score 是错误概率模型,不是研究总评分
FASTQ quality string 为每个碱基编码一个质量估计。Q 值每增加 10,模型错误概率下降 10 倍。
Q = −10 log₁₀(Perror)
FASTQ 将序列与逐碱基质量编码放在同一记录中;Phred score 表示估计的 base-call error probability。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
什么时候需要 trimming,而不是把它当成固定仪式?
短 insert、真实 adapter、低质量末端和 assay 结构决定是否需要处理;任何剪切都应记录前后 reads、长度和定位变化。
短 insert 才会让 read 进入 adapter
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
Alignment 的结果不是‘成功/失败’,而是 reads 去向的分解
同一条 read 可能唯一定位、对应多个位置、无法定位或因规则被过滤;总 mapping rate 会隐藏这些不同含义。
SAM/BAM 记录 reads 的定位、flags、CIGAR 与附加标签;“已比对”不是单一质量结论。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
Reference genome 告诉你‘在哪里’,annotation 告诉你‘算作什么’
FASTA 定义参考序列和坐标;GTF/GFF 定义 gene、transcript、exon 等 feature。两者版本都能改变最终矩阵。
提供序列和坐标系
定义哪些坐标属于哪些 feature
产生可建模的 feature count
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
同一项目中的文件和矩阵回答不同问题
从物理样本到数值矩阵,每一步的对象类型、shape、分母和科学含义都在变化。
更深测序什么时候仍有收益,什么时候主要是在重复?
测序深度、文库复杂度、低丰度目标和独立样本数共同决定资源配置;不存在跨 assay 的万能 reads 数。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
多样本 QC 应寻找跨 sample、lane 和 run 的结构,而不是只看单个绿色或橙色图标。
一张 Sequencing QC Figure 应怎样被逆向阅读?
切换 A–D Panel,从每周期质量、adapter、reads 去向和 count matrix 反向追踪到 FASTQ、文库与独立样本。
From sequencing run to an analysis-ready matrix
MedResearch Atlas Teaching Dataset · paired-end RNA library · Figure 1
测序参数必须放回 assay、样本与下游目标中判断
read length、insert size、Q30、深度、重复、mapping 与注释版本都没有脱离上下文的唯一正确值。
测序基础最常见的 8 个推理错误
问题往往不是软件没运行,而是把技术观测、独立样本、特征定义和生物学结论混在了一起。
Sequencing QC 可以支持什么,不能证明什么?
高质量 reads 是可靠分析的必要条件之一,却从来不是研究设计、机制或因果成立的充分条件。
结果可以支持什么?
样本已经产生可读取且可追溯的序列数据
特定 cycle 的 base calling 质量与错误概率估计
文库片段长度、接头、复杂度和重复模式
reads 相对指定 reference 与 annotation 的定位结果
从 FASTQ 到 feature matrix 的计算转换和数据损失
为特定 assay 的下游分析提供质量与可用性依据
不能单独证明什么?
患者分组没有偏倚或混杂
建库无偏地保留了样本中的所有真实分子
高测序深度等于高独立样本量
高 Q30 或高 mapping rate 等于生物学结论正确
检测到某个序列就证明其具有机制或因果作用
一次测序 run 可以替代独立实验和正交验证
用五道判断题检查测序科研思维
重点是判断统计单位、质量层级、reads 去向、深度收益和 reference/annotation,而不是背软件参数。
某研究有 4 位患者,每位获得约 5000 万条 reads。进行组间推断时,最合理的独立样本量理解是什么?
一个样本 Q30 为 94%,最稳妥的结论是什么?
总 mapping rate 为 96%,下一步最重要的追问是什么?
增加测序深度时新检测到的分子迅速减少,duplicate rate 持续上升,最合理的下一步是什么?
同一批 FASTQ 使用不同 GTF 后基因计数发生变化,最合理的解释是什么?
把样本、reads、矩阵和证据压缩成一条可追溯链
任何 Figure 都应能反向追到统计结果、矩阵、比对记录、FASTQ、文库和独立样本。
Data
数据怎样产生与变化
Method
每一步为什么存在
Figure
结果怎样被看见
Evidence
结论能够走多远
参考与数据声明
本页全部 reads、质量、比对比例、矩阵与复杂度曲线均为固定规则生成的原创教学模拟,不代表真实患者或测序 run。不同平台、物种、建库策略和 assay 的预期分布不同,应以对应实验方案和官方技术文档为准。
参考文献与进一步阅读
References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。
文件格式与质量模型
支撑 FASTQ、Phred、SAM/BAM 和多样本 QC 的正式定义。
The Sanger FASTQ file format for sequences with quality scores, and the Solexa/Illumina FASTQ variants
Peter J. A. Cock et al.. Nucleic Acids Research, 2010.
为什么推荐:FASTQ 格式与质量编码。
DOI 10.1093/nar/gkp1137 PMID 20015970 PMC2847217 查看原文Base-calling of automated sequencer traces using phred. II. Error probabilities
Brent Ewing, Phil Green. Genome Research, 1998.
为什么推荐:Phred error probability。
PMID 9521922 查看原文The Sequence Alignment/Map format and SAMtools
Heng Li et al.. Bioinformatics, 2009.
为什么推荐:SAM/BAM format 与 SAMtools。
DOI 10.1093/bioinformatics/btp352 PMID 19505943 PMC2723002 查看原文MultiQC: summarize analysis results for multiple tools and samples in a single report
Philip Ewels, Måns Magnusson, Sverker Lundin, Max Käller. Bioinformatics, 2016.
为什么推荐:跨工具、多样本 QC 汇总。
DOI 10.1093/bioinformatics/btw354 PMID 27312411 PMC5039924 查看原文官方规范与文档
格式、QC 模块和公共归档规则随版本变化,应优先查官方来源。
FastQC: A Quality Control Tool for High Throughput Sequence Data
Simon Andrews, Babraham Bioinformatics. Official project documentation.
为什么推荐:FastQC 模块的官方解释。
查看原文GA4GH SAM/BAM and Related Specifications
Global Alliance for Genomics and Health, SAM/BAM Format Specification Working Group. Official format specifications.
为什么推荐:SAM/BAM/CRAM 等正式规范。
查看原文