PHASE 1B · FILE EXPLORER
FASTQ Viewer
测序原始文件解读器
从一条 read 开始理解:序列、质量和身份信息如何被保存,又怎样继续变成 BAM、矩阵、统计结果和 Figure。
RAW DATA OBJECT
一条 read,为什么需要四行?
FASTQ 把每条测序 read 的碱基序列与逐位置质量编码保存在四行记录中。它是原始测序数据,不是表达矩阵。
QUALITY DECODER
质量字符怎样变成错误概率?
点击任意碱基。相同位置的质量字符经过 Phred+33 解码,得到 Q score。
POSITION9
BASEA
PHREDQ33
ERROR PROBABILITY5.01e-4
Q = −10 log10(Perror)。质量分数是概率的对数编码,不是“正确百分比”。
DATA TRANSFORMATION
FASTQ 之后,数据不断变成什么?
文件格式变化意味着数据对象和能够回答的问题也在变化。
FASTQraw
原始 read 序列与质量
SAMintermediate可读文本形式的比对记录
BAMintermediate压缩并可索引的比对文件
Count Matrixanalysisfeature × sample / cell 的计数对象
Statisticsanalysis差异、聚类或其他模型结果
Figureanalysis可以被检查的结果表达
原始数据中间数据分析数据 / Figure
QC THINKING
不要只盯着一条 read
01质量分数是错误概率的对数尺度;Q30 约对应 0.1% 的碱基调用错误概率,而不是 30% 正确率。
02单条 read 的低质量尾部不自动决定整个样本是否失败;必须结合全文件分布、adapter、比对率和研究用途。
03FASTQ 不包含已经解释好的基因表达量;表达矩阵来自后续比对、定量、barcode / UMI 处理。