MedResearch Atlas临床科研图谱
PHASE 1B · FILE EXPLORER

FASTQ Viewer

测序原始文件解读器

从一条 read 开始理解:序列、质量和身份信息如何被保存,又怎样继续变成 BAM、矩阵、统计结果和 Figure。

4 行 / readPhred+33Raw → Matrix → Figure
RAW DATA OBJECT

一条 read,为什么需要四行?

FASTQ 把每条测序 read 的碱基序列与逐位置质量编码保存在四行记录中。它是原始测序数据,不是表达矩阵。

sample_R1.fastqREAD 0001 · SYNTHETIC
4 lines / readASCII Phred+33
QUALITY DECODER

质量字符怎样变成错误概率?

点击任意碱基。相同位置的质量字符经过 Phred+33 解码,得到 Q score。

POSITION9
BASEA
PHREDQ33
ERROR PROBABILITY5.01e-4

Q = −10 log10(Perror)。质量分数是概率的对数编码,不是“正确百分比”。

DATA TRANSFORMATION

FASTQ 之后,数据不断变成什么?

文件格式变化意味着数据对象和能够回答的问题也在变化。

FASTQraw

原始 read 序列与质量

SAMintermediate

可读文本形式的比对记录

BAMintermediate

压缩并可索引的比对文件

Count Matrixanalysis

feature × sample / cell 的计数对象

Statisticsanalysis

差异、聚类或其他模型结果

Figureanalysis

可以被检查的结果表达

原始数据中间数据分析数据 / Figure
QC THINKING

不要只盯着一条 read

01质量分数是错误概率的对数尺度;Q30 约对应 0.1% 的碱基调用错误概率,而不是 30% 正确率。

02单条 read 的低质量尾部不自动决定整个样本是否失败;必须结合全文件分布、adapter、比对率和研究用途。

03FASTQ 不包含已经解释好的基因表达量;表达矩阵来自后续比对、定量、barcode / UMI 处理。