Statistics Foundations
医学科研统计学基础
不从公式和检验名称开始,而是从研究问题、目标估计量、统计单位、变量类型、效应量、不确定性、模型诊断和证据边界建立统计判断。
学完这一章,你应该能够
点击勾选不是“完成任务”,而是对自己的理解做一次承诺。
统计学不是寻找显著性的工具
它把科学问题映射为可估计的数量,并诚实表达有限数据带来的不确定性。
先问“平均改善多少、区间有多宽”,再问数据与某个假设是否相容。不能把 P<0.05 当作研究完成。
Statistical inference links an estimand, study design, sampling unit and probability model to an estimate, uncertainty and diagnostics.
分布、中心、离散、缺失。
差、比、斜率与区间。
模型假设、异常、分析选择。
SAMPL 指南强调完整报告统计方法、描述、估计值和不确定性,让读者能重建分析逻辑,而不是只看到 P 值。
变量类型之前,先确认谁才是独立 N
点击六种变量,比较合理摘要、模型对象和常见编码错误。
Treatment response
Responder / non-responder
- 合理摘要 / 模型对象
- n/N · risk · risk difference · risk ratio
- 常见错误
- 把 0/1 均值叫连续变量均值而不说明它就是比例。
中心值必须和分布一起看
切换对称、右偏和影响点情景,观察 mean、median、SD 与 IQR 如何回应尾部。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
从问题到有边界解释的 18 步统计链
点击任一节点,检查 WHY、INPUT、PROCESS、OUTPUT、PARAMETERS、QC、COMMON ERROR 与 NEXT。
Statistical Unit
统计单位
有效样本量来自独立单位,不来自图上的点数。
有效样本量来自独立单位,不来自图上的点数。
患者、动物、培养、细胞或 reads
识别独立单位与嵌套层级
真正 N 与层级结构
相同效应,可以有完全不同的精度
保持效应点估计为 4,切换样本量,观察标准误、95% CI 与 P 值共同变化。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
Bootstrap 通过对正确统计单位重抽样近似抽样分布;增加重抽样次数只能降低 Monte Carlo 波动,不能修复非代表性样本。
方法选择不是“正态就 t,不正态就秩和”
结局类型、组数、依赖结构和目标估计量共同决定候选模型;诊断决定它是否可用。
两组独立患者的平均 FVC 是否不同?
- 候选方法
- Linear model / two-sample t procedure
- 必须检查
- 检查残差、方差和影响点;不要只由正态性检验决定。
效应量先回答“多大”,区间再回答“多不确定”
报告原始尺度通常最容易连接临床意义;标准化效应适合跨尺度比较,但更依赖样本变异。
最直接表达增加多少、减少多少。
表达相对于比较组的倍数变化。
显示当前数据仍与哪些效应兼容。
置信区间不是参数的概率盒子;它依赖分析方案、抽样模型和选择过程。应解释区间内仍兼容的效应,而不只判断是否跨零。
P 值不是零假设为真的概率
P 值只在指定模型、假设和分析选择下描述数据的相对不相容程度。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
效应大小 · 样本量 · 测量噪声 · 模型 · 分析选择
P value cannot tell假设为真的概率 · 效应重要性 · 结果可重复概率 · 研究是否无偏
ASA 明确指出,科学结论不应只由 P 值是否跨过固定阈值决定;P 值也不衡量效应大小或结果重要性。
回归模型首先由结局结构决定
模型的名字不是复杂程度排名,而是结局分布、链接函数和依赖结构的组合。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
检查模型残差,不是给原始变量盖“正态”印章
独立性来自设计;线性、方差、分布和影响结构需要图形与领域知识共同判断。
不能由一张残差图证明。
检查曲线、交互和时间变化。
必要时稳健 SE 或替代模型。
核查来源并预设敏感性分析。
20 次检验不是 20 个孤立的 P 值
切换逐项阈值与 BH FDR,观察发现数量怎样变化,以及两种规则在回答什么错误率问题。
同一组 P 值,不同错误率问题
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
Benjamini–Hochberg 控制被拒绝假设集合中的预期错误发现比例;它不同于控制“至少一个假阳性”的 FWER。
缺失和异常值处理必须独立于结果方向
先核查数据来源和产生机制,再决定纠错、保留、建模或敏感性分析。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
样本量设计从最小重要效应和目标精度开始
Power 不是研究完成后的质量分数;observed power 通常只是 P 值的变形。
一张统计 Figure 如何反向追到研究问题?
切换 A–D Panel,检查原始数据、效应区间、模型诊断与多重检验,并反向追踪到统计单位和设计。
From participant-level data to transparent statistical inference
MedResearch Atlas Teaching Dataset · 120 synthetic participants · prespecified primary contrast
统计参数改变错误率、精度和解释,不改变事实本身
Alpha、置信水平、摘要、异常规则、参考水平、模型公式、bootstrap 与 FDR 都必须在研究语境中判断。
Distribution Plot
- 回答
- 数据的形状、中心、离散和异常如何?
- 误读
- 只看箱线图而忽略样本量和原始点。
Estimation Plot
- 回答
- 组间效应有多大、区间多宽?
- 误读
- 只按区间是否跨 0 二分结论。
Scatter + Fit
- 回答
- 两个连续变量的关系与不确定性如何?
- 误读
- 相关与回归斜率不能证明因果。
Residual Plot
- 回答
- 模型残差是否显示函数形式、方差或影响点问题?
- 误读
- 把图看起来随机当作所有假设都成立。
Forest Plot
- 回答
- 多个效应或亚组的方向和精度如何?
- 误读
- 一个亚组显著、另一个不显著不等于交互显著。
Multiplicity Plot
- 回答
- 原始 P 值在调整后还有多少发现?
- 误读
- FDR 是发现集合的错误比例概念,不是单项为真的概率。
医学科研最常见的 8 个统计推断错误
沿 Error → Consequence → Better Thinking 检查错误如何从统计单位传播到 Figure 和结论。
精确估计不等于无偏,更不等于因果
统计方法量化数据和模型中的结构;研究设计决定比较能走多远。
结果可以支持什么?
描述已观测样本的分布、中心、离散和缺失结构
量化预先定义效应的方向、大小与抽样不确定性
检查模型假设、影响点和结果对分析选择的敏感程度
在明确检验家族中控制 FWER 或 FDR
不能单独证明什么?
用小 P 值证明研究假设为真或结果可重复
用非显著结果证明没有差异或已经等效
用复杂模型修复错误统计单位、选择偏倚或混杂
仅凭相关、回归系数或统计显著性证明机制和因果
用五个判断题检查统计推断
重点不是计算,而是识别统计单位、精度、尾部、多重检验和非显著结果的边界。
三位患者各测量 100 个细胞,比较治疗前后细胞信号。若直接把 300 个细胞作为 n=300,主要问题是什么?
两项研究估计同样的均值差 4 单位;大样本研究 P<0.001,小样本研究 P=0.20。最合理解释是?
右偏住院费用中有真实高费用患者。最佳处理是?
20 个独立零假设均成立,均以未调整 P<0.05 宣布发现。哪项最合适?
调整后差值 2.1(95% CI −0.8 至 5.0,P=0.15)。最恰当结论是?
把统计结果压缩成一条可复核推断链
每个 P 值和 Figure 都应能反向追到估计量、单位、设计和科学问题。
Data
数据怎样产生与变化
Method
每一步为什么存在
Figure
结果怎样被看见
Evidence
结论能够走多远
参考与数据声明
本页所有参与者、分布、效应量、P 值、残差和多重检验结果均为原创教学模拟,不代表真实临床、湿实验或组学研究结论。本教程用于科研教育,不替代专业统计咨询、方案预注册或研究设计审查。
参考文献与进一步阅读
References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。
统计推断与透明报告
支撑 P 值、置信区间、效应量、统计单位和完整分析报告。
The ASA Statement on p-Values: Context, Process, and Purpose
Ronald L. Wasserstein, Nicole A. Lazar. The American Statistician, 2016.
为什么推荐:P 值的六项共识原则与阈值化误区。
DOI 10.1080/00031305.2016.1154108 查看原文Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations
Sander Greenland et al.. European Journal of Epidemiology, 2016.
为什么推荐:P 值、区间与功效的 25 类常见误解。
DOI 10.1007/s10654-016-0149-3 PMID 27209009 PMC4877414 查看原文Basic statistical reporting for articles published in biomedical journals: the SAMPL Guidelines
Thomas A. Lang, Douglas G. Altman. International Journal of Nursing Studies, 2015.
为什么推荐:生物医学论文统计报告最低规范。
DOI 10.1016/j.ijnurstu.2014.09.006 PMID 25441757 查看原文Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing
Yoav Benjamini, Yosef Hochberg. Journal of the Royal Statistical Society: Series B, 1995.
为什么推荐:多重检验中 FDR 控制的基础方法。
DOI 10.1111/j.2517-6161.1995.tb02031.x 查看原文不确定性与模型方法
支撑 bootstrap、生存模型及缺失数据等可复用统计对象。
Bootstrap Methods: Another Look at the Jackknife
Bradley Efron. The Annals of Statistics, 1979.
为什么推荐:按正确统计单位进行重抽样。
DOI 10.1214/aos/1176344552 查看原文Nonparametric Estimation from Incomplete Observations
Edward L. Kaplan, Paul Meier. Journal of the American Statistical Association, 1958.
为什么推荐:带删失观察的生存函数估计。
DOI 10.1080/01621459.1958.10501452 查看原文Regression Models and Life-Tables
David R. Cox. Journal of the Royal Statistical Society: Series B, 1972.
为什么推荐:时间到事件回归与 hazard ratio。
DOI 10.1111/j.2517-6161.1972.tb00899.x 查看原文Multiple imputation for missing data in epidemiological and clinical research: potential and pitfalls
Jonathan A. C. Sterne et al.. BMJ, 2009.
为什么推荐:缺失数据与多重插补的假设。
DOI 10.1136/bmj.b2393 PMID 19564179 PMC2714692 查看原文