MedResearch Atlas临床科研图谱
ESTIMAND · UNCERTAINTY · TRANSPARENT INFERENCE

Statistics Foundations

医学科研统计学基础

不从公式和检验名称开始,而是从研究问题、目标估计量、统计单位、变量类型、效应量、不确定性、模型诊断和证据边界建立统计判断。
Beginner → IntermediateNo coding required / R / Python transferable10–16 h learningSynthetic participant-level data
LEARNING OBJECTIVES

学完这一章,你应该能够

点击勾选不是“完成任务”,而是对自己的理解做一次承诺。

01 · QUESTION TO QUANTITY

统计学不是寻找显著性的工具

它把科学问题映射为可估计的数量,并诚实表达有限数据带来的不确定性。

零基础解释

先问“平均改善多少、区间有多宽”,再问数据与某个假设是否相容。不能把 P<0.05 当作研究完成。

专业解释

Statistical inference links an estimand, study design, sampling unit and probability model to an estimate, uncertainty and diagnostics.

DESCRIBE样本长什么样?

分布、中心、离散、缺失。

ESTIMATE效应有多大?

差、比、斜率与区间。

CHECK结论依赖什么?

模型假设、异常、分析选择。

SAMPL 指南强调完整报告统计方法、描述、估计值和不确定性,让读者能重建分析逻辑,而不是只看到 P 值。

02 · DATA STRUCTURE

变量类型之前,先确认谁才是独立 N

点击六种变量,比较合理摘要、模型对象和常见编码错误。

二元

Treatment response

Responder / non-responder

合理摘要 / 模型对象
n/N · risk · risk difference · risk ratio
常见错误
把 0/1 均值叫连续变量均值而不说明它就是比例。
03 · DISTRIBUTION FIRST

中心值必须和分布一起看

切换对称、右偏和影响点情景,观察 mean、median、SD 与 IQR 如何回应尾部。

Mean 50.0Median 50.0

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

04 · CORE WORKFLOW

从问题到有边界解释的 18 步统计链

点击任一节点,检查 WHY、INPUT、PROCESS、OUTPUT、PARAMETERS、QC、COMMON ERROR 与 NEXT。

STEP 4 / 18

Statistical Unit

统计单位

有效样本量来自独立单位,不来自图上的点数。

WHY

有效样本量来自独立单位,不来自图上的点数。

INPUT

患者、动物、培养、细胞或 reads

PROCESS

识别独立单位与嵌套层级

OUTPUT

真正 N 与层级结构

PARAMETERScluster · repeated measures
QC说明谁独立接受条件或被抽样。
COMMON ERROR把技术重复、细胞或 reads 当独立 N。
05 · PRECISION

相同效应,可以有完全不同的精度

保持效应点估计为 4,切换样本量,观察标准误、95% CI 与 P 值共同变化。

Clinical threshold

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

Bootstrap 通过对正确统计单位重抽样近似抽样分布;增加重抽样次数只能降低 Monte Carlo 波动,不能修复非代表性样本。

06 · METHOD CHOICE

方法选择不是“正态就 t,不正态就秩和”

结局类型、组数、依赖结构和目标估计量共同决定候选模型;诊断决定它是否可用。

SCIENTIFIC QUESTION

两组独立患者的平均 FVC 是否不同?

OUTCOMEContinuous
GROUPS2 independent groups
DEPENDENCEIndependent participants
ESTIMANDMean difference
候选方法
Linear model / two-sample t procedure
必须检查
检查残差、方差和影响点;不要只由正态性检验决定。
07 · MAGNITUDE

效应量先回答“多大”,区间再回答“多不确定”

报告原始尺度通常最容易连接临床意义;标准化效应适合跨尺度比较,但更依赖样本变异。

ABSOLUTEMean / risk difference

最直接表达增加多少、减少多少。

RELATIVERisk / rate / odds ratio

表达相对于比较组的倍数变化。

+
UNCERTAINTYConfidence interval

显示当前数据仍与哪些效应兼容。

置信区间不是参数的概率盒子;它依赖分析方案、抽样模型和选择过程。应解释区间内仍兼容的效应,而不只判断是否跨零。

08 · COMPATIBILITY

P 值不是零假设为真的概率

P 值只在指定模型、假设和分析选择下描述数据的相对不相容程度。

Clinical threshold

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

P value can reflect

效应大小 · 样本量 · 测量噪声 · 模型 · 分析选择

P value cannot tell

假设为真的概率 · 效应重要性 · 结果可重复概率 · 研究是否无偏

ASA 明确指出,科学结论不应只由 P 值是否跨过固定阈值决定;P 值也不衡量效应大小或结果重要性。

09 · MODEL

回归模型首先由结局结构决定

模型的名字不是复杂程度排名,而是结局分布、链接函数和依赖结构的组合。

CONTINUOUSLinear / robust / mixeddifference · slope
BINARYBinomial / logisticrisk · odds
COUNT / RATEPoisson / negative binomialrate ratio · dispersion
TIME-TO-EVENTKM / Cox / RMSTrisk set · censoring
REPEATED / CLUSTEREDMixed / GEEwithin-unit dependence

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

10 · DIAGNOSTICS

检查模型残差,不是给原始变量盖“正态”印章

独立性来自设计;线性、方差、分布和影响结构需要图形与领域知识共同判断。

INDEPENDENCE来自抽样与设计

不能由一张残差图证明。

FUNCTIONAL FORM关系是否被正确表达?

检查曲线、交互和时间变化。

VARIANCE误差是否随拟合值变化?

必要时稳健 SE 或替代模型。

INFLUENCE结论是否由少数单位主导?

核查来源并预设敏感性分析。

11 · MULTIPLICITY

20 次检验不是 20 个孤立的 P 值

切换逐项阈值与 BH FDR,观察发现数量怎样变化,以及两种规则在回答什么错误率问题。

20 PRESPECIFIED HYPOTHESES

同一组 P 值,不同错误率问题

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

Benjamini–Hochberg 控制被拒绝假设集合中的预期错误发现比例;它不同于控制“至少一个假阳性”的 FWER。

12 · DATA DECISIONS

缺失和异常值处理必须独立于结果方向

先核查数据来源和产生机制,再决定纠错、保留、建模或敏感性分析。

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

13 · DESIGN PRECISION

样本量设计从最小重要效应和目标精度开始

Power 不是研究完成后的质量分数;observed power 通常只是 P 值的变形。

Clinical threshold
14 · FIGURE READING

一张统计 Figure 如何反向追到研究问题?

切换 A–D Panel,检查原始数据、效应区间、模型诊断与多重检验,并反向追踪到统计单位和设计。

原创教学重绘 · 模拟数据ADistribution + Raw DataControl · n=60Intervention · n=60BEffect + 95% CI0MIDUnadjustedAdjustedBootstrapCModel DiagnosticsFitted valueDMultiplicity
15 · DECISION PARAMETERS

统计参数改变错误率、精度和解释,不改变事实本身

Alpha、置信水平、摘要、异常规则、参考水平、模型公式、bootstrap 与 FDR 都必须在研究语境中判断。

A纵轴 = 表达量;宽度 = 局部密度;横线 = 中位数
纵轴 = 表达量;宽度 = 局部密度;横线 = 中位数

Distribution Plot

回答
数据的形状、中心、离散和异常如何?
误读
只看箱线图而忽略样本量和原始点。
B图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Estimation Plot

回答
组间效应有多大、区间多宽?
误读
只按区间是否跨 0 二分结论。
C图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Scatter + Fit

回答
两个连续变量的关系与不确定性如何?
误读
相关与回归斜率不能证明因果。
D图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Residual Plot

回答
模型残差是否显示函数形式、方差或影响点问题?
误读
把图看起来随机当作所有假设都成立。
E方块 = 点估计;横线 = 置信区间
方块 = 点估计;横线 = 置信区间

Forest Plot

回答
多个效应或亚组的方向和精度如何?
误读
一个亚组显著、另一个不显著不等于交互显著。
F图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Multiplicity Plot

回答
原始 P 值在调整后还有多少发现?
误读
FDR 是发现集合的错误比例概念,不是单项为真的概率。
16 · BETTER THINKING

医学科研最常见的 8 个统计推断错误

沿 Error → Consequence → Better Thinking 检查错误如何从统计单位传播到 Figure 和结论。

ERRORCONSEQUENCEBETTER THINKING
01按变量名机械选检验忽略估计量、设计、依赖结构与模型假设。先写问题、效应尺度、单位和组间关系。
02把技术观测当 N标准误过小、区间过窄、P 值过小。按独立单位分析或使用层级/重复测量模型。
03用均值±SEM描述样本分布读者看不到个体离散程度。描述数据用 SD/IQR;推断精度用 SE/CI。
04Shapiro P>0.05 即正态小样本无力发现偏离,大样本对轻微偏离过敏。检查残差图、设计稳健性和目标估计量。
05P<0.05 等于重要小但精确的无意义效应被夸大。优先解释效应大小、区间和临床/生物学阈值。
06P>0.05 等于无效应低精度研究被误写成等效或不存在差异。报告区间排除了什么,尚兼容什么。
07删除异常值直到显著结果驱动的数据处理破坏推断。预定义规则,展示含/不含的敏感性分析。
08只调整最终展示的检验隐藏的分析选择仍增加假阳性机会。定义检验家族并透明报告探索范围。
17 · EVIDENCE BOUNDARY

精确估计不等于无偏,更不等于因果

统计方法量化数据和模型中的结构;研究设计决定比较能走多远。

结果可以支持什么?

描述已观测样本的分布、中心、离散和缺失结构

量化预先定义效应的方向、大小与抽样不确定性

检查模型假设、影响点和结果对分析选择的敏感程度

在明确检验家族中控制 FWER 或 FDR

不能单独证明什么?

用小 P 值证明研究假设为真或结果可重复

用非显著结果证明没有差异或已经等效

用复杂模型修复错误统计单位、选择偏倚或混杂

仅凭相关、回归系数或统计显著性证明机制和因果

AssociationMechanismCausality
18 · RESEARCH DECISIONS

用五个判断题检查统计推断

重点不是计算,而是识别统计单位、精度、尾部、多重检验和非显著结果的边界。

RESEARCH THINKING QUIZ0/5 已回答
Q1

三位患者各测量 100 个细胞,比较治疗前后细胞信号。若直接把 300 个细胞作为 n=300,主要问题是什么?

Q2

两项研究估计同样的均值差 4 单位;大样本研究 P<0.001,小样本研究 P=0.20。最合理解释是?

Q3

右偏住院费用中有真实高费用患者。最佳处理是?

Q4

20 个独立零假设均成立,均以未调整 P<0.05 宣布发现。哪项最合适?

Q5

调整后差值 2.1(95% CI −0.8 至 5.0,P=0.15)。最恰当结论是?

19 · ONE-PAGE SUMMARY

把统计结果压缩成一条可复核推断链

每个 P 值和 Figure 都应能反向追到估计量、单位、设计和科学问题。

QuestionEstimandDesignStatistical UnitVariable TypeData QCMissingnessDistributionSummaryModelAssumptionsEffectUncertaintyP valueMultiplicityDiagnosticsFigureBounded Conclusion
01

Data

数据怎样产生与变化

02

Method

每一步为什么存在

03

Figure

结果怎样被看见

04

Evidence

结论能够走多远

参考与数据声明

本页所有参与者、分布、效应量、P 值、残差和多重检验结果均为原创教学模拟,不代表真实临床、湿实验或组学研究结论。本教程用于科研教育,不替代专业统计咨询、方案预注册或研究设计审查。

REFERENCE INFRASTRUCTURE

参考文献与进一步阅读

References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。

8
EVIDENCE SOURCES

统计推断与透明报告

支撑 P 值、置信区间、效应量、统计单位和完整分析报告。

[4]
COREoriginal method

Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing

Yoav Benjamini, Yosef Hochberg. Journal of the Royal Statistical Society: Series B, 1995.

为什么推荐:多重检验中 FDR 控制的基础方法。

DOI 10.1111/j.2517-6161.1995.tb02031.x 查看原文
LIBRARY →
EVIDENCE SOURCES

不确定性与模型方法

支撑 bootstrap、生存模型及缺失数据等可复用统计对象。