MedResearch Atlas临床科研图谱
QUESTION · STUDIES · SYNTHESIS · CERTAINTY

Systematic Review & Meta-analysis Foundations

系统评价与 Meta-analysis 基础

从临床问题、PICO 和预设方案出发,系统识别、筛选、评价并综合研究,在偏倚、异质性与证据确定性的边界内形成可更新结论。
Beginner → IntermediateNo coding required / R / Python transferable10–16 h learningSynthetic studies and effect estimates
LEARNING OBJECTIVES

学完这一章,你应该能够

点击勾选不是“完成任务”,而是对自己的理解做一次承诺。

01 · QUESTION TO EVIDENCE BODY

系统评价不是把检索到的论文排成一张表

它用预设、可复核的方法回答:在一个明确问题下,现有全部可获得证据支持什么,又在哪些地方仍不确定。

IDENTIFY系统寻找

定义来源、检索式、日期和补充路径。

APPRAISE评估可信度

按结果识别设计与实施造成的偏倚。

SYNTHESIZE综合而非堆叠

比较可比性、效应、精度和研究间差异。

BOUND限定结论

把确定性和适用边界写进结论。

PRISMA 2020 的 27 项清单用于透明报告系统评价为何开展、如何完成、发现什么和结果意味着什么;它不是替代方法学质量判断的“合格证”。

02 · PRESPECIFICATION

在阅读结果之前固定问题和关键选择

逐项展开 PICOS,观察同一个目标估计量如何约束检索、纳入、提取、合并和解释。

TARGET DEFINITION

Population

成人特发性肺纤维化(稳定期)

目标估计量
52 周 FVC 明显下降的风险比(RR)
预设的价值
筛选、提取和统计模型都必须回到同一个问题对象。
04 · CORE WORKFLOW

从临床问题到有边界结论的 20 步证据链

点击任一节点,检查 WHY、INPUT、PROCESS、OUTPUT、PARAMETERS、QC、COMMON ERROR 与 NEXT。

STEP 1 / 20

Clinical Question

临床问题

系统评价必须回答可操作的问题,而不是先收集论文再寻找主题。

WHY

系统评价必须回答可操作的问题,而不是先收集论文再寻找主题。

INPUT

临床不确定性

PROCESS

界定目标人群、干预、比较、结局与研究设计

OUTPUT

可检索、可纳入的问题

PARAMETERSscope · decision context
QC问题能否导出明确纳排标准?
COMMON ERROR问题过宽,导致研究不可比。
05 · STUDY SELECTION

PRISMA 流程图必须能做数量守恒

点击每个阶段查看判断任务;特别区分检索记录、论文报告和独立研究。

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

06 · STRUCTURED EVIDENCE

同一项研究可以有多篇报告,但不能被当成多项独立证据

从问题、记录和研究到效应与证据 profile,检查每一步对象类型如何变化。

07 · INTERNAL VALIDITY

偏倚风险按设计、结果和域判断,不做机械质量总分

切换随机试验与非随机研究,阅读每个域的支持信息如何形成 overall judgement。

RoB 2

Trial A · primary outcome

Low
Randomization

中央随机与隐藏分配。

Deviations

盲法与意向性分析一致。

Missing outcome

结局缺失 3%,组间接近。

Measurement

盲态中心读取。

Selection

与注册方案一致。

该特定结局在 RoB 2 各域均无明显担忧。

RoB 2 是当前 Cochrane 推荐的随机试验结果层面工具;ROBINS-I 针对非随机干预研究,并特别处理混杂与选择等七个域。

08 · COMMON SCALE

效应量把研究问题变成可比较的数值语言

切换 RR、RD、MD 与 SMD,比较相对、绝对和标准化尺度各自保留与丢失的信息。

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

09 · WEIGHTED SYNTHESIS

固定效应与随机效应不是由 I² 开关控制

切换模型,观察研究权重和合并区间如何变化;两者对应不同目标效应假设。

WEIGHTED SYNTHESIS

同一组研究,不同目标效应假设

Alder 2018
Birch 2019
Cedar 2020
Dahlia 2020
Elm 2021
Fir 2022
Ginkgo 2023
Hazel 2024
RR 0.76 [0.64, 0.89]

允许研究估计相关但不同的真实效应;小研究相对权重增加,不保证结果更保守。

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

随机效应模型允许研究估计相关但不同的真实效应;它常提高小研究相对权重,因此不能被笼统称为“更保守”。

10 · VARIATION BETWEEN STUDIES

异质性不是一个 I² 数字,而是一组需要解释的差异

保持平均效应相近,切换 τ²、I² 和预测区间情景,观察新场景可能落在哪里。

τ²0.004
18%
Prediction interval0.690.91

研究效应较集中,但仍需检查人群、剂量和偏倚差异。

阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。

I² 描述观察变异中超过抽样误差的比例,但不能取代临床差异、τ²、forest plot 和预测区间;少量研究时它本身也不稳定。

11 · ROBUSTNESS

敏感性分析回答:结论依赖哪个判断?

依次排除高偏倚研究、最大研究或改变模型,检查方向、大小和精度而非只看显著性。

12 · MISSING EVIDENCE

漏斗图不对称提示小研究效应,不是发表偏倚的指纹

图形模式可能来自选择性发表、真实异质性、效应尺度、方法质量或偶然;研究较少时统计检验尤其有限。

Egger 等人的经典检验也明确指出:研究数量有限且试验较小时,检测偏倚的能力受限,结果必须谨慎解释。

13 · GRADE

统计显著性不能替代证据确定性

GRADE 按关键结局综合偏倚风险、不一致、间接性、不精确和发表偏倚;确定性与推荐强度是两个不同判断。

RISK OF BIAS研究结果可信度

设计与实施是否系统偏离目标效应?

INCONSISTENCY研究间差异

效应是否方向或大小不一致且无法解释?

INDIRECTNESS问题匹配度

人群、干预、比较、结局是否直接对应决策?

IMPRECISION区间与阈值

区间是否跨越会改变决策的效应范围?

PUBLICATION BIAS缺失证据

结果可得性是否可能依赖方向或显著性?

GRADE 框架明确分开证据质量与推荐强度;“Meta-analysis”这一分析形式本身不会自动提高证据确定性。

14 · FIGURE READING

一张系统评价 Figure 如何反向追到方案与检索?

切换 A–D Panel,检查 PRISMA、Forest、Risk of Bias 和 Sensitivity 的数据对象、生成路径与误读边界。

原创教学重绘 · 模拟数据APRISMA FlowRecords2486Deduplicated1912Full text148Studies8BForest Plot · RRAlder 2018Birch 2019Cedar 2020Dahlia 2020Elm 2021Fir 2022Ginkgo 2023Hazel 2024CRisk of BiasS1S2S3S4S5S6S7S8DSensitivityPrimaryExclude high RoBExclude largestFixed effect
15 · DECISION PARAMETERS

系统评价参数改变覆盖、权重和解释,不改变原研究事实

信息来源、日期、审阅者、效应尺度、连续性校正、模型、τ² 估计和区间水平都必须由问题与方案约束。

A图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

PRISMA Flow

回答
记录如何从识别、去重和筛选进入最终纳入?
误读
混用 records、reports 与 studies,导致计数不可复核。
B方块 = 点估计;横线 = 置信区间
方块 = 点估计;横线 = 置信区间

Forest Plot

回答
各研究效应、精度和合并结果如何分布?
误读
只看菱形是否跨无效线,不看权重、区间和异质性。
C图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Risk-of-bias Plot

回答
关键结果在哪些偏倚域存在担忧?
误读
把颜色汇总成无依据的总分。
D图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Funnel Plot

回答
效应与精度是否呈现小研究效应模式?
误读
不对称并不专属于发表偏倚,少量研究时检验能力有限。
E图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

Leave-one-out Plot

回答
合并结论是否被单个研究主导?
误读
看到稳定就宣称无偏。
F图形元素来自汇总数据,不代表原始影像
图形元素来自汇总数据,不代表原始影像

GRADE Evidence Profile

回答
每个关键结局的效应与确定性为何处于当前等级?
误读
把证据确定性与推荐强度混为一谈。
16 · BETTER THINKING

8 个最常见的证据综合推断错误

沿 Error → Consequence → Better Thinking 追踪错误如何从检索传播到结论。

ERRORCONSEQUENCEBETTER THINKING
01先看论文再定义纳入标准标准可能随结果方向改变,产生选择性纳入。在 protocol 中预设 PICO、结局、时间点和设计。
02只检索一个数据库来源覆盖不全且更易受发表与索引偏倚影响。按学科选择多个数据库、注册平台与补充检索。
03用过窄检索式追求高 precision容易漏掉术语不同但符合条件的研究。围绕核心概念提高敏感性,在筛选阶段处理噪声。
04单人筛选且不留排除理由错误和主观判断无法复核。独立判断、校准标准并保留全文排除日志。
05把报告质量当偏倚风险写得完整的有偏研究可能被误判为可信。使用与设计匹配的结果层面 RoB 工具并记录支持信息。
06I²<50% 就用固定效应模型由数据后验选择,且忽视临床差异和目标效应。按 estimand 与研究差异预设模型,同时解释 τ² 和预测区间。
07漏斗图不对称即发表偏倚忽略异质性、效应尺度和小研究方法差异等替代解释。把漏斗图作为小研究效应信号,结合检索和敏感性证据。
08Meta-analysis 位于证据金字塔顶端,所以必然高质量多个有偏、间接或不精确研究被错误包装成确定结论。按结局评价完整证据体的确定性并明确降级理由。
17 · EVIDENCE BOUNDARY

Systematic ≠ complete;pooled ≠ true;significant ≠ certain

系统评价降低随意性并暴露证据结构,但不能找回从未公开的数据,也不能用统计合并修复共同偏倚。

结果可以支持什么?

系统识别并透明记录预设范围内找到和筛选的研究

量化可比较研究的效应方向、大小、精度与研究间差异

检验结论对偏倚风险、模型、尺度和单个研究的敏感程度

按结局总结当前证据体的确定性与适用边界

不能单独证明什么?

检索到所有从未发表、未注册或不可获得的研究

用更多低质量研究抵消共同偏倚或错误结局定义

仅凭合并显著性证明每个人群、剂量和场景都有效

把观察性关联或有偏试验自动升级为机制与因果确定性

AssociationMechanismCausality
18 · RESEARCH DECISIONS

用五个判断题检查检索、偏倚、模型和确定性

每题提交后都解释正确答案以及其他选项为什么不能支持当前决策。

RESEARCH THINKING QUIZ0/5 已回答
Q1

为减少筛选量,研究者想在检索式中加入“52-week FVC decline”和“double blind”。最合理的处理是?

Q2

8 项研究 I²=18%,因此应该怎样选择模型?

Q3

两位审阅者想把 RoB 2 五个域各记 0–2 分并求总分。主要问题是什么?

Q4

漏斗图不对称最恰当的结论是?

Q5

合并 RR=0.78(95% CI 0.66–0.92)且 P<0.01,能否直接定为高确定性证据?

19 · ONE-PAGE SUMMARY

把证据综合压缩成一条可复核、可更新的链

每个菱形、等级和结论都应能反向追到效应、提取表、研究报告、筛选日志、检索式与预设问题。

Clinical QuestionPICOSProtocolSearchDeduplicationScreeningPRISMAExtractionCharacteristicsRisk of BiasEffect MeasureModelHeterogeneitySensitivityCertaintyBounded Conclusion
01

Data

数据怎样产生与变化

02

Method

每一步为什么存在

03

Figure

结果怎样被看见

04

Evidence

结论能够走多远

参考与数据声明

本页 2,486 条记录、8 项研究、1,964 名参与者、效应量、偏倚判断、异质性与 Figure 均为固定教学模拟,不代表真实系统评价或临床结论。方法学论断分别链接 PRISMA、Cochrane、RoB 2、ROBINS-I、GRADE 及原始统计方法来源。

REFERENCE INFRASTRUCTURE

参考文献与进一步阅读

References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。

8
EVIDENCE SOURCES

报告与完整方法

支撑系统评价的预设、检索、筛选、合并和透明报告。

[2]
COREofficial doc

Cochrane Handbook for Systematic Reviews of Interventions, version 6.5

Julian P. T. Higgins et al.. Cochrane, 2024.

为什么推荐:检索、筛选、偏倚、Meta-analysis 与解释的核心手册。

查看原文
LIBRARY →
EVIDENCE SOURCES

偏倚与证据确定性

支撑不同研究设计的偏倚判断与按结局评价确定性。

[3]
COREofficial doc

Cochrane Handbook Chapter 8: Assessing risk of bias in a randomized trial

Jonathan A. C. Sterne et al.. Cochrane Handbook, 2024.

为什么推荐:随机试验结果层面的 RoB 2。

查看原文
LIBRARY →
EVIDENCE SOURCES

合并、异质性与小研究效应

支撑随机效应、I² 和漏斗图的原理与解释边界。