Systematic Review & Meta-analysis Foundations
系统评价与 Meta-analysis 基础
从临床问题、PICO 和预设方案出发,系统识别、筛选、评价并综合研究,在偏倚、异质性与证据确定性的边界内形成可更新结论。
学完这一章,你应该能够
点击勾选不是“完成任务”,而是对自己的理解做一次承诺。
系统评价不是把检索到的论文排成一张表
它用预设、可复核的方法回答:在一个明确问题下,现有全部可获得证据支持什么,又在哪些地方仍不确定。
定义来源、检索式、日期和补充路径。
按结果识别设计与实施造成的偏倚。
比较可比性、效应、精度和研究间差异。
把确定性和适用边界写进结论。
PRISMA 2020 的 27 项清单用于透明报告系统评价为何开展、如何完成、发现什么和结果意味着什么;它不是替代方法学质量判断的“合格证”。
在阅读结果之前固定问题和关键选择
逐项展开 PICOS,观察同一个目标估计量如何约束检索、纳入、提取、合并和解释。
Population
成人特发性肺纤维化(稳定期)
- 目标估计量
- 52 周 FVC 明显下降的风险比(RR)
- 预设的价值
- 筛选、提取和统计模型都必须回到同一个问题对象。
检索策略首先管理漏检风险
切换三种模拟检索式,比较 records、recall 与 precision;更多结果不一定更好,但过窄结果可能从一开始丢失证据。
敏感性与精确度不是同一目标
(pulmonary fibrosis OR IPF) AND (therapy X OR synonym*)保留多个术语与拼写变体,筛选负担较高但较少漏检。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
Cochrane Handbook 要求完整记录每个来源的平台、覆盖日期、最终检索日期和可重跑的检索式,并按问题范围考虑数据库之外的注册平台与补充来源。
从临床问题到有边界结论的 20 步证据链
点击任一节点,检查 WHY、INPUT、PROCESS、OUTPUT、PARAMETERS、QC、COMMON ERROR 与 NEXT。
Clinical Question
临床问题
系统评价必须回答可操作的问题,而不是先收集论文再寻找主题。
系统评价必须回答可操作的问题,而不是先收集论文再寻找主题。
临床不确定性
界定目标人群、干预、比较、结局与研究设计
可检索、可纳入的问题
PRISMA 流程图必须能做数量守恒
点击每个阶段查看判断任务;特别区分检索记录、论文报告和独立研究。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
同一项研究可以有多篇报告,但不能被当成多项独立证据
从问题、记录和研究到效应与证据 profile,检查每一步对象类型如何变化。
偏倚风险按设计、结果和域判断,不做机械质量总分
切换随机试验与非随机研究,阅读每个域的支持信息如何形成 overall judgement。
Trial A · primary outcome
中央随机与隐藏分配。
盲法与意向性分析一致。
结局缺失 3%,组间接近。
盲态中心读取。
与注册方案一致。
RoB 2 是当前 Cochrane 推荐的随机试验结果层面工具;ROBINS-I 针对非随机干预研究,并特别处理混杂与选择等七个域。
效应量把研究问题变成可比较的数值语言
切换 RR、RD、MD 与 SMD,比较相对、绝对和标准化尺度各自保留与丢失的信息。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
固定效应与随机效应不是由 I² 开关控制
切换模型,观察研究权重和合并区间如何变化;两者对应不同目标效应假设。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
随机效应模型允许研究估计相关但不同的真实效应;它常提高小研究相对权重,因此不能被笼统称为“更保守”。
异质性不是一个 I² 数字,而是一组需要解释的差异
保持平均效应相近,切换 τ²、I² 和预测区间情景,观察新场景可能落在哪里。
研究效应较集中,但仍需检查人群、剂量和偏倚差异。
阈值不是固定标准。先看数据分布、组织特性、测序深度、样本重复和研究问题。
I² 描述观察变异中超过抽样误差的比例,但不能取代临床差异、τ²、forest plot 和预测区间;少量研究时它本身也不稳定。
敏感性分析回答:结论依赖哪个判断?
依次排除高偏倚研究、最大研究或改变模型,检查方向、大小和精度而非只看显著性。
漏斗图不对称提示小研究效应,不是发表偏倚的指纹
图形模式可能来自选择性发表、真实异质性、效应尺度、方法质量或偶然;研究较少时统计检验尤其有限。
Egger 等人的经典检验也明确指出:研究数量有限且试验较小时,检测偏倚的能力受限,结果必须谨慎解释。
统计显著性不能替代证据确定性
GRADE 按关键结局综合偏倚风险、不一致、间接性、不精确和发表偏倚;确定性与推荐强度是两个不同判断。
设计与实施是否系统偏离目标效应?
效应是否方向或大小不一致且无法解释?
人群、干预、比较、结局是否直接对应决策?
区间是否跨越会改变决策的效应范围?
结果可得性是否可能依赖方向或显著性?
GRADE 框架明确分开证据质量与推荐强度;“Meta-analysis”这一分析形式本身不会自动提高证据确定性。
一张系统评价 Figure 如何反向追到方案与检索?
切换 A–D Panel,检查 PRISMA、Forest、Risk of Bias 和 Sensitivity 的数据对象、生成路径与误读边界。
Synthetic Systematic Review Figure
8 项模拟随机试验 · 成人 IPF · 52 周 FVC 明显下降
系统评价参数改变覆盖、权重和解释,不改变原研究事实
信息来源、日期、审阅者、效应尺度、连续性校正、模型、τ² 估计和区间水平都必须由问题与方案约束。
PRISMA Flow
- 回答
- 记录如何从识别、去重和筛选进入最终纳入?
- 误读
- 混用 records、reports 与 studies,导致计数不可复核。
Forest Plot
- 回答
- 各研究效应、精度和合并结果如何分布?
- 误读
- 只看菱形是否跨无效线,不看权重、区间和异质性。
Risk-of-bias Plot
- 回答
- 关键结果在哪些偏倚域存在担忧?
- 误读
- 把颜色汇总成无依据的总分。
Funnel Plot
- 回答
- 效应与精度是否呈现小研究效应模式?
- 误读
- 不对称并不专属于发表偏倚,少量研究时检验能力有限。
Leave-one-out Plot
- 回答
- 合并结论是否被单个研究主导?
- 误读
- 看到稳定就宣称无偏。
GRADE Evidence Profile
- 回答
- 每个关键结局的效应与确定性为何处于当前等级?
- 误读
- 把证据确定性与推荐强度混为一谈。
8 个最常见的证据综合推断错误
沿 Error → Consequence → Better Thinking 追踪错误如何从检索传播到结论。
Systematic ≠ complete;pooled ≠ true;significant ≠ certain
系统评价降低随意性并暴露证据结构,但不能找回从未公开的数据,也不能用统计合并修复共同偏倚。
结果可以支持什么?
系统识别并透明记录预设范围内找到和筛选的研究
量化可比较研究的效应方向、大小、精度与研究间差异
检验结论对偏倚风险、模型、尺度和单个研究的敏感程度
按结局总结当前证据体的确定性与适用边界
不能单独证明什么?
检索到所有从未发表、未注册或不可获得的研究
用更多低质量研究抵消共同偏倚或错误结局定义
仅凭合并显著性证明每个人群、剂量和场景都有效
把观察性关联或有偏试验自动升级为机制与因果确定性
用五个判断题检查检索、偏倚、模型和确定性
每题提交后都解释正确答案以及其他选项为什么不能支持当前决策。
为减少筛选量,研究者想在检索式中加入“52-week FVC decline”和“double blind”。最合理的处理是?
8 项研究 I²=18%,因此应该怎样选择模型?
两位审阅者想把 RoB 2 五个域各记 0–2 分并求总分。主要问题是什么?
漏斗图不对称最恰当的结论是?
合并 RR=0.78(95% CI 0.66–0.92)且 P<0.01,能否直接定为高确定性证据?
把证据综合压缩成一条可复核、可更新的链
每个菱形、等级和结论都应能反向追到效应、提取表、研究报告、筛选日志、检索式与预设问题。
Data
数据怎样产生与变化
Method
每一步为什么存在
Figure
结果怎样被看见
Evidence
结论能够走多远
参考与数据声明
本页 2,486 条记录、8 项研究、1,964 名参与者、效应量、偏倚判断、异质性与 Figure 均为固定教学模拟,不代表真实系统评价或临床结论。方法学论断分别链接 PRISMA、Cochrane、RoB 2、ROBINS-I、GRADE 及原始统计方法来源。
参考文献与进一步阅读
References 支撑本章论断;Further Reading 负责下一步学习。两者不混为一谈。
报告与完整方法
支撑系统评价的预设、检索、筛选、合并和透明报告。
The PRISMA 2020 statement: an updated guideline for reporting systematic reviews
Matthew J. Page et al.. BMJ, 2021.
为什么推荐:当前系统评价报告清单与流程图。
DOI 10.1136/bmj.n71 PMID 33782057 PMC8005924 查看原文Cochrane Handbook for Systematic Reviews of Interventions, version 6.5
Julian P. T. Higgins et al.. Cochrane, 2024.
为什么推荐:检索、筛选、偏倚、Meta-analysis 与解释的核心手册。
查看原文偏倚与证据确定性
支撑不同研究设计的偏倚判断与按结局评价确定性。
Cochrane Handbook Chapter 8: Assessing risk of bias in a randomized trial
Jonathan A. C. Sterne et al.. Cochrane Handbook, 2024.
为什么推荐:随机试验结果层面的 RoB 2。
查看原文ROBINS-I: a tool for assessing risk of bias in non-randomised studies of interventions
Jonathan A. C. Sterne et al.. BMJ, 2016.
为什么推荐:非随机干预研究的 ROBINS-I。
DOI 10.1136/bmj.i4919 PMID 27733354 PMC5062054 查看原文GRADE: an emerging consensus on rating quality of evidence and strength of recommendations
Gordon H. Guyatt et al.. BMJ, 2008.
为什么推荐:证据确定性与推荐强度的区分。
DOI 10.1136/bmj.39489.470347.AD PMID 18436948 PMC2335261 查看原文合并、异质性与小研究效应
支撑随机效应、I² 和漏斗图的原理与解释边界。
Meta-analysis in clinical trials
Rebecca DerSimonian, Nan Laird. Controlled Clinical Trials, 1986.
为什么推荐:经典随机效应 Meta-analysis 方法。
DOI 10.1016/0197-2456(86)90046-2 PMID 3802833 查看原文Measuring inconsistency in meta-analyses
Julian P. T. Higgins, Simon G. Thompson, Jonathan J. Deeks, Douglas G. Altman. BMJ, 2003.
为什么推荐:I² 与不一致性的原始方法。
DOI 10.1136/bmj.327.7414.557 PMID 12958120 PMC192859 查看原文Bias in meta-analysis detected by a simple, graphical test
Matthias Egger, George Davey Smith, Martin Schneider, Christoph Minder. BMJ, 1997.
为什么推荐:漏斗图不对称与小研究效应检验。
DOI 10.1136/bmj.315.7109.629 PMID 9310563 PMC2127453 查看原文