什么是循证医学?看懂药品研究与医疗建议的7个关键问题

循证医学不是只看论文或机械照搬指南,而是把当前最佳研究证据、临床专业判断和患者价值偏好结合起来。本文用通俗方法讲清PICO、研究偏倚、绝对风险、置信区间、替代终点、GRADE和共同决策。

更新日期:2026年8月4日 “有研究证明”“达到统计学显著”“指南强烈推荐”——这些说法经常出现在药品宣传、医学新闻和社交媒体中,但它们并不等于同一件事。循证医学的价值,正是把零散的研究结论放回临床问题、患者情况和真实选择中,判断一项证据究竟有多可信、作用有多大、是否适用于眼前的人。 一、什么是循证医学? 循证医学并不是“只听论文、不听医生”,也不是简单地按照指南机械执行。经典定义强调,在照护个体患者时,应当审慎使用当前最佳研究证据,并把它与临床专业能力结合起来。今天的循证决策通常还明确纳入患者的价值观、偏好、生活目标和现实条件。 可以把它理解为三个部分的交汇: 当前最佳证据: 研究是否可靠,结果是否稳定,效应有多大; 临床专业判断: 疾病阶段、合并症、既往治疗和潜在风险如何影响选择; 患者价值与处境: 患者更重视哪些获益、愿意承担哪些风险,费用和治疗负担能否接受。 缺少其中任何一项,都可能把“研究中平均有效”误写成“对每个人都应该使用”。 二、循证实践的五个步骤 循证实践常被概括为五个连续步骤: 提出问题(Ask): 把模糊疑问转换成可以回答的问题; 检索证据(Acquire): 系统寻找与问题最相关的研究、综述和指南; 评价证据(Appraise): 判断偏倚风险、结果大小、精确度和适用性; 应用证据(Apply): 结合临床情况和患者偏好作出共同决策; 评估结果(Assess): 观察获益、伤害和目标是否实现,必要时调整方案。 第一步常用PICO结构:P代表人群或患者,I代表干预,C代表对照,O代表结局。例如,与“这种药好不好”相比,“某类患者使用该药而不是现有治疗,能否在一年内减少住院,同时不会明显增加严重不良反应”更容易找到真正相关的证据。 三、证据等级不是一座永远不变的金字塔 随机对照试验和高质量系统综述在评价治疗效果时通常很重要,但研究设计必须与问题匹配: 判断一种治疗是否造成预期效果,随机对照试验通常更能减少混杂因素; 发现罕见或长期不良反应,样本更大、随访更久的观察研究和药物警戒数据可能更有价值; 评价诊断准确性,需要把待测方法与合适的参考标准进行比较; 了解疾病预后,队列研究往往比短期试验更合适; 理解患者体验、障碍和偏好,规范开展的定性研究同样不可替代。 “研究类型排得高”不代表这项研究自动可信。随机分组不当、失访过多、选择性报告结果或样本过小,都可能降低可信度;同样,系统综述如果漏检研究、纳入研究质量差,结论也不会因为“综述”二字就自然变强。 四、看懂一项药品研究,要问五个关键问题 1. 研究回答的是不是你关心的问题? 先核对研究对象、用药方案、对照措施、观察结局和随访时间。仅在年轻、合并症很少的人群中得到的结果,不一定能直接外推给高龄、多病共存或正在使用多种药物的人。 2. 结果可能受到多大偏倚影响? 治疗研究可关注随机化、分配隐藏、盲法、失访、是否按原分组分析,以及研究是否预先登记。还要查看资助来源和利益冲突,但“存在企业资助”本身不是自动否定结论的理由;关键是研究设计、数据透明度和独立重复结果是否足以控制偏倚。 3. 效果有多大,而不只是“有没有显著性”? 相对风险容易让效果看起来很醒目,绝对风险更接近患者实际会遇到的差异。假设某项研究在相同随访期内把事件发生率从8%降至6%,可以说相对风险下降25%,也可以说绝对风险下降2个百分点,即每1,000人约少20人发生事件。两种表达都正确,但只说“降低25%”会遗漏基线风险。 还要看置信区间。区间越宽,说明估计越不精确;如果区间同时容许明显获益、几乎无差异甚至潜在伤害,就不应把一个单独的点估计写成确定答案。“没有统计学显著差异”也不自动等于“两种治疗效果相同”。 4. 研究测量的是患者真正关心的结局吗? 死亡、住院、症状、功能、生活质量和严重不良反应,通常比单纯的化验数值更直接。血压、肿瘤缩小或某项生物标志物有时可以作为替代终点,但替代终点能否可靠预测患者活得更久、感觉更好或功能改善,需要另外验证。指标改善并不必然等于临床获益已经得到确认。 5. 结果能否用于眼前的患者? 即使证据可信,也要比较研究人群与现实患者的年龄、疾病严重程度、肝肾功能、合并用药和医疗环境。随后权衡预期获益、不良反应、用药负担、费用、替代方案和患者本人最重视的目标。循证医学的最后一步不是“找到论文”,而是作出适合具体情境的决定。 五、“证据确定性”和“推荐强度”不是一回事 GRADE等方法通常把一组证据的确定性分为高、中、低和极低。评价时会关注五类常见问题:偏倚风险、不同研究结果是否一致、证据是否间接、估计是否不精确,以及是否存在发表偏倚。 指南的推荐则常分为强推荐和条件性推荐。推荐强度不仅取决于证据确定性,还取决于获益与伤害的平衡、不同人群的价值偏好、资源使用、公平性、可接受性和实施难度。因此: 高确定性证据不一定意味着所有人都应作出同一选择; 条件性推荐并不等于“无效”,而是不同患者可能作出不同的合理选择; 指南提供的是结构化建议,不能替代对个体情况的判断。 六、常见的五种误读 “一篇论文证明了结论。” 单项研究通常只是证据链的一部分,需要结合全部相关研究。 “P值小于0.05,所以效果很重要。” 统计学显著不代表效应足够大,也不说明利大于弊。 “没有显著差异,所以两者完全一样。” 样本不足或区间太宽时,也可能得出不显著结果。 “系统综述就是最高质量证据。” 综述的质量取决于检索、纳入标准、偏倚评价和所纳入研究。 “指南推荐就必须照做。” 指南要结合适用人群、更新日期、推荐强度和个人偏好理解。 七、患者与家属可以直接使用的提问清单 面对一种药物、检查或治疗建议时,可以向医生或药师询问: 这一选择主要希望改善什么结局? 与不使用或使用其他方案相比,绝对获益有多大,观察时间多长? 常见不良反应和严重风险分别是什么? 证据来自哪些人群,与我的情况相似吗? 证据确定性和指南推荐强度分别是什么? 还有哪些合理替代方案,包括暂不改变治疗并继续观察? 这些问题不是为了让患者独自完成专业文献评价,而是帮助医患双方把“研究平均结果”转化为透明、可讨论的个人选择。 权威资料 BMJ:循证医学的经典定义与边界 BMC Medical Education:循证实践的五步骤模型 Cochrane Handbook:结果解释、绝对风险与相对风险 Cochrane Handbook:证据确定性与GRADE评价 世界卫生组织:规范性产品制定方法手册,第IV卷(2025) 英国NICE:共同决策与患者价值偏好 美国FDA:临床终点与替代终点 说明: 本文依据公开的权威方法学资料进行中文整理和二次创作,内容用于一般医学知识与研究阅读教育,不能替代医生诊断、处方或针对个人情况的治疗建议。正在接受治疗者不应仅凭网络文章自行停药、换药或调整剂量。