DAY 61

健康长寿:循证素养与如何读懂健康研究
Evidence Literacy — How to Read Health Research Without Being Fooled

2026-07-17 · BigCat's Vitality Protocol
本期是"元技能":不给新协议,给一套读懂所有协议的工具。以循证医学方法学共识 + 经典案例为主。
SUB · 研究设计 / 因果推断
证据金字塔:不是所有"研究显示"都平等
The Evidence Pyramid — Not All "Studies Show" Are Equal
一句话结论
看到"研究显示",先问三件事:什么设计、多少人、有没有对照。观察性研究只能建立相关,RCT 才能逼近因果——两者的证据分量差一个数量级。
证据等级
专家共识:OCEBM 牛津循证医学中心证据分级(2011)与 GRADE 系统,是全球循证医学教学的通用框架。
科学背景 + 机制
系统综述 / Meta 分析
随机对照试验 RCT
前瞻队列研究
病例对照研究
横断面 / 相关研究
动物 / 机制研究
专家意见 / 个案
▲ 越往上,控制混杂的能力越强、离因果越近
相关不等于因果,有三条常见"逃逸路径":混杂(第三变量同时影响因果两端——"喝红酒的人更长寿",真凶常是社会经济地位)、反向因果(不是 X 致 Y 而是 Y 致 X——"低胆固醇伴随癌症",其实是早期癌症拉低了胆固醇)、选择偏倚。RCT 靠随机分组把已知与未知混杂一并平均掉,这是它凌驾观察研究的唯一理由。Bradford Hill(1965)的九条准则(强度、剂量反应、时序、一致性、生物学合理性等)则帮助从相关审慎地推向因果。
可执行协议
设计能回答什么典型陷阱
Meta / 系统综述综合多项研究垃圾进垃圾出、异质性
RCT因果样本小、人群窄、随访短
前瞻队列强相关 + 时序残余混杂
病例对照罕见病、快速回忆偏倚
横断面生成假设无时序,不能推因果
动物 / 机制通路、可行性剂量与物种外推
女性特别提示
大量"经典结论"来自以男性为主的样本。动物实验的雌性纳入率长期偏低——Beery & Zucker(2011)统计多个领域雄性:雌性可达 5:1。把雄鼠或男性受试者的结果外推到女性有真实风险。读一项研究,先看受试者的性别构成,以及是否做了性别分层
常见误区
误区一:"RCT 一定最可信" — 小样本、短随访、用替代终点的 RCT 同样会误导;一项设计精良的大队列常胜过一项劣质 RCT。
误区二:"机制说得通就有效" — 无数机制合理的疗法在 RCT 里翻车(下一张卡的 CAST 是经典)。
关键参考
• OCEBM Levels of Evidence Working Group. 2011.
• Hill AB. The environment and disease: association or causation? Proc R Soc Med. 1965;58:295-300.
本周一试 + 思考题
THIS WEEK
挑一条你最近相信的健康说法(如"XX 抗炎/护脑"),顺藤查到它的原始出处:是人体 RCT,还是观察性、动物或试管研究?

思考题:如果一条建议只有机制和动物证据,你会为它改变行为吗?门槛该定在哪?
SUB · 风险沟通 / 统计素养
相对风险 vs 绝对风险:新闻标题最爱的骗术
Relative vs Absolute Risk & NNT
一句话结论
"降低 50% 风险"几乎没有信息量,除非你知道基线——从 2% 降到 1% 也叫"降 50%"。永远追问绝对数字NNT(需治疗人数)
证据等级
方法学共识:Cook & Sackett(1995, BMJ)确立 NNT 概念;Gigerenzer 一系列风险素养研究证明相对风险表述系统性地误导医生与患者。
科学背景 + 机制
相对风险降低(RRR)放大观感,绝对风险降低(ARR)才是你实际拿到的东西。NNT = 1/ARR,意为"防住一个事件需要治疗多少人"。举例:某他汀用于一级预防,把 5 年心梗风险从 2.0% 降到 1.5%——RRR = 25%(标题党最爱),ARR = 0.5%,NNT = 200。即治疗 200 人 5 年才防住 1 次心梗,其余 199 人无获益却承担成本与副作用。同理用 NNH(需伤害人数)权衡代价。
可执行协议
同一数据的三种说法表述诚实度
RRR 25%"风险降四分之一"夸大
ARR 0.5%"每百人少半个事件"诚实
NNT 200"治 200 人防 1 次"最有用
口袋公式:ARR = 对照组事件率 − 干预组事件率;NNT = 1 / ARR。看到只报相对风险、不给绝对数字的报道——一律警惕。
女性特别提示
风险沟通里女性是重灾区:乳腺癌筛查、HRT 的获益/风险常以相对风险呈现,制造恐慌。WHI(2002)报道 HRT 使"乳腺癌风险 ↑约 26%"(相对),换成绝对增量约为每年每万名使用者多 8 例——同一事实,绝对表述让个体决策理性得多。
常见误区
误区一:"5 年生存率提高 = 活得更久" — 提前诊断(领先时间偏倚)能抬高生存率却不延长寿命。
误区二:把 RRR 当 ARR 直接套到自己身上,高估了个人获益。
关键参考
• Cook RJ, Sackett DL. The number needed to treat. BMJ. 1995;310:452-454.
• Rossouw JE, et al. (Women's Health Initiative). JAMA. 2002;288:321-333.
本周一试 + 思考题
THIS WEEK
下次看到"降低 XX% 风险"的健康新闻,动手查原文里的绝对风险和 NNT——很多时候你会发现"惊人效果"缩水成小数点后一位。

思考题:一个 NNT = 200 的药和一个 NNT = 8 的药,你的用药意愿会一样吗?
SUB · 统计陷阱 / 可重复性
p<0.05 不等于"真":统计显著的三重陷阱
p-Values, Power & Publication Bias
一句话结论
p<0.05 只说"若干预无效,得到这批数据的概率小于 5%"——它不说效应有多大,更不说结论为真。小样本 + 多重比较 + 只发阳性 = 一大堆假阳性。
证据等级
方法学共识:美国统计学会 2016 年 p 值声明(Wasserstein & Lazar);Ioannidis(2005, PLoS Med)论证"多数已发表研究结论是假的"。
科学背景 + 机制
三个彼此独立的陷阱:
① 统计显著 ≠ 临床显著——样本足够大时,微不足道的差异(如减重 0.3 kg)也能 p<0.05。
② 检验力不足(样本太小)——真效应测不出(假阴性);而侥幸达标的阳性往往夸大效应("赢家诅咒")。
③ p 值操纵与发表偏倚——反复尝试多个终点/分组直到某个 p<0.05(p-hacking);阴性结果被压进抽屉不发表,使整片文献偏向阳性。这正是许多"突破"无法重复的根源。
可执行协议
读一项研究时的核对清单:
• 样本量 n 多大?效应量(绝对差、Cohen's d)报了吗?
• 主要终点是否预注册,还是事后从一堆结果里挑出来的?
置信区间宽不宽?跨没跨过"无效线"?
• 若是 Meta,看漏斗图是否对称来判断发表偏倚(Egger 1997)。
• 单项"惊艳"研究先存疑,等重复
女性特别提示
女性样本不足会直接压低女性亚组的检验力——即便研究总体阳性,"对女性也有效"很可能只是没测出差异,而非真的没差异。要看它是否做了"性别 × 干预"的交互检验,而不是只在脚注补一句。
常见误区
误区一:"p=0.049 和 p=0.051 天壤之别" — 0.05 是人为阈值,两者证据强度几乎相同。
误区二:"n 越大越好,不看效应量" — 大样本会把琐碎差异也变得"显著"。
关键参考
• Wasserstein RL, Lazar NA. The ASA statement on p-values. Am Stat. 2016;70:129-133.
• Ioannidis JPA. Why most published research findings are false. PLoS Med. 2005;2:e124.
• Egger M, et al. BMJ. 1997;315:629-634.
本周一试 + 思考题
THIS WEEK
找一篇你在意的研究,先只看它的样本量和置信区间(暂时别看摘要结论),自己判断结论稳不稳,再对照它的结论。

思考题:如果一个效应需要 n = 10000 才勉强显著,它对你个人意味着什么?
SUB · 伪科学识别 / 批判思维
伪科学的五个指纹
Five Fingerprints of Pseudoscience
一句话结论
替代终点冒充硬终点、动物/试管结果直接外推人体、健康光环、只举有利案例、拒绝可证伪——命中越多,越可疑。
证据等级
专家共识 + 经典案例(下引 CAST 试验为硬终点/替代终点冲突的教科书级反例)。
科学背景 + 机制
逐个拆解五指纹:
① 替代终点冒充硬终点——用中间指标代替你真正在乎的结局。反例 CAST 试验(Echt 1991, NEJM):抗心律失常药成功压住了室性早搏(替代终点),却让死亡率翻倍(硬终点);机制再合理也照样致命。
② 外推过度——试管/小鼠有效 ≠ 人有效,且实验剂量常是人类的几十倍。
③ 健康光环——"天然""排毒""增强免疫"等无操作定义的模糊词。
④ 樱桃采摘——只引对自己有利的研究。
⑤ 不可证伪——"没效是你没坚持/毒素太多",无论结果都能自圆其说。
可执行协议
买单前跑一遍"排雷清单":
• 谈的是硬终点(死亡、心梗、骨折)还是某个替代指标?
• 证据来自人体 RCT,还是小鼠、试管、个人体验?
• 有没有具体剂量和可被证伪的预测?
• 卖家是否就是研究者?利益冲突披露了吗?
• 是否堆砌"量子""排毒""提升能量"等无定义术语?
女性特别提示
女性健康是伪科学重灾区:"平衡激素""子宫排毒""经期净化"等多数缺乏 RCT,常拿模糊症状(疲劳、腹胀)当疗效凭据。对孕产、围绝经期的商业方案尤其要追问硬终点与监管状态
常见误区
误区一:"祖传/天然 = 安全有效" — 天然不等于安全(见 Day 45),历史悠久不等于有效。
误区二:"我个人有效就是证据" — 安慰剂、自愈、回归均值都能造出"我试了真有用"的错觉。
关键参考
• Echt DS, et al. (CAST). Mortality and morbidity in patients receiving encainide, flecainide, or placebo. N Engl J Med. 1991;324:781-788.
• Ioannidis JPA. PLoS Med. 2005;2:e124.
本周一试 + 思考题
THIS WEEK
拿一个你正在用或想买的保健方案,照五指纹逐条打勾——中了几条?

思考题:如果一个方案"无论结果如何都能说自己有效",这件事本身说明了什么?
深入思考
① 既然 RCT 最强,为什么营养学几乎没有终身随访的饮食 RCT?
伦理与依从性都不允许:让一群人几十年严格吃某种指定饮食既不现实也不人道。所以营养学天然更依赖队列 + 机制,证据等级本就矮一档——这也是营养结论反复"翻烧饼"的根源。用心血管药物级别的证据去要求营养学并不现实;成熟的做法是学会与"当前最佳可得证据"共处,而非等一个永不到来的完美 RCT。
② 绝对风险很小(NNT 很大)的干预,一定不值得做吗?
不一定。若干预便宜、无害、可全人群推广(如食盐加碘、疫苗),即使个体 NNT 很大,人群层面的绝对获益依然巨大——这就是 Geoffrey Rose 的"预防悖论"。个人视角(我做这件事划算吗)与公共卫生视角(在千万人尺度上划算吗)的最优解常常不同,两者都对,只是问题不同。
③ 预注册和公开数据能根治发表偏倚吗?
能大幅缓解,但难以根治。预注册锁死主要终点、压缩 p-hacking 空间;ClinicalTrials.gov 等强制注册让"消失的阴性试验"更难藏。但阴性结果仍可能不被投稿或不被引用。期刊接受"注册报告"(先审方法、后看结果决定是否刊登)是更彻底的方向。制度在往对的方向走,但读者的怀疑仍不可省。
④ 面对相互矛盾的研究,个体到底该如何行动?
三条启发:其一,看证据层级与一致性——多个高质量研究同向,胜过单个惊艳结果。其二,区分决策类型:"停掉一个有害习惯"对证据的要求可以低,"采纳一个新干预"则要求高。其三,按成本与风险排序:低成本、无害的先试,高成本、高风险的等重复验证。行动不必等到确定,但要与不确定性的大小相称。