中文EN
← Deep Research
深度研究 · 易读版

AI 越好用,人越不中用?一个 42 年前就被预言的问题(易读版)

本文是易读版 · 查看深入版(完整论证与出处)→
TL;DR
AI 在场时人机组合更强,撤走后人可能比从前更差——评估 AI 部署要记两本账。从不出错的自动化最危险(故障检出 33% vs 82%);AI 说错时专家也跟着错,20 小时 AI 课防不住(-14 个百分点);技能停用就生锈,且脑子锈得比手快。有效的招:亲历失效、结果问责、决策时提醒、把核对做便宜;没用的招:口头叮嘱和说教课。三条绕不开的底线:盯梢撑不过半小时、未知故障没法预演、AI 越好人的检出越差。
从不出错的自动化:检出 33% vs 82%20 小时 AI 课防不住:-14pp资深医生也掉到 45.5%撤走 AI 后:28.4%→22.4%

本文是同名深入版的精简版。所有关键数字经过分级核查(96 票逐字保真验证 + 9 份反证搜索与方法学审计判决——审计扣下了一个被广泛引用但被勘误波及的系数,也给几个流行结论加上了边界)。想看完整论证、证据分级和出处,请读深入版。

一位医生的检出率,和一篇 5 页的老论文

2025 年,顶级医学期刊登了一项让整个行业发凉的研究:四家医院引入 AI 帮医生在肠镜里找息肉,几个月后,19 位平均干了 28 年的老医生不用 AI 时的检出率,从 28.4% 掉到了 22.4%。AI 在场时人机组合确实更强——可这项观察性研究给出的信号是:AI 一撤走,人比从前更差了。(观察性意味着混杂未除,后文会给它做完整体检。)

这个剧本其实 1983 年就写好了。一位英国心理学家在 5 页纸里预言:自动化越先进,人越只剩下"盯着它、出事时接管"这个活;可技能不用就生锈,盯着一台几乎不出错的机器人又根本盯不住——系统最需要人的那一刻,恰恰是人最不在状态的一刻。她管这个叫"自动化的反讽"。

我们做这期研究,是因为本站前几期的结论全都落在"最后由人拍板"上。如果"拍板的人"会被 AI 泡软,那我们等于把房子盖在酥掉的地基上。所以这期把 40 年的证据翻了个底朝天:这个反讽,到底是死刑判决,还是可以设计绕开的约束?

答案先给:是约束,能设计,但有三条底线绕不开;而且每个有效的招,都有它的价格。

同一项技术的两本账:AI 辅助肠镜的腺瘤检出率(ADR) 账本一:AI 在场时(21 项 RCT 的 meta) 账本二:AI 撤走后(单一观察性研究) 35.9%标准肠镜 44.0%AI 辅助 28.4%引入 AI 前 22.4%引入 AI 后 35.9% → 44.0%(多源证实) 28.4% → 22.4%(待确认假说)
示意:左=Hassan 2023 RCT meta(在场增益,RR 1.24);右=Budzyń 2025(资深医生无 AI 肠镜,-6.0pp,观察性、混杂未除)——部署评估必须同时记两本账(正文第 5 章)

40 年证据最狠的几刀

从不出错的自动化,最危险。经典实验:让人一边干活一边盯着自动系统,系统偶尔出错时,人能抓住 82% 的故障;系统一直很可靠时,只能抓住 33%。不是人懒——是"它从不出错"教会了你的注意力离开。所以最危险的不是烂 AI,是几乎从不犯错的好 AI。

机器一说错,专家也跟着错。27 名放射科医生读片子,AI 提示正确时大家准确率都在 80% 左右;AI 故意给错提示时,年轻医生掉到 20%,连最资深的组也掉到 45%。2026 年一项随机试验更扎心:44 名专门上过 20 小时 AI 课的医生,拿到掺了错的 ChatGPT 建议,诊断准确率还是被拉低了 14 个百分点——上课防不住这个。

技能生锈快,而且先锈"脑子"。元分析:技能停用一年以上,水平掉掉超过一个标准差;认知类技能比动手类掉得更快。航空的实测更具体:手飞得准不准,跟"最近练没练"关系最大,跟"总共飞过多少小时"关系不大;而且真正退化的不是手上功夫,是导航推理、异常识别这些判断力。坏消息:AI 自动化的恰恰就是判断类工作。

航空把整个剧本演完了。法航 447:自动驾驶把一架完好的飞机交还给三名飞行员,失速警告连响 54 秒,没人提它一句,228 人遇难。事故报告的判词是:靠"人当自动化的后备"的安全模型,会进入"共因失效"——稳不住导致看不懂,看不懂导致更稳不住。美国监管机构复核 26 起事故:六成以上有手飞差错,一半以上飞行员"脱离了控制回路,需要时没准备好接管"。但另一半也要说:自动化时代的航空总体安全性大幅提升,致命事故率二十年降了 60%。自动化在总量上救人,同时把风险集中到了"交还给人的那一刻"。

1993 奠基实验:人抓住自动化故障的比例 自动化恒定可靠 · 人在多任务33%自动化偶尔出错 · 人在多任务82%单任务纯监控(对照条件)约 97%
示意:Parasuraman, Molloy & Singh 1993(大学生、MATB 多任务平台)——从不出错的自动化教会注意力离开;注意实验室故障率远高于真实系统,外推受限(正文第 3 章)

但先别急着给"人"定罪

有两个流行数字,查完发现冤枉了人:

有效的招和它们的价格

40 年攒下来的干预记分卡,每行都带价格:

三条绕不开的底线:人盯着几乎不出事的东西,撑不过半小时,这是生理;演习只能练"已知的故障",而自动化的新故障恰恰是没人想到过的;AI 越好、故障越稀有,人的检出就越差、误报占比就越高——终审席位的价值,和它的可靠性天生互相消耗。

所以给 AI 工作流设计"人拍板"席位,要问四个问题:这个席位每天见到几个真问题(太少就别设全职盯梢,改抽检+自动兜底)?核对一条 AI 产出比重做便宜多少?这个人上次不带 AI 干这活是什么时候?AI 坏的时候,坏得显眼吗?——最后这条在大模型时代最难也最值钱,因为大模型的特长是"错得流畅"。

干预杠杆记分卡:40 年实测 有实测效果(各有代价) 实测无效 亲历 AI 失效的演习(非口头告知)对总体结果的个人问责决策时点的行为 nudge把核验成本降到一眼可核对定期手动剂量(需核查落地)认知强制:子任务层有效,感知更复杂叮嘱「请核对 AI 建议」说教式培训 / 20 小时通识课单纯增加透明度 缺最后一公里 适应性自动化(动态轮换控制权): 模拟环境有效 30 年,无运营部署评估
示意:每条的效应量、边界条件与代价见正文第 8 章;「有效」不等于普适,多数效应依设计而定

这篇文章的判断,怎么检验

深入版结尾有十一条可检验主张,按证据强弱排序,这里用大白话重写:

  1. AI 给错建议会把人带偏,这是板上钉钉(随机试验+多个独立团队,医生掉 14 到 69 个百分点不等);资历深只能少掉点,免疫不了。
  2. "用的时候更强"和"撤走后更差"是两本账:前者证据很硬(几十个随机试验),后者目前只有一项观察性研究。上 AI 之前,两本都得记。
  3. 几乎从不出错的自动化最危险——33% 对 82% 那个实验;太烂的别依赖,太好的防自满。
  4. 技能停用就生锈,脑子锈得比手快;保鲜靠"最近练过",不靠"当年练得多"。
  5. 1983 年的预言,成绩单大体是"应验":技能退化、警觉上限、"最需要人时人最不在状态"都有了实证;只有"人没法实时核查比自己强的系统"还停在推理层。
  6. 40 年没长出"预言错了"的学派,只长出了"怎么缓解"的文献——40 周年纪念特刊的判词是:对 AI 更适用。
  7. 通识型培训单独没用,有用的是:亲历失效、结果问责、决策时的小提醒、把核对做便宜——每招都有实测效果,也都有价格或边界。
  8. 人"无视警报"多数时候是对的(95.6% 被专家认同)——先修系统,再怪人。
  9. "流程里塞个人"不等于安全:没设计过的人审是合规安慰剂;人的角色要先设计、再检验。
  10. "AI 让人变笨"的爆款研究大多不合格,但最扎实的几个新证据确实都指向坏方向——别信恐慌,信警报。
  11. 程序员这行至今没人测过:没有任何已发表研究对职业开发者做过"用 AI 前后"的技能对照——这是眼下最该做的实验。

值得盯什么:那项内镜研究有没有人做前瞻复测、方向保不保得住;谁第一个测职业开发者的技能存量;"AI 坏得显眼"这类失效可见性设计,什么时候有第一批实测数据。

最要紧的几件事