中文EN
← Deep Research
深度研究 · 深入版

自动化的反讽:AI 越好,人握的终审越会退化吗?(深入版)

本文是深入版 · 查看易读版(精简直白)→
TL;DR
「自动化越好,人握终审越会退化」在 1983 年是过程控制语境的分析性预言,原文一半篇幅其实是工程处方。40 年后的成绩单:技能退化(剂量依赖、认知先于运动)与警觉上限被证实;automation bias 多源证实且 RCT 因果确立——掺错的 LLM 建议让上过 20 小时 AI 课的医生准确率掉 14 个百分点,资深放射科医生也从 82.3% 掉到 45.5%。2025 年内镜研究首次给出「撤走 AI 后人比从前差」的真实世界信号(ADR 28.4%→22.4%,观察性、待确认),与在场增益(RCT meta RR 1.24)构成部署评估的两本账。40 年没长出「反讽被证伪」派,长出的是缓解文献:亲历失效、结果问责、决策 nudge、可核验性设计有实测效果,叮嘱与通识培训无效;警觉生理、未知故障不可预演、底率数学是三个不可工程化的硬底。十一个可检验主张收尾。
96 票对抗验证 · 32/32 挺过在场 RR 1.24 vs 撤后 -6.0pp可工程化 + 3 个硬底11 个可检验主张

本文的实证引用经过分级验证:32 组承重论断各投 3 票做转述保真核查(逐字核对一手原文、复算口径;96 票 0 组推翻、40 余处口径修正),另对 5 组单源承重实证增设反证搜索席(检索独立团队、独立数据的矛盾/证实测量)与方法学审计席(敌意审稿,有否决权,共 9 份判决)。审计改变了本文多处写法:内镜研究的校正系数因勘误被扣下不引、"认知强制有三重代价"缩水成"实锤只有感知复杂度"、"解释降低过度依赖"被独立测量按上了边界条件。正文标签:【多源证实】=独立团队独立数据的测量同向;【单源已核】=仅此一次测量,转述保真且通过方法学审计;【方向存争】=独立测量互相矛盾;【已核】=对一手原文/官方文件逐字核验的引文与机制性事实;【厂商口径】【行业自报】【未验证,来源】如字面。转述保真 ≠ 事实为真——单源论断的验证天花板是前者,这正是分级存在的原因。文末附来源索引。

0. 一篇 2025 年的医学研究,和一篇 1983 年的预言

2025 年 8 月,《Lancet Gastroenterology & Hepatology》登出一项波兰研究:四家内镜中心引入 AI 息肉检测几个月后,19 名平均从业 28 年的资深医生在不用 AI 做肠镜时,腺瘤检出率从 28.4% 掉到了 22.4%。检出率每掉 1 个百分点,病人的肠癌风险都有可测的对应变化。这是第一次有人把"用了 AI 之后,人自己变差了"和临床质量指标挂上钩——尽管它是观察性研究,一会儿我们要给它做完整的方法学体检。【单源已核;详见第 5 章】

四十二年前,伦敦大学学院的认知心理学家 Lisanne Bainbridge 在一篇只有 5 页的论文《Ironies of Automation》里写下过这个剧本。她说的不是 AI,是化工厂的过程控制,但逻辑一模一样:自动化越先进,留给人的活越是它做不了的疑难杂症;人长期不动手,技能就退化;可系统偏偏指望这个技能已经生锈的人,在自动化失灵的最坏时刻接管一切。她的原话是:"There is no way in which the human operator can check in real-time that the computer is following its rules correctly"——"人类监控者被交付了一项不可能的任务"。【已核】

这个问题对本站不是学术兴趣。《当代码变得便宜》《AI code review》《Scalable oversight 的地基体检》《机器裁判全景》——前几期的结论全部收敛到同一个席位:裁决留给人。如果这个席位本身会在自动化之下腐蚀,整条主线就架在一块酥掉的地基上。所以这一期攻击自己方案最薄的地方:40 年人因工程证据,对"人握终审"到底是判词,还是可工程化的约束?

先把结论放在这里:是约束,可工程化,但有三个不可工程化的硬底;而且每一个有实测效果的杠杆,都带着实测的代价。下面按证据从旧到新过堂。

1. 读数说明:三条防骗规则

这个领域的数字有三个系统性陷阱,本文所有结论都要带着它们读:

2. 原典重读:1983 年那 5 页纸说了什么,没说什么

Bainbridge 1983(Automatica 19(6):775-779)值得逐字重读,因为它被引用了四十年(截至 2023 年底 Google Scholar 约 2,800 次),多数引用者只记住了"反讽"两个字。【已核】

她说了什么。核心反讽:"the more advanced a control system is, so the more crucial may be the contribution of the human operator"——系统越先进,人的贡献越关键,因为设计者"想消灭操作员,却把自己不会自动化的任务留给了人"。技能层:"physical skills deteriorate when they are not used"——长期监控自动化的老手会退化成新手,而接管时刻恰恰要求这个人"比平均更熟练、负荷更低"。警觉层:引 Mackworth 1950 年代的警戒实验,人对少事件信源无法维持有效视觉注意超过约半小时,所以让人盯着一台几乎不出错的机器,是结构性的设计错误。【已核】

她没说什么。她没说"所以自动化是死路"。原文约一半篇幅(§2-3)是工程处方:秒级故障必须有可靠的自动兜底,做不到且失败代价不可接受就不该建这个系统;自动化系统应当"fail obviously"——坏得显眼;用高保真模拟器把应急反应练成过度学习;每个班次保留一段真实的手动操作。换句话说,原典本身就是"约束+缓解清单",纯判词的形象是后人裁剪出来的。【已核】

还有一点后人常忘:这是一篇过程控制语境的分析性论文,几乎没有原始数据。1983 年它是预言;它需要之后四十年的证据来定生死。

3. 实验室 40 年:两个稳健现象,和它们自己承认的缺口

人因工程用两个概念接住了 Bainbridge 的预言:automation complacency(自动化自满:该盯不盯)和 automation bias(自动化偏误:机器说什么信什么)。2010 年 Parasuraman & Manzey 的整合综述是这条线的对账单。【已核】

正面账。奠基实验(Parasuraman, Molloy & Singh 1993,大学生,MATB 多任务平台):自动化恒定可靠时,人对自动化故障的检出率均值只有 33%;可靠性波动时升到 82%;单任务纯监控时约 97%。三个数字合起来是一句话:漏检不是人懒,是多任务下的注意分配——而从不出错的自动化恰恰是最危险的,因为它教会人把注意力挪走。【已核】automation bias 一侧,综述的结论四条款写得很硬:现象跨场景稳健、新手专家都犯(complacency 在平均 440 小时飞行经验者和资深空管身上同样出现)、训练和"请核对"的明确叮嘱都防不住(标准范式下 60 分钟额外练习无效)。【已核】专家不免疫的最狠数据在医疗:资深读片者用乳腺 CAD,机器漏标时,人对"未标注癌"的检出率从无辅助的 46% 掉到 21%——机器的沉默被当成了"无癌"的证据。【已核,Alberdi 2004/2008 经 P&M 2010 转述】

技能衰退侧也有定量底座:Arthur et al. 1998 元分析(53 篇文献、保留区间分析 178 个数据点、N=8,719),不练习的技能损失随停用期加深,一年以上约 δ=-1.27(注意:该档只有 3 个数据点;摘要里流传更广的 -1.4 与正文表格对不上,本文按表格引);认知任务比体能任务掉得快(δ=-1.15 vs -0.75)。这条对 AI 时代是坏消息:AI 自动化的正是认知任务。【单源已核(元分析层)】

反面账——同一篇综述自己列的。complacency 至今没有共识定义;Moray & Inagaki 的批评四十年没被正面回答:不盯一台几乎不出错的机器,可能是理性的注意分配而不是失职——已有研究从未对照"规范采样率"证明人盯得比理性最优少;Lee & See 2004 也没找到"高信任导致差监控"的可信证据。还有上一章说过的:实验室故障率与真实系统差几个数量级。【已核】把这页反面账记住——它是"退化叙事"的证据天花板,第 5 章医疗数据会再撞上它一次。

1993 奠基实验:人抓住自动化故障的比例 自动化恒定可靠 · 人在多任务33%自动化偶尔出错 · 人在多任务82%单任务纯监控(对照条件)约 97%
示意:Parasuraman, Molloy & Singh 1993(大学生、MATB 多任务平台)——从不出错的自动化教会注意力离开;注意实验室故障率远高于真实系统,外推受限(正文第 3 章)

4. 航空:最完整的现场档案,和一个双面判决

航空是唯一一个把"自动化依赖"完整写进事故调查、监管文件、对照实测和干预循环的行业。它的档案是 AI 工作流最好的预习材料。

事故侧。AF447(2009,228 人遇难):自动驾驶因空速管结冰退出、把一架完好的飞机交还给三名飞行员,失速警告连续鸣响 54 秒,两名当班飞行员从未提及它、从未正式识别失速。BEA 最终报告的判词值得逐字抄录:当初始稳杆能力与诊断能力同时丧失,"人当自动化后备"的安全模型进入 "common failure mode"(共因失效)——稳不住导致看不懂,看不懂导致更稳不住。报告把"高空手飞训练不存在"列进致因链:"Current training practices do not fill the gap left by the non-existence of manual flying at high altitude"。【已核】四年后的 Asiana 214:副驾出身的当班机长 9,684 小时、当过教员、通过全部训练检查,NTSB 仍认定其缺乏关键手飞技能——并顺手拆了一个自报口径:航司自称 2012 年 77.7% 的落地是手动的,NTSB 指出该数据没写自动驾驶几时断开,多数机组可能一千英尺以下才接手。"我们仍在大量手飞"的行业自报,和"手飞技能在退化"的官方认定,可以同时成立。【已核】

统计侧。FAA 2013 年的自动化工作组复核 26 起事故+20 起重大事件:超过 60% 的事故报告把手飞差错列为因素;超过 50% 的事故中,调查机构认定飞行员"脱离控制回路、处于实际操作的边缘,因而在需要时没准备好接管"——Bainbridge 的句子几乎原样出现在监管文件里。约四分之一存在对自动化的过度自信。【已核】同年 FAA 发 SAFO 13002,官方在同一段里把两面都写了:自动飞行系统"改善了安全与工作负荷管理",但"持续使用可能导致飞行员快速改出非预期状态能力的退化"。【已核】

对照实测侧。Haslbeck & Hörmann 2016:126 名按机队×资历分层随机抽取的航线飞行员,全动模拟机手飞无指引 ILS 进近——长程机队(手飞机会少)显著差于短程机队,机队主效应 ηp²=.45(航向道 .39/下滑道 .38);且近期练习量比总飞行经验更能预测手飞精度。技能衰退是剂量依赖的,生锈的是"最近没练",不是"飞得不多"。【单源已核】更细的刀在 Casner et al. 2014(16 名飞行员,小样本):杆舵和扫视技能"大体完好",真正退化的是认知层——导航推理、异常识别。该练的是"想",不是"手"。【单源已核(摘要级)】

双面判决。把天平另一端摆上来:自动化时代的航空总体安全性大幅提升——Boeing 统计年报口径,近二十年致命事故率下降 60%、总事故率下降 35%,同期离场量增长超 20%【行业自报(行业标准数据集)】;Airbus 口径,带包线保护的第四代机队近十年零致命失控类(LOC-I)事故,LOC-I 机毁率比第三代低 89%【厂商口径,Airbus 是 FBW 制造商,利益相关】。但注意 AF447 本身就是第四代机——在保护降级(alternate law)之后失事。两句话必须一起说:自动化在总量上救人,同时制造了一种新的、集中在"交还时刻"的失效模式。这不是矛盾,是同一枚硬币。

干预侧(落地打折的教训)。FAA 2013 年后新增 14 CFR 121.423"扩展包线训练"(全失速/非正常姿态改出,2019 年合规)——注意它强制的是极端状态改出,不是日常手飞保持,这恰是审计指出的缺口:DOT 监察长 2016 年发现,FAA 发了"鼓励手飞"的 SAFO 之后,从未核实航司是否真的增加了手飞机会;审查的 19 份模拟机训练计划只有 5 份提及监控技能;且空域现代化让航线上的手飞机会"有限且可能继续减少"。【已核】此后 IATA 报告 2020 与 2025 两个整年全球零 LOC-I 事故【行业自报;因果未经检验,同期多项安全投入并行】。航空的教训一体两面:干预有效的证据存在,干预落地的核查缺席。

5. 医疗:第二份档案,和本文最重要的一张双面图

医疗档案的开头是一个反直觉教训:最著名的"人不听机器"数字,恰恰不是人的失职。药物警报被医生 override 的比例是 49-96%(超量类严重警报约 25%)——但在被复核的案例里,评审专家 95.6% 认同医生 override 有效警报的决定(单研究口径);被 override 的警报中随后观察到不良事件的比例只有 2.3%-6%,且综述并未把这些事件归因于 override 行为本身。高 override 率的主因是警报特异度太差,这是可工程化的告警设计问题,不是终审席位腐蚀。【已核,van der Sijs 2006】这一课与第 3 章 Moray/Inagaki 的"理性采样"批评同向:在给"人不可靠"定罪之前,先检查是不是系统在滥发信号。《机器裁判全景》里 Argus 的底率机制——低错误率×极低底率=误报淹没真报——在医院的告警系统上提前上演了二十年。

但 automation bias 的账是真的。上一代辅助诊断(乳腺 CAD)的规模化数据:Fenton 2007(43 家机构、222,135 名女性、429,345 次筛查),用 CAD 后特异度从 90.2% 降到 87.2%、PPV 从 4.1% 降到 3.2%、活检率涨 19.7%,敏感度提升不显著,整体判读准确度(AUC)用 CAD 反而更低(0.871 vs 0.919)。Lehman 2015(625,625 次筛查、271 名放射科医生):CAD 不改善任何指标;最难赖掉的是组内对比——同一批医生,用 CAD 时敏感度 83.3%,不用时 89.6%。一代人给"给人配个机器提示员"交了学费:辅助没有兑现,行为被改变了。【已核】机制实验补刀:Dratsch 2023,27 名放射科医生读片,AI 建议正确时各经验组准确率约 80%;AI 给出错误建议时,低年资掉到 19.8%、中年资 24.8%、资深 45.5%——"all radiologists, regardless of expertise, can be subject to automation bias",资历只买到部分抵抗力。【单源已核】

然后是 2025 年的内镜双面图——本文的钱图。正面:AI 辅助肠镜在场使用的增益是多源证实的,21 项 RCT、18,232 名患者的 meta 给出 ADR 44.0% vs 35.9%(RR 1.24),腺瘤漏检率相对降 55%,代价只是退镜多 0.47 分钟。【多源证实(RCT meta;ADR 主效应证据确定性标注为低)】反面:开头那项 Budzyń 研究——AI 引入前后,同一批资深医生的无 AI 肠镜 ADR 从 28.4%(226/795)降到 22.4%(145/648),绝对差 -6.0 个百分点(95%CI -10.5 至 -1.6,P=0.009)。【单源已核】

方法学审计席对它的完整判决必须原样交给读者:这是回顾性、单组前后对照的观察性研究,"deskilling"是它提出的假说,不是它证明的机制。三个未排除的替代解释:AI 暴露与时间完全共线(季节性、病例构成漂移、流程变更都分不开);引入后的"无 AI 病例"如何产生并不透明(若是被 AI 抽剩的选择性子集,ADR 下降可以纯粹是选择偏倚);退镜时间——ADR 最强的可改预测子——完全没测。多因素校正后方向不变,但那个被广泛引用的校正系数恰好被一则已发表勘误触及(附录模型漏纳了一个协变量),本文按审计要求不引它的精确值。19 名医生、整体 ADR 低于质控基准,外推受限。反证搜索席的结果:这个临床端点至今零直接独立复现,是单源;邻近的一项克拉科夫研究方向相反(AI 辅助下受训的年轻医生,独立操作 ADR 反而更高),但人群、问题、机构都与 Budzyń 不同且疑似重叠,只能算拉扯不算反驳;机制层(错误提示带偏专家)倒是有放射、病理的跨学科独立证实。ACG 的定性是公允的:一个需要前瞻试验确认的假说。有一个细节反而为它加分:作者群是 AI 肠镜的主力研究者(Mori、Bretthauer 等人同时是那个 RR 1.24 meta 的作者)——这批人的利益方向本该是"证明 AI 有益",他们发表了对自己不利的信号。【方向存争(deskilling 端点单源+邻近反向测量);机制多源】

诚实的读法:在场增益是硬的,撤后退化是真实但未确认的信号。做部署决策的人从今天起要记两本账:AI 在场时的联合表现,和 AI 不在场时(宕机、超范围、迁移)人还剩多少。第二本账,2025 年之前没人记过。

同一项技术的两本账:AI 辅助肠镜的腺瘤检出率(ADR) 账本一:AI 在场时(21 项 RCT 的 meta) 账本二:AI 撤走后(单一观察性研究) 35.9%标准肠镜 44.0%AI 辅助 28.4%引入 AI 前 22.4%引入 AI 后 35.9% → 44.0%(多源证实) 28.4% → 22.4%(待确认假说)
示意:左=Hassan 2023 RCT meta(在场增益,RR 1.24);右=Budzyń 2025(资深医生无 AI 肠镜,-6.0pp,观察性、混杂未除)——部署评估必须同时记两本账(正文第 5 章)

6. AI 时代体检:哪些是证据,哪些是恐慌

2024-2026 年"AI 让人变笨"的研究井喷。这条线的核心价值不是复述它们,是把方法学强度标出来——因为这批研究的质量方差极大,而媒体传播强度与质量几乎无关。

自报层(方向一致,证据最弱)。Lee et al., CHI 2025(微软研究院+CMU,319 名知识工作者、936 个任务实例):对 GenAI 信心越高,自报的批判性思维投入越少。注意三个限定:横断面、自报感知、厂商研究员主导。这篇论文的真正价值在别处——它的引言逐字接上了 1983 年:"As Bainbridge noted, a key irony of automation is that by mechanising routine tasks and leaving exception-handling to the human user, you deprive the user of the routine opportunities to practice their judgement and strengthen their cognitive musculature, leaving them atrophied and unprepared when the exceptions do arise."。四十年前的过程控制预言,被 2025 年的顶会论文原文引用来描述 GenAI——这个连接不是本文拼接的,是文献自己长出来的。【已核】

恐慌层(方法学审计不过关)。MIT Media Lab 的"Your Brain on ChatGPT"(EEG 写作实验)是被媒体放大最狠的一篇:preprint 未同行评审、n=54(关键的第 4 场只有 18 人)、独立方法学评论测算该设计需要约 159 人才有足够检验力、多重比较的 FDR 校正水平未报告、部分子分析每组只有 2-4 篇作文。作者自己在官网 FAQ 里抵制媒体框架:"请不要使用'变笨''脑损伤'这类词"。【已核】Gerlich 2025(n=666)那条"AI 使用与批判性思维负相关"是横断面自报,作者自认无法排除反向因果——批判性思维弱的人本来就更依赖 AI。【已核】历史还提供了一个直接警示:上一轮"科技毁大脑"的旗舰证据、Sparrow 2011 年发在 Science 的"Google 效应"核心实验,在 2018 年 Nature Human Behaviour 的系统复现项目和 2020 年的专门复现中两次复现失败。认知恐慌研究有前科。【已核】

因果层(真 RCT,本线最硬)。Qazi et al.(NEJM AI 2026,单盲 RCT,预注册):44 名完成过 20 小时 AI 素养培训的医生,随机分组读临床病例,拿到掺错 ChatGPT-4o 建议的组,诊断推理准确率比拿到无错建议的组低 14 个百分点(84.9% vs 73.3%,95%CI -18.9 至 -9.1)。随机化允许因果读法:错误建议导致了这次下降,而通识型 AI 培训没能免疫它。【单源已核(量级);方向多源证实——独立团队在胸片(Gaube 2021)和多中心放射实验(2024,n=220,错误建议下准确率掉五六十个百分点)测得同向且更猛的效应】注意审计的两条限定:84.9→73.3 是组间对比不是同批人前后;"培训防不住"只判了这一门 20 小时通识课的死刑——同一课题组的后续 RCT 显示一个行为学 nudge 能把偏差显著拉回 7.6 个百分点,所以正确表述是"通识培训单独不够",不是"培训没用"。

编码层(缺口本身是发现)。截至本文发稿,没有任何已发表研究在职业开发者身上用前后测/纵向设计实测过 AI 导致的技能退化——2026 年 5 月的系统 meta 明确写道"未识别出任何用受控前后设计测量职业开发者技能保持的研究"。现有的全是代码库痕迹(GitClear:复制粘贴行占比 8.3%→12.3%【厂商口径】)和自报(DORA 2024:AI 采用提高伴随自报交付稳定性 -7.2%【行业自报】)。最接近的受控证据有两个,方向相反的注脚:Anthropic 自己的 RCT(52 名工程师学习一个陌生 Python 库)发现 AI 组随后的理解测验得分 50% vs 手写组 67%(d=0.738)——技能形成受损,差距最大在 debugging【单源已核;Anthropic 自研自发】;而初学者研究(Kazemitabaar 2023)发现用 Codex 学编程的孩子撤掉 AI 后并不更差。形成期伤害有信号、存量技能退化零测量——这是全行业最该补的实验,本文结尾会把它写进可检验主张。【方向存争】

AI 建议错误时,放射科医生的判读准确率崩塌(Dratsch 2023) AI 建议正确时 AI 建议错误时 79.7%19.8%低年资组81.3%24.8%中年资组82.3%45.5%资深组
示意:27 名放射科医生读乳腺X光,AI 提示为实验操纵;资历只买到部分抵抗力——「无论资历,所有放射科医生都可能发生 automation bias」(正文第 5 章)

7. 对手方光谱:没有"Bainbridge 错了"派,只有"多难缓解"之争

给正题做体检,必须先找最强对手方。检索的结果本身就是个发现:40 年文献里不存在系统性的"反讽被证伪"阵营。最像对手的 Dekker & Woods 2002 攻击的是"人擅长什么/机器擅长什么"式的功能分配框架(MABA-MABA),他们的替代方案——面向人机协同的联合系统设计——恰恰是"换个框架继续工程化"。40 周年纪念特刊(Ergonomics 2023)的主基调是证实+外推:Endsley 的判词是"Bainbridge 的原警告对 AI 不仅仍然适用,AI 聚焦认知任务的本性还引入了许多新挑战"。【已核】

真正的对手方是三条更细的战线:

其一,"退化叙事夸大了"。第 3 章已列:理性采样批评未被回答、"高信任→差监控"缺可信证据、实验室故障率虚高。加上本章的:lumberjack 元分析(Onnasch et al. 2014,18 个实验)确认了权衡的形状——自动化程度越高,常规表现越好、失效后表现和态势感知越差,跨过"信息分析→行动选择"边界时惩罚陡增(6 项跨界研究里,失效后接管的相关从全样本 -.34 放大到 -.90)——但它全是实验室实验、几乎全是学生被试,作者自己反复提示统计功效不足,后续文献质疑向复杂真实情境的外推。权衡的方向可信,数字不能当铁律搬。【已核(元分析结论);外推受限】

其二,"人在环是安慰剂"——比 Bainbridge 更激进的一派。Ben Green 2022 审查 41 项要求"人工监督算法决策"的政策:实证证据显示人无法履行政策指望的监督功能,人审政策反而为缺陷算法背书、提供虚假安全感。底层实验(Green & Chen 2019,注意是 MTurk 众包被试不是真实法官):被试拿着风险评估的预测仍跑输评估本身,且无法判断自己或算法谁更准。法学界的综合(Crootof, Kaminski & Price 2023)给这个陷阱起了名字——"MABA-MABA 陷阱"(文义转述其核心论点):往回路里插一个人,得到的不是人机之长,而是一个新实体——需要独立监管的混合系统;混合系统非但可能拿不到两边的长处,还可能放大双方的短处、引入新的错误源。但注意这三篇的结论都不是"取消人审",而是"人审必须被设计和检验":Green 提议两阶段制度监督,Crootof 列出人在回路的九类角色再谈怎么管。安慰剂论攻击的是未经设计的人审,不是人审本身。【已核】

其三,overreliance 经济学——对手方里最有建设性的一支。Vasconcelos et al. 2023(5 个实验、迷宫任务)把"人会不会核验 AI"从道德问题变成了经济学问题:过度依赖是核验成本-收益的策略选择——当解释把核验成本真正降到一眼可核对、且自己干很贵时,人就会去核验,过度依赖显著下降。【单源已核(该设置)】反证搜索席的结果把边界画得更清楚:机制层(核验成本是杠杆)有哈佛、KIT、UW 多个独立团队同向【多源证实】,但"解释降低过度依赖"的普适版被独立测量按了相反符号——用特征重要性这类不真正降低核验成本的解释,只在简单任务上有效,难任务上失效甚至反增依赖。宏观底色也要交代:2024 年 Nature Human Behaviour 的 meta(106 项研究)发现人机组合在决策类任务上平均劣于人或 AI 单独的最优者。【方向存争(解释效应);多源证实(机制)】这条线与 《机器裁判全景》的 Argus 机制在同一坐标系里:底率决定误报洪水,核验成本决定人是否真的核验;两个参数都是设计变量,不是人性常数。

8. 可工程化清单:每个杠杆的实测效果与实测代价,和三个硬底

把 40 年的干预证据摊开,能看到一张诚实的记分卡——注意每一行都带着代价栏:

有实测效果的杠杆:

实测无效的杠杆:"请核对 AI 建议"的叮嘱;说教式培训;单纯增加透明度(军方 2026 年实验里透明度反而显著增加工作负荷,"不透明+自愿交接"组合反而最优——n=24,方向仅供警示)。【已核】

尚未走完最后一公里的杠杆:适应性自动化(动态轮换控制权)三十年来反复有效——中段插入 10 分钟手动,随后的监控表现显著回升——并已推进到拟真 ATC 模拟与真机技术演示;但截至 2026 年,仍没有受控的、同行评审的运营环境部署评估。三十年走不完从模拟器到运营的最后一公里,本身就是数据。【已核】

三个不可工程化的硬底:

  1. 警觉的生理学。半小时上限从 Mackworth 一路复现到今天,现代研究还补了一刀:警戒监控不是轻松的无聊,是高负荷的苦役。任何"人全程盯着 AI 干活"的工作流设计,都在跟四十年的警戒文献对赌。【已核】
  2. 未知故障不可预演。Strauch 2018(NTSB 退休调查员):模拟器只能练已知失效模式,而自动化的新失效模式恰恰以"设计者没想到"为定义。训练杠杆有原理性上限。【已核】
  3. 底率数学。自动化越好,故障越稀有;故障越稀有,人的检出越差(33% 那间实验室)、误报占比越高(Argus 那道算术)。终审席位的价值和它的可靠性成反比地此消彼长——这是结构,不是态度问题。

给 AI 工作流的席位设计推论,四个参数:底率(这个席位每天见到的真异常有多少?低于警戒线就别设纯监控席,改抽检+自动兜底);核验成本(核验一条 AI 产出比重做便宜多少?不便宜就重新设计信号);练习剂量(这个人上一次不带 AI 做这件事是什么时候?给剂量,并核查剂量);失效可见性(AI 坏的时候坏得显眼吗?——1983 年的"fail obviously"在 LLM 时代变成了最难也最值钱的一条,因为 LLM 的失效模式恰恰是"错得流畅")。

干预杠杆记分卡:40 年实测 有实测效果(各有代价) 实测无效 亲历 AI 失效的演习(非口头告知)对总体结果的个人问责决策时点的行为 nudge把核验成本降到一眼可核对定期手动剂量(需核查落地)认知强制:子任务层有效,感知更复杂叮嘱「请核对 AI 建议」说教式培训 / 20 小时通识课单纯增加透明度 缺最后一公里 适应性自动化(动态轮换控制权): 模拟环境有效 30 年,无运营部署评估
示意:每条的效应量、边界条件与代价见正文第 8 章;「有效」不等于普适,多数效应依设计而定

9. 结论:十一个可检验主张

按证据强度排序:

  1. 错误建议当下把人带偏(automation bias)是多源证实+因果确立的:RCT 测得 -14pp(医生、掺错 LLM 建议),独立团队在放射(-55~-69pp)、乳腺读片(资深组也掉到 45.5%)同向;资历只买部分抵抗。【多源证实+RCT】
  2. "在场增益"与"撤后退化"是两本账:AI 辅助在场的增益有 RCT meta(ADR RR 1.24);撤后退化只有一项观察性研究(-6.0pp)。部署评估必须同时记两本账——第二本账今天几乎没人记。【多源证实 vs 单源已核】
  3. 恒定高可靠是最危险区间:33% vs 82% vs 97% 的注意分配机制,加上 70%±14% 的依赖盈亏线——低于线别依赖,高于线防自满,"几乎从不出错"是自满的最优培养基。实验室故障率外推的硬伤同时记入。【已核(实验室)】
  4. 技能衰退剂量依赖、认知先于运动:停用一年 δ≈-1.27、认知任务掉得比体能快 0.4 个标准差;手飞精度跟着近期练习量走;退化集中在认知层。AI 自动化的正是认知任务。【单源已核(各研究)】
  5. 1983 年的四个反讽,2026 年的成绩单:技能退化——证实(航空对照实测+元分析);警觉上限——证实(实验室稳健);"最需要人时人最不在状态"——现场档案强支持(AF447/FAA 统计);"实时核查更强系统不可能"——仍是分析性论断,但 scalable oversight 一期的证据与它同向。【已核】
  6. 反对派缺席是个信号:40 年没有长出"反讽被证伪"的文献,长出的是"怎么缓解"的文献;40 周年特刊的判词是对 AI 仍适用且更适用。【已核】
  7. 通识培训单独不够,有效的是亲历失效、问责、nudge、可核验性设计——每条都有实测效应量,也都有代价或边界条件;"加摩擦"不是万灵药,效果依设计而定。【多源证实(方向)】
  8. 高 override 率≠人失职:95.6% 的 override 被专家认同;先查告警特异度,再谈人的可靠性。给终审席位定罪之前,先审系统的底率与信号质量。【已核】
  9. "人在环"作为合规安慰剂的批评成立,但矛头指向"未经设计的人审":插人不产生安全,设计+检验人的角色才产生。九类角色是起点清单。【已核】
  10. AI 时代的恐慌研究大多撑不住方法学审计(功效不足、横断面、自报;上一轮"Google 效应"复现失败在先),但最硬的几个新信号恰好都指向 Bainbridge 方向(内镜观察、掺错 RCT、技能形成 RCT)。恐慌不可信,警报可信。【已核+方向存争】
  11. 职业开发者的存量技能退化至今零测量——2026 年 meta 确认这个格子是空的。这是眼下最值得做的实验:前后测、纵向、以"撤掉 AI 后的独立表现"为终点。【已核(缺口)】

值得盯的后续判据:Budzyń 的前瞻复测(ACCEPT 试验族或独立团队)何时出现、方向是否保持;职业开发者前后测何时有人做;适应性自动化能否拿出第一份运营环境的部署评估;LLM 工作流里第一批"fail obviously"设计(失效可见性工程)的实测数据。


1983 年四个反讽的 2026 成绩单 技能不用则退化,监控者由老手变新手证实:航空对照实测 + 技能衰退元分析人对少事件信源的警觉撑不过约半小时证实:警戒实验稳健复现四十年最需要人接管时,人恰恰最不在状态现场档案强支持:AF447 / FAA 事故统计人无法实时核查一台比自己强的机器仍是分析性论断;scalable oversight 证据同向
示意:「证实」指方向获独立证据支持,非逐字量化;分级与出处见正文各章与第 9 章

附:主要来源

原典与理论:Bainbridge, "Ironies of Automation", Automatica 19(6):775-779, 1983(原文逐字核对) · Parasuraman & Riley 1997, Human Factors 39(2) · Parasuraman & Manzey 2010, Human Factors 52(3):381-410(全文逐字核对;Alberdi/Bahner/Skitka/Wickens&Dixon 数字经其转述) · Endsley 1995, Human Factors 37(1);Endsley & Kiris 1995(经作者 1996 书章) · Arthur et al. 1998, Human Performance 11(1):57-101(原文含 Table 3/4) · Warm, Parasuraman & Matthews 2008, Human Factors 50(3)

航空档案:BEA, AF447 Final Report (2012)(逐字核对) · NTSB AAR-14/01 (Asiana 214) · FAA PARC/CAST, Operational Use of Flight Path Management Systems (2013) · FAA SAFO 13002 · DOT OIG AV-2016-013 · Haslbeck & Hörmann 2016, Human Factors 58(4)(DLR 自存档全文) · Casner et al. 2014, Human Factors 56(8) · Boeing Statistical Summary 1959-2025(2026-04 版) · Airbus Commercial Aviation Accidents 1958-2025(2026-02 版) · IATA Safety Report 新闻稿(2026-03)

医疗档案:van der Sijs et al. 2006, JAMIA 13(2)(PMC 全文) · Fenton et al. 2007, NEJM 356:1399 · Lehman et al. 2015, JAMA Intern Med 175(11)(PMC 全文) · Alberdi et al. 2004, Academic Radiology 11(8) · Dratsch et al. 2023, Radiology 307(4):e222176(出版社原版逐字核对) · Budzyń et al. 2025, Lancet Gastroenterol Hepatol 10(10):896-903(付费墙;数字经 ACG 评论+机构新闻稿双源交叉;勘误 2025-09-11 与多篇 correspondence(封数未逐一核实)+ 作者回复已记录) · Hassan et al. 2023, Ann Intern Med 176(9) · Zhou, ACG Evidence-Based GI 评论(2025-09) · Orzeszko et al. 2025, Surgical Endoscopy(反证席检得)

AI 时代:Lee, Sarkar, Tankelevitch et al., CHI 2025(全文逐字核对) · Qazi et al., NEJM AI 2026;3(5), DOI 10.1056/AIoa2501001(原 medRxiv 2025.08.23.25334280;后续 nudge RCT NCT07328815) · Gaube et al. 2021, npj Digital Medicine · Kosmyna et al., arXiv:2506.08872 与 brainonllm.com FAQ;方法学评论 arXiv:2601.00856 · Gerlich 2025, Societies 15(1):6(勘误 Societies 15(9):252)与 Data 10(11):172 · Sparrow et al. 2011, Science;Camerer et al. 2018, Nature Human Behaviour;Hesselmann 2020, PeerJ 8:e10325 · Shen & Tamkin, Anthropic Research(2026-01-29)【厂商自研】 · Yan et al., arXiv 2605.04779(meta)· GitClear 2025【厂商口径】 · DORA 2024【行业自报】 · Kazemitabaar et al., CHI 2023

对手方与干预:Dekker & Woods 2002, Cognition Technology & Work 4(4)(引句经二手核对,原文付费墙) · Read & Waterson (eds.), Ergonomics 66(11) 40 周年特刊;Endsley 2023 同刊 · Strauch 2018, IEEE THMS 48(5)(全文) · Onnasch, Wickens, Li & Manzey 2014, Human Factors 56(3) · Buçinca, Malaya & Gajos 2021, PACM HCI 5(CSCW1) Art.188(全文+Table 2/3 复核) · Vasconcelos et al. 2023, PACM HCI 7(CSCW1) Art.129(全文) · Zhang et al. 2024, Mensch und Computer(反证席检得) · Fok & Weld 2023 · Schemmer et al., IUI 2023 · Vaccaro, Almaatouq & Malone 2024, Nature Human Behaviour · Green 2022, CLSR 45 · Green & Chen 2019, ACM FAT* · Crootof, Kaminski & Price 2023, Vanderbilt Law Review 76(2) · Parasuraman, Mouloua & Molloy 1996, Human Factors 38(4) · USAARL-TECH-TR-2026-02 · Bahner et al. 2008 / Skitka et al. 2000(经 P&M 2010)

调研材料与全部验证判定存于研究底座(本地 ~/design/deep-research-runs/automation-irony/):32 组承重论断 × 3 票共 96 票转述保真核查,5 组单源实证 × 反证搜索席+方法学审计席共 9 份判决,全部记录在案,含内镜校正系数的扣引决定与全部口径修正。