← Deep Research
深度研究 · 易读版
AI 越好用,人越不中用?一个 42 年前就被预言的问题(易读版)
TL;DR
AI 在场时人机组合更强,撤走后人可能比从前更差——评估 AI 部署要记两本账。从不出错的自动化最危险(故障检出 33% vs 82%);AI 说错时专家也跟着错,20 小时 AI 课防不住(-14 个百分点);技能停用就生锈,且脑子锈得比手快。有效的招:亲历失效、结果问责、决策时提醒、把核对做便宜;没用的招:口头叮嘱和说教课。三条绕不开的底线:盯梢撑不过半小时、未知故障没法预演、AI 越好人的检出越差。
从不出错的自动化:检出 33% vs 82% 20 小时 AI 课防不住:-14pp 资深医生也掉到 45.5% 撤走 AI 后:28.4%→22.4%
本文是同名深入版的精简版。所有关键数字经过分级核查(96 票逐字保真验证 + 9 份反证搜索与方法学审计判决——审计扣下了一个被广泛引用但被勘误波及的系数,也给几个流行结论加上了边界)。想看完整论证、证据分级和出处,请读深入版。
一位医生的检出率,和一篇 5 页的老论文
2025 年,顶级医学期刊登了一项让整个行业发凉的研究:四家医院引入 AI 帮医生在肠镜里找息肉,几个月后,19 位平均干了 28 年的老医生不用 AI 时的检出率,从 28.4% 掉到了 22.4%。AI 在场时人机组合确实更强——可这项观察性研究给出的信号是:AI 一撤走,人比从前更差了。(观察性意味着混杂未除,后文会给它做完整体检。)
这个剧本其实 1983 年就写好了。一位英国心理学家在 5 页纸里预言:自动化越先进,人越只剩下"盯着它、出事时接管"这个活;可技能不用就生锈,盯着一台几乎不出错的机器人又根本盯不住——系统最需要人的那一刻,恰恰是人最不在状态的一刻。 她管这个叫"自动化的反讽"。
我们做这期研究,是因为本站前几期的结论全都落在"最后由人拍板"上。如果"拍板的人"会被 AI 泡软,那我们等于把房子盖在酥掉的地基上。所以这期把 40 年的证据翻了个底朝天:这个反讽,到底是死刑判决,还是可以设计绕开的约束?
答案先给:是约束,能设计,但有三条底线绕不开;而且每个有效的招,都有它的价格。
同一项技术的两本账:AI 辅助肠镜的腺瘤检出率(ADR)
账本一:AI 在场时(21 项 RCT 的 meta)
账本二:AI 撤走后(单一观察性研究)
35.9% 标准肠镜
44.0% AI 辅助
28.4% 引入 AI 前
22.4% 引入 AI 后
35.9% → 44.0%(多源证实)
28.4% → 22.4%(待确认假说)
示意:左=Hassan 2023 RCT meta(在场增益,RR 1.24);右=Budzyń 2025(资深医生无 AI 肠镜,-6.0pp,观察性、混杂未除)——部署评估必须同时记两本账(正文第 5 章)
40 年证据最狠的几刀
从不出错的自动化,最危险。 经典实验:让人一边干活一边盯着自动系统,系统偶尔出错时,人能抓住 82% 的故障;系统一直很可靠 时,只能抓住 33%。不是人懒——是"它从不出错"教会了你的注意力离开。所以最危险的不是烂 AI,是几乎从不犯错的好 AI。
机器一说错,专家也跟着错。 27 名放射科医生读片子,AI 提示正确时大家准确率都在 80% 左右;AI 故意给错提示时,年轻医生掉到 20%,连最资深的组也掉到 45%。2026 年一项随机试验更扎心:44 名专门上过 20 小时 AI 课 的医生,拿到掺了错的 ChatGPT 建议,诊断准确率还是被拉低了 14 个百分点——上课防不住这个。
技能生锈快,而且先锈"脑子"。 元分析:技能停用一年以上,水平掉掉超过一个标准差;认知类技能比动手类掉得更快。航空的实测更具体:手飞得准不准,跟"最近练没练"关系最大,跟"总共飞过多少小时"关系不大;而且真正退化的不是手上功夫,是导航推理、异常识别这些判断力 。坏消息:AI 自动化的恰恰就是判断类工作。
航空把整个剧本演完了。 法航 447:自动驾驶把一架完好的飞机交还给三名飞行员,失速警告连响 54 秒,没人提它一句,228 人遇难。事故报告的判词是:靠"人当自动化的后备"的安全模型,会进入"共因失效"——稳不住导致看不懂,看不懂导致更稳不住。美国监管机构复核 26 起事故:六成以上有手飞差错,一半以上飞行员"脱离了控制回路,需要时没准备好接管"。但另一半也要说 :自动化时代的航空总体安全性大幅提升,致命事故率二十年降了 60%。自动化在总量上救人,同时把风险集中到了"交还给人的那一刻"。
1993 奠基实验:人抓住自动化故障的比例
自动化恒定可靠 · 人在多任务 33% 自动化偶尔出错 · 人在多任务 82% 单任务纯监控(对照条件) 约 97%
示意:Parasuraman, Molloy & Singh 1993(大学生、MATB 多任务平台)——从不出错的自动化教会注意力离开;注意实验室故障率远高于真实系统,外推受限(正文第 3 章)
但先别急着给"人"定罪
有两个流行数字,查完发现冤枉了人:
"医生 90% 以上无视系统警报"——真相是,专家复核这些"无视"时,95.6% 认为医生做得对。问题出在警报系统乱叫,不是人失职。先查系统是不是在滥发信号,再谈人靠不靠谱。 "研究证明 AI 让人变笨"——2024 年以来刷屏的那几篇,大多撑不住方法学审查:MIT 那篇脑电研究是未评审的预印本,样本 54 人,独立测算说这种设计需要约 159 人才够检验力,连作者自己都在官网求媒体"别用变笨这个词"。上一轮"Google 让人记性变差"的明星研究,后来两次复现失败。恐慌文章不可信;但可信的警报(上面那几刀)恰好也指向同一个方向。
有效的招和它们的价格
40 年攒下来的干预记分卡,每行都带价格:
让人亲身经历 AI 出错,有效。 培训里只说"AI 可能出错",没用;演习中让人真的被 AI 坑一次、当场抓到,自满显著下降。(那门 20 小时的课就是前者的下场。)让人对结果负责,有效。 明确"这单最终算你的",漏检和盲从都显著下降。强制先想后看,部分有效。 先让人自己判断、再看 AI 答案,能把"跟着 AI 错"明显压低——价格是大家觉得更费劲,而且这招对偏见类错误有一次独立实验测出无效:加摩擦不是万灵药,得看设计。 把"核对"做便宜,有效。 人不核对 AI,多数时候是因为核对跟重做一样贵。把 AI 的输出设计成一眼能验对错的形式,人就真的会去验。给拍板的人配一条比重做便宜得多的核对路径,是最值钱的一条设计。 保持"手动剂量",有效但常落空。 定期不带 AI 做一遍,技能就保得住——航空的教训是:监管发文鼓励手飞,三年后审计发现没人核实航司真的照做了。开处方没用,要看着把药吃下去。
三条绕不开的底线: 人盯着几乎不出事的东西,撑不过半小时,这是生理;演习只能练"已知的故障",而自动化的新故障恰恰是没人想到过的;AI 越好、故障越稀有,人的检出就越差、误报占比就越高——终审席位的价值,和它的可靠性天生互相消耗。
所以给 AI 工作流设计"人拍板"席位,要问四个问题:这个席位每天见到几个真问题(太少就别设全职盯梢,改抽检+自动兜底)?核对一条 AI 产出比重做便宜多少?这个人上次不带 AI 干这活是什么时候?AI 坏的时候,坏得显眼吗? ——最后这条在大模型时代最难也最值钱,因为大模型的特长是"错得流畅"。
干预杠杆记分卡:40 年实测
有实测效果(各有代价)
实测无效
亲历 AI 失效的演习(非口头告知) 对总体结果的个人问责 决策时点的行为 nudge 把核验成本降到一眼可核对 定期手动剂量(需核查落地) 认知强制:子任务层有效,感知更复杂 叮嘱「请核对 AI 建议」 说教式培训 / 20 小时通识课 单纯增加透明度
缺最后一公里
适应性自动化(动态轮换控制权):
模拟环境有效 30 年,无运营部署评估
示意:每条的效应量、边界条件与代价见正文第 8 章;「有效」不等于普适,多数效应依设计而定
这篇文章的判断,怎么检验
深入版结尾有十一条可检验主张,按证据强弱排序,这里用大白话重写:
AI 给错建议会把人带偏,这是板上钉钉 (随机试验+多个独立团队,医生掉 14 到 69 个百分点不等);资历深只能少掉点,免疫不了。"用的时候更强"和"撤走后更差"是两本账 :前者证据很硬(几十个随机试验),后者目前只有一项观察性研究。上 AI 之前,两本都得记。几乎从不出错的自动化最危险 ——33% 对 82% 那个实验;太烂的别依赖,太好的防自满。技能停用就生锈,脑子锈得比手快 ;保鲜靠"最近练过",不靠"当年练得多"。1983 年的预言,成绩单大体是"应验" :技能退化、警觉上限、"最需要人时人最不在状态"都有了实证;只有"人没法实时核查比自己强的系统"还停在推理层。40 年没长出"预言错了"的学派 ,只长出了"怎么缓解"的文献——40 周年纪念特刊的判词是:对 AI 更适用。通识型培训单独没用,有用的是:亲历失效、结果问责、决策时的小提醒、把核对做便宜 ——每招都有实测效果,也都有价格或边界。人"无视警报"多数时候是对的 (95.6% 被专家认同)——先修系统,再怪人。"流程里塞个人"不等于安全 :没设计过的人审是合规安慰剂;人的角色要先设计、再检验。"AI 让人变笨"的爆款研究大多不合格,但最扎实的几个新证据确实都指向坏方向 ——别信恐慌,信警报。程序员这行至今没人测过 :没有任何已发表研究对职业开发者做过"用 AI 前后"的技能对照——这是眼下最该做的实验。
值得盯什么: 那项内镜研究有没有人做前瞻复测、方向保不保得住;谁第一个测职业开发者的技能存量;"AI 坏得显眼"这类失效可见性设计,什么时候有第一批实测数据。
最要紧的几件事
评估 AI 部署,从今天起记两本账:AI 在场时的联合表现 ,和 AI 不在场时人还剩多少 。第二本账 2025 年之前没人记过,而它决定了宕机日、超范围任务和下一次迁移时你手里还有什么。 别给团队排"全职盯着 AI"的岗——那是在跟 40 年的警觉研究对赌。改成抽检、自动兜底、外加定期"不带 AI 上手"的保鲜剂量,并且核查剂量真的发生了 。 培训预算别花在"AI 可能出错"的课件上,花在让人真的被坑一次 的演习上;再省一点,花在决策时点的一句提醒上——都比课便宜,都比课有效。 把每条送到"拍板人"面前的 AI 产出,配一条比重做便宜得多的核对路径 ;做不到,就说明这个席位是摆设。 最后记住这句:自动化在总量上救人,同时把风险集中到交还给人的那一刻。 两句都对,缺一句都是谎言。