中文EN
← Deep Research
深度研究 · 易读版

「95% 的 AI 试点都失败了」?这个数字连自己的报告都撑不住(易读版)

本文是易读版 · 查看深入版(完整论证与出处)→
TL;DR
「95% 的 AI 试点失败」连自己的报告都撑不住:报告里那是三个对不上的说法,「成功」的定义是访谈里有人夸,样本只有 52 家访谈加 153 份会议问卷,而写报告的人正在卖报告推荐的解药。同一个问题换把尺子,答案从 99% 成功变 6% 成功——成功率是尺子的函数。政府数据的三句话:用得快、用得浅、藏着用(57% 的员工瞒着老板用 AI)。高失败率数字配权威署名是三十年老配方:85% 是删掉的推特,95% 在风投行业有一模一样的先例。看到下一个失败率,先问三件事:分母是什么?失败怎么定义?说这话的人卖什么?
成功的定义:「有人夸」换把尺子:99% ↔ 6%中位 AI 支出 $11.38/人/月57% 员工藏着用

本文是同名深入版的精简版。所有关键数字都经过独立核查,想看完整论证和出处请读深入版。

一句吓崩股市的话

2025 年 8 月 18 日,Fortune 发了篇报道:"MIT 报告:95% 的企业生成式 AI 试点正在失败。"第二天,AI 股集体回调,Nvidia 跌 3.5%,Palantir 跌了近 9%。从那周起,"95% 的 AI 试点失败"成了这个行业被引用最多的数字——董事会里、研报里、卖你 AI 方案的销售嘴里,都是它。

这篇文章去把原始报告找来,逐字读了一遍,又把这个数字流传一年的每一站都查了一遍。结论先给:这个数字连它自己的报告都撑不住;但它背后有一个真问题,值得认真回答。

报告里到底写了什么

那份报告叫《The GenAI Divide》,MIT 的 Project NANDA 小组出品,26 页,版本号 v0.1,自己写着"初步发现"。拆开看,有四件事媒体从来不提:

第一,"95%"在报告里是三个对不上的说法。开头说"95% 的组织零回报";正文里唯一有数据图的 5%,说的是"定制企业 AI 工具"的漏斗——60% 的组织考察过这类工具,20% 试点了,5% 用进了生产。"没用进生产"和"零回报"是两回事:一家公司的定制工具黄了,员工可能正用着 ChatGPT 省下真金白银——这恰恰是报告自己测到的(见第四点)。顺带一提:漏斗里 80% 的组织压根没试点过,"95% 的试点失败"这句话里的"试点",大多数根本没发生;真去试了的公司里,成功率是四分之一。

第二,"成功"的定义是"有人夸"。报告原文:成功=用户或高管"评价说"带来了显著且持续的生产率或利润影响。不是看财务数据,是访谈里有没有人这么说。附录里还有另一套定义(六个月内有可测 KPI),两套对不上。报告自己承认:这些数字"方向上准确",六个月的窗口"可能低估成功率"。

第三,样本小得惊人。52 家机构的访谈,加四场行业会议现场收的 153 份问卷。就这些。而且报告的"审稿人"一栏写的是第四作者自己——自己审自己。

第四,报告里还有一批方向相反的数据,没人转述。90% 的受访公司里,员工在私下用个人 AI 工具干活,报告原话是"几乎每个人都在用",而且这种私下使用"常常比正式项目回报更好";通用聊天工具的试点转化率约 83%——是个成功故事。同一份报告,既能读出"AI 全面失败",也能读出"AI 无处不在",取决于你摘哪一句。

同一份报告里的两条漏斗(NANDA 2025,占全体受访组织比例) 定制/任务专用工具 通用 LLM 聊天工具 调研过60%80%进入试点20%50%用进生产5%40% 同一对 95%/5% 被套在三个构念上:①95% 组织「零回报」 ②5% 的 integrated pilots 提取价值 ③定制工具 5% 进生产——三者互不等价,分子从「未进生产」被改写成「零回报」
示意:报告的头条数字来自左边的漏斗(定制工具 5% 进生产),被执行摘要改写成「95% 组织零回报」;右边通用工具约 83% 的试点转化率几乎无人转述(条长按百分比等比)

数字出门就变形了

流言变形通常要传好几手。这次不用——第一篇报道就变了。报告说"95% 的组织零回报",Fortune 标题写成"95% 的试点在失败";报告的样本是"52 家访谈+153 份问卷",Fortune 写成"150 个访谈+350 名员工调查"——这组数字在公开的报告里不存在,却被几十家媒体照抄,一年过去,没有一家更正。

再往后就是标准剧本:限定语一层层脱落,"95% 的生成式 AI 试点(六个月内没有可测利润影响)"最后变成"95% 的 AI 项目失败";出身也一路升格,从"NANDA 项目组初步发现"变成"MIT 研究"再变成"MIT Media Lab 研究"。到 2026 年,还杂交出了一个没有任何出处的新数字:"90% 的企业 AI 实施失败"。

写报告的人在卖什么

Project NANDA 是个做 AI agent 基础设施的项目。报告的诊断是:AI 试点失败,因为工具不会学习;解药是会记忆、能自适应的 agentic AI——而这正是 NANDA 自己在建的东西。报告正文两次把自家协议列为解决方案,结论一章建议企业"开始和供应商合作"。做深度复盘的 80,000 Hours 说得直白:四位作者全都在开发或销售报告推荐的那类框架,而报告顶着 MIT 的牌子,没有任何利益冲突披露。

批评者不少,而且都是具名的:Wharton 教授 Werbach 公开要求"公布完整数据,否则应该撤稿"。一年过去,回应是零:没有数据,没有更正,没有续作,MIT Media Lab 那个小组的出版物页面上根本不列这份报告。

还有一个对照:同一年,MIT 还有一篇方向相反的爆款研究——"AI 让材料发现提速",被大学者背书、被国会引用,后来 MIT 自己声明对其数据"没有信心",要求撤下(批评者称数据造假)。2025 年最出圈的两个"MIT 数字",一个唱衰一个唱多,全都没过体检。机构招牌不担保方法质量,好消息和坏消息一样需要验尸。

为什么"90% 成功"和"90% 失败"能同时上头条

2024 到 2026 年,你可以同时看到这些标题:微软委托的研究说"每投 1 美元回报 3.7 美元"、只有 1% 的受访者说没回报;PwC 调查 4,454 位 CEO,56% 说 AI 过去一年既没增收也没降本;Wharton 说近四分之三的高管"已见到正回报";麦肯锡说能把像样的利润影响归因于 AI 的公司只有约 6%。

它们没有谁在撒谎。它们用的是不同的尺子,而尺子每严一级,"成功率"就掉一档:

看到了吗:NANDA 的 5% 在最严的那一端一点都不孤单——麦肯锡 6%、BCG 5%、PwC 12%,都挤在同一段。它的问题不是方向,是拿 52 个访谈报出精确数字,再把"没有显著利润影响"偷换成"零回报",最后被媒体放大成"AI 全面失败"。

顺带记住一个细节:卖 AI 的厂商,数字总是暖的;卖"AI 转型服务"的咨询公司,数字总是"少数人成功、你需要帮助"。BCG 自己的方法附录都承认:没注明"已实现"的数字,是受访者的预期,而且"可能有感知偏差"。

同一个问题,八把尺子(2024-2026 主要调查,「有回报」比例) 自估回报倍数,剔除「不知道」(IDC×微软)99%已部署企业第一年内自报 ROI(Google Cloud)74%高管感知正 ROI(Wharton;VP+ 81 / 中层 69)74%项目达成自家预期 ROI(IBM,2000 CEO)25%过去 12 个月实测增收+降本(PwC,4454 CEO)12%EBIT 归因 ≥5% 且显著价值(麦肯锡)6%规模化产生价值(BCG)5%定制工具试点→显著 P&L,6 个月(NANDA)5%
示意:光谱两端差九十个百分点,几乎全部由口径解释——分母、标尺、样本准入、答卷人职级、时间窗、自报还是实测(各调查样本与年份见正文)

政府数据说:用得快、用得浅、藏着用

跳出厂商和咨询的问卷,官方统计和学术数据的图景是三句话。

用得快。生成式 AI 三年达到约 53% 的成人使用率,比当年的个人电脑和互联网都快。

用得浅。采用了 AI 的美国企业,57% 只在三个以内的职能上用;欧洲央行说,欧元区约七成企业"在用 AI",但用到能驱动转型的强度的只有约 7%。企业实际花的钱更能说明问题:企业卡支付数据显示,付费用 AI 的公司过了半数,但中位数公司的 AI 支出是每个员工每月 11.38 美元——一杯咖啡多一点。效果端最扎实的证据来自丹麦:研究者把全国工资记录翻了个遍(2.5 万名最容易被 AI 影响的工人),结论是 AI 聊天机器人对工资和工时的影响精确为零(能排除大于 2% 的效应)。用的人自己说省了约 3% 的时间——而实验室里同类任务的对照实验(医药界验证新药的那种方法)测出的提升要高一个数量级。宏观层面连高盛自己都承认:整体经济里"找不到生产率与 AI 采用之间的实质关系"——虽然他们 2023 年预测过 AI 十年能把全球 GDP 抬 7%。

藏着用。同一个时间点,三个官方口径打架:问企业,18% 在用;问工人,41% 在用;按就业加权算,78% 的劳动力所在的公司在用。为什么差这么远?一个重要原因:员工用自己的账号,老板看不见。一项覆盖 47 国 4.8 万人的调查发现,57% 的员工向雇主隐瞒自己在用 AI,把 AI 的产出当成自己的交上去。所以"95% 试点失败"和"人人都在用 AI"不矛盾:失败的是正式立项的项目,繁荣的是统计不到的影子使用。

同一时点,三个官方口径(美国,2025 年底) 问企业:任一业务职能在用 AI(Census BTOS)18%问工人:工作中用生成式 AI(RPS 自报)41%按就业加权:所在企业已采用 AI(Atlanta Fed SBU)78% 机制之一:57% 的员工向雇主隐瞒 AI 使用(KPMG-墨尔本大学,47 国 48,000 人)
示意:三个数字都是官方/学术口径,差距来自问谁、怎么问——员工的影子使用对高管不可见,企业口径测的是官方部署率而非实际使用率(Fed 2026-04 研究简报口径)

历史上每次都这样

高失败率数字配权威署名,是个三十年的老配方,每一代都有:

新药研发从一期临床走到上市,成功率约一成,没有人因此说"制药不行"——高失败率是漏斗的形状,是所有搞实验的领域的常态。真正该记住的是:这些失败率数字,几乎从来没在测它们声称测的东西。而且辟谣没用——有研究统计过,引用了辟谣文献的论文里,继续以讹传讹的和真正纠正的,是 12 比 1。

三十年病毒失败率年表:每个数字的死法 1994Standish:「只有 16% 的软件项目成功」同一公司数据换口径可在 5.8%↔94.2% 间翻转2012「按预期 ROI 口径,超过 95% 的创业公司失败」同批公司按清算口径失败率仅三四成——95% 的同款先例2017「85% 的大数据项目失败」唯一出处是分析师个人推文,后被删除2018「85% 的 AI 项目失败」原文是「会因偏差产出过错误结果」的预测,流通中变形2018-21「七到八成制造企业卡在试点炼狱」高侧多源同向;低侧 7% 是更窄构念——差距是定义错位2025「95% 的组织 AI 零回报」报告自己的定义与数据都不支持「零回报」口径 → 本文
示意:高失败率数字 + 权威署名 + 卖方传播的配方三十年未变;引用了辟谣文献的论文里,确认迷思与否定迷思之比约 12:1(Letrud & Hernes 2019)

四种理论怎么读这个数字

经济学里有四套框架,对"95% 试点没回报"给出四种解读,而且开的药方互相矛盾:

  1. 生产率 J 曲线:新技术早期的投入(改流程、建数据、培训人)在账上全是成本、不是产出,所以"测不到回报"正是变革期的标准长相,越是大技术越明显——熬过去就好。提出者 Brynjolfsson 在 2026 年初宣布美国正在"走出谷底";同一周,另一位首席经济学家写道:"AI 无处不在,唯独宏观数据里没有。"谁对,还没裁决。
  2. 吸收能力:公司消化新技术的能力是自己练出来的副产品,买不来;缺这个能力的公司,失败不是运气差,而且可能永远过不了这道门。这派最扎心的一点:NANDA 报告也说问题是"learning",但它说的是工具要会学(所以买我们的 agent 框架),这派说的是组织要会学(所以别指望买工具解决)。同一个词,两张相反的购物单。
  3. Acemoglu 的天花板:也可能 AI 眼下能创造的企业利润本来就少——他算的上限是十年抬升生产率不到 0.66%。按这个读法,95% 不是测量假象,是正确地测到了一个小效应,等十年也不会反弹。
  4. 电气化的历史:1900 年的人完全可以说"发电机无处不在,唯独生产率数据里没有"——电气化等了四十年,等到工厂重新设计、新一代工程师长成,回报才来。回报的大头从来不在省电费,在重构工作流——而今天只有约 21% 的组织重新设计过工作流。

三层事实可以同时成立:任务层面 AI 的提升是真的(实验反复复现),企业层面的利润归因普遍缺席(严口径 5-12%),宏观层面还没有信号。四套理论赌的是这三层之间会不会传导。

四种理论读法:两个判据,四个象限 失败会自动收敛(等) 失败不会自动收敛(改/放弃) 生产率 J 曲线无形投资先计成本后兑现;越变革越先被低估——回报在路上 吸收能力(Cohen & Levinthal)消化能力买不来,是干出来的副产品;停止投资会被锁死在门外 电气化同构(David/Devine)回报等工作流重构与新一代工程师;扩散在加速,别等四十年 Acemoglu 上界十年 TFP ≤0.66%;95% 是正确测到的小效应,等不来反弹 ↑ 问题在测量或必要成本 ↓ 问题在组织或技术本身
示意:四个框架不能全对(J 曲线与 Acemoglu 对「早期数据怎么读」符号相反),但可分层各对一块——任务级增益真实、企业级归因缺席、宏观信号未至;裁决点是三层间的传导

这篇文章的判断,怎么检验

按证据从硬到软:

  1. "95% 的组织零回报"在报告里没有数据支撑——报告里唯一可追溯的 5% 是定制工具漏斗,而"没进生产"不等于"零回报"。原始 PDF 可逐字核对。
  2. 报告样本是 52 家访谈+153 份问卷;Fortune 写成 150+350,公开版本里不存在这组数字,至今未更正。
  3. "成功"的定义是访谈里"有人夸",且报告自认数字只是"方向性准确"。
  4. 报告作者在卖报告推荐的解药(agentic AI 框架),无利益冲突披露;被公开要求"公布数据或撤稿"后,一年零回应。
  5. 最严口径下的独立测量收敛在 5-12%(麦肯锡约 6%、BCG 5%、PwC 12%)——NANDA 的 5% 方向不孤单,孤单的是它的措辞和样本。
  6. 感知口径一贯乐观(约 74% 说有回报),且职级越高越乐观(副总裁以上 81% vs 中层 69%)。
  7. 官方统计:采用史上最快,使用普遍很浅(57% 的采用企业限于三个职能内;中位数公司月均每员工投入 $11.38)。
  8. 丹麦全国工资数据:AI 对工资工时的影响精确为零(排除 >2%);宏观生产率里找不到 AI 信号,连高盛自己都这么说。
  9. 57% 的员工隐瞒 AI 使用——企业口径的统计天然偏低,失败叙事和繁荣现实可以同时为真。
  10. 95% 有个一模一样的先例:按"没达预期回报"口径,95% 的风投创业公司都是"失败"的——高失败率是实验组合的常态形状,不是 AI 的绝症。
  11. 历史上的失败率数字几乎从不测它声称测的东西:85% 是删掉的推特,85% 是偏差预测的变形,74% 是"非完全成功"的凑数。
  12. 四套理论对"95% 会不会自己好起来"给出相反答案——这是接下来五年最值得盯的问题,目前没有任何同行评审研究正面检验过这个数字。

值得盯什么:NANDA 会不会公开数据(那是唯一能复测 95% 的路);美国生产率统计 2026-2027 的修订里会不会出现能归因于 AI 的加速(J 曲线之争的裁决点);Gartner 把"至少 30% 会被弃置"上修到"实际超 50%"之后,还会不会再修;以及下一个病毒式失败率数字——按老配方的节奏,它已经在路上了。

最要紧的几件事

  1. 再看到"X% 的 AI 项目失败",先问三件事:分母是什么?"失败"怎么定义?说这话的人卖什么?这三问拆掉了 70%,拆掉了 85%,也拆掉了 95%。
  2. 成功率是尺子的函数,不是事实的函数。自估口径 99% 成功,严格归因口径 6% 成功,中间隔着的不是谎言,是六个可以各自调节的口径旋钮。引用任何数字,把尺子一起引出来。
  3. 给自己的 AI 项目记两本账:一本记"有没有进生产"(漏斗账),一本记"有没有省钱赚钱"(利润账)。NANDA 的核心错误就是把两本账混成了一本。
  4. 试点大量死亡是实验组合的正常形态,别拿它当恐慌的理由,也别拿它当买解药的理由——新药九成折戟,药厂照样赚钱,秘诀是漏斗管理,不是消灭失败。
  5. 你的员工大概率已经在用 AI,而且一半人藏着。比起再立一个正式试点,先让藏着用的人敢说、用得合规——影子使用里埋着的 ROI,可能比正式项目还高,这是那份报告里最扎实、也最没人引用的发现。