← Deep Research
深度研究 · 易读版
「95% 的 AI 试点都失败了」?这个数字连自己的报告都撑不住(易读版)
TL;DR
「95% 的 AI 试点失败」连自己的报告都撑不住:报告里那是三个对不上的说法,「成功」的定义是访谈里有人夸,样本只有 52 家访谈加 153 份会议问卷,而写报告的人正在卖报告推荐的解药。同一个问题换把尺子,答案从 99% 成功变 6% 成功——成功率是尺子的函数。政府数据的三句话:用得快、用得浅、藏着用(57% 的员工瞒着老板用 AI)。高失败率数字配权威署名是三十年老配方:85% 是删掉的推特,95% 在风投行业有一模一样的先例。看到下一个失败率,先问三件事:分母是什么?失败怎么定义?说这话的人卖什么?
成功的定义:「有人夸」 换把尺子:99% ↔ 6% 中位 AI 支出 $11.38/人/月 57% 员工藏着用
本文是同名深入版的精简版。所有关键数字都经过独立核查,想看完整论证和出处请读深入版。
一句吓崩股市的话
2025 年 8 月 18 日,Fortune 发了篇报道:"MIT 报告:95% 的企业生成式 AI 试点正在失败。"第二天,AI 股集体回调,Nvidia 跌 3.5%,Palantir 跌了近 9%。从那周起,"95% 的 AI 试点失败"成了这个行业被引用最多的数字——董事会里、研报里、卖你 AI 方案的销售嘴里,都是它。
这篇文章去把原始报告找来,逐字读了一遍,又把这个数字流传一年的每一站都查了一遍。结论先给:这个数字连它自己的报告都撑不住;但它背后有一个真问题,值得认真回答。
报告里到底写了什么
那份报告叫《The GenAI Divide》,MIT 的 Project NANDA 小组出品,26 页,版本号 v0.1,自己写着"初步发现"。拆开看,有四件事媒体从来不提:
第一,"95%"在报告里是三个对不上的说法。 开头说"95% 的组织零回报";正文里唯一有数据图的 5%,说的是"定制企业 AI 工具"的漏斗——60% 的组织考察过这类工具,20% 试点了,5% 用进了生产。"没用进生产"和"零回报"是两回事:一家公司的定制工具黄了,员工可能正用着 ChatGPT 省下真金白银——这恰恰是报告自己测到的(见第四点)。顺带一提:漏斗里 80% 的组织压根没试点过,"95% 的试点失败"这句话里的"试点",大多数根本没发生;真去试了的公司里,成功率是四分之一。
第二,"成功"的定义是"有人夸"。 报告原文:成功=用户或高管"评价说"带来了显著且持续的生产率或利润影响。不是看财务数据,是访谈里有没有人这么说。附录里还有另一套定义(六个月内有可测 KPI),两套对不上。报告自己承认:这些数字"方向上准确",六个月的窗口"可能低估成功率"。
第三,样本小得惊人。 52 家机构的访谈,加四场行业会议现场收的 153 份问卷。就这些。而且报告的"审稿人"一栏写的是第四作者自己——自己审自己。
第四,报告里还有一批方向相反的数据,没人转述。 90% 的受访公司里,员工在私下用个人 AI 工具干活,报告原话是"几乎每个人都在用",而且这种私下使用"常常比正式项目回报更好";通用聊天工具的试点转化率约 83%——是个成功故事。同一份报告,既能读出"AI 全面失败",也能读出"AI 无处不在",取决于你摘哪一句。
同一份报告里的两条漏斗(NANDA 2025,占全体受访组织比例)
定制/任务专用工具
通用 LLM 聊天工具
调研过 60% 80% 进入试点 20% 50% 用进生产 5% 40%
同一对 95%/5% 被套在三个构念上:①95% 组织「零回报」 ②5% 的 integrated pilots 提取价值
③定制工具 5% 进生产——三者互不等价,分子从「未进生产」被改写成「零回报」
示意:报告的头条数字来自左边的漏斗(定制工具 5% 进生产),被执行摘要改写成「95% 组织零回报」;右边通用工具约 83% 的试点转化率几乎无人转述(条长按百分比等比)
数字出门就变形了
流言变形通常要传好几手。这次不用——第一篇报道就变了 。报告说"95% 的组织零回报",Fortune 标题写成"95% 的试点在失败";报告的样本是"52 家访谈+153 份问卷",Fortune 写成"150 个访谈+350 名员工调查"——这组数字在公开的报告里不存在,却被几十家媒体照抄,一年过去,没有一家更正。
再往后就是标准剧本:限定语一层层脱落,"95% 的生成式 AI 试点(六个月内没有可测利润影响)"最后变成"95% 的 AI 项目失败";出身也一路升格,从"NANDA 项目组初步发现"变成"MIT 研究"再变成"MIT Media Lab 研究"。到 2026 年,还杂交出了一个没有任何出处的新数字:"90% 的企业 AI 实施失败"。
写报告的人在卖什么
Project NANDA 是个做 AI agent 基础设施的项目。报告的诊断是:AI 试点失败,因为工具不会学习;解药是会记忆、能自适应的 agentic AI——而这正是 NANDA 自己在建的东西。报告正文两次把自家协议列为解决方案,结论一章建议企业"开始和供应商合作"。做深度复盘的 80,000 Hours 说得直白:四位作者全都在开发或销售报告推荐的那类框架,而报告顶着 MIT 的牌子,没有任何利益冲突披露。
批评者不少,而且都是具名的:Wharton 教授 Werbach 公开要求"公布完整数据,否则应该撤稿"。一年过去,回应是零:没有数据,没有更正,没有续作,MIT Media Lab 那个小组的出版物页面上根本不列这份报告。
还有一个对照:同一年,MIT 还有一篇方向相反的爆款研究——"AI 让材料发现提速",被大学者背书、被国会引用,后来 MIT 自己声明对其数据"没有信心",要求撤下(批评者称数据造假)。2025 年最出圈的两个"MIT 数字",一个唱衰一个唱多,全都没过体检。机构招牌不担保方法质量,好消息和坏消息一样需要验尸。
为什么"90% 成功"和"90% 失败"能同时上头条
2024 到 2026 年,你可以同时看到这些标题:微软委托的研究说"每投 1 美元回报 3.7 美元"、只有 1% 的受访者说没回报;PwC 调查 4,454 位 CEO,56% 说 AI 过去一年既没增收也没降本;Wharton 说近四分之三的高管"已见到正回报";麦肯锡说能把像样的利润影响归因于 AI 的公司只有约 6%。
它们没有谁在撒谎。它们用的是不同的尺子 ,而尺子每严一级,"成功率"就掉一档:
问"你估计你的回报是几倍"(选择题,"不知道"不算数)→ 99% 有回报; 只问已经部署了 AI 的公司"一年内有没有回报"→ 74%; 问高管"你感觉回报是正的吗"→ 74%(副总裁以上 81% 说是,中层只有 69%——问谁,答案就归谁 ); 问 CEO"你的 AI 项目达到自己的预期了吗"→ 25%; 看过去 12 个月实测 的增收加降本 → 12%; 要求把 5% 以上的利润变化明确归因给 AI、且自评获得显著价值 → 约 6%; 要求"规模化产生价值"→ 5%。
看到了吗:NANDA 的 5% 在最严的那一端一点都不孤单 ——麦肯锡 6%、BCG 5%、PwC 12%,都挤在同一段。它的问题不是方向,是拿 52 个访谈报出精确数字,再把"没有显著利润影响"偷换成"零回报",最后被媒体放大成"AI 全面失败"。
顺带记住一个细节:卖 AI 的厂商,数字总是暖的;卖"AI 转型服务"的咨询公司,数字总是"少数人成功、你需要帮助"。BCG 自己的方法附录都承认:没注明"已实现"的数字,是受访者的预期 ,而且"可能有感知偏差"。
同一个问题,八把尺子(2024-2026 主要调查,「有回报」比例)
自估回报倍数,剔除「不知道」(IDC×微软) 99% 已部署企业第一年内自报 ROI(Google Cloud) 74% 高管感知正 ROI(Wharton;VP+ 81 / 中层 69) 74% 项目达成自家预期 ROI(IBM,2000 CEO) 25% 过去 12 个月实测增收+降本(PwC,4454 CEO) 12% EBIT 归因 ≥5% 且显著价值(麦肯锡) 6% 规模化产生价值(BCG) 5% 定制工具试点→显著 P&L,6 个月(NANDA) 5%
示意:光谱两端差九十个百分点,几乎全部由口径解释——分母、标尺、样本准入、答卷人职级、时间窗、自报还是实测(各调查样本与年份见正文)
政府数据说:用得快、用得浅、藏着用
跳出厂商和咨询的问卷,官方统计和学术数据的图景是三句话。
用得快。 生成式 AI 三年达到约 53% 的成人使用率,比当年的个人电脑和互联网都快。
用得浅。 采用了 AI 的美国企业,57% 只在三个以内的职能上用;欧洲央行说,欧元区约七成企业"在用 AI",但用到能驱动转型的强度的只有约 7%。企业实际花的钱更能说明问题:企业卡支付数据显示,付费用 AI 的公司过了半数,但中位数公司的 AI 支出是每个员工每月 11.38 美元 ——一杯咖啡多一点。效果端最扎实的证据来自丹麦:研究者把全国工资记录翻了个遍(2.5 万名最容易被 AI 影响的工人),结论是 AI 聊天机器人对工资和工时的影响精确为零 (能排除大于 2% 的效应)。用的人自己说省了约 3% 的时间——而实验室里同类任务的对照实验(医药界验证新药的那种方法)测出的提升要高一个数量级。宏观层面连高盛自己都承认:整体经济里"找不到生产率与 AI 采用之间的实质关系"——虽然他们 2023 年预测过 AI 十年能把全球 GDP 抬 7%。
藏着用。 同一个时间点,三个官方口径打架:问企业,18% 在用;问工人,41% 在用;按就业加权算,78% 的劳动力所在的公司在用。为什么差这么远?一个重要原因:员工用自己的账号,老板看不见。一项覆盖 47 国 4.8 万人的调查发现,57% 的员工向雇主隐瞒自己在用 AI,把 AI 的产出当成自己的交上去 。所以"95% 试点失败"和"人人都在用 AI"不矛盾:失败的是正式立项的项目,繁荣的是统计不到的影子使用。
同一时点,三个官方口径(美国,2025 年底)
问企业:任一业务职能在用 AI(Census BTOS) 18% 问工人:工作中用生成式 AI(RPS 自报) 41% 按就业加权:所在企业已采用 AI(Atlanta Fed SBU) 78%
机制之一:57% 的员工向雇主隐瞒 AI 使用(KPMG-墨尔本大学,47 国 48,000 人)
示意:三个数字都是官方/学术口径,差距来自问谁、怎么问——员工的影子使用对高管不可见,企业口径测的是官方部署率而非实际使用率(Fed 2026-04 研究简报口径)
历史上每次都这样
高失败率数字配权威署名,是个三十年的老配方,每一代都有:
"只有 16% 的软件项目成功"(Standish,1994)——同一家公司的数据,换个统计口径,成功率能从 5.8% 变 94.2%。这个我们上一篇拆过 。 "85% 的大数据项目失败"(2017)——全部出处是 Gartner 一位分析师的一条个人推特,后来还删了 。它被当"Gartner 研究"引用了快十年。 "85% 的 AI 项目失败"(2018)——Gartner 原话是"85% 的 AI 项目会因数据或算法偏差产出过错误结果 "(几乎是句废话),流传中变成了"失败率 85%"。 "四分之三的 IoT 项目在失败"(思科,2017)——自家数据是:完成的项目里约三分之二被认为成功;"失败率 74%"是把"没自评'完全成功'的公司"全算成失败凑出来的。 最妙的是这个:哈佛商学院研究了两千多家拿到风投的创业公司,《华尔街日报》2012 年的报道口径是——"如果把失败定义为没达到预期投资回报,那超过 95% 的创业公司都失败了。" 同一批公司,按倒闭清算算,失败率只有三四成。95% 这个数字,在 AI 之前就有一个一模一样的先例,配方相同:把及格线画在"完美",失败率想多高有多高。
新药研发从一期临床走到上市,成功率约一成,没有人因此说"制药不行"——高失败率是漏斗的形状 ,是所有搞实验的领域的常态。真正该记住的是:这些失败率数字,几乎从来没在测它们声称测的东西。 而且辟谣没用——有研究统计过,引用了辟谣文献的论文里,继续以讹传讹的和真正纠正的,是 12 比 1。
三十年病毒失败率年表:每个数字的死法
1994 Standish:「只有 16% 的软件项目成功」 同一公司数据换口径可在 5.8%↔94.2% 间翻转 2012 「按预期 ROI 口径,超过 95% 的创业公司失败」 同批公司按清算口径失败率仅三四成——95% 的同款先例 2017 「85% 的大数据项目失败」 唯一出处是分析师个人推文,后被删除 2018 「85% 的 AI 项目失败」 原文是「会因偏差产出过错误结果」的预测,流通中变形 2018-21 「七到八成制造企业卡在试点炼狱」 高侧多源同向;低侧 7% 是更窄构念——差距是定义错位 2025 「95% 的组织 AI 零回报」 报告自己的定义与数据都不支持「零回报」口径 → 本文
示意:高失败率数字 + 权威署名 + 卖方传播的配方三十年未变;引用了辟谣文献的论文里,确认迷思与否定迷思之比约 12:1(Letrud & Hernes 2019)
四种理论怎么读这个数字
经济学里有四套框架,对"95% 试点没回报"给出四种解读,而且开的药方互相矛盾:
生产率 J 曲线 :新技术早期的投入(改流程、建数据、培训人)在账上全是成本、不是产出,所以"测不到回报"正是变革期的标准长相,越是大技术越明显——熬过去就好。提出者 Brynjolfsson 在 2026 年初宣布美国正在"走出谷底";同一周,另一位首席经济学家写道:"AI 无处不在,唯独宏观数据里没有。"谁对,还没裁决。吸收能力 :公司消化新技术的能力是自己练出来的副产品,买不来 ;缺这个能力的公司,失败不是运气差,而且可能永远过不了这道门。这派最扎心的一点:NANDA 报告也说问题是"learning",但它说的是工具 要会学(所以买我们的 agent 框架),这派说的是组织 要会学(所以别指望买工具解决)。同一个词,两张相反的购物单。Acemoglu 的天花板 :也可能 AI 眼下能创造的企业利润本来就少——他算的上限是十年抬升生产率不到 0.66%。按这个读法,95% 不是测量假象,是正确地测到了一个小效应 ,等十年也不会反弹。电气化的历史 :1900 年的人完全可以说"发电机无处不在,唯独生产率数据里没有"——电气化等了四十年,等到工厂重新设计、新一代工程师长成,回报才来。回报的大头从来不在省电费,在重构工作流——而今天只有约 21% 的组织重新设计过工作流。
三层事实可以同时成立:任务层面 AI 的提升是真的(实验反复复现),企业层面的利润归因普遍缺席(严口径 5-12%),宏观层面还没有信号。四套理论赌的是这三层之间会不会传导。
四种理论读法:两个判据,四个象限
失败会自动收敛(等)
失败不会自动收敛(改/放弃)
生产率 J 曲线 无形投资先计成本后兑现;越变革越先被低估 ——回报在路上
吸收能力(Cohen & Levinthal) 消化能力买不来,是干出来的副产品;停止投 资会被锁死在门外
电气化同构(David/Devine) 回报等工作流重构与新一代工程师;扩散在加 速,别等四十年
Acemoglu 上界 十年 TFP ≤0.66%;95% 是正 确测到的小效应,等不来反弹
↑ 问题在测量或必要成本
↓ 问题在组织或技术本身
示意:四个框架不能全对(J 曲线与 Acemoglu 对「早期数据怎么读」符号相反),但可分层各对一块——任务级增益真实、企业级归因缺席、宏观信号未至;裁决点是三层间的传导
这篇文章的判断,怎么检验
按证据从硬到软:
"95% 的组织零回报"在报告里没有数据支撑 ——报告里唯一可追溯的 5% 是定制工具漏斗,而"没进生产"不等于"零回报"。原始 PDF 可逐字核对。报告样本是 52 家访谈+153 份问卷;Fortune 写成 150+350,公开版本里不存在这组数字,至今未更正。 "成功"的定义是访谈里"有人夸",且报告自认数字只是"方向性准确"。 报告作者在卖报告推荐的解药 (agentic AI 框架),无利益冲突披露;被公开要求"公布数据或撤稿"后,一年零回应。最严口径下的独立测量收敛在 5-12% (麦肯锡约 6%、BCG 5%、PwC 12%)——NANDA 的 5% 方向不孤单,孤单的是它的措辞和样本。感知口径一贯乐观(约 74% 说有回报),且职级越高越乐观 (副总裁以上 81% vs 中层 69%)。官方统计:采用史上最快,使用普遍很浅 (57% 的采用企业限于三个职能内;中位数公司月均每员工投入 $11.38)。丹麦全国工资数据:AI 对工资工时的影响精确为零 (排除 >2%);宏观生产率里找不到 AI 信号,连高盛自己都这么说。57% 的员工隐瞒 AI 使用 ——企业口径的统计天然偏低,失败叙事和繁荣现实可以同时为真。95% 有个一模一样的先例 :按"没达预期回报"口径,95% 的风投创业公司都是"失败"的——高失败率是实验组合的常态形状,不是 AI 的绝症。历史上的失败率数字几乎从不测它声称测的东西 :85% 是删掉的推特,85% 是偏差预测的变形,74% 是"非完全成功"的凑数。四套理论对"95% 会不会自己好起来"给出相反答案 ——这是接下来五年最值得盯的问题,目前没有任何同行评审研究正面检验过这个数字。
值得盯什么 :NANDA 会不会公开数据(那是唯一能复测 95% 的路);美国生产率统计 2026-2027 的修订里会不会出现能归因于 AI 的加速(J 曲线之争的裁决点);Gartner 把"至少 30% 会被弃置"上修到"实际超 50%"之后,还会不会再修;以及下一个病毒式失败率数字——按老配方的节奏,它已经在路上了。
最要紧的几件事
再看到"X% 的 AI 项目失败",先问三件事:分母是什么?"失败"怎么定义?说这话的人卖什么? 这三问拆掉了 70%,拆掉了 85%,也拆掉了 95%。成功率是尺子的函数,不是事实的函数。 自估口径 99% 成功,严格归因口径 6% 成功,中间隔着的不是谎言,是六个可以各自调节的口径旋钮。引用任何数字,把尺子一起引出来。给自己的 AI 项目记两本账 :一本记"有没有进生产"(漏斗账),一本记"有没有省钱赚钱"(利润账)。NANDA 的核心错误就是把两本账混成了一本。试点大量死亡是实验组合的正常形态 ,别拿它当恐慌的理由,也别拿它当买解药的理由——新药九成折戟,药厂照样赚钱,秘诀是漏斗管理,不是消灭失败。你的员工大概率已经在用 AI,而且一半人藏着 。比起再立一个正式试点,先让藏着用的人敢说、用得合规——影子使用里埋着的 ROI,可能比正式项目还高,这是那份报告里最扎实、也最没人引用的发现。