Day 71 · 2026.07.30

AI 预算的两本账:当投资依据是尚未兑现的节省

主题:AI Investment & ROI Discipline·4 个原则
"For a successful technology, reality must take precedence over public relations, for nature cannot be fooled." — Richard P. Feynman, 1986
与前几篇的分工:Day 50 讲指标的一般陷阱,Day 54 讲怎么管一个被 AI 增强的团队。本篇只讲钱:当这一轮 AI 投资的依据,是上一轮承诺过、却从未落到损益表上的节省。四件事:两本账分开记识破期望的滚动ROI 口径六旋钮先定判据再批钱
PRINCIPLE 01

漏斗账与利润账,分开记 Keep the Funnel Ledger and the P&L Ledger Apart

配对指标上生产≠省钱谁签字确认
AI 项目有两种「成功」:进了生产、有人在用(漏斗账),和某个财务科目真的降了(利润账)。多数汇报把前者当后者报,且不是故意的——漏斗账快而可见,利润账要等几个季度还要财务认账。两账一旦混进同一张 slide,就再也拆不开。
"Because indicators direct one's activities, you should guard against overreacting. This you can do by pairing indicators, so that together both effect and counter-effect are measured." 「因为指标会引导人的行为,你必须防止过度反应。做法是给指标配对,让效果与反效果同时被测量。」 — Andy Grove,《High Output Management》第 2 章「Managing the Breakfast Factory」
两本账:同一个项目的两条独立进度
漏斗账 · 用例走到哪一格(快、可见、容易堆)
立项有人想做
POCdemo 跑通
上生产有真实用户
一年后还在被用
利润账 · 钱走到哪一格(慢、要别人认账)
节省被测出来
有非本人签字确认
进了下一年预算基线
云账单 / 合同 / 人力真的降了
漏斗账第 3 格常被当成利润账第 4 格来报——AI 汇报里最普遍的一次错位。
情境:季度评审前,老板说:「你在 slide 上写『AI 让团队效率提升 30%』。」
✗ 两种常见反应,都是坏的

「好,我写。」——你为一个自己无法复核的数字署了名。
「这个数字我没法验证。」——纯抵抗、不给替代品,会被读成「不支持 AI」,而 slide 照旧会写,只是换人写。

✓ 试着说:写两行,把两本账当场分开

「我写两行。漏斗账:6 个 AI 用例,2 个上了生产,日活 40 人。利润账:这 2 个把 code review 平均等待从 11 小时降到 6 小时;同期云与许可成本增加约 $8k/季。
我只敢说周期缩短,不敢说人力节省——因为没有人减少,也没有人被重新分配。如果这张 slide 需要 30%,请让我先定它的口径,好让明年还能按同一口径再报一次。」

✓ 若老板说「就写 30%,别搞复杂」

「明白,按 30% 写。同时在备注页留一行口径:该数字来自 2 个生产用例的周期时间缩短,未含成本增加与人力变化。」——上级要叙事,你不必对抗;你只要一行日后能自证的口径。

  • 我最近一次汇报的 AI 收益,属于漏斗账还是利润账?
  • 我说的「节省」,有哪个财务科目(headcount / 云账单 / 合同)在同期真的下降?
  • 收益数字有没有配一个测反效果的指标(新增成本、review 额外工时、缺陷率)?
  • 把 POC 数量当进展:POC 是最便宜的成功,也最容易被批量生产。稀缺的是「上了生产且一年后还活着」。
  • 从「时间节省」直跳「成本节省」:省下的小时若没换成更少的人或更多的产出,它变成的是 slack。slack 有价值,但不能记进利润账——记进去等于承诺一笔不存在的现金。

动作:把手上全部 AI 用例列成两列表:左列漏斗状态,右列对应的财务科目。右列空着就留空,不要填故事。

思考:只准报一个数字给 CFO,你报哪个?为什么不是你现在正报的那个?

PRINCIPLE 02

用未兑现的节省,为下一轮背书 Funding Round N+1 With Savings Round N Never Delivered

Bain 2026期望滚动要口径不要真相
Bain 对 951 家年收入 $100M 以上企业的调查发现:约 44% 的大企业用先前自动化项目的节省为下一轮 AI 投资背书,而那批节省系统性未达标;在欠交付的子群里,约九成仍在加码。这不是集体愚蠢,是一个结构:上一轮的差额从不被结算,而是被折进下一轮的假设里——它不消失,只往前滚。
"For a successful technology, reality must take precedence over public relations, for nature cannot be fooled." 「一项技术要成功,现实必须优先于公关,因为自然是骗不过去的。」 — Richard P. Feynman, 《Report of the Presidential Commission on the Space Shuttle Challenger Accident》Appendix F (1986)
情境:预算会上 VP 说:「去年那套 CI 自动化省了 12 个人力,所以今年 AI 平台预算翻倍。」而你知道那 12 个人力从没在任何编制表上消失过。
✗ 不要说

「我不太确定那 12 个人力是不是真省下来了。」你挑战的不是一个数据,是某人已经进了晋升材料的成果。结局固定:数字不会改,你被归类为「对 AI 有保留」,且从此拿不到这条线上的信息。

✓ 试着说:要口径,不要真相

「我支持翻倍。为了这次交付得干净,我想沿用去年那个案子的口径:那 12 个人力按哪种算法折算的?小时按谁的时薪、时间窗是全年还是峰值月?我照同一口径写今年目标,免得两年数字打架。」口径一摊开,差额自己会显形,而且不是你指出来的——这是唯一低成本的路径。

✓ 第二步(写进你自己的提案)

「按去年同口径折算,今年目标 = 减少 8 FTE 等价工时;Q3 末结算,若实际只到 3,我在同一封邮件里报告并下调 Q4 预算。」——提前把失败的样子写下来,是让结算真的发生的唯一办法。

  • 上一轮承诺过的节省数字,我找得到原始 deck 吗?被结算过吗?
  • 我这次要的钱,依据是新证据,还是上一轮未结算的承诺?
  • 我自己的提案里,写了「多少算失败」吗?
  • 当众质疑数字的真实性:把技术问题变成人的问题,代价远大于收益。同一件事,问口径是协作姿态,问真伪是审计姿态。
  • 反向错误:因口径可疑就一律不投。欠交付不等于没价值,漏斗账里那些真被使用的用例是真的。区别只在一点:别把它当成下一轮的抵押品。

动作:找出组织里最近一次公开的「AI 省了 X」,问提出者口径——只问算法,不做评价。

思考:若你团队今年欠交付,你会在什么场合、对谁、用什么措辞主动说?说不出场合,说明你也在滚。

PRINCIPLE 03

ROI 口径的六个旋钮 The Six Dials Behind Any ROI Number

Goodhart追问清单自报 vs 实测
同一个项目,合法地调六个旋钮就能把 ROI 从 0.4x 调到 5x,每一步都不算撒谎。所以听到 ROI 数字时,先问旋钮位置,再问数值——数值是结论,旋钮才是内容。
"Any observed statistical regularity will tend to collapse once pressure is placed upon it for control purposes." 「任何被观察到的统计规律,一旦因控制目的而被施加压力,就会趋于崩塌。」 — Charles Goodhart,「Problems of Monetary Management: The U.K. Experience」(1975),后被概括为 Goodhart's Law
六旋钮:同一个项目的两种合法算法
旋钮
宽口径(数字好看)
严口径(可被复核)
分母
只算 token 与许可费
含人力改造、评测集、返工、运维工时
标尺
和「什么都不做」比
和一个认真做过的非 AI 方案比
准入
只统计活下来的用例
分母含全部立项,含死掉的
职级
小时按平均或高职级时薪折价
按实际承接者薪资,且只算能真被回收的
时间窗
取最好的一个月 ×12
全年实测,含学习期与回落
来源
问用户「你觉得省了多少」
测周期时间 / 吞吐 / 缺陷率
六个全调宽,可以合法地把不赚钱的项目报成 5x。追问顺序:来源 → 分母 → 准入。
情境:peer 团队宣布 AI code review 的 ROI 是 4.2x。你的 skip-level 老板问你:「为什么你们不做?」
✗ 不要说

「他们那个数字不可信。」——你没证据却有动机(看起来像在护自己的排期)。

✓ 试着说:我要做,但先对齐口径

「我想做,但先对齐口径,否则我做出来的 4.2x 和他们的不是同一个东西。我会问 Marco 六件事:分母含不含评测与返工工时;对照组是『不做』还是现有 lint 规则;4.2x 的分母是全部 12 个用例还是活下来的 3 个;小时按谁的时薪;峰值年化还是全年实测;数据是问卷还是周期时间。问完我给您一个同口径的估计——可能仍然很好,只是这次能被复核。

✓ 对 Marco(横向,不能显得在查账)

「你们那个 4.2x 我想直接抄口径,省得自己发明一套、两边数字打架。分母和时间窗怎么定的?」——「我想抄你的口径」是索要方法论最不树敌的说法:它把你放在学习者位置,而他为了让数字站得住,会主动讲细节。

  • 分母里有没有人力改造与评测工时?
  • 对照组是「什么都不做」,还是一个认真做过的非 AI 方案?
  • 成功率的分母是全部立项,还是只有活着的用例?
  • 节省的小时数是自报还是实测?时间窗是峰值年化还是全年实测?
  • 只查别人不查自己:你的提案通常也在用宽口径,因为宽口径更容易过。先自查,追问才有立场。
  • 女性视角:ROI 一旦依赖自报(旋钮 6),就变成一场自我推销比赛。Exley 与 Kessler 发现在客观表现几乎相同时,女性对自己表现的对外描述系统性低于男性(Christine L. Exley & Judd B. Kessler,「The Gender Gap in Self-Promotion」,《Quarterly Journal of Economics》137(3), 2022)。而自报正是 AI 收益统计的默认做法。两件可做的事:关键收益改实测;收自报时给统一模板与量纲(「本周因此少做的具体动作是哪几件」),而非自由发挥。

动作:挑一个你正在引用的 AI 收益数字,标出六个旋钮各在什么位置,看哪几个是宽的。

思考:如果规定所有 AI 提案必须用严口径,你手上哪个项目会先死?它该死吗?

PRINCIPLE 04

先定哪档口径算成功,再批钱 Set the Bar Before You Fund It

Klein premortem退出条件六行判据
事后争论一个 AI 项目算不算成功,永远争不出结果——因为判据是从结果里反挑的。唯一解法是在批钱那一刻把判据写死:哪个指标、什么口径、什么阈值、什么时候看、达不到怎么办。没有退出条件的投入不会失败,它只会无限延期。
"Unlike a typical critiquing session, in which project team members are asked what might go wrong, the premortem operates on the assumption that the 'patient' has died." 「与通常那种『可能出什么问题』的评审不同,事前验尸从『病人已经死了』这个前提出发。」 — Gary Klein,「Performing a Project Premortem」,《Harvard Business Review》2007 年 9 月号
情境:你自己要申请 3 个人一个季度,做 AI 辅助的测试生成。
✗ 常见写法

「预期显著提升测试覆盖率与开发效率。」无口径、无阈值、无退出——结局只能靠叙事收尾:季度末看心情判定,而通常判「成功」,因为承认失败没有好处。

✓ 修后:提案里的判据段(六行,写死)

指标① 被合并的 AI 生成测试占新增测试 ≥ 25%(分母含被拒的)。
指标② 这些测试拦下过 ≥ 3 个会进生产的缺陷(以 revert / hotfix 记录为准,不用自报)。
看的时间:Q4 最后一周,日期已定。
两项都达 → 申请扩到 10 人。只达一项 → 维持 3 人不扩。都不达 → Q1 停掉,我在同一份文档里写结论。
成本侧记全:3 人季度 + 约 $6k 推理与工具费 + 约 15% 的 review 额外工时。

✓ 汇报时补一句

「我没写 ROI 倍数,因为现在写的任何倍数都是我自己选的口径。我写的是阈值与退出条件——Q4 末不必谈判,照表判定。」在人人报倍数的环境里,一份能判死自己的判据是极稀缺的可信度。

  • 提案里有没有一个「多少算失败」的具体数字?
  • 判据的指标是实测还是自报?达不到阈值时的动作写进提案了吗、谁执行?
  • 成本侧列全了吗(人力改造 / 评测集 / review 额外工时 / 推理费)?
  • 复盘日期定死了吗,还是「等有空看」?
  • 判据写得太软:「若有正向信号则继续」等于没写。可判死的判据才是判据。
  • 只写成功判据、不写退出条件:项目会以「再给一个季度」续命,这是 AI 投资里最贵的损耗——不占用一次失败,却持续占用最好的人。
  • 要承认的 trade-off:严判据会挡掉一些其实值得做的探索。诚实的做法是把它标成「学习性投入,不承诺 ROI,上限 X 人月」,而不是编个 ROI 混过评审。给探索一个正确的名字,比给它漂亮数字更能保护它。

动作:给金额最大的那项 AI 投入补一段六行判据(指标 / 口径 / 阈值 / 日期 / 达标动作 / 不达标动作),发给赞助人求一句确认。

思考:你有没有一个项目已经过了本该被停掉的时点?让它还活着的是证据,还是没人愿意宣布结算?

深入思考

我坚持严口径,同行都用宽口径,我是不是自己吃亏?
短期确实吃亏,不该粉饰。中间路线是两行并存:对外用组织通行口径(否则你在自建一套没人认的货币),同时给严口径的第二行并说明差在哪个旋钮。两年后宽口径开始被追责时,手里有可信存量数据的只有你。分界:严口径用在大额、长周期的投入上,几周的小试点做全套核算本就不划算。
「学习性投入」会不会变成不接受考核的挡箭牌?
会,所以要给三个硬约束:金额上限、时间上限、一个非 ROI 的可验证产出(能改变下次决策的评测集、一个被证伪的技术假设)。它的判据不是省没省钱,而是:我们现在知道了什么是三个月前不知道的,它改变了哪个具体决定?答不出,就不是学习而是拖延。
这套东西在创业公司还成立吗?
部分成立,权重不同。小公司的 AI 投入常常不为省钱而为不死,用严 ROI 去卡会杀掉正确的赌注;但两本账仍然必须分开——创业公司最常见的死法之一就是把「demo 惊艳」记成「产品有用」,再按后者去招人和融资。规模改变的是结算周期:大公司按季度,小公司按周,而且结算人往往就是提案人自己。
高层其实知道数字是宽口径,为什么还照报?
因为在资本市场与内部竞争里,「有 AI 战略」本身有独立于 ROI 的价值:它影响估值、预算分配、谁被看作未来的人。这不是纯粹欺骗,是两个真实目标叠在同一个数字上。理解这点能省下大量无用的纠正——你改不了对外叙事,但能守住内部账本。分界线是:对外可以配合叙事,对内不能拿叙事当输入;一旦叙事被用来定排期和人力,团队就会为一个不存在的收益真实地加班。