Day 50 · 2026.07.09

数据驱动的管理:让数据约束判断,而不是替你逃避判断

主题:Data-Driven Management·4 个原则
"In God we trust; all others must bring data." — W. Edwards Deming
本期的命题:"要数据驱动"是每个大公司的口头禅,但分野不在"用不用数据",而在用得对不对。用错了它会反噬你:指标一考核就被博弈变形;dashboard 越漂亮越掩盖它没测到的东西;A/B 结果被事后编成任何你想要的故事;"数据不足"成了不敢负责的挡箭牌。本期给四件工具:识破 Goodhart 陷阱、看穿定量盲区补上定性、把意见之争变成可证否的实验、划清直觉与数据的管辖权。
PRINCIPLE 01

Goodhart 陷阱:指标一旦变成目标,就不再是好指标 Goodhart's Trap — When a Measure Becomes a Target

指标博弈配对指标诊断非审判
指标一旦被拿来考核施压,人就会优化"指标本身"而非它背后的真实目标,指标随即失真。解药不是丢掉指标,是配对指标——量与质同时测,让作弊在另一维度露馅。
"When a measure becomes a target, it ceases to be a good measure." "当一个衡量指标变成了目标,它就不再是一个好的衡量指标。" — Marilyn Strathern (1997),对 Charles Goodhart 1975 年原论的通俗转述
"You should guard against overreacting... by pairing indicators, so that both effect and counter-effect are measured." "把指标成对使用,让'效果'与'副作用'被同时测量,以防过度反应。" — Andy Grove,《High Output Management》Ch.2(配对指标)
↑ 定为 KPI 施压 指标读数 真实目标 缺口=博弈 施压前二者重合,施压后指标虚涨、真实目标下滑
情境:上级要求团队本季度把单测覆盖率从 55% 提到 80%,写进 OKR 考核。
✗ 把单一指标当目标施压

"覆盖率 80% 是硬指标,进你们绩效。"三周后数字漂亮达标——但工程师写了一堆没有断言的空测试,只为让代码"被执行到"。缺陷率没变,你还毁掉了一个本有用的诊断信号。

✓ 说清用途,并配对防作弊

先降级它的身份:"覆盖率是诊断仪表,不是考核 KPI。我真正关心的是缺陷逃逸率。"

再配对:"同时看覆盖率 + 关键路径的变异测试分(mutation score)。覆盖率能靠空测试刷,但杀不死变异体的测试一眼露馅——覆盖率高、变异分低的模块,就是在凑数。"

  • 它一旦拿来考核,最省力的作弊路径是什么?(你没想到的,团队会想到)
  • 我有没有配一个反向/质量指标让刷量露馅?(速度配返工率、关单数配复开率)
  • 我在用它诊断还是审判(决定谁升谁降)?审判用途会立刻触发博弈。
  • 指标涨了,我有独立证据确认真实目标也涨了吗,还是只有指标在涨?
  • 解释权在谁手里?被考核者能同时定义和上报,等于请他作弊。
  • 把代理指标(proxy)当终极目标:velocity、行数、PR 数都是代理,不是价值本身。盯久了团队会优化代理、牺牲真实价值。
  • 单指标独裁:只挂一个北极星、没有配对护栏,等于给博弈开绿灯。
  • 既考核又让当事人自报:Campbell 定律——用于决策的社会指标越重要,越会腐蚀它本要监测的过程。
习作:挑团队最看重的一个指标,写下"若我是被考核者,怎么最省力地刷上去而不真解决问题",再为它配一个能戳穿这种作弊的反向指标。
思考题:我团队哪个数字正被优化得越来越好,我却隐约觉得"真实的东西"没变好?那多半是一个已塌陷的 Goodhart 指标。
PRINCIPLE 02

定量的盲区:数字告诉你 what,只有故事告诉你 why The Blind Spot of Numbers — What vs. Why

定性×定量用户访谈测不了≠不重要
定量告诉你发生了什么、有多大;定性告诉你为什么、怎么发生。只盯 dashboard 会系统性漏掉"重要但还没被测量"的东西——而"测不了"往往是"还没想清楚怎么测"(Hubbard:测量是降低不确定性,不是消除),不是"不该管"。
"When the data and the anecdotes disagree, the anecdotes are usually right." "当数据和轶事相矛盾时,通常是轶事对的(意指数据可能测错了东西)。" — Jeff Bezos,转述于亚马逊内部
情境:你负责的功能,周留存环比掉了 3 个百分点,几个 PM 各执一词。
✗ 在数据里继续挖数据

"再拆个维度看看。"切设备、地区、版本,两天后得到十张相关性图,谁也说不清因果,最后靠嗓门大的人拍板"应该是新引导流程的问题"。

✓ 定量定位,定性解因

定量缩小范围:"下跌集中在新用户第 2 天,老用户没变"——数字负责圈出在哪

定性解释为什么:约 5 个第 2 天流失的新用户各做 15 分钟访谈,再看 10 段回放。真相浮现:引导页在某机型上按钮被键盘挡住。这个 why,拆多少维度都拆不出来。

  • 我要答的是 "多大/涨没涨"(定量)还是 "为什么/怎么回事"(定性)?用错工具必然低效。
  • 数字给了我一个惊讶(异常/掉/涨),我有没有去找 5 个真人问"发生了什么",而非继续在数据里空转?
  • 我说"测不了所以不管"的东西(士气、技术债、信任),是真测不了,还是我没花力气设计一个粗略代理?
  • 我给决策层的汇报,是不是"一个数 + 一张脸"——既有规模证据,又有具体的人让人在乎?(呼应 Day 49)
  • 把"没测量"当成"不存在":技术债、协作摩擦、心理安全感不进 dashboard,就在决策里被当成零。
  • 用定量假装客观:"测什么、不测什么"本身就是价值判断,只是把偏见藏进了指标选择。
  • 访谈样本挑顺耳的:只访活跃用户/满意员工,等于用定性给已有结论背书。
Female Leader's Note "只认量化产出"的绩效文化会系统性低估胶水工作(glue work)——带新人、写文档、协调跨组、维护团队情绪;这些让别人产出更高、自己 commit 数却不好看的贡献,研究显示更多落在女性与少数群体身上。作为 manager,主动把它们用具体事例写进晋升材料,既是公平,也是在修正你自己 dashboard 的系统偏差。
习作:针对一个你只有"数字异常、不知原因"的问题,做 3-5 个真人访谈或看几段真实记录。定性给的洞察,是不是任何维度拆分都给不出的?
思考题:我的决策里有多少重要变量因"进不了 dashboard"被默认当成零?哪一个值得我这季度设计一个哪怕粗糙的度量?
PRINCIPLE 03

实验文化:把"谁嗓门大"之争,变成"让数据能证否"之验 Experimentation — From HiPPO to Falsifiable Hypotheses

A/B 实验可证否假设预注册
把意见之争改造成假设之验:事先写下可证否假设、预设成功阈值与样本量、说好"没到就回滚"。前提是接受一个反直觉事实——多数你自信的好点子其实没用
"Evaluating well-designed and executed experiments that were designed to improve a key metric, only about one-third were successful at improving the key metric!" "在那些精心设计、旨在改进某关键指标的实验中,最终真正改进了该指标的,只有约三分之一!" — Ron Kohavi 等,《Trustworthy Online Controlled Experiments》(2020),基于微软 Bing 的数据,Ch.1
情境:评审会上,资深 PM 拍板"CTA 按钮从绿改蓝,转化肯定高",要求直接全量。
✗ 靠职级/嗓门定输赢(HiPPO)

要么你顶不住直接全量,要么俩人在会上争"蓝好还是绿好",最后谁级别高听谁的。无论哪种都没学到东西,下次还得重吵。

✓ 把分歧转成一次预注册实验

不争对错,争假设:"不用猜。假设写清楚:改蓝后主流程转化率提升 ≥ 2%。"

预设裁决规则:"说好——样本量到 X、跑满 2 周(避开 novelty 效应),达 2% 且统计显著才全量;没到就回滚,谁都不许事后改口径。"分歧就不再是政治,而是交给数据证否。

  • 假设可证否:写成"若 X 则指标 Y 变化 ≥ Z",而非"优化体验"这种怎么都算赢的话。
  • 成功阈值预设:多少算成功,开跑前白纸黑字定好,杜绝事后挪门槛。
  • 样本量与时长:算好需多少样本、跑多久,避免见到想要的结果就叫停(peeking)。
  • 回滚条件:什么情况判失败并回退,事先约定,别让沉没成本绑架决策。
  • 护栏指标:主指标涨的同时,盯着别把延迟、退订、投诉这些副作用搞坏了。
  • HARKing(事后编假设):看完结果再倒推"我本就想验证这个",任何噪声都能被讲成故事。假设必须在看数据之前写死。
  • 只看统计显著、不看效应量:样本够大时 0.01% 的提升也能"显著",但它值得你付的工程成本吗?(也别被 novelty 效应——上线头几天用户图新鲜的虚高——骗到)
  • 硬把无法拆分的重大决策做 A/B:战略、招人、重组不是都能实验,别用"没数据"回避它们——那是 Card 4 的地盘。
习作:把最近一场"公说公有理"的争论改写成一张实验卡:假设、成功阈值、样本量/时长、回滚条件。哪怕没真跑,这动作本身就会暴露"其实谁都拿不出证据"。
思考题:若"多数好点子其实无效"为真,那我团队正信心满满全量推进的东西里,有多少从没被真正证否过?
PRINCIPLE 04

直觉与数据:划清各自的管辖权,别让一方僭越另一方 Intuition & Data — Drawing the Jurisdiction Line

高效度环境决策分类别用数据洗白
数据不消灭判断,它约束判断。规律+快反馈的环境里信数据、信训练过的直觉;新颖、低频、无先例的决策,数据只是输入,仍需你负责地拍板。别用数据给已定决策洗白,也别用"数据不足"逃避该扛的判断。
"Intuition can be trusted only when the environment is sufficiently regular to be predictable, and when there is an opportunity to learn these regularities through prolonged practice with rapid feedback." "直觉只有在两个条件下才可信:环境足够规律、可预测;且能通过长期练习加上快速反馈来学会这些规律。" — Kahneman & Klein,《Conditions for Intuitive Expertise》(2009),American Psychologist
环境规律性 / 可预测性 → 反馈速度 → 纯直觉最危险 → 靠结构化流程/外部基准 直觉最可靠 → 专家直觉可信(含数据) 慢反馈但有规律 → 数据为主,判断补位 快反馈但环境多变 → 小步实验,快速试错
情境:VP 已决定要上一个大项目,回头让你"拉点数据支持一下这个方向"。
✗ 沦为数据的粉刷匠

你心领神会,专挑支持结论的数字做一页漂亮 slide。决策没被数据改变分毫,数据只被用来合理化已定判断——这是"数据驱动"最常见的赝品。

✓ 用一句话逼出数据的真实用途

先问决策性质:"这方向定死了几成?如果数据出来是反的,我们真的会改吗?"

划清管辖权:"若是不可逆、又无先例的战略下注,它本质是判断题——我给你风险量化和最坏情况,但别包装成'数据说要这么做'。若它可切分、可回滚,那该做的不是背书,是设计一个真实验。"

  • 这决策所在的环境规律吗、反馈快吗?(快而规律→信训练过的直觉;慢而新颖→上结构化流程)
  • 它是可逆的双向门(大胆试、错了退)还是不可逆的单向门(慢下来、多要证据)?(呼应 Day 15)
  • 我要数据,是为了可能改变决定,还是给已定的决定背书?后者在浪费大家时间。
  • 直觉在报警时,我把它当成要去调查的线索还是不需论证的否决权?前者对,后者险。
  • 我是不是在用"数据还不够"拖延一个本该由我拍板的判断?
  • 数据洗白(HiPPO 变体):先有结论后找数据,把政治决定伪装成分析结论。
  • 分析瘫痪:用"再等等数据"回避低频、高风险、本就无法被数据完全解决的判断。
  • 把直觉当否决权:"我感觉不对"可启动调查,但不能替代证据直接否掉方案——尤其当你的直觉从没被校准过。
习作:挑本周一个决策先归类:规律/反馈如何?单向门还是双向门?再诚实回答——我找数据是为了可能改主意,还是为了背书?写下来给自己看。
思考题:我最信任的那个"专业直觉",是在规律、快反馈的环境里练出来的吗?若不是(比如只押过两三次的低频领域),它可能只是包装成经验的运气。

深入思考

既然指标一考核就被博弈,那还该不该用指标考核绩效?
不用,绩效就退回纯主观,更糟。解法是分层:指标当诊断仪表(低博弈压力),绩效则用多个配对指标+定性证据三角互证,解释权不在被考核者手里。核心是别让单一指标直接映射重大后果——一挂钩,Campbell 定律立刻启动。
"数据驱动"是不是本身就有偏向——让"可测的"压倒"重要的"?
是,这叫 McNamara 谬误:把可量化的当成唯一重要,无法量化的当成不存在。越尊崇数据的组织,越容易在技术债、文化、长期信任上系统性失明。解法是给难测但重要的东西也强行留一席——哪怕一个粗糙代理。成熟数据文化的标志,是它公开承认自己没覆盖到哪里。
HiPPO 文化很重的大公司里,中层 tech lead 怎么推动实验文化?
自上而下改文化超出你的权限,但你能在自己地盘做示范性小胜:挑一个低风险争论,安静跑一次预注册实验,用结果说话——尤其当它推翻了包括你自己在内的直觉时最有说服力,因为它证明这方法防的是所有人的自负,不针对谁。别框成"挑战老板判断",框成"省下一次全量翻车的成本"。
Kahneman 说直觉只在规律环境可信,可高管做的恰恰是低频大决策——那高管的"经验直觉"基本不可信?
在纯低效度领域(宏观预测、单次大赌注),是的——研究显示专家在这类场景并不比简单模型强,自信常把过往运气误认成能力(呼应 Day 30)。但高管的价值未必在"预测哪个赌注赢",而在问对问题、信息不全时果断负责——那是判断不是预测。自保之道:区分直觉哪些来自高效度经验(带过很多人→可信),哪些来自低频领域(押过两三次→存疑);对后者用外部基准和异见者套上护栏。