"覆盖率 80% 是硬指标,进你们绩效。"三周后数字漂亮达标——但工程师写了一堆没有断言的空测试,只为让代码"被执行到"。缺陷率没变,你还毁掉了一个本有用的诊断信号。
先降级它的身份:"覆盖率是诊断仪表,不是考核 KPI。我真正关心的是缺陷逃逸率。"
再配对:"同时看覆盖率 + 关键路径的变异测试分(mutation score)。覆盖率能靠空测试刷,但杀不死变异体的测试一眼露馅——覆盖率高、变异分低的模块,就是在凑数。"
"再拆个维度看看。"切设备、地区、版本,两天后得到十张相关性图,谁也说不清因果,最后靠嗓门大的人拍板"应该是新引导流程的问题"。
定量缩小范围:"下跌集中在新用户第 2 天,老用户没变"——数字负责圈出在哪。
定性解释为什么:约 5 个第 2 天流失的新用户各做 15 分钟访谈,再看 10 段回放。真相浮现:引导页在某机型上按钮被键盘挡住。这个 why,拆多少维度都拆不出来。
要么你顶不住直接全量,要么俩人在会上争"蓝好还是绿好",最后谁级别高听谁的。无论哪种都没学到东西,下次还得重吵。
不争对错,争假设:"不用猜。假设写清楚:改蓝后主流程转化率提升 ≥ 2%。"
预设裁决规则:"说好——样本量到 X、跑满 2 周(避开 novelty 效应),达 2% 且统计显著才全量;没到就回滚,谁都不许事后改口径。"分歧就不再是政治,而是交给数据证否。
你心领神会,专挑支持结论的数字做一页漂亮 slide。决策没被数据改变分毫,数据只被用来合理化已定判断——这是"数据驱动"最常见的赝品。
先问决策性质:"这方向定死了几成?如果数据出来是反的,我们真的会改吗?"
划清管辖权:"若是不可逆、又无先例的战略下注,它本质是判断题——我给你风险量化和最坏情况,但别包装成'数据说要这么做'。若它可切分、可回滚,那该做的不是背书,是设计一个真实验。"