01它问的是什么问题(The Question It Poses)
给你一张关系图,你一定会想问:这上面谁最重要?
问题在于这句话没说完。"重要"可以指连的人最多,可以指离所有人都近,可以指别人绕不开你,也可以指跟你连着的都是大人物。这四种在同一张图上会选出不同的人,而且经常差得很远。
中心性(centrality)这一族指标要做的,就是把这四种"重要"分开、各自定义清楚,好让人在动手算之前先被迫回答一个问题:这张图上到底是什么在流动?Borgatti 在 2005 年那篇被广泛引用的文章里把这件事说得最直白——每一种中心性都暗含了一种流动模型,用错了流,指标算得再准也是错的。
02规则本身(The Rules)
- 度中心性(degree centrality)= 这个节点连了几条边。最简单,也最不容易出错。
- 接近中心性(closeness centrality)= 先算这个节点到其余所有节点的最短距离,加起来,再取倒数。距离和越小,它离全场越近。
- 介数中心性(betweenness centrality)= 数一数有多少对节点之间的最短路径要经过它。若某一对之间有多条并列的最短路,就按比例分账。
- 特征向量中心性(eigenvector centrality)= 递归定义:一个节点的分数正比于它所有邻居分数之和。解出来就是邻接矩阵最大特征值对应的那个特征向量,名字由此而来。搜索引擎的 PageRank 是加了随机跳转的变种。
四条里前三条都只用到"最短路径"这一个概念,第四条完全不用。这不是细节:前三条假设东西沿最短路走,第四条假设东西像水一样往所有方向渗。现实里的流很少是纯粹的哪一种,这也是所有中心性指标共同的软肋。
另外,度和接近永远非负且不为零(只要图连通),而介数可以是 0——一个连了很多人的节点,只要它的邻居彼此都直接相连,它就不是任何人的必经之路。这个 0 很有信息量。
03跑起来会看到什么(What You See When It Runs)
标准算例是 Krackhardt 1990 年提出的"风筝图"(kite graph):十个人,十八条关系。它被反复引用的唯一原因是——三种中心性在这张图上选出三个不同的人,而且理由都成立。
同一张图上的四个冠军。D 最热闹,F 与 G 最居中,H 掐着咽喉。
把四个指标的数值并排画出来,差异更清楚:
四张图的横轴是同一批人。看 H:介数第一,特征向量中游,度中下游——三个指标对同一个人的评价完全不同。
值得单看的是 C 和 E 的介数中心性都是 0。它们各有 3 个邻居,一点不孤僻,但那 3 个邻居两两之间本来就直接相连,所以没有任何一对人需要借道它们。"人缘不错"和"别人绕不开你"是两件完全不同的事,这个 0 把它们分得干干净净。
还有一件在大图上更明显的事:四个指标彼此高度相关但从不重合。相关性高意味着随便选一个通常也不会离谱,重合度不满则意味着排名最靠前的那几个——也就是你真正要动手干预的那几个——恰恰是最容易被选错的部分。
04它解释了现实中的什么(What It Explains)
中心性最扎实的用途是把"该动谁"这个问题从直觉里拿出来。几个已经反复被验证的场景:
疫苗与接触者追踪。疫苗有限时优先打给谁?如果传播靠日常密切接触,度高的人先打;如果关键在于把几个人群连起来的少数往来者,介数高的人先打。两种策略在同一张图上给出的名单可以几乎不重叠。
供应链与基础设施。介数极高、度却不高的节点是典型的隐形单点——平时不显眼,断了整条链停。这类节点在成本审计里往往因为"体量小"最先被砍掉。
组织里的桥接者。介数高的人是效率来源也是瓶颈,还是离职风险最贵的那一类:走了之后断的不是一个岗位,是两个部门之间的路。
网页排名。PageRank 就是特征向量中心性加上"随机跳到任意一页"的修正,那个修正是为了让分数在有断头链接的真实网络上仍然收敛。
它不能解释什么(What It Cannot Explain)
- 不能替你决定用哪个指标。指标由"什么在流动"决定:能复制、能并行扩散的(消息、观念)适合度与特征向量;不能复制、必须走完一条路的(钱、货、转诊)适合介数与接近。Borgatti 2005 的核心论点就是这个——大多数误用不是算错了,是把流搞错了。
- 不能在图不准的时候还给出稳定的名次。介数中心性对漏边极其敏感,因为它依赖"唯一通道"这种性质,补上一条边就可能让某人的介数减半。真实图总是抽样出来的,所以名次必须做门槛扫描,小数点后两位没有意义。
- 不能处理时间顺序。静态图上的 A—B—C 未必在时间上走得通:如果 A 和 B 的接触发生在 B 和 C 之后,这条路不存在。把带时间戳的互动压成静态图,会系统性高估可达性,也会高估中间那个人的介数。
- 不能从位置推出影响力。中心性说的是"东西必须经过他",不是"他愿意传、有能力传、传的时候不走样"。结构给的是机会,不是行为。把中心性直接当成影响力排行,是把约束当成了动机。
- 不能跨图比原始数值。介数的原始值随节点数大致按平方增长,两张不同大小的图的原始值完全不可比。归一化能缓解,但归一化方式不止一种,换一种排名可能就变了——所以要写清用的是哪一种。
- 不能在公开之后继续可信。一旦"中心性高"能换来资源,被评估的人就会去加边,而加边比做出真实贡献便宜得多。搜索引擎排名的历史是完整演示:PageRank 公开之后立刻长出了链接农场。