IT 论文精读 · PAPER 41

The Anatomy of a Search Engine(PageRank / 谷歌雏形)

Sergey Brin & Lawrence Page · Stanford · WWW7 · 1998

EN →

这篇论文干了什么?

1998 年,斯坦福两个博士生 Sergey Brin 和 Larry Page 写了一篇论文,介绍他们做的一个搜索引擎原型——名字叫 Google(谷歌)。它靠一个关键点子,把当时又慢又难用的网页搜索,一下变得「搜什么都能把最该看的排到最前面」。这篇论文,就是今天这家公司的出生证明。

先说说旧世界有多难受

九十年代中期,网页正在爆炸式变多,可搜索引擎还很笨:你输一个词,它就去找「哪些页面里出现了这个词、出现得多」。问题是,「出现这个词」和「是不是好页面」根本是两回事。一个塞满关键词的垃圾页,能轻松盖过真正权威的页。想搜「大学」,排最前的未必是任何一所名校。那时候大家甚至靠人工编的网站目录(像早期雅虎)来找东西——可网页多到人根本编不过来。

新点子:让网页互相投票

Brin 和 Page 的洞见特别妙:别光看一个页面自己说了什么,去看「别人怎么对待它」。网页之间是用链接连起来的——A 页面上有一个能点到 B 页面的链接,就相当于 A 给 B 投了一票、说「这页值得看」。被越多页面链接的页,多半越靠谱。

但还有更妙的一层:不是每张票都一样重。一张来自权威大页的推荐,比一百张来自无名小页的推荐还管用。于是「重要」就成了一件递归的事——重要的页投的票更重,而它们又是被别的重要页推举出来的。这套「谁重要看谁被谁推荐」的打分,就叫 PageRank

它到底怎么算出来的?

想象一个人在网上漫无目的地乱点链接:点到一页,随手再点页面上的一个链接,跳到下一页,一直点下去;偶尔点腻了,就直接在地址栏敲个别的网址、随机跳到别处重新开始。这么点上无数次之后,他停留在某一页的时间比例,就是这页的 PageRank——重要的页四通八达、总被点到,冷门页则很少被路过。这个「随机冲浪者」的比喻,正是 PageRank 的真身。

还有一招同样关键:看别人怎么称呼你,往往比你怎么自我介绍更准。大量页面在链接到谷歌时,会把链接的文字写成「搜索引擎」——于是就算目标页自己一个字都没提「搜索引擎」,谷歌也知道该在这个词下把它排出来。这段「链接上的文字」叫锚文本,它让搜索引擎能读懂图片、下载文件这些自己不含文字的东西,也能描述那些还没来得及抓取的页面。

带来了什么

把「投票」和「别人怎么称呼你」这两个信号,叠加到老办法「词有没有出现」之上,搜索结果的质量一下拉开了差距——第一页十条,条条切题。这套东西撑起了后来的谷歌,也重写了整个互联网找信息的方式。当然它也有代价(诚实一句):一旦排名靠链接,就有人专门去刷链接、造假票来骗排名,这场攻防一直打到今天。

一句话记住

别只看一个网页自己说了啥,去看「谁链接了它、谁又链接了那些链接它的页」——把链接当成一票票带权重的推荐(PageRank),再加上「别人用什么词称呼它」(锚文本),就能在爆炸增长的网页里把最该看的排到最前。这就是谷歌的起点。

想看链接投票的示意图、随机冲浪者的公式和谷歌雏形的架构? → 切到精读版