IT 论文精读 · PAPER 13

Emergent Abilities(大模型的涌现能力)

Jason Wei 等 · Google / Stanford / DeepMind · TMLR 2022

EN →

这篇论文说了什么?

还记得 GPT-3 那种大模型「看几个例子就会做新题」的本事吗?这篇论文(2022 年,Google 一队人牵头)注意到一件更怪的事:有些本事,小模型怎么都学不会,模型做大到某个门槛,它却「突然」就会了——不是慢慢变好,是从「几乎全错」一下跳到「像样地会」。他们给这种现象起了个名字:涌现(emergence)

先打个比方

像烧水。你一度一度往上加热,水一直只是「热水」——90 度、95 度、99 度,看着没什么质变。可到了 100 度,它突然沸腾了,从液体变成蒸汽。多出来的这一度,带来的不是「更热一点」,而是一个新状态。大模型的某些能力就是这样:规模一点点堆上去时毫无起色,越过某条线,能力「相变」般地冒出来。

这跟以前的认识哪儿不一样?

上一代人的共识是:模型越大,各项表现平滑地、可预测地好一点点(这正是「规模定律」那篇讲的)。你甚至能拿小模型的成绩画条线、外推出大模型大概多强。可涌现能力偏偏不守这个规矩:在门槛之前,曲线贴着「瞎猜」的水平一动不动,你根本预测不到后面会有一跳。会不会跳、什么时候跳,事先看不出来。

他们怎么发现的?

方法很朴素:拿一大批难度各异的题(从三位数加法、冷门语言问答,到需要推理的综合考试),让从小到大一整排模型都去做,再把「模型多大」和「做对多少」画成一张图。结果反复出现同一种形状:前半段几乎是条贴着地面的平线(跟瞎猜差不多),到某个规模猛地翘起来。他们还发现,有些「解题技巧」也是涌现的——比如让模型「一步步把思路写出来再答」(思维链),小模型用了反而更差,大到一定程度才开始真正帮上忙。

这带来了什么?

一个既兴奋又不安的结论:把模型做得更大,可能会解锁一批你事先根本没料到的新能力——这既是「继续把模型往大做」的最强动力,也是安全研究者最担心的地方(连有害能力也可能不打招呼地冒出来)。大模型不再是「同一个东西的放大版」,而可能在放大中变成「另一种东西」。

一句话记住

有些能力小模型完全不具备,模型大到某个门槛却像烧水到沸点一样「突然」出现、且事先无法预测——这就是涌现。不过要留一句诚实的话:后来有人反驳,这种「突变」有时是打分方式造成的错觉——换把宽松点的尺子去量,陡坎就摊平成缓坡了。

想看涌现曲线、具体是哪些能力、以及「这是不是错觉」的争论? → 切到精读版