IT 论文精读 · PAPER 12

Scaling Laws(神经语言模型的缩放律)

Kaplan、McCandlish 等 · OpenAI · 2020

EN →

这篇论文干了什么?

2020 年初,OpenAI 一队人(Kaplan、McCandlish 等)系统研究了一件事:把语言模型(就是 ChatGPT 那类"猜下一个词"的模型)越做越大,到底能好到什么程度?他们发现一条惊人整齐的规律——模型的预测水平,随着三样东西(模型多大、喂多少文本、花多少算力)的增加,沿着一条极其平滑、可以提前算出来的曲线稳步变好。好到什么地步?你还没开始训练,就能算出一个大十倍的模型将会有多强。这条规律,直接给了 OpenAI 底气去造 GPT-3,也点燃了后来整个"越大越强"的大模型军备竞赛。

一个反常识的发现

凭直觉,"把模型做大"应该会撞到天花板:一开始进步快,慢慢边际收益递减,最后停在某个水平。可他们把模型从很小做到很大、数据从很少加到很多,画出来的进步曲线居然是一条笔直的下坡——没有拐点、没有饱和,横跨好几个数量级都不弯。就像你每多花十倍的力气,成绩就稳稳往上提固定的一截,屡试不爽。

更奇的是:形状不重要

人们原本以为网络怎么"搭"很关键——搭多深、多宽、放几个注意力单元。结果发现:只要总的"零件数"(参数量)一样,你把它搭得又高又瘦、还是又矮又胖,最终成绩几乎一样。真正决定成绩的,就剩三个朴素的数字:模型多大、数据多少、算力多少。这等于说,能不能变强,主要不看你多聪明地设计,而看你舍得投多少资源。

那这规律怎么用?

它把一个原本靠猜的问题变成了算术题:给你一笔固定的算力预算,该拿去买一个更大的模型,还是拿去喂它读更多的书?他们算出了配比——把大头压在"把模型做大"上,而且别傻等模型把手里的书读到滚瓜烂熟,读个大概就该收手、去投下一批算力。一句话:与其让小模型死磕到底,不如让大模型囫囵吞枣。正是靠这条账,他们敢一步跳到 GPT-3 那个史无前例的规模。

诚实说一句代价:这个"配比"后来被 DeepMind 发现算偏了——同样的算力,其实该配一个没那么夸张的模型、喂它多得多的书。规律的形状对了,最优点却放错了地方。

它带来了什么

它把"模型该做多大、要喂多少、值不值得"从一门玄学,变成了可以先在纸上算、再决定烧钱的工程。今天各家发布大模型前都会先跑一遍"缩放律"预测投入产出——这套先算后做的打法,就是从这篇开始的。

一句话记住

语言模型的水平,会随着"模型多大 + 数据多少 + 算力多少"沿一条平滑、可预测的曲线稳稳变好,跨好几个数量级都不弯;网络具体怎么搭反而不重要。于是"要不要投更多资源、怎么分配"第一次能提前算出答案——这既是 GPT-3 的底气,也是整个"大就是好"时代的定量依据。

想看那几条幂律的确切指数、算力最优配比,以及后来 Chinchilla 的修正? → 切到精读版