IT 论文精读 · PAPER 11

GPT-3(Language Models are Few-Shot Learners)

Brown 等 · OpenAI · NeurIPS 2020

EN →

这篇论文干了什么?

2020 年,OpenAI 发布了 GPT-3——ChatGPT 的直系前身。这篇论文干的事听起来简单粗暴:把语言模型做到前所未有的 1750 亿参数,让它读了海量的互联网文字。然后他们展示了一件怪事:这个模型不用再针对任何任务做训练——你只要在输入里给它看几个例子,它就能当场做翻译、答题、写文章、做算术,像人一样「看两眼就上手」。

先说旧世界的麻烦

在这之前,AI 是「一岗一训」的:想让模型做翻译,得先收集上万条人工标注的翻译例句,专门训练一遍;想让它判断影评是好评还是差评,又得再收集、再训练一遍。每换一个任务,就要请人标数据、跑一轮训练——像每换一个岗位都得把员工送去上几个月的培训班。贵、慢,还只有懂技术的人玩得起。

新点子:别办培训班了,雇个见多识广的老手

GPT-3 的思路是:与其每个任务开一个培训班,不如养一个读过天下文章的「老江湖」。它在训练时只做一件事——读海量文字、反复练习「猜下一个词」。练成之后,你不用再动它一根汗毛:把任务用人话写在纸条上、附上两三个示范,它照着就能做。论文把这叫「少样本学习」——不是重新教它,而是提醒它。

为什么「给几个例子」就够了?

关键在于:那几个例子不是在「教」它新本领,而是在告诉它「该拿出哪套本领」。想象一台巨大的点唱机——歌(能力)在它读遍互联网时就已经录进去了:语法、常识、语言之间的对应、一问一答的套路……你写下的示范就像在点歌,帮它锁定「哦,现在玩的是英译法游戏」。

而这篇论文最重要的发现是:模型越大,这招越灵。小模型看例子基本没用;模型大到一定程度后,「看例子上手」的能力才突然好使起来。「大」带来的不只是量变。也得说句诚实话:它本质上仍是在「接话」,接得流畅不等于接得对——它会一本正经地编造事实,这个毛病从 GPT-3 一直延续到今天的聊天机器人。

带来了什么

从此用 AI 的方式变了:不再是「程序员收集数据、训练模型」,而是「任何人用一段话指挥模型」——今天人人都在写的「提示词」,就是从这篇论文开始成为一门手艺的。两年后,OpenAI 在它的续作上加了一层「听懂人话」的训练,就成了 ChatGPT。

一句话记住

把「猜下一个词」练到 1750 亿参数的规模,模型就能不经专门训练、只看几个例子当场上手新任务——GPT-3 证明了「大」本身能换来「通用」,开启了提示词时代,也是 ChatGPT 的直系前身。

想看三种提示方式的结构图、规模曲线和真实评测数字? → 切到精读版