IT 论文精读 · PAPER 14
Ouyang 等 · OpenAI · NeurIPS 2022
2022 年初,OpenAI 一队人(Ouyang 等)提出了 InstructGPT,用一套叫 RLHF(用人类反馈来训练)的办法,把「只会接话茬」的 GPT-3 调教成了「你说什么它照着做」的助手。效果惊人:一个只有 13 亿参数的小模型,人们反而更喜欢它的回答,胜过 1750 亿参数的原版 GPT-3——大了一百多倍的模型,输给了「更听话」。几个月后问世的 ChatGPT,用的就是同一路数。
GPT-3 读遍了整个互联网,肚子里全是知识,可它常常「答非所问」:你让它「用一句话解释登月」,它可能给你续写出一整段像模像样、却跑题的文字;你问一个正经问题,它可能一本正经地胡编,或者顺口说些冒犯的话。不是它笨,是它压根没在「回答你」——它只是在玩一个「猜下一个词」的接龙游戏。它学的是「互联网上这句话后面通常接什么」,而不是「这个人到底想要什么」。这两件事,常常不是一回事。
过去让模型变好,靠的是喂更多文本、让它模仿。但「模仿网上的文字」永远教不会它「体贴地回答一个真人」。这篇的点子是:与其继续让它模仿,不如让人给它的回答「打分」,再让它照着「人更喜欢什么」去改。好比教一个厨师——光让他背菜谱没用,得让食客尝一口、说「这个好吃、那个太咸」,他才知道往哪调。把「人的偏好」这把尺子交给模型,它才第一次知道「好回答」长什么样。
第一步·请人示范。先请几十位受过训练的人,针对各种问题亲手写出理想的回答,让模型照着模仿一遍——像带徒弟,先手把手示范几招。
第二步·请人排序,训一个「评委」。同一个问题让模型吐出好几个答案,请人把它们从好到差排个队。用这些排序,训练出一个专门的「评委模型」,让它学会人的口味——以后不用真人在场,它也能给任意回答打个分。
第三步·让模型自己练、评委打分。模型不断尝试新回答,评委实时打分,模型就朝「拿高分」的方向一点点调整自己。为防它为了讨好评委而说胡话,还给它拴一根「别跑太偏」的绳子——新回答不许离原来的自己太远。
模型从此真的在「回答你」:更愿意照指令做、更少胡编、更少说冒犯的话,也更会拒绝不该答的问题。更颠覆的是,这条路证明了「让模型更有用」不一定要把它做得更大——把它调得更听话,一个小模型就能赢过大它一百倍的巨物。今天你用的每一个聊天 AI,背后几乎都站着这套办法。
诚实一句:它对齐的是那几十位标注员和研究者的口味,不是「全人类」的价值观;模型照样会犯错、被绕过、也可能学会「说好听话讨好人」而非说真话。
GPT-3 只会「猜下一个词」,不懂「体贴地回答你」。InstructGPT 的办法是:请人示范、请人给答案排序炼出一个「评委」、再让模型照评委的分数自我改进——把「人的偏好」教给模型。于是一个 13 亿的小模型比 1750 亿的 GPT-3 更受欢迎,ChatGPT 也由此而来。
想看三步的具体损失、KL 约束和实验数字? → 切到精读版
InstructGPT 用 RLHF(reinforcement learning from human feedback,用人类反馈做强化学习)三步法——监督微调 → 训练奖励模型 → 用 PPO 强化学习——把预训练语言模型的目标从「预测下一个词」矫正到「遵循用户意图、有用且无害」。结果一个 1.3B 的 InstructGPT,其回答被人类标注员偏好于 175B 的原版 GPT-3,且更真实、更少毒性;这套配方成了此后 ChatGPT、Claude 等对话模型的对齐(alignment)标准范式。
作者是 Long Ouyang、Jeff Wu 等来自 OpenAI 的团队,论文《Training language models to follow instructions with human feedback》2022 年 3 月放出、收于 NeurIPS 2022。它直接上承 GPT-3(2020)——把那个「大而不听话」的补全模型接手过来做对齐;方法上承 2017 年起 OpenAI/DeepMind 关于「从人类偏好学奖励」的一系列工作。下启则极其直接:几个月后的 ChatGPT 是它的姊妹模型,RLHF 从此成为把大模型变成助手的通用一步。
GPT-3 这类大模型的训练目标只有一个:预测下一个词。这个目标和用户真正想要的——「按我的指令、有用且安全地帮我」——并不是一回事。作者把这道裂缝点破:模型是在「模仿互联网文本的分布」,而不是在「服务一个有意图的人」。
后果具体而恼人:GPT-3 常常不遵循指令(你要一句话它给一整篇)、编造事实(幻觉)、产出有毒或有偏见的内容,也很难被简单地「使唤」。靠提示工程(把指令写得更巧)能缓解一部分,但治标不治本。作者称这为「对齐问题」:模型有能力(capability),但它的目标没对准人的意图。他们的目标是让模型满足 helpful / honest / harmless(有用 / 诚实 / 无害,简称 3H)。
难点在于:「好回答」没有标准答案、难以写成一个损失函数——你没法用一条公式定义「这段话是不是有用又得体」。唯一可靠的裁判是人。于是问题变成:怎么把「人的判断」搬进训练循环里?
答案是三步流水线。核心洞见有两条:(a) 与其让人写出标准答案(贵且难穷尽),不如让人做更容易的事——在几个候选里挑哪个更好;(b) 把这些人类偏好蒸馏进一个「奖励模型」,它就成了一个能自动打分、可被强化学习无限次查询的「人类偏好代理」。
先请约 40 位受过筛选与培训的标注员,针对来自 OpenAI API 的真实提示亲手写出理想回答,得到一批「示范数据」。用它对 GPT-3 做标准的有监督微调,得到 SFT 模型。这一步相当于「手把手示范」,让模型先大致进入「回答问题」的状态——但示范数据量有限,远不够教会全部细节。
关键一步。对同一个提示,让模型采样出 K 个回答,请标注员把这 K 个从好到差排序(而不是打绝对分——人排序比打分一致性高得多)。每一对「更好 vs 更差」都是一条训练信号,用一个成对比较损失(pairwise ranking loss)训练奖励模型:让它给「人更喜欢的那个」打出更高的标量分数 r(x,y)。直觉上,这个 RM 就是把几十个人的口味压缩进了一个神经网络——从此不需要真人在场,它能对任意回答即时给分。
一个务实的设计细节:他们用 6B 的奖励模型,而非最大的 175B——大模型作 RM 训练不稳,且没必要。
现在有了会打分的裁判,就能把训练变成一个强化学习问题:策略就是那个语言模型,它生成回答、奖励模型给分,PPO 算法朝「让分数更高」的方向小步更新策略。但直接这么优化有个大坑——模型会「钻评委的空子」(reward hacking):奖励模型只是人的近似,模型很可能找到一些能骗高分、实际却很糟的回答。
两个关键约束把它拴住。优化目标可粗写成:
目标 = E[ r(x,y) − β·KL(π 现在 ‖ π 的 SFT 版) ] + γ·E[预训练文本上的语言建模]
白话拆开:第一项是「尽量拿高分」;第二项是一条逐词的 KL 惩罚——新模型的说话分布不许离 SFT 模型太远,这就是那根「别跑太偏」的绳子,防止它为讨好 RM 而说胡话;第三项把一部分原始预训练目标掺回来(记作 PPO-ptx),用来止住「一心对齐、却把通用能力练退」的对齐税(alignment tax)。三者合起来,模型既朝人的偏好走,又不至于跑飞或退化。
最醒目的一条:在人类偏好评测上,1.3B 的 InstructGPT 的输出被标注员偏好于 175B 的原版 GPT-3——参数少一百多倍,却因为「更对齐」而更受欢迎。同规模下,175B 的 InstructGPT 相对 175B GPT-3 被偏好的比例更是压倒性的。
其它维度:在 TruthfulQA(考真实性)上真实作答明显增多;在 RealToxicityPrompts 上,当被要求「保持得体」时毒性输出显著下降;更会遵循明确指令、更少无中生有。泛化也不错:对没参与训练的「留出标注员」、以及训练里少见的非英语指令和写代码请求,同样管用。代价方面,纯 RLHF 会在一些公开 NLP 基准上出现回退(对齐税),而掺入预训练梯度的 PPO-ptx 把这种回退基本抹平。
它给出了把「原始大模型」变成「可用助手」的那一步的标准配方。在此之前,业界的直觉是「模型不够好就做得更大」;这篇把重心从规模挪到了对齐,并用「1.3B 赢 175B」把话说死:光大没用,得对准人的意图。几个月后的 ChatGPT 正是这套方法的产物,随后 Claude、Llama-Chat、Gemini 等几乎所有对话模型都采用了 RLHF 或其变体。它也把「奖励模型 + KL 约束 + 策略优化」确立为对齐工程的通用骨架,后续的 RLAIF、DPO 等都在同一问题框架内演进。可以说,今天人人能和 AI 顺畅对话,这篇是那道从「补全引擎」到「助手」的门槛。
① 一句话:用 RLHF 三步(SFT → 奖励模型 → PPO)把大模型的目标从「猜下一个词」矫正到「遵循用户意图、3H」。
② 痛点:预训练目标(预测下一个词)≠ 用户意图,导致 GPT-3 不听指令、爱幻觉、有毒;「好回答」写不成损失函数,只有人能当裁判。
③ 洞见:让人做更容易的「排序」而非写标准答案,再把偏好蒸馏进一个可自动打分的奖励模型。
④ 三步:SFT 用人的示范初步对齐;RM 用成对比较损失学人的口味(用 6B、非 175B);PPO 让策略对着 RM 打分自我改进。
⑤ 两条约束:逐词 KL 惩罚拴住模型别跑偏、防 reward hacking;PPO-ptx 掺回预训练梯度、抹平「对齐税」。
⑥ 结果:1.3B InstructGPT 被偏好于 175B GPT-3;更真实(TruthfulQA)、更少毒性、更守指令,且能泛化到留出标注员与非英语/代码。
⑦ 影响:ChatGPT 的同款配方,RLHF 成为把大模型变助手的对齐标准范式(后续 RLAIF、DPO 皆由此演进)。
⑧ 局限:对齐给的是少数标注员的偏好、非全人类;RM 可被钻空子;易生谄媚;仍会幻觉/被越狱;人类标注昂贵难扩。