IT 论文精读 · PAPER 15

Constitutional AI(宪法 AI)

Bai 等 · Anthropic · 2022

EN →

这篇论文干了什么?

你用 ChatGPT、Claude 时,它多数情况下会拒绝帮你造炸弹、写钓鱼邮件——这套「不作恶」的分寸,从前是靠请几千个人工标注员一条条读、一条条打分教出来的。2022 年底,Anthropic 这队人提出 Constitutional AI(宪法 AI):写一小份「宪法」——几十条白纸黑字的原则(比如「别帮人做危险的事」「别居高临下」),然后让 AI 拿这份宪法自己管自己,几乎不再需要人工去逐条标注那些有害内容。它是今天 Claude 的训练基石之一。

旧世界的痛

要教 AI「什么不该说」,老办法是让它对着大量刁钻问题作答,再请人工逐条读它的回答、标出哪句有害。这有两个麻烦:一是脏活累人——标注员整天读暴力、仇恨、犯罪内容,很折磨人,还很难规模化;二是教出来的 AI 常常变「怂」:为了绝不说错,它对稍微敏感的问题一律「这我不能帮你」,连「为什么这事不该做」都懒得解释——有用性被一刀切掉了。

那个点子

Anthropic 的想法很直接:与其把价值观藏在几万条人工打分里,不如把它写成一小份看得见、改得动的原则清单,再让 AI 照着这份清单自我批评、自我改写。人只需要写好那几十条原则,繁重的「逐条评判」交给 AI 自己做。

它怎么做到的?

两步走。第一步「自我改写」:先让 AI 对刁钻问题给个初版回答,再让它回头读自己这段话——「按『别教人做危险事』这条原则看,我刚才哪里越界了?」它自己找出毛病,再重写一版,反复几轮,答案越洗越干净;然后拿这批「洗干净的答案」回炉再训练它。这就像学生对着老师发的评分表给自己的作业挑错、重做

第二步「自我评判」:让 AI 对同一个问题生成两version回答,再拿宪法里随机抽一条原则,让 AI 自己判断「哪一版更符合这条」。这些判断攒成一大批偏好数据,反过来打磨 AI——相当于它一边做题一边给自己的两份答案排名,排名再教它下次答得更好。老办法里这个「排名」得人来做,现在 AI 自己包了。妙处还在于:这样调出来的 AI 不怂——面对有害请求,它不再甩一句「不能帮」,而是解释清楚为什么不该做,既守住了底线,又还算有用。

一句话记住

把 AI 的价值观从「几万条人工标注」搬进「一小份看得见、改得动的原则清单」,让 AI 照着清单自我批评、自我改写、自我评判——几乎不用人再去逐条读那些有害内容,还顺手治好了老模型「一遇敏感话题就装死」的毛病。

一句诚实话:这套清单里写的是谁的价值观?由谁来定?AI 自己的判断也可能出错——把评判权交给 AI,省了人力,也把「它判错了怎么办」一起交了出去。

想看两阶段训练流程图、RLAIF 的机制和实验数字? → 切到精读版