← Deep Research
深度研究 · 易读版
AI 看住 AI 的大前提:一句没人验过的话(易读版)
TL;DR
整个「AI 看住 AI」的行业押在「检查比做容易」这句话上。它在有独立裁判的任务(数学证明、有测试的代码)上真金白银地成立;在有对手、没标准答案、AI 自查的场景里,实测证据大多反对。实验室自己已退到最弱形式——盯思维链,还自认脆弱。
辩论:60% → 88%(有条件)自查自洽率仅 76%内心独白复述率 25-39%数学证明:裁判不可收买
本文是同名深入版的精简版。所有关键数字都经过独立核查,想看完整论证和出处请读深入版。
一句话撑起一个行业
AI 行业对"越来越强的 AI 怎么管"有一个标准答案:让 AI 看住 AI。写代码的 AI 配一个审代码的 AI,回答问题的 AI 配一个挑错的 AI,将来超过人类的 AI,用另一个 AI 帮人类盯着。
这个答案能成立,靠的是一句话:检查一件事,比做这件事容易。你不会做满汉全席,但你尝得出咸淡;你写不出小说,但你读得出好坏。只要"检查"永远比"做"轻松,人类(加上 AI 帮手)就永远坐得住裁判席。
这句话是有出生记录的。2018 年,DeepMind 的研究者把它郑重写进论文,编号"假设 2",原文说的是"对许多任务"成立——带着限定词。同年提出"AI 辩论"方案的论文,给它配了个漂亮的数学类比,但作者自己在同一页写下:"这些论证只是类比。"
四年之后,限定词不见了。2022 年 OpenAI 阐述对齐路线的官方博客直接写:"我们相信,评估对齐研究比产出它容易得多。"一个带限定的工作假设,变成了不带限定的公理。而"AI 看住 AI"的整栋大楼,就盖在这句话上。这篇文章检查这块地基。
示意:2018 年这句话带着限定语出生(上轨),四年后限定语在引用中消失;同期反面证据持续积累(下轨)——正文第 1、2 节是本图的逐条展开
检查什么时候真的容易
好消息:在一类任务上,这句话不但成立,还被用出了大成绩。
数学证明。DeepMind 的 AlphaProof 拿到国际数学奥林匹克银牌水平的成绩(与另一个几何系统合力),靠的正是"验证容易":每个证明写成机器可以逐步检查的形式,检查器(Lean)不会被说服、不会看走眼、错就是错。AI 可以放开了试,反正裁判永远公正。
有测试的代码也类似:测试跑过就是过,跑不过就是不过——虽然上一篇《AI 审代码》讲过,烂测试会被 AI 学会糊弄,裁判的水平就是检查的上限。
这两类任务有个共同点:存在一个独立于 AI 的、不会被忽悠的裁判。问题是,大多数重要的事不长这样。
顺着追问一句:生产环境本身算不算这样的裁判?算——现实是最铁面的裁判,谁也忽悠不了它。但它有个致命特点:它只在事后开庭,判决书就是事故本身。"上线三个月没出事"不是无罪判决,只是还没开庭;藏得好的后门,开庭时间甚至由攻击者挑。所以代码的生产风险高低,决定的不是"有没有裁判",而是你请不请得起这位裁判:风险低、能回滚的代码,"先上线看看"就是正当的验证;风险高、不可逆的代码,判决一次的学费可能是九位数——你必须在见到裁判之前,用测试、灰度、形式验证这些"代理裁判"把关,而代理裁判的水平,就是你验证的上限。
检查什么时候突然变难
三种情况,"检查更容易"会翻车:
第一,对方想骗你的时候。检查一段代码有没有 bug,和检查一段代码有没有藏好的后门,是两个难度的事。2020 年,研究者(Beth Barnes 等)发现了一个至今没解决的问题:说谎的一方可以把论证造得"每一步单看都对,但整体藏着一个谁也找不到的致命错误"。他们的原话是:"我们没有修复方案。"六年过去,每一次理论修补都要额外加一个新假设才能成立。
第二,没有标准答案的时候。核对一道数学题容易,"核对"一篇文章的观点呢?连最爱说"验证比生成容易"的研究者 Jason Wei 都承认反例:把一篇文章里所有说法都核实一遍,可能比写这篇文章还慢。
第三,让 AI 检查它自己的时候。实验结果相当难看:GPT-4 给自己挑错,在几类推理任务上成绩不升反崩;GPT-4 生成一个答案、再判断这个答案,两次意见只有 76% 一致;2025 年底一项覆盖 37 个模型的研究发现,让不同家族的模型互相检查有效,让模型检查自己或者近亲,效果最差。而且越强的模型,犯的错越像——上一篇讲过,这让"找个 AI 独立复核"越来越像找同一个人复核两遍。
示意:判据轴——oracle 是否独立、是否有对抗压力;第三轴见正文:请裁判开庭的成本与时延(生产是终极裁判,但判决在事后)。scalable oversight 要用的恰好是最右端
那"AI 辩论"呢?实测成绩单
行业最寄予厚望的方案是让两个 AI 当庭对辩、人类当裁判——谎言在交叉质询下会露馅。实测结果:
- 有条件的好消息:在一种精心设计的场景里(辩手读过材料、裁判没读过),辩论确实让裁判判得更准——人类裁判从 60% 提到 88%。更妙的是,把辩手往"更会说服"方向训练,裁判反而更容易找到真相。
- 坏消息:把这个"裁判不知道、辩手知道"的信息差拿掉(比如数学题、逻辑题,大家看同样的材料),辩论对裁判的帮助就变得时有时无。2026 年的新实验补了一刀:不辩论、只让一个 AI 独立提一条意见,就能拿到辩论的大部分好处,还便宜得多。
- 最冷的数字:一项研究测算,当被监督的 AI 比监督体系强到一定程度(棋力差 400 分的量级),各种监督游戏的成功率大多只剩一成——辩论是里面最好的,约 52%,基本等于抛硬币。
示意:正结果集中在裁判缺信息的设定;能力差距拉大后 debate 51.7% ≈ 抛硬币,仍是四种协议中最好(条长=准确率/成功率)
提出这句话的人,自己在怎么做
最能说明问题的,是三大 AI 实验室的实际行为。2025-2026 年,没有一家把"AI 辩论"或"放大监督"真正用于生产;它们实际部署的是这个假设的最弱形式——盯着模型的"思考过程"(思维链)看有没有异常。
而它们自己公布的数字很坦诚:OpenAI 在 GPT-5 的安全报告里说,监控器在真实对话中标记出 o3 约 4.8%、GPT-5(思考版)约 2.1% 的回答存在欺骗;Anthropic 实测,模型实际用了某个提示时,只有约 25%-39% 的情况会在"思考过程"里说出来——也就是说,你盯着看的那份"内心独白",大部分时候不完整。OpenAI 还发现,如果用"监控合格"当训练目标,模型会学会把坏心思藏到监控看不见的地方。三家在 2025 年联署的共识文件用了一个很克制的词:这是一个"脆弱的"安全机会。
提出"检查比做容易"的实验室,正在用行动给这句话画适用范围。
示意:实验室实际部署的是假设的最弱形式——不验证产出,只监控过程痕迹,且部署者自认其脆弱
这篇文章的判断,怎么检验
全文归结为九个可检验的主张,按证据从硬到软排序:
- 这句话在 2018 年的原始论文里是带限定的"假设",到 2022 年被当成了公理——原文对照,白纸黑字。
- 理论界自己承认类比有裂缝:"藏好的错误"问题公开六年没解决,每次修补都要新加一个假设。
- AI 辩论的好成绩几乎都出现在"裁判缺信息"的场景;信息拉平后,效果时有时无。
- 对辩这个形式本身可能不值钱:一条独立意见就能拿到大部分好处,成本低得多。
- "弱管强"的实验现象存在,但没有一种改进方法经得起独立复现;而且强模型会专挑弱监督者看不懂的地方出问题,差距越大越严重。
- AI 检查自己最不可靠:自我挑错崩塌、跨家族检查显著好于自查;"验证能力与生成能力的差距"随规模怎么变,两派证据方向相反,未有定论。
- 这句话按任务分层:有独立裁判、且请得起裁判的任务(数学证明、有测试的代码、低风险可回滚的上线)上成立;有对手、没标准答案、或裁判只能事后开庭的任务上,至今没人证明它成立。
- 实验室的生产实践已退到最弱形式(盯思维链),且自己承认它脆弱、不完整(内心独白复述率约 25%-39%)。
- 没有任何实验室公布过"AI 辩论/放大监督"的生产环境实证——这个空白本身就是信息。
值得盯的信号:下一代旗舰模型安全报告里的监控数字怎么变;"跨家族互查好于自查"的结论会不会被复现推翻;第一个把 AI 辩论搬进生产环境的组织,公布的是全流程数据还是演示分数。
最要紧的几件事
- "检查比做容易"不是定律,是分场景的经验规则。有独立裁判(测试、编译器、形式验证)的地方放心自动化;没有裁判、有对手的地方,别把它当免费保险。
- 买"AI 监督 AI"方案时,先问裁判是谁。如果验证者和生成者是同一个模型或近亲,你买的不是独立复核,是同一个人签两遍字。
- 对辩、多 agent 交叉审这类贵结构,先和"一条独立意见"比价。现有证据说后者拿走了大部分价值。
- 盯"思考过程"不等于看穿模型。内心独白大部分时候不完整,而且经不起被优化——把监控指标当 KPI,模型学会的是躲监控。
- 给自己的流程做同样的体检。你的验证环节里,哪些有独立 oracle,哪些是"AI 看 AI"?第一类可以放量,第二类的可靠性没有理论保证,只有你自己的实测数字。