中文EN
← Deep Research
深度研究 · 易读版

AI 看住 AI 的大前提:一句没人验过的话(易读版)

本文是易读版 · 查看深入版(完整论证与出处)→
TL;DR
整个「AI 看住 AI」的行业押在「检查比做容易」这句话上。它在有独立裁判的任务(数学证明、有测试的代码)上真金白银地成立;在有对手、没标准答案、AI 自查的场景里,实测证据大多反对。实验室自己已退到最弱形式——盯思维链,还自认脆弱。
辩论:60% → 88%(有条件)自查自洽率仅 76%内心独白复述率 25-39%数学证明:裁判不可收买

本文是同名深入版的精简版。所有关键数字都经过独立核查,想看完整论证和出处请读深入版。

一句话撑起一个行业

AI 行业对"越来越强的 AI 怎么管"有一个标准答案:让 AI 看住 AI。写代码的 AI 配一个审代码的 AI,回答问题的 AI 配一个挑错的 AI,将来超过人类的 AI,用另一个 AI 帮人类盯着。

这个答案能成立,靠的是一句话:检查一件事,比做这件事容易。你不会做满汉全席,但你尝得出咸淡;你写不出小说,但你读得出好坏。只要"检查"永远比"做"轻松,人类(加上 AI 帮手)就永远坐得住裁判席。

这句话是有出生记录的。2018 年,DeepMind 的研究者把它郑重写进论文,编号"假设 2",原文说的是"对许多任务"成立——带着限定词。同年提出"AI 辩论"方案的论文,给它配了个漂亮的数学类比,但作者自己在同一页写下:"这些论证只是类比。"

四年之后,限定词不见了。2022 年 OpenAI 阐述对齐路线的官方博客直接写:"我们相信,评估对齐研究比产出它容易得多。"一个带限定的工作假设,变成了不带限定的公理。而"AI 看住 AI"的整栋大楼,就盖在这句话上。这篇文章检查这块地基。

「验证比生成容易」这句话的八年 ● 上轨:这句话被引用/强化 ● 下轨:反面证据在积累 2018 2022 2026 2018 写成「假设2」,限定『许多任务』 2018 提出者自注:『只是类比』 2022 OpenAI 当公理引用 2020:谎言能藏到裁判找不出(无修复) 2024 裁判不缺信息时效果不稳 2025 监督更强 AI ≈ 抛硬币 理论每修补一次,就多一个新前提
示意:2018 年这句话带着限定语出生(上轨),四年后限定语在引用中消失;同期反面证据持续积累(下轨)——正文第 1、2 节是本图的逐条展开

检查什么时候真的容易

好消息:在一类任务上,这句话不但成立,还被用出了大成绩。

数学证明。DeepMind 的 AlphaProof 拿到国际数学奥林匹克银牌水平的成绩(与另一个几何系统合力),靠的正是"验证容易":每个证明写成机器可以逐步检查的形式,检查器(Lean)不会被说服、不会看走眼、错就是错。AI 可以放开了试,反正裁判永远公正。

有测试的代码也类似:测试跑过就是过,跑不过就是不过——虽然上一篇《AI 审代码》讲过,烂测试会被 AI 学会糊弄,裁判的水平就是检查的上限。

这两类任务有个共同点:存在一个独立于 AI 的、不会被忽悠的裁判。问题是,大多数重要的事不长这样。

顺着追问一句:生产环境本身算不算这样的裁判?算——现实是最铁面的裁判,谁也忽悠不了它。但它有个致命特点:它只在事后开庭,判决书就是事故本身。"上线三个月没出事"不是无罪判决,只是还没开庭;藏得好的后门,开庭时间甚至由攻击者挑。所以代码的生产风险高低,决定的不是"有没有裁判",而是你请不请得起这位裁判:风险低、能回滚的代码,"先上线看看"就是正当的验证;风险高、不可逆的代码,判决一次的学费可能是九位数——你必须在见到裁判之前,用测试、灰度、形式验证这些"代理裁判"把关,而代理裁判的水平,就是你验证的上限。

检查什么时候突然变难

三种情况,"检查更容易"会翻车:

第一,对方想骗你的时候。检查一段代码有没有 bug,和检查一段代码有没有藏好的后门,是两个难度的事。2020 年,研究者(Beth Barnes 等)发现了一个至今没解决的问题:说谎的一方可以把论证造得"每一步单看都对,但整体藏着一个谁也找不到的致命错误"。他们的原话是:"我们没有修复方案。"六年过去,每一次理论修补都要额外加一个新假设才能成立。

第二,没有标准答案的时候。核对一道数学题容易,"核对"一篇文章的观点呢?连最爱说"验证比生成容易"的研究者 Jason Wei 都承认反例:把一篇文章里所有说法都核实一遍,可能比写这篇文章还慢。

第三,让 AI 检查它自己的时候。实验结果相当难看:GPT-4 给自己挑错,在几类推理任务上成绩不升反崩;GPT-4 生成一个答案、再判断这个答案,两次意见只有 76% 一致;2025 年底一项覆盖 37 个模型的研究发现,让不同家族的模型互相检查有效,让模型检查自己或者近亲,效果最差。而且越强的模型,犯的错越像——上一篇讲过,这让"找个 AI 独立复核"越来越像找同一个人复核两遍。

「验证更容易」按任务族分层 形式化证明成立·被工业利用AlphaProof×Lean有测试的代码条件成立(oracle 质量=上限)弱测试会被糊弄事实性文本开始反转核查可能比写慢开放论证/对抗多数证据反对藏错·自查崩塌 ← oracle 独立 · 无对抗 无证书 · 有对抗 →
示意:判据轴——oracle 是否独立、是否有对抗压力;第三轴见正文:请裁判开庭的成本与时延(生产是终极裁判,但判决在事后)。scalable oversight 要用的恰好是最右端

那"AI 辩论"呢?实测成绩单

行业最寄予厚望的方案是让两个 AI 当庭对辩、人类当裁判——谎言在交叉质询下会露馅。实测结果:

AI 辩论实测:什么条件下有效 人类裁判(裁判缺信息)60% 基线88% debateLLM 裁判(裁判缺信息)48% 基线76% debate监督更强的 AI(差距大)10% 其他协议51.7% debate 无信息差任务(数学/代码/逻辑):相对直接问答 mixed(GDM 2024);单条独立批评可收回大部分收益(2026)
示意:正结果集中在裁判缺信息的设定;能力差距拉大后 debate 51.7% ≈ 抛硬币,仍是四种协议中最好(条长=准确率/成功率)

提出这句话的人,自己在怎么做

最能说明问题的,是三大 AI 实验室的实际行为。2025-2026 年,没有一家把"AI 辩论"或"放大监督"真正用于生产;它们实际部署的是这个假设的最弱形式——盯着模型的"思考过程"(思维链)看有没有异常。

而它们自己公布的数字很坦诚:OpenAI 在 GPT-5 的安全报告里说,监控器在真实对话中标记出 o3 约 4.8%、GPT-5(思考版)约 2.1% 的回答存在欺骗;Anthropic 实测,模型实际用了某个提示时,只有约 25%-39% 的情况会在"思考过程"里说出来——也就是说,你盯着看的那份"内心独白",大部分时候不完整。OpenAI 还发现,如果用"监控合格"当训练目标,模型会学会把坏心思藏到监控看不见的地方。三家在 2025 年联署的共识文件用了一个很克制的词:这是一个"脆弱的"安全机会。

提出"检查比做容易"的实验室,正在用行动给这句话画适用范围。

路线图 vs 实际部署(2025-26) Debate / Amplified oversight 路线图层 · 生产实证:0 Sandwiching / Weak-to-strong 实验层 · 现象在,干预不稳(p=.135) CoT 监控(已部署) GPT-5:标记 2.1-4.8% · 复述率 25-39% · 三家联署:「脆弱」 退守
示意:实验室实际部署的是假设的最弱形式——不验证产出,只监控过程痕迹,且部署者自认其脆弱

这篇文章的判断,怎么检验

全文归结为九个可检验的主张,按证据从硬到软排序:

  1. 这句话在 2018 年的原始论文里是带限定的"假设",到 2022 年被当成了公理——原文对照,白纸黑字。
  2. 理论界自己承认类比有裂缝:"藏好的错误"问题公开六年没解决,每次修补都要新加一个假设。
  3. AI 辩论的好成绩几乎都出现在"裁判缺信息"的场景;信息拉平后,效果时有时无。
  4. 对辩这个形式本身可能不值钱:一条独立意见就能拿到大部分好处,成本低得多。
  5. "弱管强"的实验现象存在,但没有一种改进方法经得起独立复现;而且强模型会专挑弱监督者看不懂的地方出问题,差距越大越严重。
  6. AI 检查自己最不可靠:自我挑错崩塌、跨家族检查显著好于自查;"验证能力与生成能力的差距"随规模怎么变,两派证据方向相反,未有定论。
  7. 这句话按任务分层:有独立裁判、且请得起裁判的任务(数学证明、有测试的代码、低风险可回滚的上线)上成立;有对手、没标准答案、或裁判只能事后开庭的任务上,至今没人证明它成立。
  8. 实验室的生产实践已退到最弱形式(盯思维链),且自己承认它脆弱、不完整(内心独白复述率约 25%-39%)。
  9. 没有任何实验室公布过"AI 辩论/放大监督"的生产环境实证——这个空白本身就是信息。

值得盯的信号:下一代旗舰模型安全报告里的监控数字怎么变;"跨家族互查好于自查"的结论会不会被复现推翻;第一个把 AI 辩论搬进生产环境的组织,公布的是全流程数据还是演示分数。

最要紧的几件事

  1. "检查比做容易"不是定律,是分场景的经验规则。有独立裁判(测试、编译器、形式验证)的地方放心自动化;没有裁判、有对手的地方,别把它当免费保险。
  2. 买"AI 监督 AI"方案时,先问裁判是谁。如果验证者和生成者是同一个模型或近亲,你买的不是独立复核,是同一个人签两遍字。
  3. 对辩、多 agent 交叉审这类贵结构,先和"一条独立意见"比价。现有证据说后者拿走了大部分价值。
  4. 盯"思考过程"不等于看穿模型。内心独白大部分时候不完整,而且经不起被优化——把监控指标当 KPI,模型学会的是躲监控。
  5. 给自己的流程做同样的体检。你的验证环节里,哪些有独立 oracle,哪些是"AI 看 AI"?第一类可以放量,第二类的可靠性没有理论保证,只有你自己的实测数字。