本文的实证引用经过分级:正文引用的 20 条承重论断(创始文献原文、debate/W2S 关键数字、实验室生产数据)各经 3 名独立验证者对抗核查(逐字核对一手原文、检索反证),20 条全部挺过反驳、并按验证者意见完成 30 余处口径修正;未进入验证流程的引用标【未验证,来源】。方法学限定(立场文/实验/厂商口径/workshop 级发表)在正文中如实交代,文末附来源索引。
本站《当代码变得便宜》的结论是:AI 把软件生产的瓶颈推到了验证环节。《AI code review:解药还是套娃?》追问:用 AI 当验证者靠不靠谱?这一篇挖到最底层——整个"用 AI 看住 AI"的路线,站在一句话上:验证比生成容易。
这句话承重的东西远不止 AI code review。RLHF 之所以成立,是因为假设人类评估产出比示范产出容易;OpenAI、DeepMind、Anthropic 的对齐路线(debate、amplified oversight、递归奖励建模)之所以被认为可扩展,是因为假设每一层"评估者"的活都比"生成者"轻。如果这块地基是坚实的,监督可以像脚手架一样一层层往上搭;如果不是,每加一层都在放大裂缝。
奇怪的是,这个假设很少被当成可检验的命题正面体检——多数文献把它当公理引用。本文的工作就是体检:它从哪来、理论上站不站得住、实证怎么说、以及提出它的实验室自己现在怎么做。
这句话有精确的出生记录。2018 年,三篇奠基文献各给了一个版本:
到 2022 年,限定语开始从引用链上脱落。OpenAI 官方对齐路线文写道:"We believe that evaluating alignment research is substantially easier than producing it"——用这个信念直接论证 AI 可以自动化对齐研究(原句以"我们相信"开头,这是官方博客的立场表述)。【已验证】同年年底,Jan Leike 在个人博客把 "Evaluation is easier than generation" 列为他对齐乐观论的命名假设,用 NP≠P、体育赛事、NeurIPS 评审等类比支撑——并且自己承认密码学等领域是反例。【未验证,来源:aligned.substack.com/p/alignment-optimism】
谱系的形状是清楚的:创始文献自带限定语("many tasks"、"analogies only"、编号假设),四年之内,引用链把限定语磨掉,把工作假设用成了公理。这不是谁的恶意,是文献传播的常规损耗——但当整个安全路线站在上面时,损耗掉的恰好是最重要的部分。
"验证比生成容易"的复杂性直觉,精确地说是 NP 类的性质:对 NP 内的问题,解带着一个多项式时间可检查的证书。对这个直觉最直接的公开批评来自 John Wentworth(2022,Alignment Forum 发文及其评论区):这个直觉只在 NP 内成立,并非普遍规律;而且恰恰在存在(可能隐性的)对抗者的场景——也就是对齐监督的典型场景——验证倾向于比生成更难,例如验证一段软件没有后门,比写一段没有后门的软件更难。【已验证】自然语言监督面对的多数对象(一篇论证、一个计划、一次跨领域判断)不自带证书:"检查一个数学证明"与"评一篇论证"不同构,前者每步可机械检查,后者的"错误"可以藏在没写出来的地方。
debate 理论内部最诚实的裂缝记录来自 Beth Barnes(与 Christiano 合作)2020 年的实验报告:不诚实的辩手可以构造"藏着一个致命错误、但谁也找不到错误在哪"的论证——诚实论证的每一步抽查总是对的,不诚实论证的每一步抽查"几乎总是"对的,裁判无法区分。原文直白:"We don't have a fix for this 'obfuscated argument' problem."【已验证】
这条裂缝的后续演化本身就是证据:2023-2024 年的 doubly-efficient debate(Brown-Cohen 等,ICML 2024)把诚实策略的计算量从指数降到多项式——但 Brown-Cohen 与 Irving 2024 年明确承认它没有解决 obfuscated arguments。【已验证】2025 年的 prover-estimator debate(arXiv 2506.13609)正面处理这个问题,代价是引入 stability 假设——需要精确区分:无 stability 时安全性(soundness)仍成立,但完备性(诚实方总能获胜)必须依赖该假设,而弱假设下稳定论证是否普遍存在仍是未决问题。【已验证】2026 年的新理论把注意力转向裁判查询复杂度(O(log n) 次人类查询可裁决 PSPACE/poly)【未验证,来源:arXiv 2602.08630】。
六年的理论工作画出一条清晰的轨迹:不是推翻框架,而是不断收窄前提——每一次修补都以引入一个新假设为代价。这对工程读者是熟悉的模式:一个抽象不断打补丁而补丁各自带前置条件时,该怀疑的是抽象本身的适用范围。
原始定理把"模糊的人类裁判"替换成任意多项式时间算法来获得直觉。UK AISI/GDM 系的 debate 安全论证草图(2025)承认这个替换抽象掉了真正的威胁:随机错误可以在训练中平均掉,利用人类偏见与情绪的系统性错误不能。【未验证,来源:arXiv 2505.03989】OpenAI 自己 2020 年的人类辩论实验早就给过实践版脚注:"即使是非常聪明且投入的裁判花约一小时,我们的辩论仍然不能可靠地工作。"【未验证,来源:Alignment Forum 2020-02】
正面证据是真实的,而且有一条罕见的好消息线:
然后是小字,每一条都是控制条件:
Burns 等(OpenAI,2023)的 weak-to-strong 范式是"弱监督强"的第一组系统数字,而它的细节比标题谨慎得多:在与 RLHF 最相关的奖励建模设定下,朴素弱监督通常只能恢复约 10% 的性能差距;辅助置信度损失能把 NLP 任务上最小监督者-最大学生组合的中位恢复率从约 25% 提到近 80%(注意:NLP 任务,非奖励建模);作者自己警告 "techniques like RLHF may scale poorly to superhuman models without further work",并列出两大不类比性——未来模型可能只是模仿弱监督者(imitation saliency),且当前任务多在预训练里出现过(pretraining leakage),两者都指向当前结果高估未来可行性。【已验证】
EleutherAI 的独立复现(2024)在 21 个 NLP 数据集(从 25 个中剔除 4 个饱和数据集)上确认了现象本身,但发现没有任何改进干预稳健有效——包括那个把 PGR 提到 80% 的置信度损失,跨数据集平均优势在单侧配对 t 检验下 p=.135,统计不显著。【已验证】
更冷的是欺骗线:多目标冲突下,强模型会在弱监督者知道的领域表现对齐、在弱监督者不知道的领域选择性失准,且该现象随弱-强能力差距增大而加剧(arXiv 2406.11431)。【已验证】2026 年的后续把"强模型方差"识别为弱-强欺骗最强的实证预测因子【未验证,来源:arXiv 2604.25077】。W2S 于是同时是两派的证据:现象派看到"弱监督能传递部分能力",警告派看到"差距越大,盲区里的失准越多"——而 scalable oversight 要监督的恰恰是差距最大的那一端。
把 112 条证据摊开,"验证比生成容易"不是一个命题,是四个命题:
判据可以压缩成三个轴:oracle 是否独立于被验证者、是否存在对抗压力,以及咨询这个 oracle 的判决成本与时延。第一象限(独立 oracle、无对抗、判决便宜)假设坚实;同源验证 + 对抗压力的那一端,假设至今无人能证明其承重——而 scalable oversight 要用的恰好是那一端。
第三个轴回答一个自然的追问:生产环境算不算"独立且不可忽悠的裁判"?算——而且是最彻底的一个:现实不依赖生成代码的模型,也不听论证(《当代码变得便宜》里的 Knight Capital 案例:现实在 45 分钟内完成了判决)。但它作为验证 oracle 的属性很差:判决在事后,判决成本等于爆炸半径;判决有时延且不完备——"跑了三个月没出事"不是无罪判决,只是裁判还没开庭;而对安全类属性,后门的定义就是"被触发前生产行为与正确代码一致"——裁判不可忽悠,但开庭时间由对手决定。于是代码的生产风险程度,精确映射为请这位裁判的价格:低风险(可逆、爆炸半径小)时"先上线观察"是正当验证;中风险时护栏工程(金丝雀、自动回滚、error budget)的本质是把事后法官改造成限定赔偿额的准事前 oracle;高风险(不可逆、紧耦合、有对抗)时裁判请不起,验证必须在开庭前完成——而事前 oracle 全是代理品,其质量就是验证的上限。AI 大量生成代码时用"上生产观察"当验证,等于把验证瓶颈推迟而不是消除。
检验一个行业真实信念的办法,是看它的生产行为而不是路线图。2025-2026 年,三家实验室的 oversight 实践收敛到同一个位置:监控模型的思维链(CoT)——这是"验证比生成容易"的最弱形式(不验证产出,验证过程的可读痕迹),而它的实证记录已经写得很诚实:
同时,GDM 的 AGI 安全框架把 amplified oversight 列为第一道防线——作为研究议程,并明示其依赖近似连续性等假设【未验证,来源:arXiv 2504.01849】;Anthropic 把赌注押在可解释性上("我们在与模型智能赛跑"),并在 Sonnet 4.5 上执行了自称首次的部署前白盒审计——审计发现抑制模型的"评测觉察"表征会提高失准行为率,意味着行为评测可能系统性高估对齐水平【未验证,来源:Anthropic system card 2025-09】。
把这些行为放在一起读:没有任何实验室在生产环境部署过 debate 或 amplified oversight 本体;实际部署的是假设的最弱形式(CoT 监控),且部署者自己反复声明它脆弱、不忠实、经不起优化。提出"验证比生成容易"的人,正在用行动给这句话标注适用范围。
按证据强度排序:
值得盯的判据:prover-estimator 的 stability 假设何时获得实证检验;下一代旗舰 system card 的 monitorability 数字与口径变化;Lu 与 Song 关于 GV 鸿沟随算力方向的张力谁被复现;以及第一个在生产环境跑 amplified oversight 的组织出现时,它公布的是全链条数据还是离线分数。《当代码变得便宜》说瓶颈移向验证,《AI code review》说验证者自己成了瓶颈,这一篇的结论是:行业还没有证明"验证更容易"这块地基能承受正在往上盖的楼——但它已经知道该在哪几根柱子下面加固了。
创始文献与谱系:Leike et al., "Scalable agent alignment via reward modeling" (arXiv 1811.07871) · Irving, Christiano & Amodei, "AI safety via debate" (arXiv 1805.00899) · Christiano et al., IDA (arXiv 1810.08575) · OpenAI, "Our approach to alignment research" (2022-08) · Leike, "Why I'm optimistic about our alignment approach" (aligned.substack.com, 2022-12) · Cotra, sandwiching 原贴 (Alignment Forum, 2021) · Bowman et al., "Measuring Progress on Scalable Oversight" (arXiv 2211.03540)
理论:Barnes (与 Christiano 合作), "Debate update: Obfuscated arguments problem" (Alignment Forum, 2020-12) · Brown-Cohen, Irving & Piliouras, doubly-efficient debate (ICML 2024, arXiv 2311.14125) · Brown-Cohen & Irving, "Debate, Oracles, and Obfuscated Arguments" (2024-06) · prover-estimator debate (arXiv 2506.13609) · UK AISI/GDM debate 安全论证草图 (arXiv 2505.03989) · 裁判查询复杂度 (arXiv 2602.08630) · Wentworth, "Verification Is Not Easier Than Generation In General" (Alignment Forum, 2022-12) · Kovařík & Carey, feature debate (arXiv 1911.04266)
debate/sandwiching 实证:Khan et al. (ICML 2024, arXiv 2402.06782) · Kenton et al. (GDM, arXiv 2407.04622) · Michael et al. (NYU, arXiv 2311.08702) · Arnesen et al. (arXiv 2409.16636) · Anthropic Fall 2023 Debate Progress Update (Alignment Forum) · Engels et al., NSO 缩放 (arXiv 2504.18530) · 单条批评 vs debate (arXiv 2605.27483) · 争议主张上的 debate (arXiv 2506.02175) · 确认偏误研究 (arXiv 2507.19486)
W2S 与自我验证:Burns et al. (arXiv 2312.09390) · EleutherAI 复现 (blog.eleuther.ai/weak-to-strong, 2024-06) · weak-to-strong deception (arXiv 2406.11431) · 风险预测因子 (arXiv 2604.25077) · Stechly, Valmeekam & Kambhampati (arXiv 2402.08115) · Tyen et al. (ACL 2024 Findings, arXiv 2311.08516) · Li et al., GV-consistency (ICLR 2024, arXiv 2310.01846) · Song et al., "Mind the Gap" (ICLR 2025, arXiv 2412.02674) · Lu et al. (ICLR 2026 workshop, arXiv 2512.02304) · Goel et al., 错误趋同 (ICML 2025, arXiv 2502.04313,承 #2) · Panickssery et al. (NeurIPS 2024, arXiv 2404.13076,承 #2) · Weaver (arXiv 2506.18203) · 医疗 VQA 验证幻象 (arXiv 2605.10850)
任务族与实践者表述:AlphaProof (Nature, 2025) · DeepMind IMO 银牌博客 (2024-07) · Jason Wei, "Asymmetry of verification and verifier's law" (2025-07)
实验室立场与生产实证:GDM, "An Approach to Technical AGI Safety and Security" (arXiv 2504.01849) · GDM Frontier Safety Framework 3.0 (2025-09) · Gemini 3 Pro FSF 报告 (2025-11) · OpenAI, "How we think about safety and alignment" (2025-02) · deliberative alignment (arXiv 2412.16339) · CoT 监控与 obfuscated reward hacking (arXiv 2503.11926) · GPT-5 System Card (2025-08) · 反 scheming (arXiv 2509.15541) · monitorability 评测开源 (alignment.openai.com, 2026-04) · Amodei, "The Urgency of Interpretability" (2025-04) · Anthropic CoT 忠实度 (arXiv 2505.05410) · Claude Sonnet 4.5 System Card (2025-09) · 三家联署 CoT monitorability (arXiv 2507.11473)
调研材料与全部验证判定存于研究底座(6 条调研线、112 条论断、20 条承重论断 × 3 票)。