深度研究
多 agent 调研 · 对抗式核查 · 正反证据并陈
方法:① 调研 数十至上百个 AI agent 并行阅读一手来源 → ② 对抗核查 每条关键论断由 3 名独立验证者尝试反驳(逐字核对原文、检索反证)→ ③ 成文 没挺过验证的论断被剔除或降级标注,正反证据并陈。
传统软件组织的 AI-native 转型
为什么人人自觉变快、组织却更不稳定?从交易成本、Conway/Brooks、控制论到创新理论的完整论证,含高可靠 legacy 组织(BigQuery 式)专章。
组织经济学软件工程复杂系统/控制论创新理论高可靠 legacy
2026-07 · 166 票对抗验证 · 6 个可检验主张
「初级工程师正在消失」是真的吗?
总就业创新高,22-25 岁一档却跌近两成——「消失」是流量现象,不是存量现象。四个数据口径逐一对表,并回答一个悖论:最帮新手的技术,为什么最先收缩新手的岗位。
劳动经济学招聘数据RCT 证据职业阶梯AI 与就业
2026-07 · 45 票对抗验证 · 7 个可检验主张
AI code review:验证瓶颈的解药,还是套娃?
查代码的人跟不上 AI 写代码的速度,行业的答案是再买一个 AI 来查。解剖厂商基准混战与大厂生产漏斗,追问「AI 验证 AI」还剩多少独立性——以及它在什么条件下真的管用。
验证不对称基准混战大厂生产数据自动化人因LLM 当裁判
2026-07 · 45 票对抗验证 · 8 个可检验主张
Scalable oversight 的地基体检
整个「AI 看住 AI」的路线站在「验证比生成容易」一句话上——创始文献里它是带限定的假设,后来被当成了公理。理论裂缝、条件化的实证、与实验室退守 CoT 监控的生产行为,拼出这块地基的真实承重图。
AI 对齐验证不对称debate 实证弱监督强CoT 监控
2026-07 · 60 票对抗验证 · 9 个可检验主张
学习科学的证据等级:哪些方法真的有效?
一万小时、学习风格、划重点——为什么流行的学习建议和实测证据几乎对不上?五场学术对战逐一对账,把常见学习方法按证据强度重新排座次,并给出读效应量数字的防骗规则。
学习科学meta 分析刻意练习之战学习风格神话主动学习
2026-07 · 72 票对抗验证 · 12 个可检验主张
机器裁判全景:LLM 能把软件验证的 oracle 做大多少?
同一种 AI,接崩溃检测器产出二十年 CVE,扔给人类分诊却是 slop 洪水——差别只在裁判是谁。按软件验证的裁判家族逐格盘点,核查每格「LLM 增益」的正反证据。
验证不对称test oracle形式验证fuzzing/差分LLM 当裁判
2026-07 · 87 票对抗验证 · 11 个可检验主张
「70% 转型失败」考古:上一轮的尸检报告能预测 AI 吗?
被整个变革工业当了三十年招牌的「70% 会失败」,是谁测出来的?——没有人。追溯这个数字的引用链原文,复读真实失败率的测量记录,再用 Agile/DevOps 留下的完整档案,评估上一轮转型对 AI-native 转型的预测力。
组织变革僵尸统计Agile/DevOps 档案制度同构AI 转型
2026-07 · 90 票对抗验证 · 11 个可检验主张
给 Agent 看的 README:上下文文件是基建还是货物崇拜?
人人都说要给代码库写 AGENTS.md/CLAUDE.md,但第一批对照实证互相打架,方法学审计还否决了两组流传最广的数字。标准之争、厂商共识、安全攻击面与企业落地 playbook,逐条对抗核验+反证搜索。
Agent 上下文文件AGENTS.md 标准对照实证prompt injection落地 playbook
2026-07 · 三轮 117 份验证 · 10 个可检验主张
自动化的反讽:AI 越好,人握的终审越会退化吗?
自动化越可靠,人这个终审席位退化越快——1983 年的预言正在 AI 工作流里重演吗?从 40 年人因工程实验、航空与医疗两份现场档案,到最新的 AI 时代证据与干预实测,给「人握终审」做一次全面体检。
自动化人因技能退化automation bias人在环AI 工作流设计
2026-07 · 96 票对抗验证 · 11 个可检验主张
「95% 试点失败」体检:企业 AI 的真实基率
吓崩过股市的「95%」,连它自己的报告都撑不住——那到底有多少企业 AI 项目真的失败了?逐字解剖病毒数字的出生与变异,把厂商、咨询与官方统计的口径排成一把阶梯,再用三十年失败率考古和四种经济学理论,给「转型难度的基率」一个诚实的答案。
僵尸统计企业 AI ROI口径混战生产率 J 曲线影子 AI
2026-07 · 102 票对抗验证 · 12 个可检验主张
这轮 AI 资本开支是不是 1999?
人人都在引用 1999 电信泡沫,但那场泡沫本身就被记错了——病根是需求神话、会计造假和债务,不是「建基础设施」。把 2026 的账本口径摆平,再对类比逐项体检:钱从哪来、资产能活多久、需求是不是真的,以及五套理论里哪两套真的能用。
AI capex资本周期1999 电信泡沫融资结构折旧之争
2026-07 · 126 票对抗验证 · 12 个可检验主张
AI 带来的硬件短缺与电力短缺:是真的吗,还要多久?
内存年初售罄、电费连年上涨——但硬件短缺和电力短缺是两场性质不同的短缺:一场涨价出清,一场排队失灵。预测有两次高估前科,约束却已写进拍卖结果和账单;把供给侧交付时间表逐条摆开,「还要多久」的答案基本自动得出。
AI 基建电网约束内存超级周期幽灵需求Jevons 悖论
2026-07 · 36 票对抗验证 + 双席审计 · 10 个可检验主张
未来十年选什么专业?给准大学生的就业证据体检
官方的十年职业预测在大方向上可信,在细分职业排名上几乎只比「假设什么都不变」好一点点——而选专业恰恰发生在细分层面。把最常被搬进志愿指导的几个数字逐个拆开口径,再给一份按判据分栏、每格挂着证据分级的清单。
选专业就业数据口径陷阱AI 与入门岗中美对比
2026-07 · 180 票对抗验证 + 24 席双席审计 · 10 个可检验主张
屏幕时间与青少年心理健康:Haidt 对不对?
《焦虑的一代》推动了半个西方世界的禁手机立法,Nature 的书评却判它「不被科学支持」——七年吵不出结果的争论,毛病出在哪?把危机真实性、因果证据、政策实测拆成三个问题分开审,并把双方的招牌数字逐条送回一手来源。
青少年心理健康因果推断口径陷阱禁手机政策僵尸统计
2026-07 · 72 票对抗验证 + 10 席双席审计 · 12 个可检验主张
长寿干预的证据分级:雷帕霉素、二甲双胍、NAD+、禁食
证据最强的那个几乎没有零售市场,被判否的那个市场最大——这不是巧合。四个长寿明星的招牌数字逐个送回一手文件核对,覆盖三站点小鼠寿命台账、二甲双胍流行病学的反转与复现、NAD+ 大前提的人体体检、热量限制与限时进食的随机证据,以及支撑全部主张的替代终点本身有多松。
循证医学老年医学临床试验方法学补剂产业监管与市场
2026-07 · 102 票对抗验证 · 11 个可检验主张
指数化的终局:被动投资会破坏市场吗?
同一个「被动占比」,换一把尺子就差 40 倍,而争论双方都只报对自己有利的那把。把这场争论的全部证据送回一手来源,覆盖占比的三种量法、警告者的原话与下场、价格发现的六种度量、指数纳入效应的消失与复活、主动跑输的记分牌,以及所有权与指数编制商这两层真正扎实的集中度。
指数基金市场微观结构口径陷阱公司治理金融监管
2026-08 · 96 票对抗验证 · 14 个可检验主张