「学习技巧」有上百种,认知科学反复验证的只有三个开关——其余都是包装,包括你的 AI 学习工具卖给你的那套。
Day 53 讲了「用 AI 学习必须装护栏」,这一期给出护栏里最硬核的那三根钢筋。Dunlosky 等人 2013 年那篇被反复引用的综述把十种主流学习技巧摆上台,逐一按证据强度打分——结果绝大多数(划重点、重读、总结、想象法)只拿到低分或依赖场景,只有「练习性测验」和「分散练习」拿到跨年龄、跨材料的高效用评级,交错练习拿到有条件的中等。也就是说,把学习当系统来工程化,真正值得你装进流程的开关只有三个:检索练习、间隔、交错。这一期不讲「它们是什么」(那是心理学 101),讲三件工程上要命的事:每个开关精确的生效条件、失效边界,以及怎么用一张四问清单去筛选或自建 AI 学习工具——因为几乎没有一个 AI 家教默认打开它们。
Roediger & Karpicke 2006 那组经典实验把它测死:读完一段材料,「再读一遍」组和「合上书自由回忆」组,短期内重读组自我感觉更好、当场也不差;但一周后的延迟测验里,做过检索练习的组显著胜出。这就是 testing effect——记忆不是在「看到」时变牢,是在「费劲取出」时变牢。Dunlosky 综述把它评为最高效用之一,跨年龄跨学科都成立。但它有两个不可省的工程条件:一是取出必须费劲(自由回忆,不是能猜的选择题——那测的是再认,不是回忆);二是必须有反馈纠错,否则错误答案会被你一同「练牢」。而衡量它有没有生效,只能看延迟后测,当场测只反映短期缓存。
把任意 chatbot 从「答案机」改造成「考官」,一段 system prompt 就够:
# 检索练习循环:先逼回忆,再揭晓 + 纠错,最后排延迟后测
SYSTEM: 你是我的检索练习教练,严格遵守:
1. 我给一个刚学的主题,你出 3 道开放式自由回忆题
(不许出选择题——选择题能猜,测的是再认不是回忆)
2. 在我作答之前绝不泄露任何提示或答案
3. 我答完后给标准答案 + 逐点纠错(无反馈 = 错误固化)
4. 每题附一个延迟后测计划:这题放到 N 天后再考我一次
关键是第 2、3 条:把「揭晓」推到你作答之后,并强制反馈——这正是 Day 53 里「导师版」护栏消除学习损害的机制。
集中练(cramming)当场分数高、感觉流畅,但忘得快;把同样的时间摊到多次、拉开间隔,长期留存显著更好。工程上真正要拿捏的是间隔多长。Cepeda 等人 2008 年用 1350 多人、复习间隔最长 3.5 个月、终测延迟最长 1 年,画出了一条「岭线」:终测表现随间隔先升后降(倒 U),而最优间隔随考期放大,但占考期的比例在缩小——考期 1 周时最优间隔约占 20–40%,考期 1 年时降到约 5–10%。另一条反直觉结论来自 Karpicke & Roediger 2007:递增间隔(expanding)只赢短期,等间隔在长期反而更好;真正重要的是「第一次复习要延迟、要费劲」,而不是后续间隔递不递增。
# 按「考期比例」定间隔,而不是背固定天数
retention_interval = days_until_needed # 距面试/上线/考试还有几天
first_gap = 0.1 * retention_interval # 首次复习 ≈ 考期的 ~10%
# Cepeda 2008:最优间隔随考期放大,但占考期的比例递减
# Karpicke&Roediger 2007:长期用等间隔即可,别迷信递增;
# 真正重要的是「第一次复习别紧跟着学、要隔开、要费劲」
为什么交错(interleaving)比分块(blocking)好?Rohrer & Taylor 2007 的数学实验给了机制级答案:分块练习时,你已经知道「这一整版都用同一个公式」,于是只练了执行,没练判别;一到混合考试就抓瞎。他们的错误分析显示,分块组的错绝大多数是「选错了方法」——不是不会算,是不知道该用哪个。交错练习把不同类型打散,逼你每题先判断「这是哪一类、该用哪招」,练的正是这个判别动作。但这也划定了它的边界:交错的红利来自「区分易混项」,所以它只对彼此易混、需要选择策略的材料有效(求导 vs 积分、乐观锁 vs 悲观锁、几类相似的 bug);对彼此独立、不存在「选错方法」问题的技能,交错只徒增上下文切换成本。这正是 Dunlosky 只给它中等评级的原因——效用高度依赖材料。
# 只交错「易混对」,独立技能照常分块
confusable = [("求导","积分"), ("BFS","DFS"), ("乐观锁","悲观锁")]
independent = ["学 SQL", "练听力"] # 无判别问题 → 交错只增成本
for pair in confusable: # 把两类题打散混排,
quiz = shuffle(problems(pair)) # 逼你每题先答「这是哪一类」
# 让 AI 出题时明确要求:混合出题、不要标注题目类型
把前三节收成一条选型判据。市面上绝大多数 AI 家教默认的是「先讲解、再给完整答案」——那正是重读,也是 Day 53 里 PNAS「原味 GPT」组学习损害的来源。更常见的营销话术是「智能适配你的学习风格」(视觉型/听觉型…):Pashler 等人 2008 年的权威综述明确指出,这套「meshing 假说」缺乏支持证据——按学习风格定制教学并不能提升效果。所以「卖学习风格」不是卖点,是伪科学信号。还有一层工程现实:实验室 → 课堂的效应衰减。上面三个开关在实验室效应量漂亮,但一落到真实场景,效应普遍缩水、且随材料波动(Dunlosky 综述反复强调「效用依条件而变」)。含义很直接:把三个开关的纪律外包给工具的默认设置,比靠你自己每天坚持更可靠——因为轻剂量、断续执行,正是它们失效的方式。
# AI 学习工具四问(选型 or 自建都用它)
[ ] 揭晓答案前先逼我回忆? 否 = 伪装成聊天的重读
[ ] 自动排「延迟后测」,而非当场测?否 = 只测短期缓存
[ ] 把易混内容混排出题? 否 = 丢了判别训练
[ ] 每次作答都给纠错反馈? 否 = 错误会被练牢
# 减分信号:卖点是「适配你的学习风格」
# → meshing 假说无证据(Pashler 2008)
四问全过,才是把三个开关设成了默认;否则纪律仍压在你身上——而你不会长期坚持。
① 检索练习——生效条件:自由回忆(非选择题)+ 纠错反馈 + 延迟后测;失效:能猜、无反馈、只当场测。
② 间隔——生效条件:首次复习延迟到「考期的 ~10%」、多剂量;失效:只隔一次(轻剂量)、拉太长跌下岭线、迷信递增间隔。
③ 交错——生效条件:材料彼此易混、需选对方法;失效:交错本无关联的独立技能(纯切换成本)。
内核:学习技巧有上百种,跨材料稳定生效的只有这三个(Dunlosky 2013)。选 AI 工具就一句话——它把这三个设成默认了吗?还是在卖「学习风格」?