你以为你在看世界——其实你在猜,世界只负责纠错。
此刻你正盯着屏幕。感觉很直接对吧——光进了眼睛,大脑就"看到"了。但这几十年的神经科学把这个直觉整个翻了过来:你的大脑不是一台老实拍下世界的相机,而是一台不停在"猜"世界长什么样、再拿眼睛送回来的信息去纠错的机器。你看到的每一帧,都是大脑的一个"最佳猜测"。这一期我们就掰扯这一件事——但一旦你信了它,后面的注意、记忆、甚至意识,都会跟着松动。
先说那个被推翻的老直觉:光子打到眼睛 → 信号一层层往上传 → 大脑最后"看到"。听起来天经地义。可解剖学早就打脸了:在大脑的视觉通路上,从"高层"往"低层"倒着走的连接,数量远远多过从眼睛往上走的。换句话说,大脑绝大部分精力不是在收数据,而是在往下发猜测。
不信?看下面这两个灰块。左边那块在浅色里,右边那块在深色里——你几乎肯定觉得右边那块更亮。但它俩的颜色一模一样:
这不是眼睛坏了,而是大脑在用它对"背景会影响物体"的经验,主动帮你"脑补"。所以你看到的从来不是原始像素,而是被大脑的预期塑造过的结果。(这条从眼睛到大脑的路每一站怎么走,视觉通路)
EN Perception is mostly top-down prediction, not bottom-up reception — in the visual pathway, feedback connections outnumber feedforward ones. What you "see" is the brain's best guess, shaped by priors: which is exactly why two physically identical grays look different against different backgrounds.
AI 里有一类东西叫生成模型(会画图的 Stable Diffusion、AI 换脸那类工具都是),思路和大脑一模一样:与其硬存一堆像素,不如学一个能"生成"世界的内部模型,再拿它去解释眼前的输入——先给个假设、生成一版、和真实比对、按差错修正。大脑"先猜 → 往下发 → 拿感官纠错",走的正是同一个骨架。
大脑怎么高效地猜?靠一个很省的机制:每一层只把"没猜中的部分"往上报。你可以把大脑想成一叠楼层,每层都在预测下面一层会发生什么,把预测往下发;下层拿预测和实际一比,只有对不上的地方(差错)才往上传。猜中的部分,根本不往上走——因为它没带来任何新消息。
这一下就说通了好多日常小事。你听不见自己家冰箱的嗡嗡声——因为它太可预测了,差错为零,压根不上报;可它一停,你反而立刻警觉,因为"预测落空"了。越熟悉的东西越像隐形,不是你的耳朵变钝,是它们早被大脑猜到、提前扣掉了。说到底,大脑的注意力,是留给意外的。
EN The cortex predicts itself layer by layer and sends only the "prediction error" upward — correctly predicted signals stay silent. That's why the familiar goes invisible (you stop hearing your own fridge), and why attention is reserved for the surprising.
AI 里也反复在用"只记没猜中的部分"这个省法——不重复已知、只存增量。最贴的例子是大语言模型(ChatGPT 那类)的训练:模型每一步都在猜"下一个词是什么",猜得多离谱(那个数叫 loss)就是它的"预测差错",然后它只沿着"没猜准的方向"去微调自己。大脑用差错实时纠正当下的判断,模型用差错慢慢纠正自己——本质都是"被意外推着学"。
把前面两点合起来,就得到一条特别实用的规律:你最终看到的 = 大脑的预期 + 眼前的证据,各占多少,看谁更靠谱。
关键在"谁更靠谱"。光线昏暗时,眼睛送回的证据很不可靠,大脑就更信自己的预期——于是你把衣架看成蹲着的人,把风声听成有人叫你名字。反过来,大白天证据充足,预期就得让位、老老实实按看到的来。这也顺带给了"注意"一个很准的定义:注意,就是大脑临时调高某个地方证据的可信度,让它更有资格改写你眼里的世界(注意本身是 Topic 2)。
EN What you perceive ≈ prior × evidence, weighted by reliability (precision). When sensory evidence is weak — say, in dim light — priors take over, the same mechanism behind both illusions and hallucinations. Attention is simply the brain turning up the precision of the evidence somewhere.
这在 AI 里叫按可信度加权:证据不足时,就更信自己的经验(先验)。AI 模型里也有个旋钮管"多信先验"(画图时的 guidance、聊天模型里的 temperature 都是这类),只不过大脑是用一个叫精度的量、逐个感官、实时自动地在拧这个旋钮。更妙的是——AI 的"幻觉"和人的错觉是同一个故事:先验被过度采信、证据被压过,大脑或模型就"看见"了根本不在那儿的东西。
预测和现实对不上,怎么办?前面讲的都是改大脑——更新猜测去贴合世界。但还有一条对称的路:改世界去贴合猜测。这就是主动推理,也是它最妙的地方。
举个最简单的:你预测"眼睛应该正对着桌子中央",可现在没有——于是你动了下眼睛,让它真的对准中央。差错被抹平了,不是靠改信念,是靠动作。把这个推到底,会得到一个惊人的重述:你的每个动作,其实都是一个"被身体实现出来的预测"。你伸手去拿杯子,是大脑先预测"手已经握住杯子了",这个还没实现的预测产生的差错,驱动肌肉去把它变成真。
所以感知和行动根本是同一台机器的两个出口:感知问"世界是啥样",行动问"我怎么让世界变成我猜的样"。这也是为什么后面讲运动、讲决策、甚至讲冥想(主动去调自己的预测),都能挂回这根主线。
EN Prediction error can be minimized two ways: change the model (perception) or change the world (action). So every action is a prediction the body makes come true — perception and action are two outlets of one error-minimizing engine (active inference).
这跟 AI 训练智能体的主流办法强化学习很像,但有个耐人寻味的差别:强化学习让智能体去"最大化奖励",主动推理让它去"最小化预测差错"——很多时候两者等价,但后者把"探索世界"和"达成目标"揉成了同一件事。它天生就是那种"先在脑子里建个世界模型、用它想象、再行动去让想象成真"的智能体——如今 AI 圈在重新发现的这套思路,大脑已经用了上亿年。
"你从没直接碰过世界,只碰到大脑造的模型"——这个结论,好几门古老学问几千年前就抵达过,只是当年没有 fMRI: