TOPIC 1 · PHASE A 认知

感知即推断

你不是在"看见",你是在"猜"

2026-07-10 · BigCat

你以为你在看世界——其实你在猜,世界只负责纠错。

此刻你正盯着屏幕。感觉很直接对吧——光进了眼睛,大脑就"看到"了。但这几十年的神经科学把这个直觉整个翻了过来:你的大脑不是一台老实拍下世界的相机,而是一台不停在"猜"世界长什么样、再拿眼睛送回来的信息去纠错的机器。你看到的每一帧,都是大脑的一个"最佳猜测"。这一期我们就掰扯这一件事——但一旦你信了它,后面的注意、记忆、甚至意识,都会跟着松动。

// 01

大脑是"猜测机器",不是相机

先说那个被推翻的老直觉:光子打到眼睛 → 信号一层层往上传 → 大脑最后"看到"。听起来天经地义。可解剖学早就打脸了:在大脑的视觉通路上,从"高层"往"低层"倒着走的连接,数量远远多过从眼睛往上走的。换句话说,大脑绝大部分精力不是在数据,而是在往下发猜测

高层大脑 · 先有一个"猜测" 眼睛 · 只回送"没猜中"的差错 预测 · 大量 误差 · 少量
感知的主方向是"脑 → 眼睛"的预测,不是"眼睛 → 脑"的数据

不信?看下面这两个灰块。左边那块在浅色里,右边那块在深色里——你几乎肯定觉得右边那块更亮。但它俩的颜色一模一样

浅色背景 深色背景 两块灰的填充完全相同 · #8a8a8a
你"看到"的深浅,是大脑结合背景猜出来的,不是眼睛量出来的

这不是眼睛坏了,而是大脑在用它对"背景会影响物体"的经验,主动帮你"脑补"。所以你看到的从来不是原始像素,而是被大脑的预期塑造过的结果。(这条从眼睛到大脑的路每一站怎么走,视觉通路

EN Perception is mostly top-down prediction, not bottom-up reception — in the visual pathway, feedback connections outnumber feedforward ones. What you "see" is the brain's best guess, shaped by priors: which is exactly why two physically identical grays look different against different backgrounds.

AI 对读

AI 里有一类东西叫生成模型(会画图的 Stable Diffusion、AI 换脸那类工具都是),思路和大脑一模一样:与其硬存一堆像素,不如学一个能"生成"世界的内部模型,再拿它去解释眼前的输入——先给个假设、生成一版、和真实比对、按差错修正。大脑"先猜 → 往下发 → 拿感官纠错",走的正是同一个骨架。

// 02

只有"没猜中的"才值得上报

大脑怎么高效地猜?靠一个很省的机制:每一层只把"没猜中的部分"往上报。你可以把大脑想成一叠楼层,每层都在预测下面一层会发生什么,把预测往下发;下层拿预测和实际一比,只有对不上的地方(差错)才往上传。猜中的部分,根本不往上走——因为它没带来任何新消息。

高层 中层 眼睛 / 低层 预测↓ 误差↑ 猜中 = 静默 · 猜错 = 上报
分层预测:预测往下发,只有"意外"往上走

这一下就说通了好多日常小事。你听不见自己家冰箱的嗡嗡声——因为它太可预测了,差错为零,压根不上报;可它一停,你反而立刻警觉,因为"预测落空"了。越熟悉的东西越像隐形,不是你的耳朵变钝,是它们早被大脑猜到、提前扣掉了。说到底,大脑的注意力,是留给意外的。

EN The cortex predicts itself layer by layer and sends only the "prediction error" upward — correctly predicted signals stay silent. That's why the familiar goes invisible (you stop hearing your own fridge), and why attention is reserved for the surprising.

AI 对读

AI 里也反复在用"只记没猜中的部分"这个省法——不重复已知、只存增量。最贴的例子是大语言模型(ChatGPT 那类)的训练:模型每一步都在猜"下一个词是什么",猜得多离谱(那个数叫 loss)就是它的"预测差错",然后它只沿着"没猜准的方向"去微调自己。大脑用差错实时纠正当下的判断,模型用差错慢慢纠正自己——本质都是"被意外推着学"。

// 03

光线越暗,你越"看见你以为的"

把前面两点合起来,就得到一条特别实用的规律:你最终看到的 = 大脑的预期 + 眼前的证据,各占多少,看谁更靠谱。

关键在"谁更靠谱"。光线昏暗时,眼睛送回的证据很不可靠,大脑就更信自己的预期——于是你把衣架看成蹲着的人,把风声听成有人叫你名字。反过来,大白天证据充足,预期就得让位、老老实实按看到的来。这也顺带给了"注意"一个很准的定义:注意,就是大脑临时调高某个地方证据的可信度,让它更有资格改写你眼里的世界(注意本身是 Topic 2)。

EN What you perceive ≈ prior × evidence, weighted by reliability (precision). When sensory evidence is weak — say, in dim light — priors take over, the same mechanism behind both illusions and hallucinations. Attention is simply the brain turning up the precision of the evidence somewhere.

AI 对读

这在 AI 里叫按可信度加权:证据不足时,就更信自己的经验(先验)。AI 模型里也有个旋钮管"多信先验"(画图时的 guidance、聊天模型里的 temperature 都是这类),只不过大脑是用一个叫精度的量、逐个感官、实时自动地在拧这个旋钮。更妙的是——AI 的"幻觉"和人的错觉是同一个故事:先验被过度采信、证据被压过,大脑或模型就"看见"了根本不在那儿的东西。

// 04

还有一招:不改猜测,改世界

预测和现实对不上,怎么办?前面讲的都是改大脑——更新猜测去贴合世界。但还有一条对称的路:改世界去贴合猜测。这就是主动推理,也是它最妙的地方。

举个最简单的:你预测"眼睛应该正对着桌子中央",可现在没有——于是你动了下眼睛,让它真的对准中央。差错被抹平了,不是靠改信念,是靠动作。把这个推到底,会得到一个惊人的重述:你的每个动作,其实都是一个"被身体实现出来的预测"。你伸手去拿杯子,是大脑先预测"手已经握住杯子了",这个还没实现的预测产生的差错,驱动肌肉去把它变成真。

所以感知和行动根本是同一台机器的两个出口:感知问"世界是啥样",行动问"我怎么让世界变成我猜的样"。这也是为什么后面讲运动、讲决策、甚至讲冥想(主动去调自己的预测),都能挂回这根主线。

EN Prediction error can be minimized two ways: change the model (perception) or change the world (action). So every action is a prediction the body makes come true — perception and action are two outlets of one error-minimizing engine (active inference).

AI 对读

这跟 AI 训练智能体的主流办法强化学习很像,但有个耐人寻味的差别:强化学习让智能体去"最大化奖励",主动推理让它去"最小化预测差错"——很多时候两者等价,但后者把"探索世界"和"达成目标"揉成了同一件事。它天生就是那种"先在脑子里建个世界模型、用它想象、再行动去让想象成真"的智能体——如今 AI 圈在重新发现的这套思路,大脑已经用了上亿年。

🌀 越界 · 跨学科的联想

"你从没直接碰过世界,只碰到大脑造的模型"——这个结论,好几门古老学问几千年前就抵达过,只是当年没有 fMRI:

// 深入思考

如果我"看到"的永远是大脑的猜测,那我凭什么信我看到的世界是真的?
严格说,你从没"直接"碰过世界——你碰的一直是大脑的模型。但这不导致怀疑一切:这个模型被持续的差错拴在现实上,猜错就要付代价(撞墙、抓空)。所以感知不是幻觉,是一个被现实不停校准的"受控幻觉"——真到足够让你活下来,但永远不是像素级的真相。这也解释了为什么两个人能"看到"不同的东西:预期不同,结果就不同。
既然"熟悉 = 零差错 = 无感",那为什么我们还爱重复——重听一首歌、重看一部电影?
因为"差错"不止一层。低层(音符、画面)被猜到了,但高层(情绪的走向、意义、和记忆的共振)还在冒新差错;而且"完全可预测"本身能变成一种安全感(仪式、白噪音、ASMR 就靠这个)。审美的甜区,往往落在"猜得到的骨架 + 恰到好处的意外"之间——太意外是噪声,太好猜是无聊。这条 Topic 19 敬畏、以及音乐认知里还会回来。
大脑和生成模型是同一个骨架,那 LLM 的"幻觉"和人的"错觉/妄想"是一回事吗?
机制上高度同源:先验被过度采信、证据被压过,两边都会"生成"不存在的细节。但有个关键差别——健康大脑多一条腿:主动推理。它能去动、去采样新证据来验自己的猜(多看一眼、伸手摸一下)。而现在的 LLM 大多没有这条"主动去查"的闭环,只能在已有先验里往下编——这也指了缓解幻觉的方向:给它取证据、并让证据有权压过先验的能力。工具调用、检索,本质就是给模型接上"感官"。

// 延伸阅读