前几期都在逐力、逐守恒地看世界。现在换一个惊人的视角:给定起点和终点,自然仿佛在所有可能路径 里"比较"了一遍,然后走了让一个叫作用量 的量取极小(严格说是驻定)的那一条。光走最省时的路、行星走该走的轨道,连相对论和量子场都能从同一句话推出来。这一期讲这条把整个物理拧成一股的主线——从费马、拉格朗日到费曼的路径积分——以及它为什么和机器学习的"优化"是同一个念头。四张卡:自然挑路径、拉格朗日的记账、一句话统一物理、以及量子如何解释"它凭什么知道要挑"。
自然"挑"出一条路 Nature Picks a Path — Fermat
变分原理 · 费马 1662
直觉
沙滩上的救生员要救水里的人:笔直冲过去并不是最快的 ,因为在水里游得慢。聪明的做法是在沙滩上多跑几步、少游一点,走一条折线 。光正是这么干的——从空气射进玻璃会拐弯(折射),拐的角度恰好让总用时最短 。费马 1662 年一句话说穿:光走的是用时驻定(通常最短) 的那条路。不是光"想"省时间,而是整个物理都能这么描述。
机制
把"总用时"——更一般地叫作用量 ——写成沿路径累加的一个数,自然选的那条让它取极值。折射里这个数就是时间 T = ∫ ds /v (在慢介质里速度 v 小,就该少走那段)。你中学背的斯涅尔定律 n 1 sin θ1 = n 2 sin θ2 根本不用背——它就是"总用时最短"自动吐出来的结论。
快介质(空气)
慢介质(玻璃)
A
B
直线:更短,却更慢
θ₁
θ₂
真实路径:总用时最短
笔直的路最短,却因为在慢介质里泡太久而更慢;光拐一下,在快介质多走、慢介质少走,反而总用时最短。
反直觉的重点
最短距离 和最短时间 是两码事。在均匀介质里它们碰巧重合,可一旦介质不均匀(光速变了),二者立刻分家——自然认的是时间(作用量) ,不是距离。这一步把"力推着光走"换成了"光在比较所有路",看世界的视角天翻地覆:不再问"每一刻受什么力",而问"整条路让哪个量取了极值"。
跨学科对读 · 工程 / 生物
透镜、光纤的设计全建立在费马原理上——把玻璃形状调到让所有光线"同时到达",就聚成一个焦点。自然界也反复用这一招:蚂蚁觅食踩出的近似最短路、河流改道、闪电劈下的锯齿路径,都能读成某种"代价最小"的路径选择 。"走代价最省的路"是自然一再复用的同一个模板。
一句话:自然不走最短的路,走"代价"最省的路。
思考: 如果水里游得和沙滩上跑得一样快,救生员的折线还会拐吗?不会,直接走直线。折线是因为两段「代价」(速度)不同,为省总时间要在快慢介质里重新分配路程;一旦两边速度相同,最省时的路就是几何直线。这正是斯涅尔折射定律的直觉——光也这么「选路」。
拉格朗日的记账:作用量是什么 Lagrangian: the Ledger of Action
分析力学 · 拉格朗日 1788
直觉
牛顿让你逐点算力 :这一刻受多大力、往哪加速,一步步推。拉格朗日换了个记账法:只盯两样东西——运动的"劲"(动能 T )和位置的"势"(势能 V ),把它们的差 T −V 沿整个过程从头累加到尾,得到一个总数,叫作用量 S 。自然真正走的那条轨迹,让这个总数驻定 (通常取最小)。
机制
定义
拉格朗日量 L =
T −
V (动能
减 势能,注意是减不是加)。作用量是它沿时间的累加:
S = ∫ L dt = ∫ (T − V ) dt
∫ 是"累加/积分"号(把每一小段 L ·dt 加起来),T 是动能、V 是势能,dt 是一小段时间。真实路径满足 δS = 0 (读作"作用量的一阶变化 为零",这个 0 是数字零 ):把路径稍微挪一点点(δ 表示对整条路径的微小变形),S 几乎不变——就像在谷底,往哪个方向偏一点,高度都基本不动。从 δS =0 能推出欧拉–拉格朗日方程 ,它和 F =m a 完全等价,却不必先把力一个个分解出来。
起点
终点
变形路径(S 更大)
变形路径(S 更大)
真实路径 δS = 0
起点终点固定,任你怎么把中间那条路捏来捏去,作用量都会变大;唯独真实轨迹处在"谷底",微小变形一阶不变。
反直觉的重点
为什么是 T 减 V ,不是加(加起来那是总能量)?这是最卡人的一步。直觉上:自然既想让动能别太剧烈 (T 尽量小),又想让物体尽快"下坡"释放势能 (V 尽量早点变小)。T −V 的累加取最小,正是这两个愿望的最佳折中 。真实轨迹,是"能量账本"在时间上摊得最平顺的那一条。
跨学科对读 · AI
这套数学叫变分法(calculus of variations) ——在"所有可能的函数/路径"里,挑出让某个积分(泛函)取极值的那一个。机器学习的整个训练就是同一件事:在所有可能的参数配置 里,找让损失函数 最小的那组。物理的 δS =0 和深度学习的 ∇Loss=0 是同一个数学动作 ,只是一个发生在路径空间、一个发生在参数空间。
一句话:自然是个极简主义会计,只让 T−V 的总账驻定。
思考: F=ma 和 δS=0 完全等价,为什么物理学家越往后越偏爱后者?因为作用量视角更普适、更省事:一个标量 L 就编码全部动力学,天然兼容约束、场、相对论与量子(路径积分直接用 S),且对称↔守恒(Noether)在这框架里最透亮。F=ma 是矢量、逐力记账,换坐标就麻烦。等价,但后者高一层。
一句话统一整个物理 One Sentence for All of Physics
作用量原理 · 统一
直觉
最小作用量最惊人的地方,不在力学本身,而在于——几乎每一条基本物理定律,都能写成"某个作用量驻定" 。你只要换一个 L 的具体形式,同一句 δS =0 就分别吐出光学、牛顿力学、电磁场、广义相对论、甚至量子场论。现代物理学家找新理论,往往不再猜"力是什么",而是猜"作用量长什么样 "。
机制
每个领域有它自己的拉格朗日量,可语法完全一样 :写下 S =∫L dt ,令 δS =0,就得到该领域的运动方程。换 L ,不换那套动作。
作用量原理
δS = 0
光学
费马 · 最短时间
牛顿力学
L = T − V
电磁场
麦克斯韦
广义相对论
时空弯曲
量子场论
路径积分
同一句"δS=0",配上不同的拉格朗日量,就分别长成光学、力学、电磁、引力与量子场——一套语法,整座物理。
为什么重要
这是物理学"美"与"统一"的核心来源。它还天然兼容相对论 :作用量是个标量 (换参考系时数值不变),所以用它写出的理论自动满足相对论要求;而力、加速度这些矢量 语言,在接近光速或强引力下会互相打架。这就是为什么粒子物理、弦论几乎全用作用量语言写成——报一个新理论,往往就是报它的一行拉格朗日量 。
跨学科对读 · 哲学
"自然在优化某个量"这幅图像,历史上一再被塞进目的论 (自然仿佛有"目的")甚至神学。诚实地说:驻定原理只是和逐力描述严格等价 的另一种记法,并没有多给"自然知道终点"或"心怀意图"的任何证据。别把数学的优雅 误读成宇宙的意志 ——下一张卡的量子解释,会把这层浪漫彻底祛魅。
一句话:报一个物理理论,就是报它的作用量。
思考: 如果两套不同的 L 给出完全相同的运动方程,它们算"同一个理论"吗?就可观测而言算同一个。L 有规范自由度——加一个全导数项、或乘常数,运动方程不变,物理预言也不变。物理只认能测的,两套 L 若给出全同的方程与观测,就是同一理论的两种写法。
量子如何解释"它凭什么挑" Why Nature "Knows" — the Path Integral
路径积分 · 费曼 1948
直觉
经典最小作用量有个尴尬的漏洞:一个球怎么"知道" 要先比较所有路径、再挑最省的那条?它又没长眼睛,也没预演。费曼 1948 年给了石破天惊的答案:粒子确实"同时走了所有路径" 。每条路径带一个像小时钟指针 的相位,把无穷多条路径的指针加起来——绝大多数路径彼此指向乱七八糟、相互抵消 ,唯独在经典路径(δS =0)附近,相邻路径的相位几乎一致、指针同向叠加 ,活了下来。
机制
每条路径的贡献是
eiS /ℏ (一个长度为 1 的复数
指针 ,转角由该路径的作用量
S 决定;ℏ 是
普朗克常数 ,一个极小的数)。总振幅 = 所有路径的指针求和。
因为 ℏ 极小,S 只要稍微变一点,指针就转好几圈。于是绝大多数地方,相邻路径的指针方向乱转、彼此抵消 ;只有在 S 驻定 (δS =0、相邻路径相位几乎不变)的地方,指针才不打架、叠加不为零 。宏观世界里,我们于是只看得到那一条经典路径。
A
B
经典路径 δS=0
乱转 → 抵消
同向 → 叠加
粒子"走遍"所有路径;离经典路径远的那些,相位指针乱转、成对抵消,只有经典路径附近同向相加——它才是我们唯一看得见的那条。
反直觉的重点
最小作用量不是一条额外的神秘定律 ,它是量子叠加在宏观尺度上的残影 。经典力学"选最优路径"的表象,底下是量子"走遍所有路径、让不最优的那些自己抵消"。当 ℏ→0,除经典路径外的一切贡献全被干涉湮灭——这才是最小作用量真正的出处。所谓"自然在优化",其实是"自然在干涉" 。
跨学科对读 · AI
路径积分 = 对所有可能配置按 eiS /ℏ 加权求和;这和统计里的配分函数 、能量模型/扩散模型里"对所有可能样本按 e−E 加权",是同构的数学骨架 (把 iS /ℏ 换成 −E 就从量子跨到统计)。采样、变分推断、乃至扩散式生成,骨子里都在做"路径积分"式的加权求和——物理与现代生成式 AI 在这里握了手。
一句话:不是自然挑了最优路径,是所有路径里只有它没被抵消。
思考: 如果 ℏ 不是极小、而是很大,我们还会看到"确定的经典轨迹"吗?不会。经典轨迹之所以确定,是因为 ℏ 极小、让非最小作用量的路径剧烈相消,只剩 δS=0 那条。若 ℏ 很大,各路径相位差不大、都参与叠加,世界就「糊」成量子概率云,没有单一确定轨道。经典性是 ℏ→小 的极限。
深入思考
都叫"最小"作用量,可为什么严谨的说法是"驻定"?两者差在哪?
严格的名字叫稳定作用量原理 (stationary action)。驻定 指一阶变分为零(δS =0),它可能是极小 、极大 或鞍点 。多数日常情形真实路径确实对应极小(所以历史上叫"最小"),但也有真实路径落在鞍点的例子(比如光经过焦点之后的某些路径)。要害不在"最小",而在"对微小变形不敏感" ——谷底、山脊顶、马鞍中心都满足:往任何方向偏一点,一阶高度都不变。费曼路径积分给出的正是"相位驻定 "这个条件,和是否全局最小无关。
δS=0 和牛顿的 F=ma 真的完全等价吗?有没有哪一方更根本?
对经典系统,两者数学上严格等价 :从 δS =0 经欧拉–拉格朗日方程能推出 F =ma ,反过来也行。但"更根本"有几层意思:(1) 适用面 ——作用量语言能直接写场论、相对论、量子,F =ma 不能;(2) 约束处理 ——带约束的系统(摆、纯滚动)用拉格朗日法优雅得多,不用去解未知的约束力;(3) 物理来源 ——路径积分说明作用量原理有更深的量子出处 ,而 F =ma 没有类似的"下层解释"。所以:数学等价,地位不等价——作用量是更深的那句话。
为什么偏偏是 T−V?这个减号是硬凑出来的吗?
不是硬凑,但也无法从更基本处"推导"出来 ——它是被"必须给出正确运动方程"这个要求反推 定下来的。真正的逻辑是:我们已知正确答案(牛顿方程),再问"什么样的 L 能让 δ∫L dt =0 恰好复现它",答案就是 L =T −V 。所以 T −V 的地位像一个极其成功的定义/猜测 :它的正当性来自结果,而非先验。有趣的是,这个形式换到相对论、场论时会改写(相对论自由粒子的 L 是 −mc ²√(1−v ²/c ²) ),但"写个 L 、令 δS =0"这套语法一路不变。
既然粒子"走所有路径",为什么我们从没见过一个电子同时出现在两个地方?
其实见过 ——双缝实验里,单个电子正是"同时走两条缝"才产生干涉条纹(后面「波函数与叠加」一期会专讲)。你"没见过"宏观物体这样,是因为它的作用量 S 远远大于 ℏ,非经典路径的相位转得飞快、彼此抵消得干干净净,只剩一条经典轨迹可被观测。电子质量小、作用量小,量子性才露得出来。区别只是尺度,不是原理 :万物都在走所有路径,只不过大物件的"其他路径"被干涉杀得片甲不留。
"自然在优化"会不会诱人相信宇宙有目的、有设计?
这是历史上真实发生过的误读——莫佩尔蒂当年就把最小作用量当作"上帝节俭"的证据。但要诚实:驻定原理和逐力描述严格等价 ,并不多给任何"目的"信息;而路径积分更进一步,把"优化"还原成无意识的相位干涉 ——没有谁在"选",只是不最优的路径自己抵消掉了。数学上呈现出的优化形式,不蕴含任何目的论 。把一种优雅的记法误当成宇宙的意图,是物理学里最常见的浪漫化陷阱之一(这也呼应「物理定律是什么」那一期:定律是压缩,不是律令)。
延伸阅读
Feynman,The Feynman Lectures on Physics ,Vol. II 第 19 章「The Principle of Least Action」——最好的直觉入门
R. Feynman & A. Hibbs,Quantum Mechanics and Path Integrals ——路径积分的原始教材
Landau & Lifshitz,Mechanics (理论物理教程 Vol. 1)——拉格朗日 / 哈密顿力学的经典底本
Pierre de Maupertuis(1744)& Pierre de Fermat(1662)——最小作用量与最短时间的历史源头
Sean Carroll,The Biggest Ideas in the Universe: Space, Time, and Motion ——作用量的现代直觉