醉汉站在长街上,每步抛硬币决定向左或向右。走一千步后他在哪?「正负抵消,还在原地」这个直觉一半对、一半错得很远——期望位置确实是 0,但抵消掉的是方向,不是距离。
真实答案:$n$ 步后离原点的典型距离约 $\sqrt n$ 步——100 步后约 10 步,10000 步后约 100 步。不是 $n$(那是径直走),也不是 0(那是抵消),而是平方根。随机性不把你钉在原地,它以比线性慢的速度把你推开,这就是扩散。
维度还会改变结局:一维、二维的游走以概率 1 回到起点,三维只有约 34%(Pólya 定理)。醉汉总能回家,醉鸟回不了巢。
$X_i$ 是独立同分布的单步,取 $+1$ 与 $-1$ 各半;$S_n$ 是 $n$ 步后的位置。展开平方:$\mathbb{E}[S_n^2]=\sum_i\mathbb{E}[X_i^2]+\sum_{i\ne j}\mathbb{E}[X_iX_j]$。第一项每个都是 1,共 $n$ 个;第二项因独立且均值为 0 而全部消失。于是典型偏移量 $\sqrt{\mathbb{E}[S_n^2]}=\sqrt n$。
那些交叉项为什么消失?因为在以「乘积期望」为内积的空间里,独立(且零均值)就是正交。方差可加,$\sqrt n$ 的来历便是勾股定理:$n$ 个互相垂直的单位向量首尾相接,合长 $\sqrt n$。「独立」与「垂直」是同一件事——$\sqrt n$ 是毕氏定理在概率空间里的回声。Pólya 的维度门槛同样只是算术:回归概率取决于 $\sum_n n^{-d/2}$ 是否发散,$d=2$ 恰是分界线。
1905 年爱因斯坦由 $\langle x^2\rangle=2Dt$ 解释花粉运动,并借此首次算出阿伏伽德罗常数——$\sqrt n$ 律成了原子存在的实验证据。PageRank 是网页图上随机游走的平稳分布;MCMC 靠它遍历后验;node2vec 用图上游走生成节点嵌入。SGD 则是带漂移的随机游走:梯度是漂移,minibatch 噪声按 $\sqrt{\text{步数}}$ 累积——这正是「学习率随 batch size 平方根缩放」的来源。
设 $X_n$ 是你在赌局中第 $n$ 轮后的赌本。鞅的条款只有一句:把之前的全部历史摊在桌上,对下一轮赌本的最优预测仍是「就是现在这个数」。
它不是说值不变——波动可以剧烈到破产;它说的是趋势为零:历史里没有可提取的方向性信息。这才是「公平」的准确含义。
倍投法(输了加倍,赢一次净赚一块)的真相由此清楚:它几乎必然赢一块,代价是极小概率的连败分支里输掉天文数字,期望恰好抹平。可选停时定理把这句吐槽升级成定理:只要不能预知未来、下注受限,任何停止规则都改不了期望。
$\mathcal{F}_n$ 是「到第 $n$ 步为止全部已知信息」的形式化——一个 $\sigma$-代数(Day 21 的测度论在此兑现);$\mathbb{E}[\,\cdot\mid\mathcal{F}_n]$ 是在这些信息下的最优预测。等号换成 $\le$ 便是上鞅:赌场抽水后,你的赌本正是上鞅。
鞅把「公平」这个价值判断压缩成一个等式,于是人能证明关于「不可能」的定理。更深一层:任何合理的随机过程都可唯一分解成「可预测的漂移 + 一个鞅」(Doob 分解)——鞅是随机性中不可预测的那份纯净成分。它也是概率论的守恒律:Day 18 里对称性给出守恒量,这里鞅性给出期望守恒,可选停时定理即其陈述。
金融的地基定理:无套利 ⟺ 存在一个测度使贴现价格成为鞅(风险中性测度),Black-Scholes 的骨架即此。Azuma–Hoeffding 不等式为随机化算法与在线学习给出集中界。A/B 测试的 anytime-valid 推断(检验鞅 / e-value)让你随时看数据而不膨胀假阳性,修的正是 Day 34 里「偷看数据」的病。强化学习中 TD 误差是鞅差序列,这是收敛证明的核心。
把随机游走的步长缩小、频率加密,逼近连续时间。关键的选择题是:当时间步 $\Delta t\to0$,步长该取多小?
取 $\Delta t$,方差归零,极限是静止的直线;取常数,方差爆炸到无穷。唯一活下来的尺度是 $\sqrt{\Delta t}$——正是 $\sqrt n$ 律的倒影。
后果很惊人:路径处处连续,却处处不可导。原因是自相似——任取一小段放大(时间 ×4、空间 ×2),仍是同一种锯齿,永远不会像光滑曲线那样被放大成切线(Day 17 分形的直系亲属)。这也是「$dW$ 的平方与 $dt$ 同阶」的根源:位移平方与时间同量级,位移便比时间高一阶小量。
公理:起点为 0;不重叠时段的增量互相独立;增量服从均值 0、方差等于时间跨度的正态分布;路径连续。方差 $=t-s$ 正是 $\sqrt{\Delta t}$ 尺度的正式写法。$(dW)^2=dt$ 则是伊藤微积分的核心:二阶项不再可忽略,链式法则多出一项 $\tfrac12 f''\,dt$。
正态分布在这里不是假设,而是被迫的结论:无论单步是硬币、骰子还是任何有限方差的分布,缩放极限都收敛到同一个布朗运动(Donsker 不变原理)。微观细节被彻底遗忘,只剩一个对象——这是数学最深的一类美:普适性。第二重美是它与热方程的等价(Feynman–Kac),概率与分析在此互译。
金融资产用几何布朗运动建模,Black-Scholes 正由伊藤引理导出;物理上它是 Langevin 方程的噪声项。扩散模型的前向过程就是逐步注入布朗噪声,反向去噪学的是分数(score)——今天的图像与视频生成建立在 1905 年爱因斯坦那篇论文的数学之上。SGD 的连续时间近似(随机微分方程)则被用来解释平坦极小值与泛化。
取一个 $1000\times1000$ 的矩阵,每个元素独立填随机数(保持对称),求它的一千个特征值。你会预期一团乱麻,事实恰恰相反:画成直方图,它们几乎完美地落在一条半圆曲线之下;换一批随机数重做,形状还是那个半圆。
更反直觉的是特征值之间的互斥:独立撒下的随机点会成团扎堆,特征值却几乎均匀排开,仿佛彼此带同种电荷。
单个元素的层面是彻底的无序,整体谱的层面是刚性的秩序。维度不是让随机叠加得更乱,而是把它熨平。
Wigner 半圆律:$N\times N$ 实对称矩阵的元素独立、均值 0、方差 $\sigma^2$,把特征值除以 $\sigma\sqrt N$ 归一化,$N\to\infty$ 时经验分布收敛到上式。$\sqrt N$ 这个缩放又是 $\sqrt n$ 律——矩阵乘向量时一行内 $N$ 个随机项相加,量级正是 $\sqrt N$。数据分析里对应的是 Marchenko–Pastur 律。
这是高维集中最漂亮的展示:$N^2$ 个随机数的宏观函数(谱分布)的波动以 $1/N$ 量级消失,随机变成确定——所谓「自平均」。而 1972 年 Montgomery 与 Dyson 在普林斯顿茶歇闲谈中发现:黎曼 $\zeta$ 函数零点的间距分布与随机矩阵(GUE)的特征值间距分布完全一致——数论最深的未解问题与量子混沌共用同一条统计律,半个世纪过去仍无人知道为什么。
PCA 与协方差去噪:Marchenko–Pastur 给出「若全是噪声,谱该长什么样」的基线,只有越过上边缘的特征值才可能是真信号(用于投资组合、基因表达)。神经网络初始化的实质是控制权重矩阵的谱半径——Xavier/He 的方差公式就是让信号在深层间既不爆炸也不消失;Hessian 的谱结构则解释了训练景观各方向曲率的悬殊。