Day 37 · 2026.07.29

随机性的数学

The Mathematics of Randomness — 无序在什么尺度上生成秩序
"Chance is a more fundamental conception than causality." — Max Born, Natural Philosophy of Cause and Chance

随机游走

Random Walk · 随机性的产物是扩散,不是抵消
Probability
直觉版

醉汉站在长街上,每步抛硬币决定向左或向右。走一千步后他在哪?「正负抵消,还在原地」这个直觉一半对、一半错得很远——期望位置确实是 0,但抵消掉的是方向,不是距离

真实答案:$n$ 步后离原点的典型距离约 $\sqrt n$ 步——100 步后约 10 步,10000 步后约 100 步。不是 $n$(那是径直走),也不是 0(那是抵消),而是平方根。随机性不把你钉在原地,它以比线性慢的速度把你推开,这就是扩散。

维度还会改变结局:一维、二维的游走以概率 1 回到起点,三维只有约 34%(Pólya 定理)。醉汉总能回家,醉鸟回不了巢。

±√n 包络 步数 n →
正式定义
$$S_n=\sum_{i=1}^{n}X_i,\qquad \mathbb{E}[S_n]=0,\qquad \mathbb{E}[S_n^2]=n$$

$X_i$ 是独立同分布的单步,取 $+1$ 与 $-1$ 各半;$S_n$ 是 $n$ 步后的位置。展开平方:$\mathbb{E}[S_n^2]=\sum_i\mathbb{E}[X_i^2]+\sum_{i\ne j}\mathbb{E}[X_iX_j]$。第一项每个都是 1,共 $n$ 个;第二项因独立且均值为 0 而全部消失。于是典型偏移量 $\sqrt{\mathbb{E}[S_n^2]}=\sqrt n$。

为什么美

那些交叉项为什么消失?因为在以「乘积期望」为内积的空间里,独立(且零均值)就是正交。方差可加,$\sqrt n$ 的来历便是勾股定理:$n$ 个互相垂直的单位向量首尾相接,合长 $\sqrt n$。「独立」与「垂直」是同一件事——$\sqrt n$ 是毕氏定理在概率空间里的回声。Pólya 的维度门槛同样只是算术:回归概率取决于 $\sum_n n^{-d/2}$ 是否发散,$d=2$ 恰是分界线。

应用

1905 年爱因斯坦由 $\langle x^2\rangle=2Dt$ 解释花粉运动,并借此首次算出阿伏伽德罗常数——$\sqrt n$ 律成了原子存在的实验证据。PageRank 是网页图上随机游走的平稳分布;MCMC 靠它遍历后验;node2vec 用图上游走生成节点嵌入。SGD 则是带漂移的随机游走:梯度是漂移,minibatch 噪声按 $\sqrt{\text{步数}}$ 累积——这正是「学习率随 batch size 平方根缩放」的来源。

一句话精华 · 思考题
随机性不让你归零,它让你以 $\sqrt n$ 的速度离开。
若单步是偶尔跳得极远的重尾分布(Lévy flight),$\sqrt n$ 律还成立吗?动物觅食与注意力机制里的长程跳跃,为什么可能比稳步扩散更高效?

Martingale · 公平赌局的精确定义
Stochastic Process
直觉版

设 $X_n$ 是你在赌局中第 $n$ 轮后的赌本。鞅的条款只有一句:把之前的全部历史摊在桌上,对下一轮赌本的最优预测仍是「就是现在这个数」。

是说值不变——波动可以剧烈到破产;它说的是趋势为零:历史里没有可提取的方向性信息。这才是「公平」的准确含义。

倍投法(输了加倍,赢一次净赚一块)的真相由此清楚:它几乎必然赢一块,代价是极小概率的连败分支里输掉天文数字,期望恰好抹平。可选停时定理把这句吐槽升级成定理:只要不能预知未来、下注受限,任何停止规则都改不了期望。

正式定义
$$\mathbb{E}\!\left[X_{n+1}\mid\mathcal{F}_n\right]=X_n$$

$\mathcal{F}_n$ 是「到第 $n$ 步为止全部已知信息」的形式化——一个 $\sigma$-代数(Day 21 的测度论在此兑现);$\mathbb{E}[\,\cdot\mid\mathcal{F}_n]$ 是在这些信息下的最优预测。等号换成 $\le$ 便是上鞅:赌场抽水后,你的赌本正是上鞅。

为什么美

鞅把「公平」这个价值判断压缩成一个等式,于是人能证明关于「不可能」的定理。更深一层:任何合理的随机过程都可唯一分解成「可预测的漂移 + 一个鞅」(Doob 分解)——鞅是随机性中不可预测的那份纯净成分。它也是概率论的守恒律:Day 18 里对称性给出守恒量,这里鞅性给出期望守恒,可选停时定理即其陈述。

应用

金融的地基定理:无套利 ⟺ 存在一个测度使贴现价格成为鞅(风险中性测度),Black-Scholes 的骨架即此。Azuma–Hoeffding 不等式为随机化算法与在线学习给出集中界。A/B 测试的 anytime-valid 推断(检验鞅 / e-value)让你随时看数据而不膨胀假阳性,修的正是 Day 34 里「偷看数据」的病。强化学习中 TD 误差是鞅差序列,这是收敛证明的核心。

一句话精华 · 思考题
鞅是「无法被任何策略利用」的数学定义。
若你的信息集比市场更大(内幕),同一个价格过程对你就不再是鞅——鞅性不是过程的属性,而是过程与谁的信息的关系。那么随机性是客观的,还是相对于观察者的?

布朗运动

Brownian Motion · 随机性在放大镜下的不动点
Stochastic Analysis
直觉版

把随机游走的步长缩小、频率加密,逼近连续时间。关键的选择题是:当时间步 $\Delta t\to0$,步长该取多小?

取 $\Delta t$,方差归零,极限是静止的直线;取常数,方差爆炸到无穷。唯一活下来的尺度是 $\sqrt{\Delta t}$——正是 $\sqrt n$ 律的倒影。

后果很惊人:路径处处连续,却处处不可导。原因是自相似——任取一小段放大(时间 ×4、空间 ×2),仍是同一种锯齿,永远不会像光滑曲线那样被放大成切线(Day 17 分形的直系亲属)。这也是「$dW$ 的平方与 $dt$ 同阶」的根源:位移平方与时间同量级,位移便比时间高一阶小量。

放大后还是同一种锯齿 时间 t →
正式定义
$$W_0=0,\qquad W_t-W_s\sim\mathcal{N}(0,\,t-s),\qquad (dW)^2=dt$$

公理:起点为 0;不重叠时段的增量互相独立;增量服从均值 0、方差等于时间跨度的正态分布;路径连续。方差 $=t-s$ 正是 $\sqrt{\Delta t}$ 尺度的正式写法。$(dW)^2=dt$ 则是伊藤微积分的核心:二阶项不再可忽略,链式法则多出一项 $\tfrac12 f''\,dt$。

为什么美

正态分布在这里不是假设,而是被迫的结论:无论单步是硬币、骰子还是任何有限方差的分布,缩放极限都收敛到同一个布朗运动(Donsker 不变原理)。微观细节被彻底遗忘,只剩一个对象——这是数学最深的一类美:普适性。第二重美是它与热方程的等价(Feynman–Kac),概率与分析在此互译

应用

金融资产用几何布朗运动建模,Black-Scholes 正由伊藤引理导出;物理上它是 Langevin 方程的噪声项。扩散模型的前向过程就是逐步注入布朗噪声,反向去噪学的是分数(score)——今天的图像与视频生成建立在 1905 年爱因斯坦那篇论文的数学之上。SGD 的连续时间近似(随机微分方程)则被用来解释平坦极小值与泛化。

一句话精华 · 思考题
布朗运动是随机性在缩放下的不动点:越放大,越是它自己。
真实花粉颗粒有质量与速度,路径其实可导。那么「处处不可导」是错了,还是它只在某个尺度以上才成立?还有哪些模型也是「粗粒化后才真」?

随机矩阵

Random Matrix Theory · 高维里随机反而变得可预测
Linear Algebra
直觉版

取一个 $1000\times1000$ 的矩阵,每个元素独立填随机数(保持对称),求它的一千个特征值。你会预期一团乱麻,事实恰恰相反:画成直方图,它们几乎完美地落在一条半圆曲线之下;换一批随机数重做,形状还是那个半圆。

更反直觉的是特征值之间的互斥:独立撒下的随机点会成团扎堆,特征值却几乎均匀排开,仿佛彼此带同种电荷。

单个元素的层面是彻底的无序,整体谱的层面是刚性的秩序。维度不是让随机叠加得更乱,而是把它熨平。

−2 0 +2 半圆律 ρ(x) = √(4−x²) / 2π 归一化特征值
正式定义
$$\rho(x)=\frac{1}{2\pi}\sqrt{4-x^2},\qquad x\in[-2,2]$$

Wigner 半圆律:$N\times N$ 实对称矩阵的元素独立、均值 0、方差 $\sigma^2$,把特征值除以 $\sigma\sqrt N$ 归一化,$N\to\infty$ 时经验分布收敛到上式。$\sqrt N$ 这个缩放又是 $\sqrt n$ 律——矩阵乘向量时一行内 $N$ 个随机项相加,量级正是 $\sqrt N$。数据分析里对应的是 Marchenko–Pastur 律。

为什么美

这是高维集中最漂亮的展示:$N^2$ 个随机数的宏观函数(谱分布)的波动以 $1/N$ 量级消失,随机变成确定——所谓「自平均」。而 1972 年 Montgomery 与 Dyson 在普林斯顿茶歇闲谈中发现:黎曼 $\zeta$ 函数零点的间距分布与随机矩阵(GUE)的特征值间距分布完全一致——数论最深的未解问题与量子混沌共用同一条统计律,半个世纪过去仍无人知道为什么。

应用

PCA 与协方差去噪:Marchenko–Pastur 给出「若全是噪声,谱该长什么样」的基线,只有越过上边缘的特征值才可能是真信号(用于投资组合、基因表达)。神经网络初始化的实质是控制权重矩阵的谱半径——Xavier/He 的方差公式就是让信号在深层间既不爆炸也不消失;Hessian 的谱结构则解释了训练景观各方向曲率的悬殊。

一句话精华 · 思考题
维度足够高时,随机不再意味着不可预测。
若千维随机矩阵的谱几乎是确定的,那么一个巨大神经网络的行为有多少由架构与数据决定、多少由那组具体的随机初始权重决定?「换个种子重训会得到另一个模型吗」本质就是在问自平均有多强。

深入思考

随机性是世界的属性,还是我们无知的名字?
概率论只是测度论的一个分支,不预设随机的来源,但它给出了几种答案。Kolmogorov 把随机性定义成「不可压缩」——序列随机,当且仅当描述它的最短程序不比它本身短,这是关于结构而非因果的定义。密码学更实用:伪随机数生成器完全确定,但对多项式时间的观察者不可区分,够用了。量子力学则以 Bell 不等式的实验违背排除了定域隐变量。三条路指向同一件事:随机性总是相对于某种观察能力
为什么维度越高,反而越可预测?
因为大数定律有一个几何版本:测度集中。高维球面的面积几乎全挤在赤道附近的一层薄壳里——换言之,一个「合理的」高维函数在几乎所有点上取几乎相同的值。半圆律、Marchenko–Pastur、Johnson–Lindenstrauss 引理都是它的不同面孔。于是有了一个表面悖论:维数灾难让数据填充空间无望,却让宏观量的估计异常稳定。深度学习正坐在这条张力上。
$\sqrt n$ 为什么无处不在?它可以被打破吗?
根源只有一句:独立即正交,方差可加,标准差按 $\sqrt n$ 长。蒙特卡罗误差 $\propto 1/\sqrt N$ 是它的另一侧——精度提高十倍要多算一百倍,这是所有采样方法交的税。想打破它就得放弃独立性:准蒙特卡罗用低差异序列刻意制造负相关,误差趋近 $1/N$。另一端由重尾分布打破——无穷方差时极限不是布朗运动而是 Lévy 过程,$\sqrt n$ 变成 $n^{1/\alpha}$。$\sqrt n$ 是「独立 + 有限方差」的联合指纹。
这四个概念背后是同一个思想吗?
是的,这个思想叫尺度。随机游走问:把许多小随机量加起来,什么被保留?答案是 $\sqrt n$ 与正态形状,其余细节被遗忘。布朗运动是这一提问推到极限后的不动点:再怎么放大也不改变形态。鞅从另一侧下刀,剥掉可预测的漂移,留下纯粹的随机成分。随机矩阵换的是维度这条轴:维数趋于无穷,个体的随机被熨成群体的确定曲线。四者共享同一母题——聚合与放大时,什么消失、什么留下,物理学称之为普适类。这直觉对做分布式系统的人可以直接搬运:单机延迟不可预测,尾延迟分位数却稳定可测。