Day 26 · 2026.07.18

数学与音乐

Mathematics & Music — 藏在声音里的整数、无理数与预期
"音乐是心灵在无意识地数数时体验到的快乐。" — Leibniz 致 Goldbach 的信

泛音列

The Overtone Series · 一个音里的整数乐队
Acoustics · Analysis
直觉版

拨一根吉他弦,你以为听到"一个音"。其实你同时听到一整叠音。弦不只作为整体来回摆动,它还同时分成两段、三段、四段各自振动,每段的频率恰好是最低那个音(基频)的 2 倍、3 倍、4 倍……这串隐藏的高音就是泛音列

你几乎意识不到它们,大脑却一直在听。小提琴和长笛拉同一个 A,为什么一听就分得出?因为泛音配方不同——哪几个强、哪几个弱,决定了音色。音高来自基频,音色来自泛音的比例。同一个音,无数张脸。

n=1 f₁ n=2 2f₁ n=3 3f₁ n=4 4f₁ 同一根弦上叠加的驻波 · 红点 = 不动的节点
正式定义

一根两端固定、长 $L$ 的弦,只允许两端不动的驻波存在,于是波长被筛成离散的一串:$\lambda_n = 2L/n$,对应频率

$$f_n = n\,f_1,\qquad n = 1, 2, 3, \ldots$$

$f_1$ 是基频(弦整体振动),$n$ 是弦被分成的段数。核心就一句话:允许的频率是基频的整数倍。「整数」不是巧合,是"两端必须不动"这个边界条件逼出来的。

为什么美

弦本可以用任何频率振动;可一旦钉住两端,连续的无穷可能被筛成一列干净的整数。这是"离散源于约束"最纯粹的演示——它和量子力学里氢原子能级为何离散,是同一个数学(波动方程 + 边界条件 = 本征值问题)。两千五百年前毕达哥拉斯发现弦长成简单整数比时最协和,第一次把"悦耳"翻译成"整数",点燃了"宇宙由数写成"的信念。

应用

加法合成器直接把正弦泛音按配方叠出音色,管风琴的音栓则在开关不同泛音。跨到物理:一维势阱里粒子的能级 $E_n \propto n^2$、微波腔的模式,都是同一套"波 + 边界 = 离散谱"。小提琴的泛音奏法——轻触弦的中点、只让偶次谐波存活——是演奏者在手上直接操控这个数学。

一句话精华:一个音从来不是一个音,而是一支由整数指挥、你几乎听不见却始终在场的隐形乐队。
思考题
敲一面鼓,你很难说出它的"音高",拨一根弦却能。鼓面是二维振动,泛音频率不是基频的整数倍。为什么"非整数倍的泛音"会让音高变得模糊?

平均律 vs 纯律

Equal Temperament vs Just Intonation · 一场用无理数换来的和平
Number Theory · Tuning
直觉版

纯律用最简单的整数比造音程:纯八度 $2{:}1$、纯五度 $3{:}2$、大三度 $5{:}4$——比越简单越和谐(正是泛音重合的结果)。听起来完美,可麻烦来了。

从一个音出发连叠 12 个纯五度,你以为能干净地绕回起点(高七个八度)。但 $(3/2)^{12} \approx 129.75$,而 $2^7 = 128$——差一丁点,永远合不拢。这道缝叫毕达哥拉斯逗号。数学的残酷判决:你没法既让每个五度都纯、又让八度闭合,二者不可兼得。

起点 差一点 叠 12 个 纯五度 纯律 12 五度 (3/2)¹² ≈ 129.75 7 个八度 2⁷ = 128 缝隙 = 毕氏逗号
正式定义

平均律的解法很暴力:把一个八度(频率比 $2$)在对数尺度上均分成 12 个相等的半音,每个半音的频率比是

$$r = 2^{1/12} \approx 1.05946$$

于是五度 $= 2^{7/12} \approx 1.4983$——接近但不等于理想的 $1.5$。指数 $7/12$ 里的 $7$ 是半音数,$12$ 是一个八度的总半音数。代价是每个音程都轻微失准;回报是任意转调听起来都一样

为什么美

这是数学妥协的教科书范例。纯律的 $3{:}2$ 之美与八度闭合在逻辑上不能共存,人类的选择是把误差平摊到十二个音上,谁也不完美、谁也不难听。而它能成立全靠一个数值巧合:$2^{7/12} \approx 3/2$——用连分数的话说,$\log_2(3/2) \approx 7/12$ 是它最好的低阶有理近似。巴赫写《平均律键盘曲集》,正是庆祝这场妥协让 24 个调第一次都能弹。美,有时就是恰到好处地认输。

应用

今天每台钢琴、每段 MIDI、每个合成器音源都活在平均律里。更深一层是连分数:$12$ 不是随便选的——$\log_2(3/2)$ 的连分数收敛给出 $7/12$,往下是 $24/41$、$31/53$。所以 53 平均律五度几乎全纯、比 12 律准得多,却因琴键太多没人用。数学指出哪些"等分数"值得一试,工程和手指决定了 12 胜出。

一句话精华:十二平均律是人类和数学签下的和平条约——用一个无理数,买断了纯律永远合不拢的那道缝。
思考题
假如 $\log_2(3/2)$ 恰好是个有理数 $p/q$,那么叠 $q$ 个纯五度就会精确回到某个八度,毕氏逗号消失,平均律和纯律合而为一。音乐史会因此变得更简单还是更贫乏?"不完美"在这里是缺陷,还是恰恰是丰富性的来源?

傅里叶分析

Fourier Analysis · 给声音戴上频率的眼镜
Analysis · Signal Processing
直觉版

一段声音的波形可以复杂到毫无规律——人声、钢琴、嘈杂的街道。傅里叶的惊人主张是:无论多复杂,都能拆成一堆纯正弦波的叠加。给我一段波形,我能报出它由哪些频率组成、各占多少。

这是一次翻译:把"声音在时间上长什么样"翻成"它在频率上有哪些成分"。同一个声音,两种看法。而这不只是数学游戏——你的耳蜗真的在做这件事:一条卷起来的膜,不同位置对不同频率共振,等于一台生物傅里叶变换器。你"听到音高",物理上就是频率分解。

合波 = 下面这些正弦波之和 ↓ f 2f 3f
正式定义

任何周期为 $T$ 的波形 $f(t)$ 都能写成正弦波的无穷叠加:

$$f(t) = a_0 + \sum_{n=1}^{\infty}\Big[a_n\cos(n\omega t) + b_n\sin(n\omega t)\Big]$$

$\omega = 2\pi/T$ 是基频角频率,$n$ 遍历各次谐波。系数 $a_n, b_n$ 是 $f$ 和对应正弦波的内积(投影)——直白说就是"这个频率在信号里占了多少"。

为什么美

正弦波构成一组正交基——像空间里互相垂直的 $x,y,z$ 轴,任何向量都能唯一分解到它们上面。傅里叶做的,是给无穷维的"函数空间"也装上一副坐标系。这与线性代数的特征向量是同一首歌:正弦波恰好是"求导"和"平移"算子的本征函数,所以一切振动、波动、扩散问题里它们天生是主角——选对了基,难题就散架成一堆简单的一维问题。

应用

MP3 / AAC 压缩:把声音变到频域,扔掉人耳听不见的频率,体积砍到十分之一。FFT(快速傅里叶变换)是整个数字信号处理的心脏——从 5G、医学 CT 到 JPEG 图像,无处不在。频谱图让你"看见"声音,降噪靠削掉特定频段,声纹识别靠频谱指纹。而你的耳蜗,是这一切的天然原型。

一句话精华:傅里叶给了声音一副频率眼镜——一戴上,混沌的波形立刻显出它清晰的骨架。
思考题
一声急促的"咔哒"极短,它的频谱却必然很宽——包含大量频率;而一个悠长纯净的长音,频谱极窄。时间上越"集中",频率上就越"弥散",反之亦然。这个"不能又短又纯"的约束,和量子力学的海森堡不确定性原理,为什么其实是同一条数学定理?

音乐为何取悦人

Consonance, Expectation & Why Music Moves Us · 秩序与混沌的边缘
Cognitive Math · Complexity
直觉版

为什么八度($2{:}1$)听起来"融为一体",相邻半音一起响却"刺耳打架"?一个解释:频率比越简单,两个音的泛音重合越多,耳朵越省力、越协和;比越复杂,泛音靠得太近,产生粗糙的拍频,就不协和——协和竟能追溯回概念一的整数。

但音乐的魅力远不止"和谐"。真正动人的音乐走在意料之中和意料之外的钢丝上:太可预测=无聊,太随机=噪音。旋律不断建立预期又恰到好处地打破它——那点被满足或被违背的悬念,就是情绪。

最悦耳 纯规律 (无聊) 1/f · 边缘 纯随机 (噪音) 愉悦度 →
正式定义(半形式)

协和度大致与频率比 $p{:}q$ 的简单程度相关(Plomp–Levelt 粗糙度曲线量化了这一点)。而音乐的"惊喜"可用信息论刻画:一个音符在上下文中的意外程度是

$$\text{惊喜}(x) = -\log P(x \mid \text{前文})$$

$P(x\mid\text{前文})$ 是听者根据已听到的旋律对下一个音的预期概率。越出乎意料,$-\log P$ 越大。大脑对这种"预测误差"的响应,正是审美张力之源。

为什么美

许多好听的音乐,其响度与音高涨落的功率谱是 $1/f$ 噪声——不偏不倚坐在"纯规则的 $1/f^2$"与"纯随机的白噪声"之间。而同一种分形统计也出现在心跳间隔、河流水位、DNA 序列里。这暗示:美感也许就是大脑对"恰到好处的可预测性"发出的奖赏——不是秩序本身,也不是混沌本身,而是二者交界处那条窄窄的边缘。

应用

算法作曲的核心就是建模条件概率 $P(\text{下一个音}\mid\text{前文})$——从早年的马尔可夫链到今天的 Transformer。MusicLM、Suno 本质上在学这个分布,再一边采样一边控制"惊喜度",避免太平或太乱。音乐推荐、情感计算乃至用音乐做焦虑干预,都建立在"预期—违背—奖赏"这条数学链上。

一句话精华:音乐是数学在"预期"上玩的游戏——它精确地喂给大脑刚好够多、又不至于太多的惊喜。
思考题
若一段旋律完全可预测——熵为零、每个音都百分百猜得到——按公式它的"惊喜"恒为零,它还算音乐吗?反过来,一段熵最大的纯随机声音又如何?"音乐"是否只存在于两极之间的某个熵区间?

深入思考

Open Questions · 推向概念的边界
协和的整数比跨越几乎所有文化被独立采用——是数学的普适,还是听觉生理的普适?
八度几乎在每个传统里都被当作"同一个音",难说是巧合。协和源于泛音重合,而泛音是弦与管的物理必然,用这类乐器的文明都会撞上同一组整数比——像一次趋同演化。但音阶(五声、七声、微分音)又高度依赖文化。可能的分界是:协和的"物理骨架"普适,具体音阶的"文化血肉"多样。
耳蜗做傅里叶变换却有物理极限——这解释了为什么某些和弦"糊成一团"吗?
基底膜按频率分区,每处有一定临界带宽:落在同一带宽内的两个频率分不开,就互相干扰产生粗糙感。这是 Plomp–Levelt 粗糙度的生理基础——不协和不是抽象的数字丑,而是两个频率挤进了同一段膜。它还意味着协和度依赖绝对音高:同一音程在低音区更浑、高音区更清。
时频不确定性给音乐设了硬墙:能同时精确知道"什么音"和"何时发生"吗?
测准一个频率要观察足够多个周期,也就是足够长的时间;可音乐随时间变化。于是有根本取舍:想把"此刻音高"定得越准,就越说不清"何时",反之亦然——这正是海森堡不确定性的傅里叶版本。它限制了频谱图分辨率,也解释了为何极短的打击乐"没有音高"。
$1/f$ 分形统计横跨音乐、心跳、河流——是深层规律,还是对"美"的循环定义?
$1/f$ 噪声出现在惊人多的系统里,一说它对应"多尺度弱耦合"的普遍动力学:没有单一特征尺度,涨落在所有尺度上自相似。但也有警告:我们或许觉得某声音好听、测出它碰巧是 $1/f$,把相关误当因果。要验证需能预测——合成不同谱指数的声音,看偏好是否真在 $1/f$ 处峰值。至今支持但未定论。