高斯分布是统计物理中出现最多的分布:速度分量(§5.4)、宏观量的涨落(§2.4、§4.4、§22.1)、扩散粒子的位置(§P5.2)、高分子的末端距(§30.1)、朗之万方程中的随机力(第23章)。本节汇总它的性质,并说明它为什么无处不在。
§C5.1定义与基本性质
p(x)=2πσ21exp[−2σ2(x−μ)2](C5.1)
记作 X∼N(μ,σ2)。正文 §2.3 已用高斯积分验证了归一化、均值 μ 与方差 σ2。令 z=(x−μ)/σ,任何高斯变量都化为标准正态 N(0,1)。
矩与累积量:奇数阶中心矩为零(对称性);偶数阶中心矩 ⟨(x−μ)2n⟩=(2n−1)!!σ2n((A7.4))。累积量生成函数 K(s)=μs+21σ2s2(由 (A7.5)),所以只有前两个累积量不为零——高斯分布完全由均值和方差确定。特征函数为 ϕ(k)=eikμ−σ2k2/2。
§C5.2概率的数值与尾巴
偏离平均值不超过 kσ 的概率为 erf(k/2),其中 erf(x)=π2∫0xe−t2dt 称为误差函数:
| 范围 | ∣x−μ∣<σ | <2σ | <3σ |
|---|
| 概率 | 68.3% | 95.4% | 99.73% |
单侧的尾巴 P(x−μ>kσ)=∫k∞2πe−z2/2dz 在 k 较大时可以这样估计:写成 ∫k∞z1⋅ze−z2/2dz 并分部积分(ze−z2/2 的原函数是 −e−z2/2),
P(x−μ>kσ)=k2πe−k2/2[1−k21+⋯](C5.2)
例如 k=5:(C5.2) 的首项给出 3.0×10−7,严格值 2.9×10−7。尾巴的衰减由 e−k2/2 主导:多偏离一点,概率就小很多。§2.4 中 N=1020 的硬币偏离 10−5N 时,k=2×105,概率约 e−2×1010——宏观上"不可能"的事件在概率论里只是极其罕见。(但要注意:这样远的尾巴已超出高斯近似的有效范围,真实的概率由大偏差的速率函数给出,§22.6。)
§C5.3线性组合仍是高斯分布
独立高斯变量之和是高斯变量:若 X∼N(μ1,σ12)、Y∼N(μ2,σ22) 独立,特征函数相乘(§C3.6),eikμ1−σ12k2/2eikμ2−σ22k2/2 仍是高斯型,所以 X+Y∼N(μ1+μ2, σ12+σ22)。更一般地,联合高斯变量(例如相互独立的高斯变量)的线性组合仍是高斯变量。这一性质使得线性系统在高斯噪声驱动下的响应仍然是高斯的:例如朗之万方程的解 (23.5) 是高斯随机力的线性泛函,所以速度服从高斯分布(附录 C9 的奥恩斯坦–乌伦贝克过程)。
§C5.4多元高斯分布
n 个变量的联合高斯分布为
p(x)=(2π)ndetAexp[−21(x−μ)TA(x−μ)](C5.3)
A 为实对称正定矩阵(归一化由 (B2.7) 给出)。由 (B2.9),协方差矩阵 C=⟨δxδxT⟩ 等于 A−1。§22.1 的爱因斯坦涨落公式正是这种形式(A 换成 A/kB)。
性质:
- 边缘分布仍是高斯分布:对部分变量积分(用配方法),剩下的变量仍服从高斯分布,其协方差矩阵就是 C 中相应的子矩阵。
- 不相关 ⟺ 独立(这是高斯分布的特殊性质,一般分布只有"独立 ⇒ 不相关"):若 C 是对角矩阵,则 A=C−1 也是对角的,(C5.3) 的指数是各变量的平方和,概率密度因子化为各变量的一维高斯分布之积,即独立。§30.1 中末端距三个分量的独立性正是由此而来(§C3.4)。
- 二元的例子:两个方差为 1、相关系数为 r 的高斯变量,
p(x,y)=2π1−r21exp[−2(1−r2)x2−2rxy+y2]
(C=(1rr1),detC=1−r2,A=C−1=1−r21(1−r−r1)。)已知 X=x 时,Y 的条件分布是均值 rx、方差 1−r2 的高斯分布(自测题 4):知道了 X,对 Y 的不确定性减小了。
§C5.5维克定理(伊瑟利斯定理)
对均值为零的联合高斯变量,高阶矩等于所有两两配对方式的二阶矩乘积之和。例如
⟨x1x2x3x4⟩=⟨x1x2⟩⟨x3x4⟩+⟨x1x3⟩⟨x2x4⟩+⟨x1x4⟩⟨x2x3⟩(C5.4)
奇数个变量之积的平均为零;2n 个变量共有 (2n−1)!! 种配对方式。特例 x1=⋯=x4=x:⟨x4⟩=3⟨x2⟩2,与 (A7.4) 一致。
证明:由 (B2.8)–(B2.9),⟨ebTx⟩=e21bTCb=e21∑ijCijbibj。⟨x1x2x3x4⟩ 是左边展开式中 b1b2b3b4 的系数。右边的指数展开中,含四个不同 b 的项只来自二阶项 2!1(21∑Cijbibj)2;把 b1b2b3b4 分成两对的方式有三种,每种的系数恰好是相应的 CijCkl(21⋅41 被 i,j 的两种次序、k,l 的两种次序以及两对的两种先后次序共 8 种排列抵消)。
维克定理把一切高斯涨落的计算化为二阶关联函数("传播子")的组合,是场论与多体理论中费曼图方法的基础。
§C5.6高斯分布为什么无处不在
- 中心极限定理(附录 C6):大量独立(或弱关联)小贡献之和趋于高斯分布,与各贡献的具体分布无关。宏观量正是大量微观贡献之和。
- 在极大值附近展开:任何尖锐的分布 p∝ef(x),把 f 在极大值处展开到二阶,就得到高斯近似(拉普拉斯方法,§2.3;爱因斯坦涨落公式,§22.1)。N 越大,峰越尖,近似越好。
- 最大熵(§A12.5):只知道均值与方差时,熵最大的分布是高斯分布。
- 线性动力学保持高斯性(§C5.3):线性系统受高斯噪声驱动,输出仍是高斯的。
什么时候不是高斯分布:(a) 方差无限的"重尾"分布(例如洛伦兹分布,附录 C6);(b) 临界点附近,关联长度发散,大量贡献不再"独立",序参量的涨落是非高斯的(临界指数 η=0 的来源之一,第19、20章);(c) 远离平均值的大偏差(§22.6):高斯近似只在平均值附近若干个 σ 内可靠。
自测题
- 设 X∼N(μ,σ2),证明 ⟨eX⟩=eμ+σ2/2。[提示:(A7.5),或特征函数中令 k=−i。]
- 用维克定理求 ⟨x6⟩(⟨x⟩=0,⟨x2⟩=σ2)。[答:15σ6。]
- 设 X、Y 独立且都服从 N(0,1)。证明 U=X+Y 与 W=X−Y 相互独立。[提示:二者联合高斯,Cov(U,W)=VarX−VarY=0。]
- 对 §C5.4 的二元高斯分布,求 X=x 时 Y 的条件分布。[提示:把指数对 y 配方:x2−2rxy+y2=(y−rx)2+(1−r2)x2。答:N(rx, 1−r2)。]
- 用 (C5.2) 估计 P(x−μ>3σ),并与严格值 0.00135 比较。[答:首项给出 0.00148;乘上 (1−1/9) 后为 0.00131。]
这一篇已记为读完。