§C2.1 期望(平均值)§C2.2 方差与标准差§C2.3 切比雪夫不等式§C2.4 矩、累积量与生成函数§C2.5 詹森不等式自测题 正文用到本节的地方:玩具模型的平均值与涨落(§2.2 );能量涨落与热容(§4.4 );博戈留波夫不等式(§18.5 );相对熵的非负性(§23.6 );雅津斯基等式与第二定律(§33.4 )。
§C2.1 期望(平均值)
离散变量 ⟨ X ⟩ = ∑ k x k p k \langle X\rangle = \sum_kx_kp_k ⟨ X ⟩ = ∑ k x k p k ,连续变量 ⟨ X ⟩ = ∫ x p ( x ) d x \langle X\rangle = \int x\,p(x)\,dx ⟨ X ⟩ = ∫ x p ( x ) d x 。函数的平均值直接用原来的分布计算:
⟨ g ( X ) ⟩ = ∑ k g ( x k ) p k 或 ∫ g ( x ) p ( x ) d x (C2.1) \langle g(X)\rangle = \sum_kg(x_k)\,p_k\quad\text{或}\quad\int g(x)\,p(x)\,dx \tag{C2.1} ⟨ g ( X )⟩ = k ∑ g ( x k ) p k 或 ∫ g ( x ) p ( x ) d x ( C2.1 )
(不必先求出 g ( X ) g(X) g ( X ) 的分布。)数学书中也记作 E [ X ] E[X] E [ X ] ;物理中常写 ⟨ X ⟩ \langle X\rangle ⟨ X ⟩ 或 X ˉ \bar X X ˉ 。
线性 :⟨ a X + b Y ⟩ = a ⟨ X ⟩ + b ⟨ Y ⟩ \langle aX + bY\rangle = a\langle X\rangle + b\langle Y\rangle ⟨ a X + bY ⟩ = a ⟨ X ⟩ + b ⟨ Y ⟩ ,无论 X X X 、Y Y Y 是否独立 (用联合分布写出来,求和可以拆开,附录 C3 )。这一条看似平凡,却极其有用。
指示变量技巧 。事件 A A A 的指示变量 1 A \mathbb 1_A 1 A 在 A A A 发生时为 1、否则为 0,⟨ 1 A ⟩ = P ( A ) \langle\mathbb 1_A\rangle = P(A) ⟨ 1 A ⟩ = P ( A ) 。要求"满足某种条件的对象的平均个数",把总数写成指示变量之和再用线性性。例:§2.2 中 n = ∑ i x i n = \sum_ix_i n = ∑ i x i ,⟨ n ⟩ = ∑ i ⟨ x i ⟩ = N / 2 \langle n\rangle = \sum_i\langle x_i\rangle = N/2 ⟨ n ⟩ = ∑ i ⟨ x i ⟩ = N /2 ;体积 V V V 中 N N N 个独立均匀分布的粒子,落在子体积 v v v 中的平均个数为 N ⋅ ( v / V ) N\cdot(v/V) N ⋅ ( v / V ) 。
注意 ⟨ g ( X ) ⟩ ≠ g ( ⟨ X ⟩ ) \langle g(X)\rangle\ne g(\langle X\rangle) ⟨ g ( X )⟩ = g (⟨ X ⟩) (除非 g g g 是线性的)。例如 ⟨ X 2 ⟩ ≠ ⟨ X ⟩ 2 \langle X^2\rangle\ne\langle X\rangle^2 ⟨ X 2 ⟩ = ⟨ X ⟩ 2 ,⟨ 1 / X ⟩ ≠ 1 / ⟨ X ⟩ \langle1/X\rangle\ne1/\langle X\rangle ⟨ 1/ X ⟩ = 1/ ⟨ X ⟩ ,⟨ e X ⟩ ≠ e ⟨ X ⟩ \langle e^X\rangle\ne e^{\langle X\rangle} ⟨ e X ⟩ = e ⟨ X ⟩ 。两者之间的不等式关系由 §C2.5 的詹森不等式给出。
§C2.2 方差与标准差
V a r ( X ) = ⟨ ( X − ⟨ X ⟩ ) 2 ⟩ = ⟨ X 2 ⟩ − ⟨ X ⟩ 2 (C2.2) \mathrm{Var}(X) = \left\langle(X - \langle X\rangle)^2\right\rangle = \langle X^2\rangle - \langle X\rangle^2 \tag{C2.2} Var ( X ) = ⟨ ( X − ⟨ X ⟩ ) 2 ⟩ = ⟨ X 2 ⟩ − ⟨ X ⟩ 2 ( C2.2 )
(第二个等号:展开平方,⟨ X 2 − 2 X ⟨ X ⟩ + ⟨ X ⟩ 2 ⟩ = ⟨ X 2 ⟩ − 2 ⟨ X ⟩ 2 + ⟨ X ⟩ 2 \langle X^2 - 2X\langle X\rangle + \langle X\rangle^2\rangle = \langle X^2\rangle - 2\langle X\rangle^2 + \langle X\rangle^2 ⟨ X 2 − 2 X ⟨ X ⟩ + ⟨ X ⟩ 2 ⟩ = ⟨ X 2 ⟩ − 2 ⟨ X ⟩ 2 + ⟨ X ⟩ 2 ,用了线性性与"⟨ X ⟩ \langle X\rangle ⟨ X ⟩ 是常数"。)标准差 σ = V a r \sigma = \sqrt{\mathrm{Var}} σ = Var 衡量分布的宽度;σ / ⟨ X ⟩ \sigma/\langle X\rangle σ / ⟨ X ⟩ 是相对涨落。性质:V a r ( a X + b ) = a 2 V a r ( X ) \mathrm{Var}(aX + b) = a^2\mathrm{Var}(X) Var ( a X + b ) = a 2 Var ( X ) (平移不改变宽度);V a r ≥ 0 \mathrm{Var}\ge0 Var ≥ 0 ,等号当且仅当 X X X 恒为常数。
物理中的例子 :σ E 2 = k B T 2 C V \sigma_E^2 = k_{\mathrm B}T^2C_V σ E 2 = k B T 2 C V ((4.13) ),于是由 V a r ≥ 0 \mathrm{Var}\ge0 Var ≥ 0 得 C V ≥ 0 C_V\ge0 C V ≥ 0 ——热力学稳定性条件成了概率论的平凡推论。
§C2.3 切比雪夫不等式
P ( ∣ X − μ ∣ ≥ k σ ) ≤ 1 k 2 (C2.3) P\big(\lvert X - \mu\rvert\ge k\sigma\big)\le\frac{1}{k^2} \tag{C2.3} P ( ∣ X − μ ∣ ≥ kσ ) ≤ k 2 1 ( C2.3 )
(μ = ⟨ X ⟩ \mu = \langle X\rangle μ = ⟨ X ⟩ 。)证明 :σ 2 = ∫ ( x − μ ) 2 p d x ≥ ∫ ∣ x − μ ∣ ≥ k σ ( x − μ ) 2 p d x ≥ k 2 σ 2 ∫ ∣ x − μ ∣ ≥ k σ p d x \sigma^2 = \int(x - \mu)^2p\,dx\ge\int_{\lvert x-\mu\rvert\ge k\sigma}(x - \mu)^2p\,dx\ge k^2\sigma^2\int_{\lvert x-\mu\rvert\ge k\sigma}p\,dx σ 2 = ∫ ( x − μ ) 2 p d x ≥ ∫ ∣ x − μ ∣ ≥ kσ ( x − μ ) 2 p d x ≥ k 2 σ 2 ∫ ∣ x − μ ∣ ≥ kσ p d x ,两边除以 k 2 σ 2 k^2\sigma^2 k 2 σ 2 。
它对任何分布都成立,所以很粗糙(高斯分布偏离 3 σ 3\sigma 3 σ 的概率是 0.27%,切比雪夫只保证不超过 11%),但它告诉我们:只要方差小,大偏离就不可能 。这是证明大数定律的关键一步(附录 C6 )。例:宏观量的相对涨落 σ / μ ∼ 1 0 − 12 \sigma/\mu\sim10^{-12} σ / μ ∼ 1 0 − 12 ,则偏离平均值达 1 0 − 8 10^{-8} 1 0 − 8 (相对值)的概率不超过 ( 1 0 − 12 / 1 0 − 8 ) 2 = 1 0 − 8 (10^{-12}/10^{-8})^2 = 10^{-8} ( 1 0 − 12 /1 0 − 8 ) 2 = 1 0 − 8 ——这还只是最保守的估计。
§C2.4 矩、累积量与生成函数
矩 m n = ⟨ X n ⟩ m_n = \langle X^n\rangle m n = ⟨ X n ⟩ ,中心矩 ⟨ ( X − μ ) n ⟩ \langle(X - \mu)^n\rangle ⟨( X − μ ) n ⟩ 。方差是二阶中心矩;三阶中心矩衡量分布的不对称(偏度),四阶衡量"尾巴"的轻重。
矩生成函数 M ( s ) = ⟨ e s X ⟩ = ∑ n s n n ! m n M(s) = \langle e^{sX}\rangle = \sum_n\frac{s^n}{n!}m_n M ( s ) = ⟨ e s X ⟩ = ∑ n n ! s n m n :它在 s = 0 s = 0 s = 0 处的各阶导数就是各阶矩。累积量生成函数
K ( s ) = ln M ( s ) = ∑ n ≥ 1 s n n ! κ n (C2.4) K(s) = \ln M(s) = \sum_{n\ge1}\frac{s^n}{n!}\kappa_n \tag{C2.4} K ( s ) = ln M ( s ) = n ≥ 1 ∑ n ! s n κ n ( C2.4 )
的展开系数 κ n \kappa_n κ n 称为累积量 。由 K ′ = M ′ / M K' = M'/M K ′ = M ′ / M 、K ′ ′ = M ′ ′ / M − ( M ′ / M ) 2 K'' = M''/M - (M'/M)^2 K ′′ = M ′′ / M − ( M ′ / M ) 2 在 s = 0 s = 0 s = 0 处取值(M ( 0 ) = 1 M(0) = 1 M ( 0 ) = 1 ):
κ 1 = ⟨ X ⟩ , κ 2 = V a r ( X ) , κ 3 = ⟨ ( X − μ ) 3 ⟩ , κ 4 = ⟨ ( X − μ ) 4 ⟩ − 3 V a r ( X ) 2 (C2.5) \kappa_1 = \langle X\rangle,\qquad \kappa_2 = \mathrm{Var}(X),\qquad \kappa_3 = \langle(X - \mu)^3\rangle,\qquad \kappa_4 = \langle(X - \mu)^4\rangle - 3\,\mathrm{Var}(X)^2 \tag{C2.5} κ 1 = ⟨ X ⟩ , κ 2 = Var ( X ) , κ 3 = ⟨( X − μ ) 3 ⟩ , κ 4 = ⟨( X − μ ) 4 ⟩ − 3 Var ( X ) 2 ( C2.5 )
为什么用累积量 :若 X X X 、Y Y Y 独立,⟨ e s ( X + Y ) ⟩ = ⟨ e s X ⟩ ⟨ e s Y ⟩ \langle e^{s(X+Y)}\rangle = \langle e^{sX}\rangle\langle e^{sY}\rangle ⟨ e s ( X + Y ) ⟩ = ⟨ e s X ⟩ ⟨ e s Y ⟩ (附录 C3 ),所以 K X + Y = K X + K Y K_{X+Y} = K_X + K_Y K X + Y = K X + K Y :独立变量之和的各阶累积量都是相加的 。对高斯分布,K ( s ) = μ s + 1 2 σ 2 s 2 K(s) = \mu s + \frac12\sigma^2s^2 K ( s ) = μ s + 2 1 σ 2 s 2 (由 (A7.5) ),三阶及以上的累积量全为零;所以高阶累积量衡量"偏离高斯的程度"。
ln Z \ln Z ln Z 就是累积量生成函数 。正则分布下 ⟨ e − λ E ⟩ = 1 Z ( β ) ∑ i e − ( β + λ ) E i = Z ( β + λ ) Z ( β ) \langle e^{-\lambda E}\rangle = \frac{1}{Z(\beta)}\sum_ie^{-(\beta + \lambda)E_i} = \frac{Z(\beta + \lambda)}{Z(\beta)} ⟨ e − λ E ⟩ = Z ( β ) 1 ∑ i e − ( β + λ ) E i = Z ( β ) Z ( β + λ ) ,所以能量的累积量生成函数为 ln Z ( β + λ ) − ln Z ( β ) \ln Z(\beta + \lambda) - \ln Z(\beta) ln Z ( β + λ ) − ln Z ( β ) (以 − λ -\lambda − λ 为变量),
κ n ( E ) = ( − 1 ) n ∂ n ln Z ∂ β n (C2.6) \kappa_n(E) = (-1)^n\frac{\partial^n\ln Z}{\partial\beta^n} \tag{C2.6} κ n ( E ) = ( − 1 ) n ∂ β n ∂ n ln Z ( C2.6 )
n = 1 , 2 n = 1,2 n = 1 , 2 就是 (A7.6) 。由于 ln Z ∝ N \ln Z\propto N ln Z ∝ N ,能量的所有累积量都正比于 N N N ;相对涨落 κ 2 1 / 2 / κ 1 ∝ N − 1 / 2 \kappa_2^{1/2}/\kappa_1\propto N^{-1/2} κ 2 1/2 / κ 1 ∝ N − 1/2 ,偏度 κ 3 / κ 2 3 / 2 ∝ N − 1 / 2 \kappa_3/\kappa_2^{3/2}\propto N^{-1/2} κ 3 / κ 2 3/2 ∝ N − 1/2 ——N N N 越大,分布越接近一个窄的高斯峰。
特征函数 ϕ ( k ) = ⟨ e i k X ⟩ = ∫ p ( x ) e i k x d x \phi(k) = \langle e^{ikX}\rangle = \int p(x)e^{ikx}dx ϕ ( k ) = ⟨ e ik X ⟩ = ∫ p ( x ) e ik x d x 是概率密度的傅里叶变换(附录 A14 的时间约定)。它对任何分布都存在(∣ e i k x ∣ = 1 \lvert e^{ikx}\rvert = 1 ∣ e ik x ∣ = 1 ),ϕ ( 0 ) = 1 \phi(0) = 1 ϕ ( 0 ) = 1 ,并且通过反变换唯一地确定 p ( x ) p(x) p ( x ) 。矩由导数给出:⟨ X n ⟩ = ( − i ) n ϕ ( n ) ( 0 ) \langle X^n\rangle = (-i)^n\phi^{(n)}(0) ⟨ X n ⟩ = ( − i ) n ϕ ( n ) ( 0 ) 。高斯分布的特征函数是 e i k μ − σ 2 k 2 / 2 e^{ik\mu - \sigma^2k^2/2} e ik μ − σ 2 k 2 /2 (由 (A14.9) )。附录 C6 用它证明中心极限定理。
§C2.5 詹森不等式
凸函数 (g ′ ′ ≥ 0 g''\ge0 g ′′ ≥ 0 ,图像向上弯)位于它任一点切线的上方:g ( x ) ≥ g ( x 0 ) + g ′ ( x 0 ) ( x − x 0 ) g(x)\ge g(x_0) + g'(x_0)(x - x_0) g ( x ) ≥ g ( x 0 ) + g ′ ( x 0 ) ( x − x 0 ) 。取 x 0 = ⟨ X ⟩ x_0 = \langle X\rangle x 0 = ⟨ X ⟩ ,对 X X X 的分布求平均,右边第二项的平均为零,于是
⟨ g ( X ) ⟩ ≥ g ( ⟨ X ⟩ ) ( g 凸 ) (C2.7) \langle g(X)\rangle\ge g(\langle X\rangle)\qquad(g\text{ 凸}) \tag{C2.7} ⟨ g ( X )⟩ ≥ g (⟨ X ⟩) ( g 凸 ) ( C2.7 )
对凹函数不等号反向。若 g g g 严格凸(g ′ ′ > 0 g''>0 g ′′ > 0 ),等号当且仅当 X X X 是常数。直观图像:凸函数上两点的连线(弦)在曲线上方,"先平均再取函数"落在曲线上,"先取函数再平均"落在弦上。
例 :
g = x 2 g = x^2 g = x 2 :⟨ X 2 ⟩ ≥ ⟨ X ⟩ 2 \langle X^2\rangle\ge\langle X\rangle^2 ⟨ X 2 ⟩ ≥ ⟨ X ⟩ 2 ,即 V a r ≥ 0 \mathrm{Var}\ge0 Var ≥ 0 。
g = e x g = e^x g = e x :⟨ e X ⟩ ≥ e ⟨ X ⟩ \langle e^X\rangle\ge e^{\langle X\rangle} ⟨ e X ⟩ ≥ e ⟨ X ⟩ 。这就是博戈留波夫不等式 (18.21) 的来源:⟨ e − β ( H − H 0 ) ⟩ 0 ≥ e − β ⟨ H − H 0 ⟩ 0 \langle e^{-\beta(\mathcal H - \mathcal H_0)}\rangle_0\ge e^{-\beta\langle\mathcal H - \mathcal H_0\rangle_0} ⟨ e − β ( H − H 0 ) ⟩ 0 ≥ e − β ⟨ H − H 0 ⟩ 0 。
雅津斯基等式与第二定律 (§33.4 ):⟨ e − β W ⟩ = e − β Δ F \langle e^{-\beta W}\rangle = e^{-\beta\Delta F} ⟨ e − β W ⟩ = e − β Δ F (33.1) 。由 (C2.7) ,e − β ⟨ W ⟩ ≤ ⟨ e − β W ⟩ = e − β Δ F e^{-\beta\langle W\rangle}\le\langle e^{-\beta W}\rangle = e^{-\beta\Delta F} e − β ⟨ W ⟩ ≤ ⟨ e − β W ⟩ = e − β Δ F ,所以 ⟨ W ⟩ ≥ Δ F \langle W\rangle\ge\Delta F ⟨ W ⟩ ≥ Δ F :平均而言,外界做的功不少于自由能的增加——这就是第二定律。个别实现中 W < Δ F W<\Delta F W < Δ F 是允许的,只是必须足够罕见。
熵的上界 :ln \ln ln 是凹函数,所以 ⟨ ln Y ⟩ ≤ ln ⟨ Y ⟩ \langle\ln Y\rangle\le\ln\langle Y\rangle ⟨ ln Y ⟩ ≤ ln ⟨ Y ⟩ 。取 Y = 1 / P i Y = 1/P_i Y = 1/ P i (以概率 P i P_i P i 取值,只计 P i > 0 P_i>0 P i > 0 的 Ω \Omega Ω 个态):− ∑ i P i ln P i = ⟨ ln ( 1 / P ) ⟩ ≤ ln ∑ i P i ⋅ 1 P i = ln Ω -\sum_iP_i\ln P_i = \langle\ln(1/P)\rangle\le\ln\sum_iP_i\cdot\frac{1}{P_i} = \ln\Omega − ∑ i P i ln P i = ⟨ ln ( 1/ P )⟩ ≤ ln ∑ i P i ⋅ P i 1 = ln Ω 。熵在等概率分布时最大 ,与附录 A8 的例 2 一致。
相对熵非负 (吉布斯不等式):对两个分布 P P P 、Q Q Q ,
D ( P ∥ Q ) ≡ ∑ i P i ln P i Q i ≥ 0 (C2.8) D(P\Vert Q)\equiv\sum_iP_i\ln\frac{P_i}{Q_i}\ge0 \tag{C2.8} D ( P ∥ Q ) ≡ i ∑ P i ln Q i P i ≥ 0 ( C2.8 )
证明:− D = ∑ i P i ln Q i P i ≤ ln ∑ i P i Q i P i = ln ∑ i Q i ≤ 0 -D = \sum_iP_i\ln\frac{Q_i}{P_i}\le\ln\sum_iP_i\frac{Q_i}{P_i} = \ln\sum_iQ_i\le0 − D = ∑ i P i ln P i Q i ≤ ln ∑ i P i P i Q i = ln ∑ i Q i ≤ 0 ;等号当且仅当 P = Q P = Q P = Q 。§23.6 中 D ( t ) = ∑ i P i ln ( P i / π i ) ≥ 0 \mathcal D(t) = \sum_iP_i\ln(P_i/\pi_i)\ge0 D ( t ) = ∑ i P i ln ( P i / π i ) ≥ 0 就是相对熵,它随时间单调减小到零((23.20) ,证明用到细致平衡),说明满足细致平衡的主方程总使系统趋于平衡分布。
自测题
求 [ 0 , 1 ] [0,1] [ 0 , 1 ] 上均匀分布的方差。[答:1 3 − 1 4 = 1 12 \frac13 - \frac14 = \frac1{12} 3 1 − 4 1 = 12 1 。]
指数分布 p = λ e − λ x p = \lambda e^{-\lambda x} p = λ e − λ x 的累积量生成函数是 K ( s ) = − ln ( 1 − s / λ ) K(s) = -\ln(1 - s/\lambda) K ( s ) = − ln ( 1 − s / λ ) 。求 κ 1 \kappa_1 κ 1 、κ 2 \kappa_2 κ 2 与一般的 κ n \kappa_n κ n 。[答:1 / λ 1/\lambda 1/ λ ,1 / λ 2 1/\lambda^2 1/ λ 2 ,κ n = ( n − 1 ) ! / λ n \kappa_n = (n-1)!/\lambda^n κ n = ( n − 1 )! / λ n 。]
两能级系统(能量 0 0 0 与 ε \varepsilon ε ),激发态概率 p = 1 / ( e β ε + 1 ) p = 1/(e^{\beta\varepsilon} + 1) p = 1/ ( e βε + 1 ) 。求能量的方差,并由 (4.13) 写出热容。[答:ε 2 p ( 1 − p ) \varepsilon^2p(1-p) ε 2 p ( 1 − p ) ;C = k B ( β ε ) 2 e β ε ( e β ε + 1 ) 2 C = k_{\mathrm B}(\beta\varepsilon)^2\frac{e^{\beta\varepsilon}}{(e^{\beta\varepsilon} + 1)^2} C = k B ( βε ) 2 ( e βε + 1 ) 2 e βε (肖特基峰)。]
用詹森不等式证明:对正的随机变量,⟨ 1 / X ⟩ ≥ 1 / ⟨ X ⟩ \langle1/X\rangle\ge1/\langle X\rangle ⟨ 1/ X ⟩ ≥ 1/ ⟨ X ⟩ 。
对 Y = Y = Y = 骰子点数,比较切比雪夫不等式对 P ( ∣ Y − 3.5 ∣ ≥ 2.5 ) P(\lvert Y - 3.5\rvert\ge2.5) P (∣ Y − 3.5 ∣ ≥ 2.5 ) 给出的上界与真实值。[答:σ 2 = 35 / 12 \sigma^2 = 35/12 σ 2 = 35/12 ,k = 2.5 / σ ≈ 1.46 k = 2.5/\sigma\approx1.46 k = 2.5/ σ ≈ 1.46 ,上界 ≈ 0.47 \approx0.47 ≈ 0.47 ;真实值 2 / 6 ≈ 0.33 2/6\approx0.33 2/6 ≈ 0.33 。]
这一篇已记为读完。标为未读