符号约定

记号 含义
P(A) P(A) 事件 A A 的概率
P(AB) P(A \mid B) B B 发生条件下 A A 的条件概率
Ω, \Omega, \varnothing 样本空间,不可能事件
A \overline{A} A A 的对立事件
X,Y,Z X, Y, Z 随机变量(大写字母)
x,y,z x, y, z 随机变量的取值(小写字母)
F(x),f(x) F(x), f(x) 分布函数,密度函数
E(X), D(X) E(X),\ D(X) 期望(均值),方差
Cov(X,Y), ρXY \operatorname{Cov}(X, Y),\ \rho_{XY} 协方差,相关系数
XN(μ,σ2) X \sim N(\mu, \sigma^2) X X 服从正态分布
Φ(x), φ(x) \Phi(x),\ \varphi(x) 标准正态分布函数,标准正态密度
B(n,p), π(λ) B(n, p),\ \pi(\lambda) 二项分布,泊松分布
X1,X2,,Xn X_1, X_2, \dots, X_n 简单随机样本
Xˉ, S2 \bar{X},\ S^2 样本均值,样本方差
θ^ \hat{\theta} 参数 θ \theta 的估计量
     \iff 当且仅当
\blacksquare 证毕

1. 随机事件与概率

1. 随机试验与样本空间

概率论的研究对象是随机现象:个别试验中结果呈现出不确定性,但在大量重复试验中其结果又具有统计规律性的现象。

随机试验是满足以下三个条件的试验:

  1. 可在相同条件下重复进行;
  2. 全部可能结果不止一个,且事先明确;
  3. 每次试验之前无法预知哪一个结果出现。

试验的所有可能结果组成的集合称为样本空间,记作 Ω \Omega ;每个可能结果称为样本点。例如掷一颗骰子,Ω={1,2,3,4,5,6} \Omega = \{1, 2, 3, 4, 5, 6\} ;测度一台灯的寿命,Ω={tt0} \Omega = \{t \mid t \geq 0\}

随机事件是样本空间的子集,简称事件。事件 A A 发生,当且仅当试验结果 ωA \omega \in A 。特殊地:Ω \Omega 自身是必然事件, \varnothing 是不可能事件。

2. 事件间的关系与运算

A,BΩ A, B \subset \Omega

  • 包含 AB A \subset B A A 发生必导致 B B 发生;
  • AB A \cup B A A B B 至少一个发生;
  • AB A \cap B (记 AB AB ):A A B B 同时发生;
  • AB A - B A A 发生而 B B 不发生,即 AB A\overline{B}
  • 互斥 AB= AB = \varnothing :二者不能同时发生;
  • 对立 B=A=ΩA B = \overline{A} = \Omega - A A A 不发生,AA=Ω A \cup \overline{A} = \Omega AA= A\overline{A} = \varnothing

运算满足交换律、结合律、分配律,以及 对偶律(德摩根律)

AB=AB,AB=AB\overline{A \cup B} = \overline{A} \cap \overline{B}, \qquad \overline{A \cap B} = \overline{A} \cup \overline{B}

通俗地说:不发生"至少其一"就是"都不发生";不发生"同时发生"就是"至少一个不发生"。对偶律把"或"与"且"互换,是化简事件表达式的首要工具(习题 1.2)。

3. 频率与概率

1. 频率

在相同条件下重复试验 n n 次,事件 A A 发生 nA n_A 次,比值

fn(A)=nAnf_n(A) = \frac{n_A}{n}

称为 A A 频率。频率满足非负性(fn(A)0 f_n(A) \geq 0 )、规范性(fn(Ω)=1 f_n(\Omega) = 1 )与可加性(互斥事件的频率等于频率之和)。

频率稳定性:当 n n 增大时,fn(A) f_n(A) 在某个常数附近摆动,且摆动幅度随 n n 增大而减小——这个常数就是事件的概率的"频率定义"(图 1-1)。

2. 概率的公理化定义

Ω \Omega 为样本空间,若 Ω \Omega 的子集族上的实值函数 P() P(\cdot) 满足:

  1. 非负性P(A)0 P(A) \geq 0
  2. 规范性P(Ω)=1 P(\Omega) = 1
  3. 可列可加性:对两两互斥的事件列 A1,A2, A_1, A_2, \dots ,有 P(iAi)=iP(Ai) P\left(\bigcup_i A_i\right) = \sum_i P(A_i)

则称 P(A) P(A) 为事件 A A 概率。频率是概率的经验来源,公理化定义则给出数学上自洽的演绎起点。

3. 性质

由公理可推出:

  1. P()=0 P(\varnothing) = 0 (不可能事件概率为零,反之不然);
  2. 有限可加性:互斥时 P(AB)=P(A)+P(B) P(A \cup B) = P(A) + P(B)
  3. P(A)=1P(A) P(A) = 1 - P(\overline{A}) (正难则反);
  4. 单调性AB    P(A)P(B) A \subset B \implies P(A) \leq P(B)
  5. 加法公式P(AB)=P(A)+P(B)P(AB) P(A \cup B) = P(A) + P(B) - P(AB)

证明(加法公式):AB=A(BA) A \cup B = A \cup (B - A) ,且二者互斥,故 P(AB)=P(A)+P(BA) P(A \cup B) = P(A) + P(B - A) ;又 B=AB(BA) B = AB \cup (B - A) ,故 P(BA)=P(B)P(AB) P(B - A) = P(B) - P(AB) ,代入即得。 \blacksquare

4. 古典概型与几何概型

1. 古典概型

若样本空间有限(n n 个样本点)且每个样本点等可能,则

P(A)=A 包含的样本点数Ω 包含的样本点数=knP(A) = \frac{A \text{ 包含的样本点数}}{\Omega \text{ 包含的样本点数}} = \frac{k}{n}

排列组合是基本的计数工具。典型例子:掷两颗骰子,和为 s s 的概率 P(s)=(6s7)/36 P(s) = (6 - \lvert s - 7 \rvert)/36 ——s=7 s = 7 恰有 6 种组合,是唯一的最可能结果(图 1-2)。

2. 几何概型

样本空间是可测区域 ΩRd \Omega \subset \mathbb{R}^d (长度、面积、体积),投点等可能地落入任一同测度子区域,则

P(A)=m(A)m(Ω)P(A) = \frac{m(A)}{m(\Omega)}

会面问题:甲、乙两人先后独立到达,时刻 X,YU(0,1) X, Y \sim U(0, 1) (以 60 分钟为单位),能会面当且仅当 XY1/4 \lvert X - Y \rvert \leq 1/4 。会面区域是单位方形中的对角带,故

P(会面)=1(34)2=716=0.4375P(\text{会面}) = 1 - \left(\frac{3}{4}\right)^2 = \frac{7}{16} = 0.4375

(图 1-3)。几何概型把概率从"数点"推广到"量面积"——第五章蒙特卡洛法的想法即源于此。

5. 条件概率与三大公式

1. 条件概率

P(A)>0 P(A) > 0 ,称

P(BA)=P(AB)P(A)P(B \mid A) = \frac{P(AB)}{P(A)}

A A 发生条件下 B B 的概率。其含义是"缩小的样本空间里的新概率":已知 A A 发生后,样本空间由 Ω \Omega 缩为 A A B B 的份额需除以 A A 的概率重新归一化(图 1-4)。条件概率满足概率的全部公理,因而拥有概率的一切性质。

2. 乘法公式

P(AB)=P(A)P(BA)=P(B)P(AB)P(AB) = P(A)\, P(B \mid A) = P(B)\, P(A \mid B)

3. 全概率公式

B1,,Bn B_1, \dots, B_n Ω \Omega 的一个划分(两两互斥且并为 Ω \Omega P(Bi)>0 P(B_i) > 0 ),则

P(A)=i=1nP(Bi)P(ABi)P(A) = \sum_{i=1}^{n} P(B_i)\, P(A \mid B_i)

证明:A=AΩ=A(iBi)=iABi A = A\Omega = A\left(\bigcup_i B_i\right) = \bigcup_i AB_i ,诸 ABi AB_i 两两互斥,由可加性与乘法公式即得。 \blacksquare

全概率公式的思想是"分情况讨论":不知道 A A 怎么来,就把每条来路的贡献加总。

4. 贝叶斯公式

在上述划分下,若再设 P(A)>0 P(A) > 0 ,则

P(BjA)=P(Bj)P(ABj)i=1nP(Bi)P(ABi)P(B_j \mid A) = \frac{P(B_j)\, P(A \mid B_j)}{\sum_{i=1}^{n} P(B_i)\, P(A \mid B_i)}

P(Bj) P(B_j) 称为先验(试验前的信念),P(BjA) P(B_j \mid A) 称为后验(观察到证据 A A 后修正的信念)——贝叶斯公式是"由果溯因"的数学化。

6. 独立性

P(AB)=P(A)P(B)P(AB) = P(A)\, P(B)

则称 A A B B 相互独立。等价地(当 P(A)>0 P(A) > 0 时),P(BA)=P(B) P(B \mid A) = P(B) ——A A 的发生不改变 B B 的概率。

注意:独立与互斥是截然不同的概念——互斥事件 P(AB)=0 P(AB) = 0 ,只要 P(A),P(B)>0 P(A), P(B) > 0 就不可能独立;直观上互斥事件关联性极强(一个发生另一个必然不发生)。多个事件的相互独立性要求任意子族皆满足乘法分解,两两独立并不必然导致整体独立(习题 1.5)。

7. 代码

本章演示程序:src/chapter1(可执行文件 bin/Chapter1.exe,图像输出至 output/chapter1/)。

文件 内容 讲义位置
output/chapter1/fig_1_1_frequency.ppm 频率稳定于概率 图 1-1,3.1 节
output/chapter1/fig_1_2_dice.ppm 两颗骰子之和的古典概型 图 1-2,4.1 节
output/chapter1/fig_1_3_meeting.ppm 会面问题的几何概型 图 1-3,4.2 节
output/chapter1/fig_1_4_conditional.ppm 条件概率的区域划分 图 1-4,5.1 节

图 1-1(fig_1_1_frequency.ppm:5 条不同颜色的运行频率曲线(各 20000 次独立抛硬币)在 0.5 0.5 附近摆动,且摆动幅度随 n n 增大明显收窄;绿线标出真实概率 0.5 0.5 。每条路径形状各异,但殊途同归——这就是"频率稳定于概率"的直观含义。

图 1-2(fig_1_2_dice.ppm:蓝色棒图为两颗骰子之和的理论分布律 P(s)=(6s7)/36 P(s) = (6 - \lvert s - 7 \rvert)/36 ,在 s=7 s = 7 处达到峰值 6/36 6/36 ;橙色点为 100000 次模拟的频率,与理论棒严丝合缝——频率确实收敛到古典概率。

图 1-3(fig_1_3_meeting.ppm:单位方形中紫色对角带 xy1/4 \lvert x - y \rvert \leq 1/4 是会面区域,其面积恰为 7/16 7/16 ;400 个均匀投点中落入带内的着绿色、带外的着橙色,绿点的比例直观地接近 0.4375 0.4375 ——几何概率就是面积比。

图 1-4(fig_1_4_conditional.ppm:单位方形按 A={x2+y21} A = \{x^2 + y^2 \leq 1\} (四分之一圆)与 B={x+y1} B = \{x + y \leq 1\} (下三角)划分为四块:AB A \cap B 绿、AB A \cap \overline{B} 青、AB \overline{A} \cap B 蓝、其余灰。条件概率 P(BA) P(B \mid A) 即"只看绿色与青色两块,绿色占多大比例"——样本空间被缩小后重新归一化。

8. 习题

  1. P(A)=0.7 P(A) = 0.7 P(B)=0.6 P(B) = 0.6 P(AB)=0.9 P(A \cup B) = 0.9 ,求 P(AB) P(AB) P(AB) P(\overline{A}B) P(AAB) P(A \mid A \cup B)
  2. 用对偶律化简 (AB)(AC) \overline{(A \cup B)(\overline{A} \cup C)}
  3. 掷两颗骰子,求"点数之和为 8"与"点数之差不大于 2"同时考虑时至少一个发生的概率。
  4. 10 件产品中有 3 件次品,不放回地取 3 件,求恰好取到 1 件次品的概率;再求已知第 1 件是次品时后两件全为正品的概率。
  5. 举例说明"两两独立但三事件不相互独立"。
  6. 病人患病率为 0.01,某检测方法对患者的阳性率为 0.95,对健康人的误报率为 0.05。某人检测结果为阳性,求他确实患病的概率(贝叶斯公式),并解释为何远小于 0.95 0.95
  7. (编程) 修改 meeting.cpp 中的等待时间(现为 1/4 1/4 ),观察 P(会面) 如何随等待时间变化;验证 w=1/2 w = 1/2 时概率为 3/4 3/4
  8. (编程) 仿照图 1-1,用骰子替代硬币(p=1/6 p = 1/6 )绘制频率曲线,观察收敛速度是否变慢,并用 3 节的摆动收窄现象解释之。

2. 随机变量及其分布

1. 随机变量与分布函数

随机变量是定义在样本空间上的实值函数 X:ΩR X: \Omega \to \mathbb{R} 。它把随机试验的每个结果数量化,使得"事件"成为"变量落在某范围内":{Xx} \{X \leq x\}

为统一刻画随机变量的概率规律,定义分布函数

F(x)=P{Xx},xRF(x) = P\{X \leq x\}, \qquad x \in \mathbb{R}

分布函数具有:单调不减性、右连续性,以及 F()=0 F(-\infty) = 0 F(+)=1 F(+\infty) = 1 ;反之,满足这四条的函数必是某个随机变量的分布函数。由它可以算出一切区间概率:P{a<Xb}=F(b)F(a) P\{a < X \leq b\} = F(b) - F(a)

2. 离散型随机变量

1. 分布律

X X 的取值为至多可列个 x1,x2, x_1, x_2, \dots ,则其分布律

P{X=xk}=pk,pk0,kpk=1P\{X = x_k\} = p_k, \qquad p_k \geq 0, \quad \sum_k p_k = 1

2. 二项分布

X X n n 重伯努利试验中成功的次数(每次成功概率 p p ),则 XB(n,p) X \sim B(n, p)

P{X=k}=(nk)pk(1p)nk,k=0,1,,nP\{X = k\} = \binom{n}{k} p^k (1-p)^{n-k}, \qquad k = 0, 1, \dots, n

二项分布是"独立重复计数"的普适模型(图 2-1)。其期望与方差为

E(X)=np,D(X)=np(1p)E(X) = np, \qquad D(X) = np(1-p)

3. 泊松分布与泊松定理

P{X=k}=λkeλk!,k=0,1,2,P\{X = k\} = \frac{\lambda^k e^{-\lambda}}{k!}, \qquad k = 0, 1, 2, \dots

Xπ(λ) X \sim \pi(\lambda) (或记 Poisson(λ) \operatorname{Poisson}(\lambda) ),λ>0 \lambda > 0 是单位时间内稀有事件平均发生的次数。

泊松定理:设 npnλ>0 np_n \to \lambda > 0 ,则

limn(nk)pnk(1pn)nk=λkeλk!\lim_{n \to \infty} \binom{n}{k} p_n^k (1 - p_n)^{n-k} = \frac{\lambda^k e^{-\lambda}}{k!}

n n 大、p p 小时 B(n,p)π(np) B(n, p) \approx \pi(np) (图 2-2:B(100,0.03) B(100, 0.03) π(3) \pi(3) 几乎重合)。稀有事件计数——单位时间电话呼叫数、放射性衰变数、排版错字数——都近似服从泊松分布。

3. 连续型随机变量

1. 密度函数

若存在非负函数 f(x) f(x) 使

F(x)=xf(t)dtF(x) = \int_{-\infty}^{x} f(t)\, dt

X X 连续型的,f f 为其概率密度函数。密度满足 f0 f \geq 0 +f=1 \int_{-\infty}^{+\infty} f = 1 ;且 P{a<X<b}=abf(x)dx P\{a < X < b\} = \int_a^b f(x)\, dx ,单点概率为零。密度不是概率,是"概率的变化率"——直方图中棒高是频率密度(棒的面积才是频率),正是为了与密度曲线直接对照(见 3 节与图 2-3)。

2. 均匀分布

XU(a,b) X \sim U(a, b) :密度在 [a,b] [a, b] 上恒为 1/(ba) 1/(b - a) ,落点在任何等长子区间的概率相等。"等可能"从离散到连续的自然延伸。

3. 指数分布

XExp(λ) X \sim \operatorname{Exp}(\lambda) (密度 f(x)=λeλx f(x) = \lambda e^{-\lambda x} x0 x \geq 0 ):

F(x)=1eλx,x0;E(X)=1λ,D(X)=1λ2F(x) = 1 - e^{-\lambda x}, \quad x \geq 0; \qquad E(X) = \frac{1}{\lambda}, \quad D(X) = \frac{1}{\lambda^2}

无记忆性:对任意 s,t>0 s, t > 0

P{X>s+tX>s}=P{X>t}P\{X > s + t \mid X > s\} = P\{X > t\}

证明:左边 =P{X>s+t}P{X>s}=eλ(s+t)eλs=eλt = \dfrac{P\{X > s + t\}}{P\{X > s\}} = \dfrac{e^{-\lambda(s+t)}}{e^{-\lambda s}} = e^{-\lambda t} \blacksquare

“已经等了 s s 分钟"并不影响"还要等多久"的分布——指数分布因此成为"寿命”(电子元件、等待时间)的标准模型(图 2-3)。

4. 正态分布

XN(μ,σ2) X \sim N(\mu, \sigma^2)

f(x)=12πσexp((xμ)22σ2),E(X)=μ,D(X)=σ2f(x) = \frac{1}{\sqrt{2\pi}\,\sigma} \exp\left(-\frac{(x - \mu)^2}{2\sigma^2}\right), \qquad E(X) = \mu, \quad D(X) = \sigma^2

密度曲线关于 x=μ x = \mu 对称、钟形、两端衰减,σ \sigma 控制宽窄:σ \sigma 越大越"矮胖"(分散),越小越"高瘦"(集中),面积恒为 1(图 2-4)。

μ=0,σ=1 \mu = 0, \sigma = 1 时称标准正态分布,分布函数记 Φ(x) \Phi(x) ,密度记 φ(x) \varphi(x) 。重要事实:

  1. 对称性:Φ(x)=1Φ(x) \Phi(-x) = 1 - \Phi(x)
  2. 标准化:若 XN(μ,σ2) X \sim N(\mu, \sigma^2) ,则 Z=XμσN(0,1) Z = \dfrac{X - \mu}{\sigma} \sim N(0, 1) ,反之 Φ \Phi 可算一切正态概率——查表只此一张;
  3. 3σ 3\sigma 原则P{Xμ<σ}68.3% P\{\lvert X - \mu \rvert < \sigma\} \approx 68.3\% 2σ 2\sigma 95.4% \approx 95.4\% 3σ 3\sigma 99.7% \approx 99.7\%

正态分布的地位由第五章的中心极限定理奠定:大量独立微小因素叠加的结果都近似正态。

4. 随机变量函数的分布

X X 的密度为 fX f_X Y=g(X) Y = g(X) 。当 g g 严格单调、可导且反函数 h=g1 h = g^{-1} 时:

fY(y)=fX(h(y))h(y)f_Y(y) = f_X(h(y)) \lvert h'(y) \rvert

公式法);一般情形用分布函数法:先求 FY(y)=P{g(X)y} F_Y(y) = P\{g(X) \leq y\} ,再求导。例如 XN(0,1) X \sim N(0, 1) Y=X2 Y = X^2 的密度即 χ2(1) \chi^2(1) 的密度(习题 2.6,并与 6 章 2 节呼应)。

5. 代码

本章演示程序:src/chapter2(可执行文件 bin/Chapter2.exe,图像输出至 output/chapter2/)。

文件 内容 讲义位置
output/chapter2/fig_2_1_binomial.ppm B(10,0.5) B(10, 0.5) 的分布律与模拟 图 2-1,2.2 节
output/chapter2/fig_2_2_poisson.ppm 泊松定理 B(100,0.03)π(3) B(100, 0.03) \approx \pi(3) 图 2-2,2.3 节
output/chapter2/fig_2_3_exponential.ppm 指数分布直方图与密度 图 2-3,3.3 节
output/chapter2/fig_2_4_normal_family.ppm 正态分布族与 σ \sigma 的作用 图 2-4,3.4 节

图 2-1(fig_2_1_binomial.ppmB(10,0.5) B(10, 0.5) 的分布律蓝色棒图对称于 k=5 k = 5 (峰值概率 (105)2100.246 \binom{10}{5} 2^{-10} \approx 0.246 ),橙色点为 100000 次模拟频率——"结果的分配方案"被大量重复试验忠实地复现。

图 2-2(fig_2_2_poisson.ppm:泊松 π(3) \pi(3) 的分布律蓝棒与二项 B(100,0.03) B(100, 0.03) 的橙点几乎逐点重合(注意 λ=np=3 \lambda = np = 3 )。n=100 n = 100 次中每次以 p=0.03 p = 0.03 的"稀有事件",其计数规律已经完全由一个数 λ \lambda 决定。

图 2-3(fig_2_3_exponential.ppm:100000 个 Exp(1) \operatorname{Exp}(1) 样本的频率密度直方图(蓝棒)紧贴密度曲线 f(x)=ex f(x) = e^{-x} (红线)。样本在 0 附近最密集,长等待的概率按指数缩小——无记忆性使得"下一分钟"永远同样崭新。

图 2-4(fig_2_4_normal_family.ppm:标准正态样本直方图(蓝棒)与三条密度曲线对照:σ=0.5 \sigma = 0.5 (红,高瘦)、σ=1 \sigma = 1 (绿)、σ=2 \sigma = 2 (橙,矮胖)。三条曲线下面积都是 1——分散必然以变矮为代价,概率守恒。

6. 习题

  1. 设随机变量 X X 的分布函数 F(x)=a+barctanx F(x) = a + b\arctan x ,求常数 a,b a, b P{X>1} P\{X > 1\}
  2. 一批产品 20 件中 5 件次品,从中任取 4 件,求次品数 X X 的分布律(超几何分布),并计算 E(X) E(X)
  3. 某寻呼台每分钟接到的呼叫数 π(3) \sim \pi(3) ,求一分钟内呼叫不超过 2 次的概率与超过 5 次的概率。
  4. XExp(0.5) X \sim \operatorname{Exp}(0.5) ,求 P{X>4X>2} P\{X > 4 \mid X > 2\} ,并解释结果与无记忆性的关系。
  5. XN(3,4) X \sim N(3, 4) ,求 P{2<X<5} P\{2 < X < 5\} P{X>2} P\{\lvert X \rvert > 2\} (用 Φ \Phi 表示并查表)。
  6. XN(0,1) X \sim N(0, 1) ,用公式法求 Y=X2 Y = X^2 的密度,并指出它属于哪一著名分布族。
  7. (编程) 修改 poisson.cpp:取 n=1000,p=0.003 n = 1000, p = 0.003 (仍 λ=3 \lambda = 3 ),观察二项点是否依然贴合泊松棒;再取 n=10,p=0.3 n = 10, p = 0.3 λ \lambda 同为 3),观察两者是否明显分离——体会泊松定理的条件"大 n n p p "缺一不可。
  8. (编程) 仿照 normal_family.cpp,固定 σ=1 \sigma = 1 而变化 μ{2,0,2} \mu \in \{-2, 0, 2\} ,验证曲线仅作整体平移、形状不变。

3. 多维随机变量及其分布

1. 二维随机变量与联合分布

X(ω),Y(ω) X(\omega), Y(\omega) 是定义在同一样本空间上的随机变量,称 (X,Y) (X, Y) 二维随机变量。其联合分布函数

F(x,y)=P{Xx,Yy}F(x, y) = P\{X \leq x, Y \leq y\}

刻画"同时"的概率规律。若存在非负二元函数 f(x,y) f(x, y) 使 F(x,y)=xyf(u,v)dvdu F(x, y) = \int_{-\infty}^{x} \int_{-\infty}^{y} f(u, v)\, dv\, du ,则称 (X,Y) (X, Y) 连续,f f 联合密度:区域 D D 上的概率是密度在 D D 上的二重积分。

最重要的模型是二维正态分布 N(μ1,μ2,σ12,σ22,ρ) N(\mu_1, \mu_2, \sigma_1^2, \sigma_2^2, \rho) ,其联合密度等高线是一族同心的斜椭圆,长轴方向由相关系数 ρ \rho 的符号决定(图 3-1)。

2. 边际分布

X X 自身的分布称为边际分布

FX(x)=P{Xx}=F(x,+),fX(x)=+f(x,y)dyF_X(x) = P\{X \leq x\} = F(x, +\infty), \qquad f_X(x) = \int_{-\infty}^{+\infty} f(x, y)\, dy

Y Y 同理。边际分布是把联合分布"向坐标轴投影"——它只保留一个分量的信息,联合分布的信息多于各边际之和(联合知道"相关性",边际不知道)。

关键事实:边际分布不能反过来决定联合分布。反例见三角形均匀分布:(X,Y) (X, Y) 在三角形 {x0, y0, x+y1} \{x \geq 0,\ y \geq 0,\ x + y \leq 1\} 上均匀,但

fX(x)=2(1x),0x1f_X(x) = 2(1 - x), \quad 0 \leq x \leq 1

并非均匀分布(图 3-2)——均匀的联合投影出的边际按"靠近对角线处更厚"而线性递减。原因是投影时靠近三角形尖端的竖条更短,摊到同样的横轴区间上密度更小。

3. 条件分布与独立性

1. 条件分布

对连续型,在 Y=y Y = y 条件下(注意 P{Y=y}=0 P\{Y = y\} = 0 ,需用极限定义):

fXY(xy)=f(x,y)fY(y)f_{X \mid Y}(x \mid y) = \frac{f(x, y)}{f_Y(y)}

即"固定横坐标切一刀,切面按 fY(y) f_Y(y) 归一化"。

2. 独立性

若对一切 x,y x, y

F(x,y)=FX(x)FY(y)(连续型即 f(x,y)=fX(x)fY(y))F(x, y) = F_X(x)\, F_Y(y) \quad \left(\text{连续型即 } f(x, y) = f_X(x) f_Y(y)\right)

X,Y X, Y 相互独立。独立意味着联合密度"可分解"——知道一个分量的取值对另一个分量的分布毫无影响。二维正态的两个分量独立当且仅当 ρ=0 \rho = 0 (习题 3.5)。

4. 协方差与相关系数

1. 定义

设期望都存在,定义

Cov(X,Y)=E[(XEX)(YEY)]=E(XY)E(X)E(Y)\operatorname{Cov}(X, Y) = E\left[(X - EX)(Y - EY)\right] = E(XY) - E(X)E(Y)

ρXY=Cov(X,Y)D(X)D(Y)\rho_{XY} = \frac{\operatorname{Cov}(X, Y)}{\sqrt{D(X)}\sqrt{D(Y)}}

2. 定理(重要性质)

  1. Cov(X,Y)=Cov(Y,X) \operatorname{Cov}(X, Y) = \operatorname{Cov}(Y, X) Cov(X,X)=D(X) \operatorname{Cov}(X, X) = D(X)
  2. 双线性:Cov(aX+b,cY+d)=acCov(X,Y) \operatorname{Cov}(aX + b, cY + d) = ac\operatorname{Cov}(X, Y)
  3. D(X±Y)=D(X)+D(Y)±2Cov(X,Y) D(X \pm Y) = D(X) + D(Y) \pm 2\operatorname{Cov}(X, Y) (独立时交叉项为零,方差才可加);
  4. ρXY1 \lvert \rho_{XY} \rvert \leq 1 ,且 ρXY=1 \lvert \rho_{XY} \rvert = 1 当且仅当 X,Y X, Y 以概率 1 线性相关。

证明(4):对任意实数 t t D(YtX)0 D(Y - tX) \geq 0 展开为 t2D(X)2tCov(X,Y)+D(Y)0 t^2 D(X) - 2t\operatorname{Cov}(X, Y) + D(Y) \geq 0 ——这是 t t 的非负一元二次型,判别式非正:Cov(X,Y)2D(X)D(Y) \operatorname{Cov}(X, Y)^2 \leq D(X)D(Y) 。取 t=Cov(X,Y)/D(X) t = \operatorname{Cov}(X, Y)/D(X) 可进一步讨论等号条件,即 YtX Y - tX 退化为常数。 \blacksquare

3. 解读

ρXY \rho_{XY} 度量的是线性相关程度:ρ>0 \rho > 0 同向(云向右上倾斜),ρ<0 \rho < 0 反向,ρ \lvert \rho \rvert 越大云越"扁"(图 3-3)。但注意:

  • ρ=0 \rho = 0 (不相关)只是"没有线性关系",不等于独立——例如 XU(1,1) X \sim U(-1, 1) X X X2 X^2 不相关却显然相依(习题 3.6);
  • 独立必不相关(期望的乘法公式使协方差为零),反之不然。

5. 两个随机变量之和的分布

X,Y X, Y 独立且分别有密度 fX,fY f_X, f_Y ,则 Z=X+Y Z = X + Y 的密度为卷积

fZ(z)=+fX(x)fY(zx)dx  =def  (fXfY)(z)f_Z(z) = \int_{-\infty}^{+\infty} f_X(x) f_Y(z - x)\, dx \;\stackrel{\text{def}}{=}\; (f_X * f_Y)(z)

证明思路(分布函数法):FZ(z)=P{X+Yz}=x+yzfX(x)fY(y)dxdy F_Z(z) = P\{X + Y \leq z\} = \iint_{x + y \leq z} f_X(x) f_Y(y)\, dx\, dy ,交换积分次序后对 z z 求导即得卷积形式。 \blacksquare

经典例子:X,Y X, Y 独立同分布于 U(0,1) U(0, 1) ,则

fZ(z)={z,0<z<12z,1z<20,其余f_Z(z) = \begin{cases} z, & 0 < z < 1 \\ 2 - z, & 1 \leq z < 2 \\ 0, & \text{其余} \end{cases}

三角形密度(图 3-4)——两枚均匀骰子之和的分布(图 1-2)正是它的离散版本。"和"把平坦的输入变成中间高两头低的输出,这正是第五章中心极限定理形状的起点。

6. 代码

本章演示程序:src/chapter3(可执行文件 bin/Chapter3.exe,图像输出至 output/chapter3/)。

文件 内容 讲义位置
output/chapter3/fig_3_1_joint.ppm 二维正态散点云与等密度椭圆 图 3-1,1 节
output/chapter3/fig_3_2_marginal.ppm 三角形均匀分布的边际分布 图 3-2,2 节
output/chapter3/fig_3_3_correlation.ppm 相关系数 ±0.8 \pm 0.8 0 0 的对照 图 3-3,4 节
output/chapter3/fig_3_4_convolution.ppm 卷积:和的三角形密度 图 3-4,5 节

图 3-1(fig_3_1_joint.ppm:二维正态 N(0,0,1,1,ρ=0.8) N(0, 0, 1, 1, \rho = 0.8) 的 2000 个样本点(橙)沿 (1,1) (1, 1) 方向拉长成椭圆云;红色椭圆为 2 倍标准差等密度线,其主轴方向即样本协方差矩阵的特征方向。正相关把圆"压扁"成斜椭圆。

图 3-2(fig_3_2_marginal.ppm:主面板是三角形区域上均匀分布的散点(橙)与边界(灰);底部蓝棒为 X X 的边际直方图,左侧绿棒为 Y Y 的边际(横向绘制)——两者都不是均匀的,密度 2(1x) 2(1 - x) x x 线性递减。"联合均匀,边际不均匀"是边际分布最直观的警钟。

图 3-3(fig_3_3_correlation.ppm:三个面板各 800 个样本,相关系数依次为 ρ=0.8 \rho = -0.8 (左,云向右下)、ρ=0 \rho = 0 (中,圆形云)、ρ=0.8 \rho = 0.8 (右,云向右上)。ρ \lvert \rho \rvert 越大云越扁;中间的圆提醒你:不相关绝非独立。

图 3-4(fig_3_4_convolution.ppm:100000 个 Z=X+Y Z = X + Y X,Y X, Y 独立 U(0,1) U(0,1) )样本的直方图(蓝棒)贴住红色三角形密度 fZ(z) f_Z(z) 。两个"平坦"的随机变量相加得到"中间高两头低"的输出——独立叠加天然地生产"向中间集中"。

7. 习题

  1. (X,Y) (X, Y) 的联合密度 f(x,y)=ke(2x+y) f(x, y) = k e^{-(2x + y)} x,y0 x, y \geq 0 ),求 k k 、边际密度并判断独立性。
  2. 求图 3-2 中三角形均匀分布的 P{X+Y1/2} P\{X + Y \leq 1/2\} P{X1/2Y1/4} P\{X \leq 1/2 \mid Y \leq 1/4\}
  3. D(X)=4,D(Y)=9,ρXY=0.5 D(X) = 4, D(Y) = 9, \rho_{XY} = 0.5 ,求 D(X+Y) D(X + Y) D(XY) D(X - Y)
  4. 证明协方差的双线性性质 Cov(aX+bZ,Y)=aCov(X,Y)+bCov(Z,Y) \operatorname{Cov}(aX + bZ, Y) = a\operatorname{Cov}(X, Y) + b\operatorname{Cov}(Z, Y)
  5. 证明:二维正态分布中 X,Y X, Y 独立当且仅当 ρ=0 \rho = 0 (提示:联合密度能否分解为两个一维正态密度之积)。
  6. XU(1,1) X \sim U(-1, 1) Y=X2 Y = X^2 ,证明 Cov(X,Y)=0 \operatorname{Cov}(X, Y) = 0 X,Y X, Y 不独立。
  7. X,Y X, Y 独立且都服从 Exp(1) \operatorname{Exp}(1) ,写出 Z=X+Y Z = X + Y 的密度(伽马型),并说明其形状与图 3-4 的异同。
  8. (编程) 修改 joint.cpp 中的 ρ \rho 0.8 -0.8 ,观察椭圆云与红色等密度椭圆主轴的翻转;再取 ρ=0.3 \rho = 0.3 ,观察云更接近圆形但仍有可辨的倾斜。
  9. (编程) 仿照 convolution.cpp,把 X,Y X, Y 改为独立 Exp(1) \operatorname{Exp}(1) ,绘制 Z=X+Y Z = X + Y 的直方图与理论密度 zez z e^{-z}

4. 随机变量的数字特征

1. 数学期望

1. 定义

离散型:E(X)=kxkpk E(X) = \sum_k x_k p_k ;连续型:E(X)=+xf(x)dx E(X) = \int_{-\infty}^{+\infty} x f(x)\, dx (绝对收敛时才有意义)。

期望是"概率加权的平均"——分布律的重心:在支点 x=E(X) x = E(X) 处概率天平恰好平衡(图 4-1)。

2. 随机变量函数的期望

E(g(X))={kg(xk)pk+g(x)f(x)dxE(g(X)) = \begin{cases} \sum_k g(x_k)\, p_k \\ \int_{-\infty}^{+\infty} g(x) f(x)\, dx \end{cases}

无须先求 Y=g(X) Y = g(X) 的分布即可求其期望——这是计算期望的捷径。

3. 性质

  1. 线性:E(aX+bY)=aE(X)+bE(Y) E(aX + bY) = aE(X) + bE(Y) (无须独立性!);
  2. X,Y X, Y 独立时 E(XY)=E(X)E(Y) E(XY) = E(X)E(Y)

常用分布的期望:B(n,p) B(n,p) np np π(λ) \pi(\lambda) λ \lambda U(a,b) U(a,b) (a+b)/2 (a+b)/2 Exp(λ) \operatorname{Exp}(\lambda) 1/λ 1/\lambda N(μ,σ2) N(\mu, \sigma^2) μ \mu

2. 方差

1. 定义

D(X)=E[(XE(X))2]=E(X2)[E(X)]2D(X) = E\left[(X - E(X))^2\right] = E(X^2) - \left[E(X)\right]^2

方差的算术平方根 σ(X)=D(X) \sigma(X) = \sqrt{D(X)} 称为标准差,与 X X 同量纲。方差度量分布对期望的偏离程度:同均值下方差越大越分散(图 4-2)。

2. 性质

  1. D(c)=0 D(c) = 0 D(X+c)=D(X) D(X + c) = D(X) (平移不改变分散度);
  2. D(cX)=c2D(X) D(cX) = c^2 D(X)
  3. 独立可加X,Y X, Y 独立时 D(X+Y)=D(X)+D(Y) D(X + Y) = D(X) + D(Y) ;一般情形要加交叉项 2Cov(X,Y) 2\operatorname{Cov}(X, Y)
  4. D(X)=0    X D(X) = 0 \iff X 以概率 1 为常数。

常用分布的方差:B(n,p) B(n,p) np(1p) np(1-p) π(λ) \pi(\lambda) λ \lambda U(a,b) U(a,b) (ba)2/12 (b-a)^2/12 Exp(λ) \operatorname{Exp}(\lambda) λ2 \lambda^{-2} N(μ,σ2) N(\mu, \sigma^2) σ2 \sigma^2

3. 契比雪夫不等式(见 4 节)

3. 协方差、相关系数与回归直线

协方差与相关系数的定义与性质见 3.4 节,此处强调其几何意义:样本散点云的"倾斜程度"由协方差翻译成最小二乘回归直线的坡度

b=Cov(X,Y)D(X),a=E(Y)bE(X)b = \frac{\operatorname{Cov}(X, Y)}{D(X)}, \qquad a = E(Y) - b\, E(X)

(图 4-3;理论依据见 8.5 节的最小二乘推导)。注意 X X Y Y 回归与 Y Y X X 回归是两条不同的直线(习题 4.5)。

4. 切比雪夫不等式

定理:设 E(X)=μ E(X) = \mu D(X)=σ2 D(X) = \sigma^2 存在,则对任意 k>0 k > 0

P{Xμkσ}1k2P\{\lvert X - \mu \rvert \geq k\sigma\} \leq \frac{1}{k^2}

证明(连续型):σ2=+(xμ)2f(x)dxxμkσ(xμ)2f(x)dxk2σ2xμkσf(x)dx=k2σ2P{Xμkσ} \sigma^2 = \int_{-\infty}^{+\infty} (x - \mu)^2 f(x)\, dx \geq \int_{\lvert x - \mu \rvert \geq k\sigma} (x - \mu)^2 f(x)\, dx \geq k^2\sigma^2 \int_{\lvert x - \mu \rvert \geq k\sigma} f(x)\, dx = k^2 \sigma^2 P\{\lvert X - \mu \rvert \geq k\sigma\} ,两边除以 k2σ2 k^2\sigma^2 即得。 \blacksquare

解读(图 4-4):

  • 只要求方差存在,对任何分布成立——这是第五章大数定律(伯努利形式)证明的关键工具;
  • 代价是宽松:对正态总体,真实尾部概率按指数衰减,远小于 1/k2 1/k^2 ——切比雪夫只保证"不比这更糟"。

5. 原点矩与中心矩

E(Xk) E(X^k) 称为 k k 原点矩E[(Xμ)k] E[(X - \mu)^k] 称为 k k 中心矩。期望是一阶原点矩,方差是二阶中心矩;矩是数字特征的一般化,第七章的矩估计直接使用它们。

6. 代码

本章演示程序:src/chapter4(可执行文件 bin/Chapter4.exe,图像输出至 output/chapter4/)。

文件 内容 讲义位置
output/chapter4/fig_4_1_expectation.ppm 期望是分布律的重心 图 4-1,1 节
output/chapter4/fig_4_2_variance.ppm 方差度量分散程度 图 4-2,2 节
output/chapter4/fig_4_3_regression.ppm 协方差与回归直线 图 4-3,3 节
output/chapter4/fig_4_4_chebyshev.ppm 切比雪夫界与真实尾部 图 4-4,4 节

图 4-1(fig_4_1_expectation.ppmB(10,0.3) B(10, 0.3) 的分布律蓝棒在 k=3 k = 3 处附近最厚,红线标出期望 E(X)=np=3 E(X) = np = 3 ;橙点为 100000 次模拟的样本均值,紧贴红线。期望既"物理"(重心平衡点)又"统计"(大量试验的平均水平)。

图 4-2(fig_4_2_variance.ppm:上下两个面板同为零均值正态,上 σ=0.5 \sigma = 0.5 (高瘦),下 σ=1.5 \sigma = 1.5 (矮胖),各 20000 个样本的直方图(蓝棒)与理论密度(红线)对照。均值相同、方差不同——分散度的差别一目了然。

图 4-3(fig_4_3_regression.ppmρ=0.8 \rho = 0.8 的 800 个样本(橙点),样本均值处画十字准线(灰),红色最小二乘直线 y=a+bx y = a + bx 穿过十字、坡度 b=Cov/Var b = \operatorname{Cov}/\operatorname{Var} 。协方差把"云的倾斜"翻译成"直线的坡度"。

图 4-4(fig_4_4_chebyshev.ppm:红线为切比雪夫界 1/k2 1/k^2 k=1 k = 1 时高达 100%,平庸),蓝线为正态总体的真实尾部 2(1Φ(k)) 2(1 - \Phi(k)) (指数衰减),橙点为 200000 个标准正态样本的模拟频率、紧贴蓝线。切比雪夫界像一条宽松的护栏——不精确,但保证任何方差不无穷的分布都翻不出去。

7. 习题

  1. X X 的密度 f(x)=x/2 f(x) = x/2 0x2 0 \leq x \leq 2 ),求 E(X) E(X) D(X) D(X) E(X3) E(X^3)
  2. 一台设备寿命 Exp(λ) \sim \operatorname{Exp}(\lambda) ,盈利与寿命关系为 Y=e0.5X Y = e^{0.5X} ,求平均盈利(用随机变量函数的期望公式,注意无须求 Y Y 的分布)。
  3. 证明方差的等价定义 D(X)=E(X2)[E(X)]2 D(X) = E(X^2) - [E(X)]^2 ,并用它重算第 1 题。
  4. XB(n,p) X \sim B(n, p) ,用期望与方差的线性性把 X X 分解为 n n 个独立伯努利变量之和,求出 E(X) E(X) D(X) D(X)
  5. Y Y X X 的回归直线为 y=a1+b1x y = a_1 + b_1 x X X Y Y 的回归直线为 x=a2+b2y x = a_2 + b_2 y ,证明两直线斜率之积 b1b2=ρ2 b_1 b_2 = \rho^2 ,并说明两条直线何时重合。
  6. 用切比雪夫不等式估计 Xπ(100) X \sim \pi(100) λ=100 \lambda = 100 )时 P{80<X<120} P\{80 < X < 120\} 的下界,再思考为什么切比雪夫给出的界远比真实值保守(对照图 4-4 的含义)。
  7. (编程) 修改 expectation.cppB(12,1/3) B(12, 1/3) ,验证期望 np=4 np = 4 处的"重心"位置;观察分布律的对称性如何随 p p 偏离 0.5 0.5 而消失。
  8. (编程) 仿照 chebyshev.cpp,将总体换成 Exp(1) \operatorname{Exp}(1) (重尾于正态),观察模拟尾部频率落在蓝线(正态精确值)与红线(切比雪夫界)之间的哪个位置——体会"通用界"对偏态分布反而更贴切。

5. 大数定律与中心极限定理

大数定律回答"平均的稳定性",中心极限定理回答"平均的分布形状"——二者共同构成频率稳定于概率、以及正态分布为什么无处不在的理论基石。

1. 依概率收敛

Y1,Y2, Y_1, Y_2, \dots 是随机变量序列,若对任意 ε>0 \varepsilon > 0

P{Yncε}0(n)P\{|Y_n - c| \geq \varepsilon\} \to 0 \quad (n \to \infty)

则称 Yn Y_n 依概率收敛于常数 c c ,记 Yn  P  c Y_n \xrightarrow{\;P\;} c 。它比数列收敛弱:不要求每次都接近,只要求"离谱的概率"趋于零。

2. 蒙特卡洛方法

先于定理看一个应用:求 π \pi 。向单位方形 [0,1]2 [0,1]^2 均匀投点,落入四分之一圆 x2+y21 x^2 + y^2 \leq 1 的概率为其面积 π/4 \pi/4 ,于是

π^n=4×内点数n  P  π\hat{\pi}_n = 4 \times \frac{\text{内点数}}{n} \xrightarrow{\;P\;} \pi

(图 5-1)——几何概型的"数点"版本,也是伯努利大数定律的直接推论。误差量级为 O(1/n) O(1/\sqrt{n}) :精度每提高一位数,代价是一百倍的投点。

3. 大数定律

1. 切比雪夫大数定律(一般情形)

X1,X2, X_1, X_2, \dots 相互独立,期望均为 μ \mu 、方差一致有界 D(Xi)M D(X_i) \leq M ,则对任意 ε>0 \varepsilon > 0

P{1ni=1nXiμε}D(1nXi)ε2Mnε20P\left\{\left|\frac{1}{n}\sum_{i=1}^{n} X_i - \mu\right| \geq \varepsilon\right\} \leq \frac{D\left(\frac{1}{n}\sum X_i\right)}{\varepsilon^2} \leq \frac{M}{n\,\varepsilon^2} \to 0

(对样本均值用切比雪夫不等式即可,独立性使方差可加:D(Xˉ)=σ2/n D(\bar{X}) = \sigma^2/n 。) \blacksquare

2. 辛钦大数定律(最常用)

Xi X_i 独立同分布且期望 μ \mu 存在(不要求方差存在),则

Xˉn=1ni=1nXi  P  μ\bar{X}_n = \frac{1}{n}\sum_{i=1}^{n} X_i \xrightarrow{\;P\;} \mu

3. 伯努利大数定律

nn 重伯努利试验中频率 fn f_n 依概率收敛于成功概率 p p 。它是辛钦定律的持例,也是第 1 章"频率稳定于概率"的严格化(图 1-1 的理论根据)。

直观解读(图 5-2):无论原始分布如何偏斜(如 Exp(1) \operatorname{Exp}(1) ),样本均值序列终将被"平均"的力量拉向期望。大数定律是"经验均值可用作理论均值"的许可证,也是蒙特卡洛方法的理论后盾。

4. 中心极限定理

1. 林德伯格–莱维定理

Xi X_i 独立同分布,E(Xi)=μ E(X_i) = \mu D(Xi)=σ2(0,) D(X_i) = \sigma^2 \in (0, \infty) ,则标准化和

Yn=i=1nXinμσnlimnFYn(x)=Φ(x)Y_n = \frac{\sum_{i=1}^{n} X_i - n\mu}{\sigma\sqrt{n}} \quad \Longrightarrow \quad \lim_{n \to \infty} F_{Y_n}(x) = \Phi(x)

即不论原始分布多么"不像钟形",当 n n 充分大时标准化和近似服从 N(0,1) N(0, 1) (图 5-3:U(0,1) U(0,1) 平坦无峰,n=30 n = 30 的标准化均值已经贴住正态曲线)。

直观解读:独立叠加时,每个因素只贡献微小份额,和的分布是各因素分布的卷积(3.5 节),卷积具有"磨平棱角、向中间集中"的效应(图 3-4 的三角形已是雏形)——叠加得足够多,形状便只剩一个极限答案:正态。

2. 棣莫弗–拉普拉斯定理

XB(n,p) X \sim B(n, p) ,当 n n 大时 Xnpnp(1p) \dfrac{X - np}{\sqrt{np(1-p)}} 近似 N(0,1) N(0,1) ——正态近似计算二项概率的依据。

3. 高尔顿板(图 5-4)

弹珠从顶部落下,逐行碰钉子各以 1/2 1/2 左右弹开,12 12 行后落点是 12 12 个独立伯努利变量之和,服从 B(12,0.5) B(12, 0.5) ——中心极限定理的机械化演示:独立性 + 叠加,正态形状自然浮现。历史上正是高尔顿板让"误差的正态性"深入人心。

5. 代码

本章演示程序:src/chapter5(可执行文件 bin/Chapter5.exe,图像输出至 output/chapter5/)。

文件 内容 讲义位置
output/chapter5/fig_5_1_monte_carlo.ppm 蒙特卡洛投点估计 π \pi 图 5-1,2 节
output/chapter5/fig_5_2_lln.ppm 大数定律:均值收敛于期望 图 5-2,3 节
output/chapter5/fig_5_3_clt.ppm 中心极限定理的直方图 图 5-3,4.1 节
output/chapter5/fig_5_4_galton.ppm 高尔顿板与二项落点 图 5-4,4.3 节

图 5-1(fig_5_1_monte_carlo.ppm:左面板单位方形内 1500 个投点,四分之一圆内绿、圆外橙、圆弧红;右面板估计值 4× 4 \times (内点比例)的运行曲线(红)随 n n 从剧烈波动收敛到绿线 π \pi 。收敛是概率意义的——曲线有回退有震荡,但振幅总体越来越小。

图 5-2(fig_5_2_lln.ppmXExp(1) X \sim \operatorname{Exp}(1) (偏斜、远离正态)的 5 条样本均值运行曲线(不同颜色)在早期波动后全部收敛到绿线 E(X)=1 E(X) = 1 。偏斜的分布被"平均"驯服——辛钦大数定律不挑分布形状。

图 5-3(fig_5_3_clt.ppmU(0,1) U(0,1) (完全平坦)抽 n=30 n = 30 个样本求均值并标准化,重复 10000 次的直方图(蓝棒)已经贴住标准正态密度(红线)。原始分布毫无"钟形"基因,正态形状却依然出现——这就是中心极限定理的震撼。

图 5-4(fig_5_4_galton.ppm:上方面板是 12 行钉阵(灰点)与 3 条示例路径(橙线);下方面板 3000 颗弹珠落点的频率直方图(蓝棒)与理论分布律 C(12,k)212 C(12,k) 2^{-12} (红点)吻合——弹珠的每一次左右抉择都是独立的伯努利试验,落点的钟形是加法的必然。

6. 习题

  1. 用切比雪夫不等式确定至少需拥多少次均匀硬币,才能保证正面频率落在 (0.4,0.6) (0.4, 0.6) 的概率至少 0.9 0.9 。(提示:先算 D(指示变量) D(\text{指示变量}) 。)
  2. Xi X_i 独立同分布于 Exp(2) \operatorname{Exp}(2) ,求 n=100 n = 100 P{Xˉ>0.55} P\{\bar{X} > 0.55\} 的正态近似值(标准化后查 Φ \Phi )。
  3. 一零件重量独立同分布,均值 10 g、标准差 0.5 g,求 100 件总重超过 1010 g 的概率近似值。
  4. 证明:若 Yn  P  c Y_n \xrightarrow{\;P\;} c 且函数 g g 连续,则 g(Yn)  P  g(c) g(Y_n) \xrightarrow{\;P\;} g(c) (连续映射定理,可用于说明 π^nπ \hat{\pi}_n \to \pi 蕴含 sinπ^n0 \sin\hat{\pi}_n \to 0 )。
  5. 某系统由 200 个独立部件组成,至少 150 个正常则系统正常,每个正常率 0.85。用正态近似求系统正常率。(提示:[ 作标准化后近似 $ \Phi )。)
  6. (编程) 修改 clt.cppn n 为 3、5、10,观察直方图从"平顶"逐步"起钟"的过程——中心极限定理是渐近的,n n 越小残差越明显。
  7. (编程) 仿照 monte_carlo.cpp,改用落点分布估计积分 01ex2dx \int_0^1 e^{-x^2} dx (被积函数作竖线高度),并与真值 0.746824 0.746824\dots 比较。

6. 样本及抽样分布

从本章起视角转换:从"已知分布研究其性质"(概率论)进入"由样本推断总体"(数理统计)。

1. 总体、样本与统计量

1. 总体与样本

总体是研究对象的全体(的某项数量指标),视为一个分布 F F 样本是独立重复观测的结果,满足:

  1. X1,,Xn X_1, \dots, X_n 与总体同分布(代表性);
  2. X1,,Xn X_1, \dots, X_n 相互独立(独立性)。

满足这两条的样本称为简单随机样本,其联合分布为 if(xi) \prod_i f(x_i) ——这是第七章极大似然的出发点。

2. 统计量

样本的不含未知参数的函数 T=T(X1,,Xn) T = T(X_1, \dots, X_n) 称为统计量,如:

Xˉ=1niXi,S2=1n1i(XiXˉ)2\bar{X} = \frac{1}{n}\sum_i X_i, \qquad S^2 = \frac{1}{n-1}\sum_i (X_i - \bar{X})^2

注意 S2 S^2 用分母 n1 n - 1 :这样才能保证 E(S2)=σ2 E(S^2) = \sigma^2 (无偏性,第七章 3 节)。统计量是"数据的加工品",它本身也是随机变量,有自己的分布——抽样分布

3. 经验分布函数

将样本按小到大排列为 X(1)X(n) X_{(1)} \leq \cdots \leq X_{(n)}

Fn(x)={i:Xix}nF_n(x) = \frac{\{i : X_i \leq x\}}{n}

是阶梯函数。格里汶科定理保证 Fn F_n 一致收敛于总体 F F (图 6-1)——样本是总体的忠实缩影,统计推断的合法性基于此。

2. 三大抽样分布

1. χ2 \chi^2 分布

Z1,,Zk Z_1, \dots, Z_k 独立同分布于 N(0,1) N(0,1) ,则

χ2(k)=i=1kZi2\chi^2(k) = \sum_{i=1}^{k} Z_i^2

密度在 x0 x \leq 0 处为零,自由度 k=1 k = 1 时在 0 处发散、k=2 k = 2 时单调衰减、k3 k \geq 3 出现峰值并向右移(图 6-2)。期望与方差:E=k E = k D=2k D = 2k ;且具有可加性 χ2(m)+χ2(n)χ2(m+n) \chi^2(m) + \chi^2(n) \sim \chi^2(m+n)

2. t t 分布

t(k)=Zχ2(k)/kt(k) = \frac{Z}{\sqrt{\chi^2(k)/k}}

密度关于 0 对称;自由度 k k 越小尾部越厚(图 6-3:t(1) t(1) 是重尾柯西型,尾部按 x2 x^{-2} 衰减甚至无期望)。k k \to \infty t(k)N(0,1) t(k) \to N(0,1) 。直观来源:用样本标准差替代未知 σ \sigma 时引入了除法的不确定性,小样本时这种不确定性大,把概率推向两端。

3. F F 分布

F(d1,d2)=U1/d1U2/d2,Uiχ2(di) 独立F(d_1, d_2) = \frac{U_1/d_1}{U_2/d_2}, \qquad U_i \sim \chi^2(d_i) \text{ 独立}

取值恒正、右偏(图 6-4);自由度交换时按倒数镜像(F1α(d1,d2)=1/Fα(d2,d1) F_{1-\alpha}(d_1, d_2) = 1/F_{\alpha}(d_2, d_1) )。

4. 分位数

0<α<1 0 < \alpha < 1 ,若 P{T>tα}=α P\{T > t_\alpha\} = \alpha 则称 tα t_\alpha T T α \alpha 分位数。三大分布表、正态分布表给出的都是分位数;后续区间估计与假设检验的临界值全部以分位数形式出现。

3. 正态总体的抽样分布定理

X1,,Xn X_1, \dots, X_n 独立同分布于 N(μ,σ2) N(\mu, \sigma^2) ,则:

  1. XˉN(μ,σ2/n) \bar{X} \sim N(\mu, \sigma^2/n) ,且 Xˉ \bar{X} S2 S^2 独立;
  2. (n1)S2σ2χ2(n1) \dfrac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)
  3. XˉμS/nt(n1) \dfrac{\bar{X} - \mu}{S/\sqrt{n}} \sim t(n-1) 。$

第 1 条是标准化(2 章 3.4 节)+ 独立可加性的直接推论;第 3 条由第 1、2 条相除而来——这正是"σ \sigma 未知时用 S S 替代"的标准情形,也是 t t 分布存在的意义。

4. 代码

本章演示程序:src/chapter6(可执行文件 bin/Chapter6.exe,图像输出至 output/chapter6/)。

文件 内容 讲义位置
output/chapter6/fig_6_1_ecdf.ppm 经验分布函数逼近总体 CDF 图 6-1,1.3 节
output/chapter6/fig_6_2_chi2.ppm χ2 \chi^2 密度曲线族 图 6-2,2.1 节
output/chapter6/fig_6_3_t.ppm t t 分布与正态对比 图 6-3,2.2 节
output/chapter6/fig_6_4_f.ppm F F 密度曲线族 图 6-4,2.3 节

图 6-1(fig_6_1_ecdf.ppmU(0,1) U(0,1) n=60 n = 60 个样本的经验分布函数 Fn F_n (蓝阶梯)与总体分布 F(x)=x F(x) = x (红对角线)。阶梯的每个台阶高度恰为 1/60 1/60 ;样本量小则阶梯清晰可见,n n 增大时阶梯将变密变矮、整体贴合对角线——格里汶科定理的直观含义。

图 6-2(fig_6_2_chi2.ppmk=1 k = 1 (红,原点发散)、k=2 k = 2 (蓝,单调衰减)、k=4 k = 4 (橙,出峰)、k=8 k = 8 (绿,峰右移)四条曲线;叠加 k=4 k = 4 的 50000 个模拟样本直方图(填充棒)贴住橙色曲线。峰随自由度右移——正态平方和的均值 E=k E = k 在增大。

图 6-3(fig_6_3_t.ppmN(0,1) N(0,1) (红)、t(1) t(1) (蓝,柯西型重尾)、t(5) t(5) (绿)三条曲线中央几乎重合,尾部厚度按 t(1)>t(5)> t(1) > t(5) > 正态 排列;叠加 t(5) t(5) 的 50000 个模拟样本直方图(填充棒)。中央的微小差异被尾部的悬殊掩盖——小样本的"不确定性"藏在尾巴里。

图 6-4(fig_6_4_f.ppmF(5,10) F(5,10) (红,强右偏)、F(10,5) F(10,5) (蓝)、F(30,30) F(30,30) (绿,近乎对称)三条曲线;叠加 F(5,10) F(5,10) 的 50000 个模拟样本直方图(填充棒)。交换分子分母自由度相当于取倒数,偏斜方向随之镜像——这是 F F 分布的对称性余味。

5. 习题

  1. Z1,,Z6 Z_1, \dots, Z_6 独立同分布于 N(0,1) N(0,1) ,指出 Z12++Z62 Z_1^2 + \cdots + Z_6^2 Z1+Z2(Z32+Z42+Z52+Z62)/4 \dfrac{Z_1 + Z_2}{\sqrt{(Z_3^2 + Z_4^2 + Z_5^2 + Z_6^2)/4}} Z12+Z22(Z32+Z42)/2 \dfrac{Z_1^2 + Z_2^2}{(Z_3^2 + Z_4^2)/2} 各服从什么分布。
  2. N(μ,σ2) N(\mu, \sigma^2) 抽取 n=16 n = 16 ,求 Xˉ \bar{X} 的分布及 P{Xˉμ>σ/2} P\{|\bar{X} - \mu| > \sigma/2\} (用 Φ \Phi 表示)。
  3. 证明 E(χ2(k))=k E(\chi^2(k)) = k (提示:E(Z2)=D(Z)=1 E(Z^2) = D(Z) = 1 ,独立和的期望可加)。
  4. 查表:t0.05(10) t_{0.05}(10) χ0.0252(15) \chi^2_{0.025}(15) F0.05(6,9) F_{0.05}(6, 9) ,并验证 F0.95(9,6)=1/F0.05(6,9) F_{0.95}(9, 6) = 1/F_{0.05}(6, 9)
  5. X1,,Xn X_1, \dots, X_n 独立同分布于 N(3,4) N(3, 4) ,求 E(S2) E(S^2) D(S2) D(S^2) (利用 3 节定理 2 与 χ2 \chi^2 的方差 2k 2k )。
  6. (编程) 修改 ecdf.cppn n 为 10 与 500,对比阶梯贴合对角线的程度——体会格里汶科定理的"一致性"。
  7. (编程) 仿照 t.cpp,叠加 t(30) t(30) N(0,1) N(0,1) 曲线,验证大自由度时二者几乎不可分辨(这是实践中 n>30 n > 30 可用正态近似 t t 的依据)。

7. 参数估计

1. 点估计与矩估计法

总体分布形式已知、参数 θ \theta 未知时,用统计量 θ^(X1,,Xn) \hat{\theta}(X_1, \dots, X_n) 去估计它——点估计

矩估计法:用样本矩替换总体矩。令

1ni=1nXik=E(Xk)(k=1,2,,有几个参数列几个方程)\frac{1}{n}\sum_{i=1}^{n} X_i^k = E(X^k) \quad (k = 1, 2, \dots \text{,有几个参数列几个方程})

例如正态总体:μ^=Xˉ \hat{\mu} = \bar{X} σ^2=1n(XiXˉ)2 \hat{\sigma}^2 = \dfrac{1}{n}\sum (X_i - \bar{X})^2 (图 7-1)。矩估计古老、直观、通用(不要求分布形式已知),但未必充分利用分布信息。

2. 极大似然估计

设总体密度(分布律)为 f(x;θ) f(x;\theta) ,样本的似然函数

L(θ)=i=1nf(xi;θ)L(\theta) = \prod_{i=1}^{n} f(x_i;\theta)

极大似然估计(MLE) θ^ \hat{\theta} 使 L(θ^)=maxθL(θ) L(\hat{\theta}) = \max_\theta L(\theta) 。实际操作常对对数似然 (θ)=lnL(θ) \ell(\theta) = \ln L(\theta) 求导置零(对数变换把连乘变成连加且不改变峰值位置,图 7-2)。

例子:Exp(λ) \operatorname{Exp}(\lambda) (λ)=nlnλλxi \ell(\lambda) = n\ln\lambda - \lambda\sum x_i ,解得 λ^=n/xi=1/Xˉ \hat{\lambda} = n / \sum x_i = 1/\bar{X} 。MLE 的思想:在所有可能的参数里,选"让这批数据最不惊人"的那一个。

3. 估计量的评选标准

  1. 无偏性E(θ^)=θ E(\hat{\theta}) = \theta 。例如 E(Xˉ)=μ E(\bar{X}) = \mu ;而 1n(XiXˉ)2 \dfrac{1}{n}\sum(X_i - \bar{X})^2 有偏,修正为 S2=1n1(XiXˉ)2 S^2 = \dfrac{1}{n-1}\sum (X_i - \bar{X})^2 后无偏(E[(XiXˉ)2]=(n1)σ2 E\left[\sum(X_i-\bar{X})^2\right] = (n-1)\sigma^2 )。
  2. 有效性:同为无偏时方差小者为优(Xˉ \bar{X} 在所有线性无偏估计中方差最小,高斯–马尔可夫定理的精神)。
  3. 相合性θ^n  P  θ \hat{\theta}_n \xrightarrow{\;P\;} \theta ,即估计量自身收敛到真值——大数定律的推论:Xˉ \bar{X} 相合。

4. 区间估计

1. 置信区间

找统计量 θ<θ \underline{\theta} < \overline{\theta} 使

P{θ<θ<θ}=1αP\{\underline{\theta} < \theta < \overline{\theta}\} = 1 - \alpha

则随机区间 (θ,θ) (\underline{\theta}, \overline{\theta}) 是置信度 1α 1-\alpha 置信区间

2. 枢轴量法(σ \sigma 已知)

XˉN(μ,σ2/n) \bar{X} \sim N(\mu, \sigma^2/n) ,故 Z=Xˉμσ/nN(0,1) Z = \dfrac{\bar{X} - \mu}{\sigma/\sqrt{n}} \sim N(0,1) 不含未知参数,作"枢轴":

P{zα/2<Xˉμσ/n<zα/2}=1αP\left\{-z_{\alpha/2} < \frac{\bar{X} - \mu}{\sigma/\sqrt{n}} < z_{\alpha/2}\right\} = 1 - \alpha

不等式变形即得

(Xˉzα/2σn,  Xˉ+zα/2σn)\left(\bar{X} - z_{\alpha/2}\frac{\sigma}{\sqrt{n}},\; \bar{X} + z_{\alpha/2}\frac{\sigma}{\sqrt{n}}\right)

正确解读(图 7-3):置信度说的是方法的成功率——反复抽样得到一族区间,长期约 95% 95\% 的区间罩住真值,而非"μ \mu 落入这个区间的概率是 95%"(μ \mu 是常数,不随机)。

3. σ \sigma 未知时

S S 替换 σ \sigma ,枢轴量变为 XˉμS/nt(n1) \dfrac{\bar{X} - \mu}{S/\sqrt{n}} \sim t(n-1) ,临界值换成 tα/2(n1) t_{\alpha/2}(n-1) ——小样本必须用更厚的 t t 分布(6 章 2.2 节)。

4. 样本量与精度(图 7-4)

区间半宽 1/n \propto 1/\sqrt{n} :样本量翻 4 倍,宽度才减半——精度是有价的,且边际收益递减。

5. 代码

本章演示程序:src/chapter7(可执行文件 bin/Chapter7.exe,图像输出至 output/chapter7/)。

文件 内容 讲义位置
output/chapter7/fig_7_1_moment.ppm 矩估计拟合正态 图 7-1,1 节
output/chapter7/fig_7_2_mle.ppm 对数似然曲线与 MLE 峰值 图 7-2,2 节
output/chapter7/fig_7_3_ci.ppm 60 个置信区间的覆盖率 图 7-3,4.2 节
output/chapter7/fig_7_4_width.ppm 区间宽度的 1/n 1/\sqrt{n} 衰减 图 7-4,4.4 节

图 7-1(fig_7_1_moment.ppm:真实总体 N(1.2,0.82) N(1.2, 0.8^2) n=200 n = 200 个样本的直方图(蓝棒),矩估计 μ^=Xˉ \hat{\mu} = \bar{X} σ^2 \hat{\sigma}^2 拟合的密度曲线(红)与真实密度曲线(绿)几乎重合——样本矩抓住了总体的全部信息(就正态而言)。

图 7-2(fig_7_2_mle.ppm:指数总体(真实 λ=0.7 \lambda = 0.7 未知)抽 n=50 n = 50 ,对数似然曲线 (λ)=nlnλλxi \ell(\lambda) = n\ln\lambda - \lambda\sum x_i (蓝)单峰,峰值恰在 MLE λ^=n/xi \hat{\lambda} = n/\sum x_i 处(红线);绿线标出真实值 0.7 0.7 供对照——"最像这批数据的参数"未必恰是真值,但很接近。

图 7-3(fig_7_3_ci.ppm:60 组 n=30 n = 30 的独立样本各画一条 95% 95\% 区间 Xˉ±1.96σ/n \bar{X} \pm 1.96\sigma/\sqrt{n} :罩住真值 μ=2 \mu = 2 (绿线)的区间为蓝色、未罩住的为红色(本例约 3 组,5% \approx 5\% )——长期频率正是置信度的含义。

图 7-4(fig_7_4_width.ppm:上方面板为 95% 95\% 区间半宽 w(n)=2×1.96/n w(n) = 2 \times 1.96/\sqrt{n} σ=1 \sigma = 1 ,蓝曲线)随 n n 的衰减,明显先陡后缓;下方面板为 n=5/25/100 n = 5/25/100 三组实际区间(蓝横线,中心为各次抽样的 Xˉ \bar{X} ),真值 μ=0 \mu = 0 (绿线)。直观验证:四倍的样本只换来一半的宽度。

6. 习题

  1. 设总体密度 f(x;θ)=θxθ1 f(x;\theta) = \theta x^{\theta-1} 0<x<1 0 < x < 1 ),分别用矩估计与极大似然估计 θ \theta ,并比较两者在同一组数据上的差异。
  2. 证明 E(S2)=σ2 E(S^2) = \sigma^2 (提示:分解 (XiXˉ)2=(Xiμ)2n(Xˉμ)2 \sum(X_i - \bar{X})^2 = \sum(X_i - \mu)^2 - n(\bar{X} - \mu)^2 后分别取期望)。
  3. X1,,Xn X_1, \dots, X_n 独立同分布于 π(λ) \pi(\lambda) ,求 λ \lambda 的 MLE,并验证它无偏且相合。
  4. σ=2 \sigma = 2 n=25 n = 25 xˉ=3 \bar{x} = 3 ,求 μ \mu 95% 95\% 99% 99\% 置信区间,并说明为什么更高的置信度必然换来更宽的区间(参考图 7-3 的红蓝对比思想)。
  5. 要使 σ \sigma 已知时置信区间半宽不超过 0.1σ 0.1\sigma ,置信度 95% 95\% ,至少需要多大样本?(对照图 7-4 上方面板。)
  6. (编程) 修改 confidence.cpp 的重复次数为 200,统计未覆盖真值的区间比例,验证其长期频率接近 5% 5\%
  7. (编程) 仿照 mle.cpp,对 N(μ,1) N(\mu, 1) σ \sigma 已知)写出对数似然 (μ)=12(xiμ)2+C \ell(\mu) = -\frac{1}{2}\sum(x_i - \mu)^2 + C 并绘制曲线,验证峰值在 μ^=xˉ \hat{\mu} = \bar{x} 处——正态的 MLE 就是样本均值。

8. 假设检验与回归分析

1. 假设检验的基本思想

对总体的未知参数提出两个对立假设:原假设 H0 H_0 备择假设 H1 H_1 。检验的逻辑是概率反证法:先假定 H0 H_0 成立;构造一个在 H0 H_0 下分布已知的统计量;若观测结果落在事先指定的拒绝域(小概率区域)内,则"小概率事件居然发生"令人生疑,拒绝 H0 H_0 ;否则不拒绝。

例(双侧 z z 检验,图 8-1)H0:μ=0 H_0: \mu = 0 σ=1 \sigma = 1 已知,n=100 n = 100 ,则 XˉN(0,0.12) \bar{X} \sim N(0, 0.1^2) 。取显著性水平 α=0.05 \alpha = 0.05 ,拒绝域

{Xˉ1.96×0.1=0.196}\left\{\lvert \bar{X} \rvert \geq 1.96 \times 0.1 = 0.196\right\}

观测 xˉ=0.18 \bar{x} = 0.18 落在接受域内——证据不足以"推翻" H0 H_0 (但不等于证明 H0 H_0 为真)。

显著性水平 α \alpha 的含义:H0 H_0 为真,这套规则有多大比例的误拒风险——它是可以事先控制的错误率。

2. 两类错误与功效

任何检验规则都可能犯两种错误:

H0 H_0 为真 H1 H_1 为真
拒绝 H0 H_0 第一类错误,概率 α \alpha 正确决策,概率 1β 1 - \beta (功效)
不拒绝 H0 H_0 正确决策 第二类错误,概率 β \beta

理想是两类错误都小,但在固定样本量下二者此消彼长(图 8-2 上方面板:临界线右移,红色 α \alpha 变小、绿色 β \beta 变大)。奈曼–皮尔逊原则:先固定 α \alpha (保护原假设),再在此约束下寻找 β \beta 最小(功效最大)的检验。

功效函数π(μ)=Pμ{拒绝H0} \pi(\mu) = P_\mu\{\text{拒绝} H_0\} ——它是参数 μ \mu 的函数:在 μ=μ0 \mu = \mu_0 处等于 α \alpha ,随真实参数偏离 H0 H_0 而升向 1(图 8-2 下方面板)。功效回答"检验的灵敏度":μ \mu 偏离多远、样本多大,才能被可靠地检出。

3. p 值

p 值:在 H0 H_0 成立的前提下,出现当前及更极端观测的概率。

定理:连续型统计量在 H0 H_0 下,p 值服从 U(0,1) U(0, 1)

证明:设统计量 T T H0 H_0 -分布函数为 G G (连续),则 p=1G(Tobs) p = 1 - G(T_{\text{obs}}) ;而 U=G(Tobs) U = G(T_{\text{obs}}) T T 经自身分布函数变换,由概率积分变换定理,UU(0,1) U \sim U(0,1) ,故 p=1UU(0,1) p = 1 - U \sim U(0,1) \blacksquare

(图 8-3:H0 H_0 下 p 值直方图平坦均匀;H1 H_1 下向 0 堆积。)由此可直接读出:

  1. p 值是随机变量,一次试验的 p 值大小有偶然性;
  2. "p<α p < \alpha 拒绝"等价于"观测落入拒绝域"——p 值与拒绝域法是同一件事的两种表述,但 p 值携带"离拒绝有多远"的连续信息;
  3. p 值不是"H0 H_0 为真的概率",也不度量效应大小。

4. 正态总体参数的检验

设总体 N(μ,σ2) N(\mu, \sigma^2) ,常用检验(单双侧的临界值相应取 zα z_{\alpha} zα/2 z_{\alpha/2} ):

检验 条件 统计量 分布
μ \mu z z 检验 σ \sigma 已知 Xˉμ0σ/n \dfrac{\bar{X} - \mu_0}{\sigma/\sqrt{n}} N(0,1) N(0,1)
μ \mu t t 检验 σ \sigma 未知 Xˉμ0S/n \dfrac{\bar{X} - \mu_0}{S/\sqrt{n}} t(n1) t(n-1)
σ2 \sigma^2 χ2 \chi^2 检验 μ \mu 未知 (n1)S2σ02 \dfrac{(n-1)S^2}{\sigma_0^2} χ2(n1) \chi^2(n-1)

双样本情形(两个正态均值之差、方差之比)分别产生 t t 检验与 F F 检验——三大抽样分布(6 章 2 节)在此各就各位。

5. 一元线性回归

1. 模型

yi=a+bxi+εi,εiiidN(0,σ2)y_i = a + b x_i + \varepsilon_i, \qquad \varepsilon_i \overset{\text{iid}}{\sim} N(0, \sigma^2)

E(YX=x)=a+bx E(Y \mid X = x) = a + bx (条件期望的线性假设)。

2. 最小二乘法

选取 a^,b^ \hat{a}, \hat{b} 使残差平方和

Q(a,b)=i=1n(yiabxi)2Q(a, b) = \sum_{i=1}^{n} (y_i - a - b x_i)^2

最小。对 a,b a, b 求偏导并置零,得正规方程,解为

b^=(xixˉ)(yiyˉ)(xixˉ)2=Cov-样本Var-样本,a^=yˉb^xˉ\hat{b} = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2} = \frac{\operatorname{Cov\text{-}样本}}{\operatorname{Var\text{-}样本}}, \qquad \hat{a} = \bar{y} - \hat{b}\,\bar{x}

回归直线必然过样本中心 (xˉ,yˉ) (\bar{x}, \bar{y}) (图 4-3 的十字准线)。在正态误差假设下,最小二乘估计恰等于极大似然估计(对数似然的极大化与残差平方和的极小化是同一件事,习题 8.5)。

3. 拟合优度

决定系数

R2=1(yiy^i)2(yiyˉ)2R^2 = 1 - \frac{\sum (y_i - \hat{y}_i)^2}{\sum (y_i - \bar{y})^2}

度量"回归解释掉的总变差比例",在一元情形恰等于 rxy2 r_{xy}^2 (样本相关系数的平方)。

6. 代码

本章演示程序:src/chapter8(可执行文件 bin/Chapter8.exe,图像输出至 output/chapter8/)。

文件 内容 讲义位置
output/chapter8/fig_8_1_rejection.ppm 双侧 z z 检验拒绝域 图 8-1,1 节
output/chapter8/fig_8_2_power.ppm 两类错误与功效函数 图 8-2,2 节
output/chapter8/fig_8_3_pvalue.ppm p 值的分布 图 8-3,3 节
output/chapter8/fig_8_4_regression.ppm 最小二乘回归与残差 图 8-4,5 节

图 8-1(fig_8_1_rejection.ppmH0:μ=0 H_0: \mu = 0 XˉN(0,0.12) \bar{X} \sim N(0, 0.1^2) 的密度(蓝色主体);两侧深红填充的尾部面积合计恰为 0.05 0.05 ,即拒绝域 xˉ0.196 \lvert \bar{x} \rvert \geq 0.196 (红色临界线);橙色竖线为一次实际抽样的观测 xˉ=0.18 \bar{x} = 0.18 ——在接受域内,不拒绝 H0 H_0

图 8-2(fig_8_2_power.ppm:上方面板:H0 H_0 (蓝线,μ=0 \mu = 0 )与 H1 H_1 (橙线,μ=0.25 \mu = 0.25 )的密度都以 σ=0.1 \sigma = 0.1 为标准误,单侧临界 c=1.645×0.1 c = 1.645 \times 0.1 (红线)右边的蓝色区域是 α=0.05 \alpha = 0.05 (弃真),左边的绿色区域是 β \beta (取伪)——两块面积此消彼长;下方面板:功效函数 π(μ)=1Φ((cμ)/σ) \pi(\mu) = 1 - \Phi\left((c - \mu)/\sigma\right) (绿线)在 μ=0 \mu = 0 处等于 α=0.05 \alpha = 0.05 (红参考线),随 μ \mu 增大迅速升向 1,橙色点标出 μ=0.25 \mu = 0.25 处的功效约 0.64 0.64

图 8-3(fig_8_3_pvalue.ppmH0 H_0 μ=0 \mu = 0 )成立时 20000 组双侧 z z 检验的 p 值直方图(蓝棒)平坦地贴住高度为 1 的红色均匀密度线——p 值在 H0 H_0 下均匀分布;而 H1 H_1 μ=0.4 \mu = 0.4 )成立时的 p 值直方图(橙点)急剧向 0 堆积——真有效应时 p 值倾向于小,这正是"小 p 值是强证据"的频率解释。

图 8-4(fig_8_4_regression.ppm:模型 y=0.5+0.8x+ε y = 0.5 + 0.8x + \varepsilon εN(0,1.22) \varepsilon \sim N(0, 1.2^2) )的 n=60 n = 60 个散点(橙);红色最小二乘直线 y^=a^+b^x \hat{y} = \hat{a} + \hat{b}x 从散点云中心穿过,灰色竖线为各点残差(点到直线的竖直距离)。残差有正有负、无系统模式——这正是"线性 + 独立同误差"假设成立的视觉表现。

7. 习题

  1. σ=1 \sigma = 1 n=100 n = 100 xˉ=0.18 \bar{x} = 0.18 ,取 α=0.05 \alpha = 0.05 分别做双侧与单侧(H1:μ>0 H_1: \mu > 0 z z 检验,比较结论并解释"单侧更容易拒绝"的几何原因(对照图 8-1:单侧只有右尾,临界值更小)。
  2. 计算 2 节例中 β=Pμ=0.25{Xˉ<c} \beta = P_{\mu = 0.25}\{\bar{X} < c\} ,并验证 1β 1 - \beta 与图 8-2 下方面板橙色点的纵坐标一致(约 0.64 0.64 )。
  3. 某厂产品平均重量标准 μ0=500 \mu_0 = 500 g,抽 n=36 n = 36 xˉ=498 \bar{x} = 498 g、s=6 s = 6 g。取 α=0.05 \alpha = 0.05 检验 H0:μ=500 H_0: \mu = 500 t t 检验),并求 p 值的范围。
  4. 证明功效函数 π(μ)=1Φ(cμσ/n) \pi(\mu) = 1 - \Phi\left(\dfrac{c - \mu}{\sigma/\sqrt{n}}\right) μ \mu 的严格增函数,并求 π(μ)=0.95 \pi(\mu) = 0.95 所需的 μ \mu (即检验能以 95% 把握检出的最小偏离)。
  5. 证明:正态误差假设下,a,b a, b 的极大似然估计与最小二乘估计一致(提示:lnL \ln L 中与参数相关的部分为 12σ2(yiabxi)2 -\frac{1}{2\sigma^2}\sum(y_i - a - bx_i)^2 )。
  6. 由图 8-4 的模型取 R2 R^2 的理论近似值:Var(y^)/[Var(y^)+σ2] \operatorname{Var}(\hat{y})/\left[\operatorname{Var}(\hat{y}) + \sigma^2\right] ,代入 b=0.8 b = 0.8 xU(0,10) x \sim U(0, 10) σ=1.2 \sigma = 1.2 计算,并思考噪声增大时 R2 R^2 如何变化。
  7. (编程) 修改 pvalue.cppkMu1 kMu1 0.1 0.1 1.0 1.0 ,观察 H1 直方图向 0 堆积的"速度"差异——效应越大,小 p 值越容易出现(即功效越高,呼应图 8-2)。
  8. (编程) 仿照 regression.cpp,把噪声标准差从 1.2 1.2 改为 3.0 3.0 ,观察残差竖线变长、拟合直线斜率偏离真实值 0.8 更多——样本量固定时,噪声越大参数估计越不稳定。

9. 估计理论进阶

第七章给了点估计的两种方法和三个评价标准;本章把评价标准推到逻辑终点:什么样的估计量是"理论上最好"的,以及"无偏"是否总是值得追求。

1. 充分统计量

1. 定义

统计量 T(X1,,Xn) T(X_1, \dots, X_n) 若满足:给定 T=t T = t 后样本的条件分布与参数 θ \theta 无关,则称 T T θ \theta 充分统计量——它把样本中关于 θ \theta 的信息"全部吸收",其余部分对推断毫无价值。

2. 因子分解定理(奈曼–费歇尔)

T T 充分当且仅当联合密度(分布律)可分解为

f(x1,,xn;θ)=g(T(x1,,xn),θ)h(x1,,xn)f(x_1, \dots, x_n;\, \theta) = g(T(x_1, \dots, x_n),\, \theta)\cdot h(x_1, \dots, x_n)

即"与 θ \theta 相关的因子只通过 T T 进入"。例如伯努利样本:pxi(1p)1xi=pT(1p)nT \prod p^{x_i}(1-p)^{1-x_i} = p^{T}(1-p)^{n-T} ,其中 T=Xi T = \sum X_i ——成功次数充分;均匀总体 U(0,θ) U(0, \theta) θn1{x(n)θ} \theta^{-n}\cdot \mathbf{1}\{x_{(n)} \leq \theta\} ,其中 T=maxXi T = \max X_i 充分。

3. 直观验证(图 9-1)

给定 T=t T = t 后,U(0,θ) U(0, \theta) 的样本只剩"相对位置":Xi/t X_i/t 的分布与 θ \theta 无关(模拟中 θ=1 \theta = 1 θ=3 \theta = 3 的两组 X1/max X_1/\max 直方图完全重合,且都贴住理论密度 (n1)(1u)n2 (n-1)(1-u)^{n-2} )。充分性由此可直接"看见"。

2. Rao–Blackwell 定理

定理:设 T T 是充分统计量,δ \delta g(θ) g(\theta) 的任一无偏估计,则

δ~=E[δT]\tilde{\delta} = E[\delta \mid T]

也是无偏估计,且 D(δ~)D(δ) D(\tilde{\delta}) \leq D(\delta) (等号当且仅当 δ \delta 已是 T T 的函数)。

证明思路:重期望公式 E[E[δT]]=E[δ]=g(θ) E[E[\delta \mid T]] = E[\delta] = g(\theta) 给出无偏性;条件方差分解 D(δ)=E[D(δT)]+D(E[δT])D(δ~) D(\delta) = E[D(\delta \mid T)] + D(E[\delta \mid T]) \geq D(\tilde{\delta}) 给出方差不增——第二项非负正是"压缩掉的部分"。 \blacksquare

把估计量对充分统计量取条件期望是"免费午餐":不牺牲无偏性,只压缩方差(图 9-2:估计 p2 p^2 时,X1X2 X_1X_2 T=Xi T = \sum X_i 取条件期望得 k(k1)/(n(n1)) k(k-1)/(n(n-1)) ,方差骤减)。反复 Rao–Blackwell 化可证明:T T 完备,则无偏 + 只依赖 T T 的估计就是 UMVUE(Lehmann–Scheffé 定理)。

3. Cramér–Rao 下界与 Fisher 信息

1. Fisher 信息

I(θ)=E[(lnf(X;θ)θ)2]I(\theta) = E\left[\left(\frac{\partial \ln f(X;\theta)}{\partial \theta}\right)^2\right]

度量单个观测携带的 θ \theta 信息量;独立观测可加:In(θ)=nI(θ) I_n(\theta) = nI(\theta)

2. Cramér–Rao 不等式

定理(正则条件下):任意无偏估计 θ^ \hat{\theta} 满足

D(θ^)1nI(θ)D(\hat{\theta}) \geq \frac{1}{nI(\theta)}

达到等号的估计称为有效估计。例如正态均值的 Xˉ \bar{X} D=σ2/n=1/(nI) D = \sigma^2/n = 1/(nI) );但有效估计凤毛麟角——Exp(λ) \operatorname{Exp}(\lambda) 的 MLE 1/Xˉ 1/\bar{X} 的精确方差 n2λ2/((n1)2(n2)) n^2\lambda^2/((n-1)^2(n-2)) 只能渐近趋向下界 λ2/n \lambda^2/n (图 9-3)。

4. MSE 分解与偏差-方差权衡

均方误差可正交分解:

MSE(θ^)=E[(θ^θ)2]=D(θ^)方差+[E(θ^)θ]2偏差2\operatorname{MSE}(\hat{\theta}) = E[(\hat{\theta}-\theta)^2] = \underbrace{D(\hat{\theta})}_{\text{方差}} + \underbrace{[E(\hat{\theta})-\theta]^2}_{\text{偏差}^2}

无偏(偏差为零)不一定 MSE 最小:在收缩族 λc=c/Xˉ \lambda_c = c/\bar{X} 中,最优收缩 c c^* 位于"无偏要求的 c c "之左侧——主动引入一点偏差换取方差大降(图 9-4)。这是现代统计(岭回归、收缩估计、机器学习的正则化)反复出现的主题。

5. 代码

本章演示程序:src/chapter9(可执行文件 bin/Chapter9.exe,图像输出至 output/chapter9/)。

文件 内容 讲义位置
output/chapter9/fig_9_1_sufficiency.ppm 充分统计量:换 θ \theta 分布不变 图 9-1,1.3 节
output/chapter9/fig_9_2_rao_blackwell.ppm Rao–Blackwell 方差压缩 图 9-2,2 节
output/chapter9/fig_9_3_cramer_rao.ppm CR 下界与精确方差 图 9-3,3 节
output/chapter9/fig_9_4_mse.ppm MSE 分解与最优收缩 图 9-4,4 节

图 9-1(fig_9_1_sufficiency.ppmθ=1 \theta = 1 (蓝棒)与 θ=3 \theta = 3 (橙点)两组 X1/max(Xi) X_1/\max(X_i) 的直方图完全重合,且贴住理论密度 19(1u)18 19(1-u)^{18} (红线)——给定 max \max 后样本只剩相对位置信息,与 θ \theta 无关,充分性成立。

图 9-2(fig_9_2_rao_blackwell.ppm:估计 p2=0.16 p^2 = 0.16 (绿线):朴素估计 X1X2 X_1X_2 只能取 0 或 1(蓝棒,集中在两端,方差巨大);Rao–Blackwell 化后的 k(k1)/(n(n1)) k(k-1)/(n(n-1)) (橙点)支撑变细、分布集中。两者均值相同,后者方差骤减——条件期望的压缩效果一目了然。

图 9-3(fig_9_3_cramer_rao.ppm:红线为 CR 下界 λ2/n \lambda^2/n (任意无偏估计的方差地板),蓝线为 1/Xˉ 1/\bar{X} 的精确方差(n3 n \geq 3 才存在),橙点为模拟方差、紧贴蓝线。蓝线在红线上方但随 n n 增大渐近贴合——有效估计(方差恰达下界)并不常见。

图 9-4(fig_9_4_mse.ppm:收缩族 λc=c/Xˉ \lambda_c = c/\bar{X} n=5 n = 5 ):方差项(蓝线)随 c c 平方增长、偏差²项(绿线)随 c c 偏离 0.8 0.8 增大,MSE(红线)是二者之和,在 c0.60 c^* \approx 0.60 (紫线)取最小——比无偏要求的 c=0.8 c = 0.8 (橙线)更小。橙点为各 c c 处的模拟 MSE,验证理论。

6. 习题

  1. 用因子分解定理验证:泊松样本的 Xi \sum X_i 、正态样本(σ \sigma 已知)的 Xˉ \bar{X} 分别是 λ \lambda μ \mu 的充分统计量。
  2. 验证图 9-2 中的 E[X1X2Xi=k]=k(k1)/(n(n1)) E[X_1X_2 \mid \sum X_i = k] = k(k-1)/(n(n-1)) (提示:k k 个成功中任意两个特定观测恰为 (1,1) 的组合计数)。
  3. 证明 Exp(λ) \operatorname{Exp}(\lambda) 的 Fisher 信息 I(λ)=1/λ2 I(\lambda) = 1/\lambda^2 (密度取对数求导后取期望)。
  4. 由 MSE 分解推导收缩族 λc=c/Xˉ \lambda_c = c/\bar{X} 的最优收缩 c=E[1/Xˉ](E[1/Xˉ])2+D(1/Xˉ) c^* = \dfrac{E[1/\bar{X}]}{(E[1/\bar{X}])^2 + D(1/\bar{X})} ,并代入 n=5 n = 5 验证 c0.6 c^* \approx 0.6 (对照图 9-4)。
  5. 证明:若 θ^ \hat{\theta} 达到 CR 下界,则它必是 θ \theta 的线性充分统计量的函数(有效估计必充分)。
  6. (编程) 修改 rao_blackwell.cppn n 为 5 与 50,观察两个估计量方差的差距如何变化——样本越多,朴素估计浪费的信息越多。
  7. (编程) 仿照 mse.cpp,将样本量改为 n=20 n = 20 ,观察最优收缩 c c^* 向 1 靠近——大样本下无偏与 MSE 最优几乎重合,偏差-方差权衡是小样本的烦恼。

10. 贝叶斯估计

第七、九章的频率派把 θ \theta 视为固定常数,用统计量去猜测它;贝叶斯派把 θ \theta $ 本身视为随机变量,用概率分布描述对它的信念。

1. 贝叶斯范式

1. 三要素

  • 先验 π(θ) \pi(\theta) :看到数据之前对 θ \theta 的信念;
  • 似然 L(θ)π L(\theta)\pi :数据对 θ \theta 的证据(频率派已熟悉);
  • 后验 π(θx) \pi(\theta \mid x) :贝叶斯公式的密度版本

π(θx1,,xn)=if(xi;θ)π(θ)if(xi;φ)π(φ)dφ\pi(\theta \mid x_1, \dots, x_n) = \frac{\prod_i f(x_i;\theta)\, \pi(\theta)}{\int \prod_i f(x_i;\varphi)\, \pi(\varphi)\, d\varphi}

贝叶斯推断 = 用后验表达一切:后验均值作点估计、后验分位数作区间。

2. 与频率派的分野

频率派:θ \theta 固定、区间随机(图 7-3 的“方法成功率");
贝叶斯派:数据固定、θ \theta 随机(后验即"拿到数据后的信念分布")。两者在数学上互相启发,在大样本下殊途同归(后验集中点与 MLE 重合)。

2. 共轭先验

若先验与后验同属一个分布族,则称共轭。两大经典配对:

总体 先验 后验
伯努利 B(1,p) B(1, p) Beta(a,b) \operatorname{Beta}(a, b) Beta(a+k,  b+nk) \operatorname{Beta}(a + k,\; b + n - k)
正态 N(θ,σ2) N(\theta, \sigma^2) σ \sigma 已知) N(μ0,τ2) N(\mu_0, \tau^2) N(μn,τn2) N(\mu_n, \tau_n^2)

Beta-伯努利共轭可读作"计票":先验相当于预先投了 a+b a + b 票(其中 a a 票成功),每条数据投一票(图 10-1:先验 Beta(2,2)、似然峰在 0.6、后验 Beta(14,10)——后验是二者的折中,中心略被先验拉离 0.6)。

3. 后验总结与收缩

1. 正态-正态的后验

后验精度 = 数据精度 + 先验精度:

1τn2=nσ2+1τ2,μn=wxˉ+(1w)μ0,w=n/σ2n/σ2+1/τ2\frac{1}{\tau_n^2} = \frac{n}{\sigma^2} + \frac{1}{\tau^2}, \qquad \mu_n = w\,\bar{x} + (1 - w)\,\mu_0, \quad w = \frac{n/\sigma^2}{n/\sigma^2 + 1/\tau^2}

后验均值是样本均值与先验均值的加权平均:权重 w w n n 从 0 升向 1(图 10-3 上方面板),后验方差恒小于两者——先验与数据的"信息"相加而非取平均。

2. 收缩的直观

小样本时数据噪声大,后验被先验"稳住"(图 10-3 下方面板:橙色的后验均值轨迹明显比蓝色的样本均值平滑);大样本时数据"淹没"先验(图 10-2:n=100 n = 100 时后验几乎不再记得先验的形状)。这种"向先验中心收缩"的机制与第 9 章 MSE 权衡中的最优收缩(图 9-4)异曲同工。

4. 可信区间与置信区间

可信区间:后验的等尾 95% 区间 [q0.025,q0.975] [q_{0.025}, q_{0.975}] ——拿到数据后,θ \theta 落入此区间的后验概率是 95%。

与频率置信区间(图 7-3、图 10-4)的对照:

  • 语义不同:可信区间是"θ \theta 在区间的概率 95%“(贝叶斯允许这种说法,因为 θ \theta $ 有分布);置信区间是"方法长期成功率 95%”。
  • 数值常接近:Beta(2,2) 先验的伯努利可信区间与 Wald 区间在中等 p p 处相近;但小样本极端 p p 处,Wald 区间可能穿出 [0,1] [0,1] ,而共轭后验自动把区间限制在 (0,1) (0,1) 内——先验提供了"软边界"(图 10-4)。

5. 代码

本章演示程序:src/chapter10(可执行文件 bin/Chapter10.exe,图像输出至 output/chapter10/)。Beta 密度与分位数(网格累积 + 二分)在演示内自实现。

文件 内容 讲义位置
output/chapter10/fig_10_1_conjugate.ppm 先验/似然/后验三曲线 图 10-1,2 节
output/chapter10/fig_10_2_updating.ppm 数据累积的后验更新 图 10-2,3.2 节
output/chapter10/fig_10_3_shrinkage.ppm 正态-正态收缩 图 10-3,3.1 节
output/chapter10/fig_10_4_credible.ppm 可信区间 vs 置信区间 图 10-4,4 节

图 10-1(fig_10_1_conjugate.ppm:先验 Beta(2,2)(紫,对称驼峰)、似然(蓝,峰在 0.6)、后验 Beta(14,10)(绿,似然的形状被先验微调)。红线为后验均值 14/240.583 14/24 \approx 0.583 ——略低于 0.6:先验 4 票对数据 20 票,说话权约 1/6。

图 10-2(fig_10_2_updating.ppm:四面板(n=1/5/20/100 n = 1/5/20/100 )依次展示同一数据流累积下的后验(绿,填充):n=1 n = 1 时仍被先验(紫线)牢牢塑形;n=5 n = 5 出现偏移;n=20 n = 20 收腰;n=100 n = 100 已是又高又窄的尖峰且中心落在真值 0.3 0.3 (红线)附近——数据逐渐夺权。

图 10-3(fig_10_3_shrinkage.ppm:上方面板:数据权重 w(n) w(n) (绿线)从 0 平滑升向 1,中点对应 n=τ2/σ22 n = \tau^2/\sigma^2 \approx 2 的量级;下方面板:样本均值 Xˉn \bar{X}_n (蓝,噪声大起大落)与后验均值(橙,被先验稳住),真值 θ=0.7 \theta = 0.7 (绿线)与先验均值 1 1 (紫线)。小 n n 时橙线贴紫线,大 n n 时贴蓝线并收敛到绿线。

图 10-4(fig_10_4_credible.ppm:上方面板 Wald 置信区间(蓝),下方面板贝叶斯可信区间(橙),各 40 组、真值 0.3(绿线),未覆盖者为红色。两者长期覆盖率都接近 95%;差别在小样本:Wald 区间在 p^ \hat{p} 极端时质量变差,贝叶斯区间始终被后验限制在 (0,1) (0,1) 内且更稳定。

6. 习题

  1. 验证 Beta-伯努利共轭:Beta(a,b) \operatorname{Beta}(a,b) 先验乘以伯努利似然后归一化即 Beta(a+k,b+nk) \operatorname{Beta}(a+k, b+n-k)
  2. 求 Beta(a, b) 的均值与方差,并说明"先验计票"解释下后验均值 (a+k)/(a+b+n) (a+k)/(a+b+n) 恰是混合"票数"。
  3. 取无信息先验 Beta(1,1)(即均匀),证明此时后验均值退化为 (k+1)/(n+2) (k+1)/(n+2) ,并与 MLE k/n k/n 比较(拉普拉斯继承率问题)。
  4. 证明正态-正态后验的权重公式 w=(n/σ2)/(n/σ2+1/τ2) w = (n/\sigma^2)/(n/\sigma^2 + 1/\tau^2) 并讨论 τ2 \tau^2 \to \infty (先验极模糊)时 w1 w \to 1
  5. 某产品合格率先验 Beta(9, 1)(强信任:均值 0.9),抽检 n=5 n = 5 全部不合格。求后验均值与 95% 可信区间的大致位置,并评论"强先验 + 少数据"的风险。
  6. (编程) 修改 conjugate.cpp:把观测改为 n=200,k=120 n = 200, k = 120 ,观察后验是否几乎与似然重合——大样本下先验失去话语权(贝叶斯与频率殊途同归)。
  7. (编程) 仿照 shrinkage.cpp,把 τ2 \tau^2 改为 1(先验更自信),观察后验均值轨迹被紫线拉得更久——先验方差是"信任的度量"。

11. 拟合优度与非参数检验

第八章的检验都针对实值参数(均值、比例、斜率);本章处理另一类问题:分布本身对不对——数据是否来自某个设想的分布、两个属性是否独立、样本与理论分布的整体差距有多大。

1. 卡方拟合优度检验

1. 统计量

把样本空间分成 k k 个类,第 i i 类观测频数 Oi O_i 、期望频数 Ei=npi E_i = np_i pi p_i 由设想分布给出):

χ2=i=1k(OiEi)2Ei\chi^2 = \sum_{i=1}^{k} \frac{(O_i - E_i)^2}{E_i}

直觉:(OiEi)2/Ei (O_i - E_i)^2/E_i 是每一类的"标准化偏差",偏差平方使得正负偏差不抵消,除以 Ei E_i 使得频数大的类不至于主导。

2. 皮尔逊定理

定理:若设想分布正确且各 Ei E_i 不太小,则 n n \to \infty

χ2    d    χ2(k1r)\chi^2 \;\xrightarrow{\;d\;}\; \chi^2(k - 1 - r)

其中 r r 是由数据估计的参数个数。自由度是"类数减约束":频数和为 n n 扣 1,每估计一个参数再扣 1。

证明思路(r=0 r = 0 情形):多元局部中心极限定理给出 (O1,,Ok) (O_1, \dots, O_k) 的渐近正态,卡方统计量恰是该高斯向量的二次型,且协方差矩阵秩为 k1 k-1 (频数和固定),故化为 k1 k-1 个独立标准正态的平方和。 \blacksquare

3. 检验流程(图 11-1)

掷骰 1200 次,均匀假设下每面期望 Ei=200 E_i = 200 χ2(k1)=χ2(5) \chi^2(k-1) = \chi^2(5) 的 5% 临界值为 11.07。观测统计量若落入右尾则拒绝"骰子均匀"。

2. 皮尔逊定理的模拟验证(图 11-2)

定理说的是抽样分布:"骰子均匀"成立时重复整个试验,统计量 χ2 \chi^2 的直方图应贴住 χ2(5) \chi^2(5) 密度。模拟 20000 次证实:直方图与红线严丝合缝,且约有 5% 的重复落入拒绝域(红色填充)——检验水平名副其实。

3. 列联表独立性检验

1. 独立性假设

两个属性交叉分类成 r×c r \times c 表,边际频数 Oi,Oj O_{i\cdot}, O_{\cdot j} 。独立性假设下期望频数为

Eij=OiOjnE_{ij} = \frac{O_{i\cdot}\, O_{\cdot j}}{n}

统计量仍是 (OijEij)2/Eij \sum (O_{ij} - E_{ij})^2 / E_{ij} ,渐近 χ2((r1)(c1)) \chi^2((r-1)(c-1)) ——自由度还是"类数减约束":rc rc 个格子,减去 r+c1 r + c - 1 个独立的边际约束。

2. 二元相关数据的模拟(图 11-3)

用高斯联结生成一对相关二元数据(n=400 n = 400 ):ρ=0 \rho = 0 时观测频数(蓝棒)与期望(红线)处处吻合;ρ=0.6 \rho = 0.6 时对角格子的观测显著偏离期望——独立性被推翻。相关会表现为对角格子"拥挤",卡方统计量正是把这种拥挤量化。

4. KS 检验

1. 统计量

柯尔莫哥洛夫–斯米尔诺夫检验不分组,直接比较经验分布函数与理论分布函数的最大距离:

Dn=supxFn(x)F(x)D_n = \sup_x \left| F_n(x) - F(x) \right|

2. 与卡方检验的分工

  • KS 用全部信息:卡方检验依赖分组方式(分得粗丢信息,分得细每格期望变小、渐近失效);KS 检验对整个分布函数逐点比较(图 11-4 上方面板的绿色竖线即最大距离)。
  • 适用面:卡方检验对离散、连续乃至任意分组都行;KS 检验要求理论分布完全指定(参数由数据估计时需修正),且对尾部不敏感(F F 本来就近 0 或 1)。

3. 临界值(图 11-4 下方面板)

nDn \sqrt{n} D_n 的渐近分布(柯尔莫哥洛夫分布)不依赖 F F ——分布无关。5% 临界值 Dn1.36/n D_n \approx 1.36/\sqrt{n} n=60 n = 60 时约 0.175。模拟 20000 次的 Dn D_n 直方图验证临界水平。

5. 代码

本章演示程序:src/chapter11(可执行文件 bin/Chapter11.exe,图像输出至 output/chapter11/)。列联表的"相关二元数据"由高斯联结(ρz1+1ρ2z2 \rho z_1 + \sqrt{1-\rho^2} z_2 再阈值切分)生成,KS 的经验分布函数为阶梯折线逐点计算。

文件 内容 讲义位置
output/chapter11/fig_11_1_goodness.ppm 卡方拟合优度:骰子均匀性 图 11-1,1 节
output/chapter11/fig_11_2_pearson.ppm 皮尔逊定理:卡方统计量的抽样分布 图 11-2,2 节
output/chapter11/fig_11_3_contingency.ppm 列联表独立性:相关 vs 独立 图 11-3,3 节
output/chapter11/fig_11_4_ks.ppm KS 检验:最大距离与其分布 图 11-4,4 节

图 11-1(fig_11_1_goodness.ppm:掷骰 1200 次。上方面板:各面观测频数(蓝棒)与期望 200(红线)——肉眼已可见偏差;下方面板:χ2(5) \chi^2(5) 密度(红线)、5% 临界值 11.07(红色竖线)与本次统计量(橙色竖线)——统计量是否落入右尾决定骰子均匀与否。

图 11-2(fig_11_2_pearson.ppm:"骰子均匀"成立时重复 20000 次整个试验,χ2 \chi^2 的直方图(蓝棒)贴住 χ2(5) \chi^2(5) 密度(红线),拒绝域 11.07 \geq 11.07 (红色填充)中恰好落下约 5% 的重复——皮尔逊定理与检验水平同时得到验证。

图 11-3(fig_11_3_contingency.ppmn=400 n = 400 的 2×2 列联表。上方面板 ρ=0 \rho = 0 :观测频数(蓝棒)与期望 Eij=OiOj/n E_{ij} = O_{i\cdot}O_{\cdot j}/n (红线)吻合;下方面板 ρ=0.6 \rho = 0.6 (橙棒):对角格子显著超出期望——独立性假设被卡方统计量推翻。

图 11-4(fig_11_4_ks.ppm:上方面板:n=60 n = 60 N(0,1) N(0,1) 样本的经验分布函数(蓝色阶梯)与 Φ \Phi (红线),绿色粗竖线标出最大距离 Dn D_n ;下方面板:重复 20000 次的 Dn D_n 直方图(蓝棒)、临界值 1.36/600.175 1.36/\sqrt{60} \approx 0.175 (红线)与本次 Dn D_n (橙色竖线)。

6. 习题

  1. 掷骰 1200 次得频数 (188,214,202,196,208,192) (188, 214, 202, 196, 208, 192) ,计算 χ2 \chi^2 并与临界值 11.07 比较(答案:χ21.76 \chi^2 \approx 1.76 ,远不显著——肉眼觉得"参差"的偏差在统计上完全正常)。
  2. 证明列联表的期望频数公式 Eij=OiOj/n E_{ij} = O_{i\cdot}O_{\cdot j}/n 是独立性下极大似然估计。
  3. 说明 2×2 列联表自由度为 1 的原因,并解释为何此时卡方检验等价于比例差的 z z 检验(χ2(1)=z2 \chi^2(1) = z^2 )。
  4. 证明 KS 统计量只须在样本点处计算:Dn=maxi{F(x(i))i/n,F(x(i))(i1)/n} D_n = \max_i \{ |F(x_{(i)}) - i/n|, |F(x_{(i)}) - (i-1)/n| \} x(i) x_{(i)} 为顺序统计量)。
  5. 把图 11-1 的骰子改为"偏骰"(某面概率加倍、其余按比例缩小),估算 χ2 \chi^2 的非中心参数,说明检验功效随 n n 增大而升高。
  6. (编程) 修改 goodness.cpp:把掷骰次数改为 120 与 12000,观察同比例偏差下统计量按 n n 放大——卡方检验对大样本"过敏"(统计显著不等于实际重要)。
  7. (编程) 仿照 contingency.cpp,取 ρ=0.15 \rho = 0.15 (弱相关),观察四格频数与期望的偏离是否还能被 n=400 n = 400 检出——弱信号需要大样本。

12. 方差分析与回归进阶

第八章用两个样本的 t t 检验比较两组均值;本章处理多组均值的方差分析(ANOVA),并把第八章的回归从"拟合"推进到"推断":斜率显著吗?预测新点时误差有多大?

1. 单因素方差分析

1. 模型与变差分解

k k 组、每组 ni n_i 个同方差观测:Xij=μi+εij X_{ij} = \mu_i + \varepsilon_{ij} εN(0,σ2) \varepsilon \sim N(0, \sigma^2) 。检验 H0:μ1==μk H_0: \mu_1 = \dots = \mu_k 。总变差可正交分解:

i,j(XijXˉ)2SST=ini(XˉiXˉ)2SSB(组间)+i,j(XijXˉi)2SSW(组内)\underbrace{\sum_{i,j} (X_{ij} - \bar{X})^2}_{\text{SST}} = \underbrace{\sum_i n_i (\bar{X}_i - \bar{X})^2}_{\text{SSB(组间)}} + \underbrace{\sum_{i,j} (X_{ij} - \bar{X}_i)^2}_{\text{SSW(组内)}}

证明即逐项展开交叉积,交叉项恰为零——与第 9 章 MSE 分解同一手法。 \blacksquare

2. F 统计量

组间均方与组内均方之比

F=SSB/(k1)SSW/(nk)=MSBMSWF(k1,  nk)(H0 下)F = \frac{\text{SSB}/(k-1)}{\text{SSW}/(n-k)} = \frac{\text{MSB}}{\text{MSW}} \sim F(k-1,\; n-k) \quad (H_0 \text{ 下})

逻辑:H0 H_0 下分子分母都是 σ2 \sigma^2 的估计,比值在 1 附近;H1 H_1 下分子被组间差"抬升"——比值右移(图 12-1:组均值错开时,组均值到总均值的落差(绿色)相对组内散布(橙色)很大;图 12-2:备择下的 F 分布(橙点)几乎整个落在拒绝域右侧)。

3. 与 t 检验的一致性

k=2 k = 2 F(1,n2)=tn22 F(1, n-2) = t_{n-2}^2 :方差分析是两组比较的推广。

2. F 统计量的零分布(图 12-2)

模拟验证:H0 H_0 (三组同均值)下重复 20000 次方差分析,F 的直方图(蓝棒)贴住 F(2,42) F(2, 42) 密度(红线),拒绝域(F3.22 F \geq 3.22 ,红色填充)恰含 5%;备择(组均值 2/3/4,图 12-1 的设定)下 F 分布(橙点)大幅右移——几乎必然拒绝。方差比天然非负且右偏,这正是 F 分布的形状来源(第 6 章)。

3. 回归斜率的抽样分布与显著性

1. 斜率估计的分布

固定设计最小二乘下(εiN(0,σ2) \varepsilon_i \sim N(0, \sigma^2) 独立):

b^=i(xixˉ)Sxxyi    b^N(b,  σ2Sxx),Sxx=i(xixˉ)2\hat{b} = \sum_i \frac{(x_i - \bar{x})}{S_{xx}} y_i \;\Rightarrow\; \hat{b} \sim N\left(b,\; \frac{\sigma^2}{S_{xx}}\right), \quad S_{xx} = \sum_i (x_i - \bar{x})^2

关键点:b^ \hat{b} yi y_i 的线性组合,正态性直接传递;方差 σ2/Sxx \sigma^2/S_{xx} 说明设计点铺得越开,斜率越准——同样的 n n ,集中在一点附近的设计对斜率毫无信息。

2. 显著性检验(图 12-3)

H0:b=0 H_0: b = 0 (“x 毫无作用”):把估计分布中心平移到 0。模拟 10000 次拟合,b^ \hat{b} 的直方图(蓝棒)贴住理论分布 N(0.8,σ2/Sxx) N(0.8, \sigma^2/S_{xx}) (红线);H0 H_0 的分布(蓝线)与红线几乎不重叠——斜率显著非零。σ \sigma 未知时用 S S 替代并改用 tn2 t_{n-2} 分布(本章演示取 σ \sigma 已知的简化设定,z z 检验与 t t 检验在 n=25 n = 25 时已几乎一致)。

4. 置信带与预测带

1. 两层不确定性

x0 x_0 处区分两个问题:

  • 估计均值 E(Yx0) E(Y \mid x_0) :波动来自参数估计,Var(y^0)=σ2(1n+(x0xˉ)2Sxx) \operatorname{Var}(\hat{y}_0) = \sigma^2\left(\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{S_{xx}}\right)
  • 预测新观测 y0 y_0 :参数估计的波动 加上 新噪声,Var(y0y^0)=σ2(1+1n+(x0xˉ)2Sxx) \operatorname{Var}(y_0 - \hat{y}_0) = \sigma^2\left(1 + \frac{1}{n} + \frac{(x_0 - \bar{x})^2}{S_{xx}}\right)

预测带恒比置信带宽(多出 1 倍 σ2 \sigma^2 ),且两者都在 x0=xˉ x_0 = \bar{x} 处最窄、远离数据中心时呈"喇叭"张开——外推愈发不可靠(图 12-4)。

2. 与第 10 章的联系

两条带是第 10 章可信区间思想在回归中的翻版:固定 x0 x_0 重复采样,约 95% 的拟合线会穿过置信带内的真均值;约 95% 的实际观测落入预测带。

5. 代码

本章演示程序:src/chapter12(可执行文件 bin/Chapter12.exe,图像输出至 output/chapter12/)。F 统计量由"一次抽样同时算 SSB 与 SSW"保证分解恒等;回归演示用固定设计 xi=0..10 x_i = 0..10 n=25 n = 25 )、真实模型 y=0.5+0.8x+ε y = 0.5 + 0.8x + \varepsilon σ=1.2 \sigma = 1.2

文件 内容 讲义位置
output/chapter12/fig_12_1_anova.ppm 单因素方差分析:变差分解 图 12-1,1 节
output/chapter12/fig_12_2_fstat.ppm F 统计量的零分布与功效 图 12-2,2 节
output/chapter12/fig_12_3_slope_test.ppm 斜率的抽样分布与显著性 图 12-3,3 节
output/chapter12/fig_12_4_prediction.ppm 置信带与预测带 图 12-4,4 节

图 12-1(fig_12_1_anova.ppm:三组各 15 个观测(μ=(2,3,4) \mu = (2,3,4) σ=0.8 \sigma = 0.8 ):散点(橙色,横向抖动避免重叠)、组均值(蓝色横线)、总均值(红线);绿色竖线标出组均值到总均值的落差(组间变差 SSB 的来源),散点围绕组均值的波动即 SSW——组间落差明显大于组内噪声,F 检验几乎必然显著。

图 12-2(fig_12_2_fstat.ppmH0 H_0 (三组同均值 3.0)下重复 20000 次:F 直方图(蓝棒)贴住 F(2,42) F(2, 42) 密度(红线),5% 拒绝域 F3.22 F \geq 3.22 (红色填充与红色竖线);备择(组均值 2/3/4)下的 F 直方图(橙点)整体远在拒绝域右侧——方差比在原假设下自然偏小,在备择下被组间差抬升。

图 12-3(fig_12_3_slope_test.ppmn=25 n = 25 、真实斜率 0.8(绿线),重复 10000 次最小二乘拟合:b^ \hat{b} 直方图(蓝棒)贴住理论抽样分布 N(0.8,σ2/Sxx) N(0.8, \sigma^2/S_{xx}) (红线);H0:b=0 H_0: b = 0 的理论分布(蓝线,中心在 0)与红线几乎不重叠——"x 毫无作用"与数据强烈矛盾,斜率显著非零。

图 12-4(fig_12_4_prediction.ppm:拟合直线(红)与散点(灰色);绿色带为均值的 95% 置信带(中间窄两头宽的喇叭),橙色带为单个新观测的 95% 预测带(厚得多——含新噪声 σ \sigma )。两条带均在数据中心 xˉ=5 \bar{x} = 5 处最窄:估计斜率与截距的误差在数据中心互相抵消,远离中心则同向放大——外推不可靠的几何表达。

6. 习题

  1. 展开证明变差分解 SST=SSB+SSW \text{SST} = \text{SSB} + \text{SSW} ,并指出交叉项为零的原因(组内残差对组内求和为零)。
  2. 三组各 15 个观测,SSB=30 \text{SSB} = 30 SSW=42 \text{SSW} = 42 :计算 F 统计量并与 F0.05(2,42)=3.22 F_{0.05}(2, 42) = 3.22 比较(答案:F14.3 F \approx 14.3 ,高度显著)。
  3. 证明 k=2 k = 2 时 ANOVA 的 F 检验与两样本 t 检验等价(F=t2 F = t^2 ),并说明自由度的对应关系。
  4. 推导 Var(b^)=σ2/Sxx \operatorname{Var}(\hat{b}) = \sigma^2/S_{xx} ,并据此设计"最省样本"的实验(提示:把设计点推向两端)。
  5. x0=xˉ x_0 = \bar{x} 处比较置信带与预测带的宽度之比(1+1/n:1/n \sqrt{1 + 1/n} : \sqrt{1/n} ),并解释为何预测带在 n n \to \infty 时不会消失(新噪声不可消除)。
  6. (编程) 修改 anova.cpp:把组均值改为 (2,2.1,2.2) (2, 2.1, 2.2) ,观察组间落差与组内噪声的比例变化——ANOVA 的灵敏度取决于"信号/噪声"比,而非绝对差异。
  7. (编程) 仿照 prediction.cpp,把 σ \sigma 改为 2.4(噪声加倍),观察预测带变宽而置信带只变宽 \sqrt{} 倍尺度——预测的困难本质上来自不可消除的噪声。

附录:工程组织

1. 目录结构

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
ProbabilityTheory/
├── CMakeLists.txt 根构建:C++20,/utf-8,输出 bin/ lib/
├── ProbabilityTheoryLearning.md 本讲义
├── code.md 全部源码汇总
├── src/
│ ├── prob/ 数学层(静态库 Prob)
│ │ ├── include/prob/random.h 伪随机数(xorshift64*)
│ │ ├── include/prob/stats.h 统计量与分布函数
│ │ └── src/ random.cpp stats.cpp
│ ├── ppm/ 图形层(静态库 Ppm)
│ │ ├── include/ppm/plot.h 统计绘图(多面板/世界坐标/直方图)
│ │ ├── include/ppm/color.h 调色板
│ │ └── src/ plot.cpp
│ └── chapter1 ... chapter12 各章演示(可执行文件)
│ ├── CMakeLists.txt
│ ├── include/chapterN/demos.h 演示接口与画布配置
│ └── src/ main.cpp + 4 个演示
├── bin/Release/ ChapterN.exe
└── output/chapterN/ fig_N_M_*.ppm(每章 4 图)

2. 依赖与构建

1
2
3
cmake -S . -B build
cmake --build build --config Release
foreach ($i in 1..12) { .\bin\Release\Chapter$i.exe }

依赖方向自下而上:Prob(数学)→ Ppm(图形)→ 各章演示,单一流水线、无第三方库。伪随机数(xorshift64*)、正态分位数(Acklam 有理逼近)、各分布密度(lgamma 对数域计算)全部自实现,确定性种子保证全部图像可复现。

3. 图像格式

输出为二进制 PPM(P6,800×600,24 位真彩色)——无压缩、无依赖、结构最简;深色背景上的配色约定见各章图注(蓝=主体/理论,橙=模拟/观测,红=临界/参考,绿=真值/目标,灰=辅助)。