符号约定
| 记号 | 含义 |
|---|---|
| 事件 的概率 | |
| 在 发生条件下 的条件概率 | |
| 样本空间,不可能事件 | |
| 的对立事件 | |
| 随机变量(大写字母) | |
| 随机变量的取值(小写字母) | |
| 分布函数,密度函数 | |
| 期望(均值),方差 | |
| 协方差,相关系数 | |
| 服从正态分布 | |
| 标准正态分布函数,标准正态密度 | |
| 二项分布,泊松分布 | |
| 简单随机样本 | |
| 样本均值,样本方差 | |
| 参数 的估计量 | |
| 当且仅当 | |
| 证毕 |
1. 随机事件与概率
1. 随机试验与样本空间
概率论的研究对象是随机现象:个别试验中结果呈现出不确定性,但在大量重复试验中其结果又具有统计规律性的现象。
随机试验是满足以下三个条件的试验:
- 可在相同条件下重复进行;
- 全部可能结果不止一个,且事先明确;
- 每次试验之前无法预知哪一个结果出现。
试验的所有可能结果组成的集合称为样本空间,记作 ;每个可能结果称为样本点。例如掷一颗骰子,;测度一台灯的寿命,。
随机事件是样本空间的子集,简称事件。事件 发生,当且仅当试验结果 。特殊地: 自身是必然事件, 是不可能事件。
2. 事件间的关系与运算
设 :
- 包含 : 发生必导致 发生;
- 和 : 与 至少一个发生;
- 积 (记 ): 与 同时发生;
- 差 : 发生而 不发生,即 ;
- 互斥 :二者不能同时发生;
- 对立 : 不发生, 且 。
运算满足交换律、结合律、分配律,以及 对偶律(德摩根律):
通俗地说:不发生"至少其一"就是"都不发生";不发生"同时发生"就是"至少一个不发生"。对偶律把"或"与"且"互换,是化简事件表达式的首要工具(习题 1.2)。
3. 频率与概率
1. 频率
在相同条件下重复试验 次,事件 发生 次,比值
称为 的频率。频率满足非负性()、规范性()与可加性(互斥事件的频率等于频率之和)。
频率稳定性:当 增大时, 在某个常数附近摆动,且摆动幅度随 增大而减小——这个常数就是事件的概率的"频率定义"(图 1-1)。
2. 概率的公理化定义
设 为样本空间,若 的子集族上的实值函数 满足:
- 非负性:;
- 规范性:;
- 可列可加性:对两两互斥的事件列 ,有 ;
则称 为事件 的概率。频率是概率的经验来源,公理化定义则给出数学上自洽的演绎起点。
3. 性质
由公理可推出:
- (不可能事件概率为零,反之不然);
- 有限可加性:互斥时 ;
- (正难则反);
- 单调性:;
- 加法公式:。
证明(加法公式):,且二者互斥,故 ;又 ,故 ,代入即得。
4. 古典概型与几何概型
1. 古典概型
若样本空间有限( 个样本点)且每个样本点等可能,则
排列组合是基本的计数工具。典型例子:掷两颗骰子,和为 的概率 —— 恰有 6 种组合,是唯一的最可能结果(图 1-2)。
2. 几何概型
样本空间是可测区域 (长度、面积、体积),投点等可能地落入任一同测度子区域,则
会面问题:甲、乙两人先后独立到达,时刻 (以 60 分钟为单位),能会面当且仅当 。会面区域是单位方形中的对角带,故
(图 1-3)。几何概型把概率从"数点"推广到"量面积"——第五章蒙特卡洛法的想法即源于此。
5. 条件概率与三大公式
1. 条件概率
设 ,称
为 发生条件下 的概率。其含义是"缩小的样本空间里的新概率":已知 发生后,样本空间由 缩为 , 的份额需除以 的概率重新归一化(图 1-4)。条件概率满足概率的全部公理,因而拥有概率的一切性质。
2. 乘法公式
3. 全概率公式
若 是 的一个划分(两两互斥且并为 ,),则
证明:,诸 两两互斥,由可加性与乘法公式即得。
全概率公式的思想是"分情况讨论":不知道 怎么来,就把每条来路的贡献加总。
4. 贝叶斯公式
在上述划分下,若再设 ,则
称为先验(试验前的信念), 称为后验(观察到证据 后修正的信念)——贝叶斯公式是"由果溯因"的数学化。
6. 独立性
若
则称 与 相互独立。等价地(当 时),—— 的发生不改变 的概率。
注意:独立与互斥是截然不同的概念——互斥事件 ,只要 就不可能独立;直观上互斥事件关联性极强(一个发生另一个必然不发生)。多个事件的相互独立性要求任意子族皆满足乘法分解,两两独立并不必然导致整体独立(习题 1.5)。
7. 代码
本章演示程序:src/chapter1(可执行文件 bin/Chapter1.exe,图像输出至 output/chapter1/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter1/fig_1_1_frequency.ppm |
频率稳定于概率 | 图 1-1,3.1 节 |
output/chapter1/fig_1_2_dice.ppm |
两颗骰子之和的古典概型 | 图 1-2,4.1 节 |
output/chapter1/fig_1_3_meeting.ppm |
会面问题的几何概型 | 图 1-3,4.2 节 |
output/chapter1/fig_1_4_conditional.ppm |
条件概率的区域划分 | 图 1-4,5.1 节 |
图 1-1(fig_1_1_frequency.ppm):5 条不同颜色的运行频率曲线(各 20000 次独立抛硬币)在 附近摆动,且摆动幅度随 增大明显收窄;绿线标出真实概率 。每条路径形状各异,但殊途同归——这就是"频率稳定于概率"的直观含义。
图 1-2(fig_1_2_dice.ppm):蓝色棒图为两颗骰子之和的理论分布律 ,在 处达到峰值 ;橙色点为 100000 次模拟的频率,与理论棒严丝合缝——频率确实收敛到古典概率。
图 1-3(fig_1_3_meeting.ppm):单位方形中紫色对角带 是会面区域,其面积恰为 ;400 个均匀投点中落入带内的着绿色、带外的着橙色,绿点的比例直观地接近 ——几何概率就是面积比。
图 1-4(fig_1_4_conditional.ppm):单位方形按 (四分之一圆)与 (下三角)划分为四块: 绿、 青、 蓝、其余灰。条件概率 即"只看绿色与青色两块,绿色占多大比例"——样本空间被缩小后重新归一化。
8. 习题
- 设 ,,,求 、 与 。
- 用对偶律化简 。
- 掷两颗骰子,求"点数之和为 8"与"点数之差不大于 2"同时考虑时至少一个发生的概率。
- 10 件产品中有 3 件次品,不放回地取 3 件,求恰好取到 1 件次品的概率;再求已知第 1 件是次品时后两件全为正品的概率。
- 举例说明"两两独立但三事件不相互独立"。
- 病人患病率为 0.01,某检测方法对患者的阳性率为 0.95,对健康人的误报率为 0.05。某人检测结果为阳性,求他确实患病的概率(贝叶斯公式),并解释为何远小于 。
- (编程) 修改
meeting.cpp中的等待时间(现为 ),观察 P(会面) 如何随等待时间变化;验证 时概率为 。 - (编程) 仿照图 1-1,用骰子替代硬币()绘制频率曲线,观察收敛速度是否变慢,并用 3 节的摆动收窄现象解释之。
2. 随机变量及其分布
1. 随机变量与分布函数
随机变量是定义在样本空间上的实值函数 。它把随机试验的每个结果数量化,使得"事件"成为"变量落在某范围内":。
为统一刻画随机变量的概率规律,定义分布函数
分布函数具有:单调不减性、右连续性,以及 、;反之,满足这四条的函数必是某个随机变量的分布函数。由它可以算出一切区间概率:。
2. 离散型随机变量
1. 分布律
若 的取值为至多可列个 ,则其分布律
2. 二项分布
设 为 重伯努利试验中成功的次数(每次成功概率 ),则 :
二项分布是"独立重复计数"的普适模型(图 2-1)。其期望与方差为
3. 泊松分布与泊松定理
若
则 (或记 ), 是单位时间内稀有事件平均发生的次数。
泊松定理:设 ,则
即 大、 小时 (图 2-2: 与 几乎重合)。稀有事件计数——单位时间电话呼叫数、放射性衰变数、排版错字数——都近似服从泊松分布。
3. 连续型随机变量
1. 密度函数
若存在非负函数 使
则 是连续型的, 为其概率密度函数。密度满足 、;且 ,单点概率为零。密度不是概率,是"概率的变化率"——直方图中棒高是频率密度(棒的面积才是频率),正是为了与密度曲线直接对照(见 3 节与图 2-3)。
2. 均匀分布
:密度在 上恒为 ,落点在任何等长子区间的概率相等。"等可能"从离散到连续的自然延伸。
3. 指数分布
(密度 ,):
无记忆性:对任意 ,
证明:左边 。
“已经等了 分钟"并不影响"还要等多久"的分布——指数分布因此成为"寿命”(电子元件、等待时间)的标准模型(图 2-3)。
4. 正态分布
:
密度曲线关于 对称、钟形、两端衰减, 控制宽窄: 越大越"矮胖"(分散),越小越"高瘦"(集中),面积恒为 1(图 2-4)。
当 时称标准正态分布,分布函数记 ,密度记 。重要事实:
- 对称性:;
- 标准化:若 ,则 ,反之 可算一切正态概率——查表只此一张;
- 原则:, 内 , 内 。
正态分布的地位由第五章的中心极限定理奠定:大量独立微小因素叠加的结果都近似正态。
4. 随机变量函数的分布
设 的密度为 ,。当 严格单调、可导且反函数 时:
(公式法);一般情形用分布函数法:先求 ,再求导。例如 时 的密度即 的密度(习题 2.6,并与 6 章 2 节呼应)。
5. 代码
本章演示程序:src/chapter2(可执行文件 bin/Chapter2.exe,图像输出至 output/chapter2/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter2/fig_2_1_binomial.ppm |
的分布律与模拟 | 图 2-1,2.2 节 |
output/chapter2/fig_2_2_poisson.ppm |
泊松定理 | 图 2-2,2.3 节 |
output/chapter2/fig_2_3_exponential.ppm |
指数分布直方图与密度 | 图 2-3,3.3 节 |
output/chapter2/fig_2_4_normal_family.ppm |
正态分布族与 的作用 | 图 2-4,3.4 节 |
图 2-1(fig_2_1_binomial.ppm): 的分布律蓝色棒图对称于 (峰值概率 ),橙色点为 100000 次模拟频率——"结果的分配方案"被大量重复试验忠实地复现。
图 2-2(fig_2_2_poisson.ppm):泊松 的分布律蓝棒与二项 的橙点几乎逐点重合(注意 )。 次中每次以 的"稀有事件",其计数规律已经完全由一个数 决定。
图 2-3(fig_2_3_exponential.ppm):100000 个 样本的频率密度直方图(蓝棒)紧贴密度曲线 (红线)。样本在 0 附近最密集,长等待的概率按指数缩小——无记忆性使得"下一分钟"永远同样崭新。
图 2-4(fig_2_4_normal_family.ppm):标准正态样本直方图(蓝棒)与三条密度曲线对照:(红,高瘦)、(绿)、(橙,矮胖)。三条曲线下面积都是 1——分散必然以变矮为代价,概率守恒。
6. 习题
- 设随机变量 的分布函数 ,求常数 及 。
- 一批产品 20 件中 5 件次品,从中任取 4 件,求次品数 的分布律(超几何分布),并计算 。
- 某寻呼台每分钟接到的呼叫数 ,求一分钟内呼叫不超过 2 次的概率与超过 5 次的概率。
- 设 ,求 ,并解释结果与无记忆性的关系。
- 设 ,求 与 (用 表示并查表)。
- 设 ,用公式法求 的密度,并指出它属于哪一著名分布族。
- (编程) 修改
poisson.cpp:取 (仍 ),观察二项点是否依然贴合泊松棒;再取 ( 同为 3),观察两者是否明显分离——体会泊松定理的条件"大 小 "缺一不可。 - (编程) 仿照
normal_family.cpp,固定 而变化 ,验证曲线仅作整体平移、形状不变。
3. 多维随机变量及其分布
1. 二维随机变量与联合分布
设 是定义在同一样本空间上的随机变量,称 为二维随机变量。其联合分布函数
刻画"同时"的概率规律。若存在非负二元函数 使 ,则称 连续, 为联合密度:区域 上的概率是密度在 上的二重积分。
最重要的模型是二维正态分布 ,其联合密度等高线是一族同心的斜椭圆,长轴方向由相关系数 的符号决定(图 3-1)。
2. 边际分布
自身的分布称为边际分布:
同理。边际分布是把联合分布"向坐标轴投影"——它只保留一个分量的信息,联合分布的信息多于各边际之和(联合知道"相关性",边际不知道)。
关键事实:边际分布不能反过来决定联合分布。反例见三角形均匀分布: 在三角形 上均匀,但
并非均匀分布(图 3-2)——均匀的联合投影出的边际按"靠近对角线处更厚"而线性递减。原因是投影时靠近三角形尖端的竖条更短,摊到同样的横轴区间上密度更小。
3. 条件分布与独立性
1. 条件分布
对连续型,在 条件下(注意 ,需用极限定义):
即"固定横坐标切一刀,切面按 归一化"。
2. 独立性
若对一切
则 相互独立。独立意味着联合密度"可分解"——知道一个分量的取值对另一个分量的分布毫无影响。二维正态的两个分量独立当且仅当 (习题 3.5)。
4. 协方差与相关系数
1. 定义
设期望都存在,定义
2. 定理(重要性质)
- ,;
- 双线性:;
- (独立时交叉项为零,方差才可加);
- ,且 当且仅当 以概率 1 线性相关。
证明(4):对任意实数 , 展开为 ——这是 的非负一元二次型,判别式非正:。取 可进一步讨论等号条件,即 退化为常数。
3. 解读
度量的是线性相关程度: 同向(云向右上倾斜), 反向, 越大云越"扁"(图 3-3)。但注意:
- (不相关)只是"没有线性关系",不等于独立——例如 时 与 不相关却显然相依(习题 3.6);
- 独立必不相关(期望的乘法公式使协方差为零),反之不然。
5. 两个随机变量之和的分布
设 独立且分别有密度 ,则 的密度为卷积:
证明思路(分布函数法):,交换积分次序后对 求导即得卷积形式。
经典例子: 独立同分布于 ,则
三角形密度(图 3-4)——两枚均匀骰子之和的分布(图 1-2)正是它的离散版本。"和"把平坦的输入变成中间高两头低的输出,这正是第五章中心极限定理形状的起点。
6. 代码
本章演示程序:src/chapter3(可执行文件 bin/Chapter3.exe,图像输出至 output/chapter3/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter3/fig_3_1_joint.ppm |
二维正态散点云与等密度椭圆 | 图 3-1,1 节 |
output/chapter3/fig_3_2_marginal.ppm |
三角形均匀分布的边际分布 | 图 3-2,2 节 |
output/chapter3/fig_3_3_correlation.ppm |
相关系数 与 的对照 | 图 3-3,4 节 |
output/chapter3/fig_3_4_convolution.ppm |
卷积:和的三角形密度 | 图 3-4,5 节 |
图 3-1(fig_3_1_joint.ppm):二维正态 的 2000 个样本点(橙)沿 方向拉长成椭圆云;红色椭圆为 2 倍标准差等密度线,其主轴方向即样本协方差矩阵的特征方向。正相关把圆"压扁"成斜椭圆。
图 3-2(fig_3_2_marginal.ppm):主面板是三角形区域上均匀分布的散点(橙)与边界(灰);底部蓝棒为 的边际直方图,左侧绿棒为 的边际(横向绘制)——两者都不是均匀的,密度 随 线性递减。"联合均匀,边际不均匀"是边际分布最直观的警钟。
图 3-3(fig_3_3_correlation.ppm):三个面板各 800 个样本,相关系数依次为 (左,云向右下)、(中,圆形云)、(右,云向右上)。 越大云越扁;中间的圆提醒你:不相关绝非独立。
图 3-4(fig_3_4_convolution.ppm):100000 个 ( 独立 )样本的直方图(蓝棒)贴住红色三角形密度 。两个"平坦"的随机变量相加得到"中间高两头低"的输出——独立叠加天然地生产"向中间集中"。
7. 习题
- 设 的联合密度 (),求 、边际密度并判断独立性。
- 求图 3-2 中三角形均匀分布的 与 。
- 设 ,求 与 。
- 证明协方差的双线性性质 。
- 证明:二维正态分布中 独立当且仅当 (提示:联合密度能否分解为两个一维正态密度之积)。
- 设 ,,证明 但 不独立。
- 设 独立且都服从 ,写出 的密度(伽马型),并说明其形状与图 3-4 的异同。
- (编程) 修改
joint.cpp中的 为 ,观察椭圆云与红色等密度椭圆主轴的翻转;再取 ,观察云更接近圆形但仍有可辨的倾斜。 - (编程) 仿照
convolution.cpp,把 改为独立 ,绘制 的直方图与理论密度 。
4. 随机变量的数字特征
1. 数学期望
1. 定义
离散型:;连续型:(绝对收敛时才有意义)。
期望是"概率加权的平均"——分布律的重心:在支点 处概率天平恰好平衡(图 4-1)。
2. 随机变量函数的期望
无须先求 的分布即可求其期望——这是计算期望的捷径。
3. 性质
- 线性:(无须独立性!);
- 独立时 。
常用分布的期望: 为 ; 为 ; 为 ; 为 ; 为 。
2. 方差
1. 定义
方差的算术平方根 称为标准差,与 同量纲。方差度量分布对期望的偏离程度:同均值下方差越大越分散(图 4-2)。
2. 性质
- ,(平移不改变分散度);
- ;
- 独立可加: 独立时 ;一般情形要加交叉项 ;
- 以概率 1 为常数。
常用分布的方差: 为 ; 为 ; 为 ; 为 ; 为 。
3. 契比雪夫不等式(见 4 节)
3. 协方差、相关系数与回归直线
协方差与相关系数的定义与性质见 3.4 节,此处强调其几何意义:样本散点云的"倾斜程度"由协方差翻译成最小二乘回归直线的坡度
(图 4-3;理论依据见 8.5 节的最小二乘推导)。注意 对 回归与 对 回归是两条不同的直线(习题 4.5)。
4. 切比雪夫不等式
定理:设 、 存在,则对任意 :
证明(连续型):,两边除以 即得。
解读(图 4-4):
- 它只要求方差存在,对任何分布成立——这是第五章大数定律(伯努利形式)证明的关键工具;
- 代价是宽松:对正态总体,真实尾部概率按指数衰减,远小于 ——切比雪夫只保证"不比这更糟"。
5. 原点矩与中心矩
称为 阶原点矩, 称为 阶中心矩。期望是一阶原点矩,方差是二阶中心矩;矩是数字特征的一般化,第七章的矩估计直接使用它们。
6. 代码
本章演示程序:src/chapter4(可执行文件 bin/Chapter4.exe,图像输出至 output/chapter4/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter4/fig_4_1_expectation.ppm |
期望是分布律的重心 | 图 4-1,1 节 |
output/chapter4/fig_4_2_variance.ppm |
方差度量分散程度 | 图 4-2,2 节 |
output/chapter4/fig_4_3_regression.ppm |
协方差与回归直线 | 图 4-3,3 节 |
output/chapter4/fig_4_4_chebyshev.ppm |
切比雪夫界与真实尾部 | 图 4-4,4 节 |
图 4-1(fig_4_1_expectation.ppm): 的分布律蓝棒在 处附近最厚,红线标出期望 ;橙点为 100000 次模拟的样本均值,紧贴红线。期望既"物理"(重心平衡点)又"统计"(大量试验的平均水平)。
图 4-2(fig_4_2_variance.ppm):上下两个面板同为零均值正态,上 (高瘦),下 (矮胖),各 20000 个样本的直方图(蓝棒)与理论密度(红线)对照。均值相同、方差不同——分散度的差别一目了然。
图 4-3(fig_4_3_regression.ppm): 的 800 个样本(橙点),样本均值处画十字准线(灰),红色最小二乘直线 穿过十字、坡度 。协方差把"云的倾斜"翻译成"直线的坡度"。
图 4-4(fig_4_4_chebyshev.ppm):红线为切比雪夫界 ( 时高达 100%,平庸),蓝线为正态总体的真实尾部 (指数衰减),橙点为 200000 个标准正态样本的模拟频率、紧贴蓝线。切比雪夫界像一条宽松的护栏——不精确,但保证任何方差不无穷的分布都翻不出去。
7. 习题
- 设 的密度 (),求 、 与 。
- 一台设备寿命 ,盈利与寿命关系为 ,求平均盈利(用随机变量函数的期望公式,注意无须求 的分布)。
- 证明方差的等价定义 ,并用它重算第 1 题。
- 设 ,用期望与方差的线性性把 分解为 个独立伯努利变量之和,求出 与 。
- 设 对 的回归直线为 , 对 的回归直线为 ,证明两直线斜率之积 ,并说明两条直线何时重合。
- 用切比雪夫不等式估计 ()时 的下界,再思考为什么切比雪夫给出的界远比真实值保守(对照图 4-4 的含义)。
- (编程) 修改
expectation.cpp为 ,验证期望 处的"重心"位置;观察分布律的对称性如何随 偏离 而消失。 - (编程) 仿照
chebyshev.cpp,将总体换成 (重尾于正态),观察模拟尾部频率落在蓝线(正态精确值)与红线(切比雪夫界)之间的哪个位置——体会"通用界"对偏态分布反而更贴切。
5. 大数定律与中心极限定理
大数定律回答"平均的稳定性",中心极限定理回答"平均的分布形状"——二者共同构成频率稳定于概率、以及正态分布为什么无处不在的理论基石。
1. 依概率收敛
设 是随机变量序列,若对任意
则称 依概率收敛于常数 ,记 。它比数列收敛弱:不要求每次都接近,只要求"离谱的概率"趋于零。
2. 蒙特卡洛方法
先于定理看一个应用:求 。向单位方形 均匀投点,落入四分之一圆 的概率为其面积 ,于是
(图 5-1)——几何概型的"数点"版本,也是伯努利大数定律的直接推论。误差量级为 :精度每提高一位数,代价是一百倍的投点。
3. 大数定律
1. 切比雪夫大数定律(一般情形)
设 相互独立,期望均为 、方差一致有界 ,则对任意
(对样本均值用切比雪夫不等式即可,独立性使方差可加:。)
2. 辛钦大数定律(最常用)
设 独立同分布且期望 存在(不要求方差存在),则
3. 伯努利大数定律
重伯努利试验中频率 依概率收敛于成功概率 。它是辛钦定律的持例,也是第 1 章"频率稳定于概率"的严格化(图 1-1 的理论根据)。
直观解读(图 5-2):无论原始分布如何偏斜(如 ),样本均值序列终将被"平均"的力量拉向期望。大数定律是"经验均值可用作理论均值"的许可证,也是蒙特卡洛方法的理论后盾。
4. 中心极限定理
1. 林德伯格–莱维定理
设 独立同分布,,,则标准化和
即不论原始分布多么"不像钟形",当 充分大时标准化和近似服从 (图 5-3: 平坦无峰, 的标准化均值已经贴住正态曲线)。
直观解读:独立叠加时,每个因素只贡献微小份额,和的分布是各因素分布的卷积(3.5 节),卷积具有"磨平棱角、向中间集中"的效应(图 3-4 的三角形已是雏形)——叠加得足够多,形状便只剩一个极限答案:正态。
2. 棣莫弗–拉普拉斯定理
,当 大时 近似 ——正态近似计算二项概率的依据。
3. 高尔顿板(图 5-4)
弹珠从顶部落下,逐行碰钉子各以 左右弹开, 行后落点是 个独立伯努利变量之和,服从 ——中心极限定理的机械化演示:独立性 + 叠加,正态形状自然浮现。历史上正是高尔顿板让"误差的正态性"深入人心。
5. 代码
本章演示程序:src/chapter5(可执行文件 bin/Chapter5.exe,图像输出至 output/chapter5/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter5/fig_5_1_monte_carlo.ppm |
蒙特卡洛投点估计 | 图 5-1,2 节 |
output/chapter5/fig_5_2_lln.ppm |
大数定律:均值收敛于期望 | 图 5-2,3 节 |
output/chapter5/fig_5_3_clt.ppm |
中心极限定理的直方图 | 图 5-3,4.1 节 |
output/chapter5/fig_5_4_galton.ppm |
高尔顿板与二项落点 | 图 5-4,4.3 节 |
图 5-1(fig_5_1_monte_carlo.ppm):左面板单位方形内 1500 个投点,四分之一圆内绿、圆外橙、圆弧红;右面板估计值 (内点比例)的运行曲线(红)随 从剧烈波动收敛到绿线 。收敛是概率意义的——曲线有回退有震荡,但振幅总体越来越小。
图 5-2(fig_5_2_lln.ppm):(偏斜、远离正态)的 5 条样本均值运行曲线(不同颜色)在早期波动后全部收敛到绿线 。偏斜的分布被"平均"驯服——辛钦大数定律不挑分布形状。
图 5-3(fig_5_3_clt.ppm):(完全平坦)抽 个样本求均值并标准化,重复 10000 次的直方图(蓝棒)已经贴住标准正态密度(红线)。原始分布毫无"钟形"基因,正态形状却依然出现——这就是中心极限定理的震撼。
图 5-4(fig_5_4_galton.ppm):上方面板是 12 行钉阵(灰点)与 3 条示例路径(橙线);下方面板 3000 颗弹珠落点的频率直方图(蓝棒)与理论分布律 (红点)吻合——弹珠的每一次左右抉择都是独立的伯努利试验,落点的钟形是加法的必然。
6. 习题
- 用切比雪夫不等式确定至少需拥多少次均匀硬币,才能保证正面频率落在 的概率至少 。(提示:先算 。)
- 设 独立同分布于 ,求 时 的正态近似值(标准化后查 )。
- 一零件重量独立同分布,均值 10 g、标准差 0.5 g,求 100 件总重超过 1010 g 的概率近似值。
- 证明:若 且函数 连续,则 (连续映射定理,可用于说明 蕴含 )。
- 某系统由 200 个独立部件组成,至少 150 个正常则系统正常,每个正常率 0.85。用正态近似求系统正常率。(提示:[ 作标准化后近似 $ \Phi )。)
- (编程) 修改
clt.cpp的 为 3、5、10,观察直方图从"平顶"逐步"起钟"的过程——中心极限定理是渐近的, 越小残差越明显。 - (编程) 仿照
monte_carlo.cpp,改用落点分布估计积分 (被积函数作竖线高度),并与真值 比较。
6. 样本及抽样分布
从本章起视角转换:从"已知分布研究其性质"(概率论)进入"由样本推断总体"(数理统计)。
1. 总体、样本与统计量
1. 总体与样本
总体是研究对象的全体(的某项数量指标),视为一个分布 ;样本是独立重复观测的结果,满足:
- 与总体同分布(代表性);
- 相互独立(独立性)。
满足这两条的样本称为简单随机样本,其联合分布为 ——这是第七章极大似然的出发点。
2. 统计量
样本的不含未知参数的函数 称为统计量,如:
注意 用分母 :这样才能保证 (无偏性,第七章 3 节)。统计量是"数据的加工品",它本身也是随机变量,有自己的分布——抽样分布。
3. 经验分布函数
将样本按小到大排列为 ,
是阶梯函数。格里汶科定理保证 一致收敛于总体 (图 6-1)——样本是总体的忠实缩影,统计推断的合法性基于此。
2. 三大抽样分布
1. 分布
设 独立同分布于 ,则
密度在 处为零,自由度 时在 0 处发散、 时单调衰减、 出现峰值并向右移(图 6-2)。期望与方差:,;且具有可加性 。
2. 分布
密度关于 0 对称;自由度 越小尾部越厚(图 6-3: 是重尾柯西型,尾部按 衰减甚至无期望)。 时 。直观来源:用样本标准差替代未知 时引入了除法的不确定性,小样本时这种不确定性大,把概率推向两端。
3. 分布
取值恒正、右偏(图 6-4);自由度交换时按倒数镜像()。
4. 分位数
对 ,若 则称 为 的上 分位数。三大分布表、正态分布表给出的都是分位数;后续区间估计与假设检验的临界值全部以分位数形式出现。
3. 正态总体的抽样分布定理
设 独立同分布于 ,则:
- ,且 与 独立;
- ;
- 。$
第 1 条是标准化(2 章 3.4 节)+ 独立可加性的直接推论;第 3 条由第 1、2 条相除而来——这正是" 未知时用 替代"的标准情形,也是 分布存在的意义。
4. 代码
本章演示程序:src/chapter6(可执行文件 bin/Chapter6.exe,图像输出至 output/chapter6/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter6/fig_6_1_ecdf.ppm |
经验分布函数逼近总体 CDF | 图 6-1,1.3 节 |
output/chapter6/fig_6_2_chi2.ppm |
密度曲线族 | 图 6-2,2.1 节 |
output/chapter6/fig_6_3_t.ppm |
分布与正态对比 | 图 6-3,2.2 节 |
output/chapter6/fig_6_4_f.ppm |
密度曲线族 | 图 6-4,2.3 节 |
图 6-1(fig_6_1_ecdf.ppm): 抽 个样本的经验分布函数 (蓝阶梯)与总体分布 (红对角线)。阶梯的每个台阶高度恰为 ;样本量小则阶梯清晰可见, 增大时阶梯将变密变矮、整体贴合对角线——格里汶科定理的直观含义。
图 6-2(fig_6_2_chi2.ppm):(红,原点发散)、(蓝,单调衰减)、(橙,出峰)、(绿,峰右移)四条曲线;叠加 的 50000 个模拟样本直方图(填充棒)贴住橙色曲线。峰随自由度右移——正态平方和的均值 在增大。
图 6-3(fig_6_3_t.ppm):(红)、(蓝,柯西型重尾)、(绿)三条曲线中央几乎重合,尾部厚度按 正态 排列;叠加 的 50000 个模拟样本直方图(填充棒)。中央的微小差异被尾部的悬殊掩盖——小样本的"不确定性"藏在尾巴里。
图 6-4(fig_6_4_f.ppm):(红,强右偏)、(蓝)、(绿,近乎对称)三条曲线;叠加 的 50000 个模拟样本直方图(填充棒)。交换分子分母自由度相当于取倒数,偏斜方向随之镜像——这是 分布的对称性余味。
5. 习题
- 设 独立同分布于 ,指出 、、 各服从什么分布。
- 从 抽取 ,求 的分布及 (用 表示)。
- 证明 (提示:,独立和的期望可加)。
- 查表:、、,并验证 。
- 设 独立同分布于 ,求 与 (利用 3 节定理 2 与 的方差 )。
- (编程) 修改
ecdf.cpp的 为 10 与 500,对比阶梯贴合对角线的程度——体会格里汶科定理的"一致性"。 - (编程) 仿照
t.cpp,叠加 与 曲线,验证大自由度时二者几乎不可分辨(这是实践中 可用正态近似 的依据)。
7. 参数估计
1. 点估计与矩估计法
总体分布形式已知、参数 未知时,用统计量 去估计它——点估计。
矩估计法:用样本矩替换总体矩。令
例如正态总体:,(图 7-1)。矩估计古老、直观、通用(不要求分布形式已知),但未必充分利用分布信息。
2. 极大似然估计
设总体密度(分布律)为 ,样本的似然函数
极大似然估计(MLE) 使 。实际操作常对对数似然 求导置零(对数变换把连乘变成连加且不改变峰值位置,图 7-2)。
例子: 的 ,解得 。MLE 的思想:在所有可能的参数里,选"让这批数据最不惊人"的那一个。
3. 估计量的评选标准
- 无偏性:。例如 ;而 有偏,修正为 后无偏()。
- 有效性:同为无偏时方差小者为优( 在所有线性无偏估计中方差最小,高斯–马尔可夫定理的精神)。
- 相合性:,即估计量自身收敛到真值——大数定律的推论: 相合。
4. 区间估计
1. 置信区间
找统计量 使
则随机区间 是置信度 的置信区间。
2. 枢轴量法( 已知)
,故 不含未知参数,作"枢轴":
不等式变形即得
正确解读(图 7-3):置信度说的是方法的成功率——反复抽样得到一族区间,长期约 的区间罩住真值,而非" 落入这个区间的概率是 95%"( 是常数,不随机)。
3. 未知时
用 替换 ,枢轴量变为 ,临界值换成 ——小样本必须用更厚的 分布(6 章 2.2 节)。
4. 样本量与精度(图 7-4)
区间半宽 :样本量翻 4 倍,宽度才减半——精度是有价的,且边际收益递减。
5. 代码
本章演示程序:src/chapter7(可执行文件 bin/Chapter7.exe,图像输出至 output/chapter7/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter7/fig_7_1_moment.ppm |
矩估计拟合正态 | 图 7-1,1 节 |
output/chapter7/fig_7_2_mle.ppm |
对数似然曲线与 MLE 峰值 | 图 7-2,2 节 |
output/chapter7/fig_7_3_ci.ppm |
60 个置信区间的覆盖率 | 图 7-3,4.2 节 |
output/chapter7/fig_7_4_width.ppm |
区间宽度的 衰减 | 图 7-4,4.4 节 |
图 7-1(fig_7_1_moment.ppm):真实总体 抽 个样本的直方图(蓝棒),矩估计 、 拟合的密度曲线(红)与真实密度曲线(绿)几乎重合——样本矩抓住了总体的全部信息(就正态而言)。
图 7-2(fig_7_2_mle.ppm):指数总体(真实 未知)抽 ,对数似然曲线 (蓝)单峰,峰值恰在 MLE 处(红线);绿线标出真实值 供对照——"最像这批数据的参数"未必恰是真值,但很接近。
图 7-3(fig_7_3_ci.ppm):60 组 的独立样本各画一条 区间 :罩住真值 (绿线)的区间为蓝色、未罩住的为红色(本例约 3 组,)——长期频率正是置信度的含义。
图 7-4(fig_7_4_width.ppm):上方面板为 区间半宽 (,蓝曲线)随 的衰减,明显先陡后缓;下方面板为 三组实际区间(蓝横线,中心为各次抽样的 ),真值 (绿线)。直观验证:四倍的样本只换来一半的宽度。
6. 习题
- 设总体密度 (),分别用矩估计与极大似然估计 ,并比较两者在同一组数据上的差异。
- 证明 (提示:分解 后分别取期望)。
- 设 独立同分布于 ,求 的 MLE,并验证它无偏且相合。
- 、、,求 的 与 置信区间,并说明为什么更高的置信度必然换来更宽的区间(参考图 7-3 的红蓝对比思想)。
- 要使 已知时置信区间半宽不超过 ,置信度 ,至少需要多大样本?(对照图 7-4 上方面板。)
- (编程) 修改
confidence.cpp的重复次数为 200,统计未覆盖真值的区间比例,验证其长期频率接近 。 - (编程) 仿照
mle.cpp,对 ( 已知)写出对数似然 并绘制曲线,验证峰值在 处——正态的 MLE 就是样本均值。
8. 假设检验与回归分析
1. 假设检验的基本思想
对总体的未知参数提出两个对立假设:原假设 与备择假设 。检验的逻辑是概率反证法:先假定 成立;构造一个在 下分布已知的统计量;若观测结果落在事先指定的拒绝域(小概率区域)内,则"小概率事件居然发生"令人生疑,拒绝 ;否则不拒绝。
例(双侧 检验,图 8-1):, 已知,,则 。取显著性水平 ,拒绝域
观测 落在接受域内——证据不足以"推翻" (但不等于证明 为真)。
显著性水平 的含义:若 为真,这套规则有多大比例的误拒风险——它是可以事先控制的错误率。
2. 两类错误与功效
任何检验规则都可能犯两种错误:
| 为真 | 为真 | |
|---|---|---|
| 拒绝 | 第一类错误,概率 | 正确决策,概率 (功效) |
| 不拒绝 | 正确决策 | 第二类错误,概率 |
理想是两类错误都小,但在固定样本量下二者此消彼长(图 8-2 上方面板:临界线右移,红色 变小、绿色 变大)。奈曼–皮尔逊原则:先固定 (保护原假设),再在此约束下寻找 最小(功效最大)的检验。
功效函数:——它是参数 的函数:在 处等于 ,随真实参数偏离 而升向 1(图 8-2 下方面板)。功效回答"检验的灵敏度": 偏离多远、样本多大,才能被可靠地检出。
3. p 值
p 值:在 成立的前提下,出现当前及更极端观测的概率。
定理:连续型统计量在 下,p 值服从 。
证明:设统计量 的 -分布函数为 (连续),则 ;而 是 经自身分布函数变换,由概率积分变换定理,,故 。
(图 8-3: 下 p 值直方图平坦均匀; 下向 0 堆积。)由此可直接读出:
- p 值是随机变量,一次试验的 p 值大小有偶然性;
- " 拒绝"等价于"观测落入拒绝域"——p 值与拒绝域法是同一件事的两种表述,但 p 值携带"离拒绝有多远"的连续信息;
- p 值不是" 为真的概率",也不度量效应大小。
4. 正态总体参数的检验
设总体 ,常用检验(单双侧的临界值相应取 或 ):
| 检验 | 条件 | 统计量 | 分布 |
|---|---|---|---|
| 的 检验 | 已知 | ||
| 的 检验 | 未知 | ||
| 的 检验 | 未知 |
双样本情形(两个正态均值之差、方差之比)分别产生 检验与 检验——三大抽样分布(6 章 2 节)在此各就各位。
5. 一元线性回归
1. 模型
即 (条件期望的线性假设)。
2. 最小二乘法
选取 使残差平方和
最小。对 求偏导并置零,得正规方程,解为
回归直线必然过样本中心 (图 4-3 的十字准线)。在正态误差假设下,最小二乘估计恰等于极大似然估计(对数似然的极大化与残差平方和的极小化是同一件事,习题 8.5)。
3. 拟合优度
决定系数
度量"回归解释掉的总变差比例",在一元情形恰等于 (样本相关系数的平方)。
6. 代码
本章演示程序:src/chapter8(可执行文件 bin/Chapter8.exe,图像输出至 output/chapter8/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter8/fig_8_1_rejection.ppm |
双侧 检验拒绝域 | 图 8-1,1 节 |
output/chapter8/fig_8_2_power.ppm |
两类错误与功效函数 | 图 8-2,2 节 |
output/chapter8/fig_8_3_pvalue.ppm |
p 值的分布 | 图 8-3,3 节 |
output/chapter8/fig_8_4_regression.ppm |
最小二乘回归与残差 | 图 8-4,5 节 |
图 8-1(fig_8_1_rejection.ppm): 下 的密度(蓝色主体);两侧深红填充的尾部面积合计恰为 ,即拒绝域 (红色临界线);橙色竖线为一次实际抽样的观测 ——在接受域内,不拒绝 。
图 8-2(fig_8_2_power.ppm):上方面板:(蓝线,)与 (橙线,)的密度都以 为标准误,单侧临界 (红线)右边的蓝色区域是 (弃真),左边的绿色区域是 (取伪)——两块面积此消彼长;下方面板:功效函数 (绿线)在 处等于 (红参考线),随 增大迅速升向 1,橙色点标出 处的功效约 。
图 8-3(fig_8_3_pvalue.ppm):()成立时 20000 组双侧 检验的 p 值直方图(蓝棒)平坦地贴住高度为 1 的红色均匀密度线——p 值在 下均匀分布;而 ()成立时的 p 值直方图(橙点)急剧向 0 堆积——真有效应时 p 值倾向于小,这正是"小 p 值是强证据"的频率解释。
图 8-4(fig_8_4_regression.ppm):模型 ()的 个散点(橙);红色最小二乘直线 从散点云中心穿过,灰色竖线为各点残差(点到直线的竖直距离)。残差有正有负、无系统模式——这正是"线性 + 独立同误差"假设成立的视觉表现。
7. 习题
- 、、,取 分别做双侧与单侧() 检验,比较结论并解释"单侧更容易拒绝"的几何原因(对照图 8-1:单侧只有右尾,临界值更小)。
- 计算 2 节例中 ,并验证 与图 8-2 下方面板橙色点的纵坐标一致(约 )。
- 某厂产品平均重量标准 g,抽 得 g、 g。取 检验 ( 检验),并求 p 值的范围。
- 证明功效函数 是 的严格增函数,并求 所需的 (即检验能以 95% 把握检出的最小偏离)。
- 证明:正态误差假设下, 的极大似然估计与最小二乘估计一致(提示: 中与参数相关的部分为 )。
- 由图 8-4 的模型取 的理论近似值:,代入 、、 计算,并思考噪声增大时 如何变化。
- (编程) 修改
pvalue.cpp的 为 与 ,观察 H1 直方图向 0 堆积的"速度"差异——效应越大,小 p 值越容易出现(即功效越高,呼应图 8-2)。 - (编程) 仿照
regression.cpp,把噪声标准差从 改为 ,观察残差竖线变长、拟合直线斜率偏离真实值 0.8 更多——样本量固定时,噪声越大参数估计越不稳定。
9. 估计理论进阶
第七章给了点估计的两种方法和三个评价标准;本章把评价标准推到逻辑终点:什么样的估计量是"理论上最好"的,以及"无偏"是否总是值得追求。
1. 充分统计量
1. 定义
统计量 若满足:给定 后样本的条件分布与参数 无关,则称 是 的充分统计量——它把样本中关于 的信息"全部吸收",其余部分对推断毫无价值。
2. 因子分解定理(奈曼–费歇尔)
充分当且仅当联合密度(分布律)可分解为
即"与 相关的因子只通过 进入"。例如伯努利样本:,其中 ——成功次数充分;均匀总体 :,其中 充分。
3. 直观验证(图 9-1)
给定 后, 的样本只剩"相对位置": 的分布与 无关(模拟中 与 的两组 直方图完全重合,且都贴住理论密度 )。充分性由此可直接"看见"。
2. Rao–Blackwell 定理
定理:设 是充分统计量, 是 的任一无偏估计,则
也是无偏估计,且 (等号当且仅当 已是 的函数)。
证明思路:重期望公式 给出无偏性;条件方差分解 给出方差不增——第二项非负正是"压缩掉的部分"。
把估计量对充分统计量取条件期望是"免费午餐":不牺牲无偏性,只压缩方差(图 9-2:估计 时, 对 取条件期望得 ,方差骤减)。反复 Rao–Blackwell 化可证明:若 完备,则无偏 + 只依赖 的估计就是 UMVUE(Lehmann–Scheffé 定理)。
3. Cramér–Rao 下界与 Fisher 信息
1. Fisher 信息
度量单个观测携带的 信息量;独立观测可加:。
2. Cramér–Rao 不等式
定理(正则条件下):任意无偏估计 满足
达到等号的估计称为有效估计。例如正态均值的 ();但有效估计凤毛麟角—— 的 MLE 的精确方差 只能渐近趋向下界 (图 9-3)。
4. MSE 分解与偏差-方差权衡
均方误差可正交分解:
无偏(偏差为零)不一定 MSE 最小:在收缩族 中,最优收缩 位于"无偏要求的 "之左侧——主动引入一点偏差换取方差大降(图 9-4)。这是现代统计(岭回归、收缩估计、机器学习的正则化)反复出现的主题。
5. 代码
本章演示程序:src/chapter9(可执行文件 bin/Chapter9.exe,图像输出至 output/chapter9/)。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter9/fig_9_1_sufficiency.ppm |
充分统计量:换 分布不变 | 图 9-1,1.3 节 |
output/chapter9/fig_9_2_rao_blackwell.ppm |
Rao–Blackwell 方差压缩 | 图 9-2,2 节 |
output/chapter9/fig_9_3_cramer_rao.ppm |
CR 下界与精确方差 | 图 9-3,3 节 |
output/chapter9/fig_9_4_mse.ppm |
MSE 分解与最优收缩 | 图 9-4,4 节 |
图 9-1(fig_9_1_sufficiency.ppm):(蓝棒)与 (橙点)两组 的直方图完全重合,且贴住理论密度 (红线)——给定 后样本只剩相对位置信息,与 无关,充分性成立。
图 9-2(fig_9_2_rao_blackwell.ppm):估计 (绿线):朴素估计 只能取 0 或 1(蓝棒,集中在两端,方差巨大);Rao–Blackwell 化后的 (橙点)支撑变细、分布集中。两者均值相同,后者方差骤减——条件期望的压缩效果一目了然。
图 9-3(fig_9_3_cramer_rao.ppm):红线为 CR 下界 (任意无偏估计的方差地板),蓝线为 的精确方差( 才存在),橙点为模拟方差、紧贴蓝线。蓝线在红线上方但随 增大渐近贴合——有效估计(方差恰达下界)并不常见。
图 9-4(fig_9_4_mse.ppm):收缩族 ():方差项(蓝线)随 平方增长、偏差²项(绿线)随 偏离 增大,MSE(红线)是二者之和,在 (紫线)取最小——比无偏要求的 (橙线)更小。橙点为各 处的模拟 MSE,验证理论。
6. 习题
- 用因子分解定理验证:泊松样本的 、正态样本( 已知)的 分别是 、 的充分统计量。
- 验证图 9-2 中的 (提示: 个成功中任意两个特定观测恰为 (1,1) 的组合计数)。
- 证明 的 Fisher 信息 (密度取对数求导后取期望)。
- 由 MSE 分解推导收缩族 的最优收缩 ,并代入 验证 (对照图 9-4)。
- 证明:若 达到 CR 下界,则它必是 的线性充分统计量的函数(有效估计必充分)。
- (编程) 修改
rao_blackwell.cpp的 为 5 与 50,观察两个估计量方差的差距如何变化——样本越多,朴素估计浪费的信息越多。 - (编程) 仿照
mse.cpp,将样本量改为 ,观察最优收缩 向 1 靠近——大样本下无偏与 MSE 最优几乎重合,偏差-方差权衡是小样本的烦恼。
10. 贝叶斯估计
第七、九章的频率派把 视为固定常数,用统计量去猜测它;贝叶斯派把 $ 本身视为随机变量,用概率分布描述对它的信念。
1. 贝叶斯范式
1. 三要素
- 先验 :看到数据之前对 的信念;
- 似然 :数据对 的证据(频率派已熟悉);
- 后验 :贝叶斯公式的密度版本
贝叶斯推断 = 用后验表达一切:后验均值作点估计、后验分位数作区间。
2. 与频率派的分野
频率派: 固定、区间随机(图 7-3 的“方法成功率");
贝叶斯派:数据固定、 随机(后验即"拿到数据后的信念分布")。两者在数学上互相启发,在大样本下殊途同归(后验集中点与 MLE 重合)。
2. 共轭先验
若先验与后验同属一个分布族,则称共轭。两大经典配对:
| 总体 | 先验 | 后验 |
|---|---|---|
| 伯努利 | ||
| 正态 ( 已知) |
Beta-伯努利共轭可读作"计票":先验相当于预先投了 票(其中 票成功),每条数据投一票(图 10-1:先验 Beta(2,2)、似然峰在 0.6、后验 Beta(14,10)——后验是二者的折中,中心略被先验拉离 0.6)。
3. 后验总结与收缩
1. 正态-正态的后验
后验精度 = 数据精度 + 先验精度:
后验均值是样本均值与先验均值的加权平均:权重 随 从 0 升向 1(图 10-3 上方面板),后验方差恒小于两者——先验与数据的"信息"相加而非取平均。
2. 收缩的直观
小样本时数据噪声大,后验被先验"稳住"(图 10-3 下方面板:橙色的后验均值轨迹明显比蓝色的样本均值平滑);大样本时数据"淹没"先验(图 10-2: 时后验几乎不再记得先验的形状)。这种"向先验中心收缩"的机制与第 9 章 MSE 权衡中的最优收缩(图 9-4)异曲同工。
4. 可信区间与置信区间
可信区间:后验的等尾 95% 区间 ——拿到数据后, 落入此区间的后验概率是 95%。
与频率置信区间(图 7-3、图 10-4)的对照:
- 语义不同:可信区间是" 在区间的概率 95%“(贝叶斯允许这种说法,因为 $ 有分布);置信区间是"方法长期成功率 95%”。
- 数值常接近:Beta(2,2) 先验的伯努利可信区间与 Wald 区间在中等 处相近;但小样本极端 处,Wald 区间可能穿出 ,而共轭后验自动把区间限制在 内——先验提供了"软边界"(图 10-4)。
5. 代码
本章演示程序:src/chapter10(可执行文件 bin/Chapter10.exe,图像输出至 output/chapter10/)。Beta 密度与分位数(网格累积 + 二分)在演示内自实现。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter10/fig_10_1_conjugate.ppm |
先验/似然/后验三曲线 | 图 10-1,2 节 |
output/chapter10/fig_10_2_updating.ppm |
数据累积的后验更新 | 图 10-2,3.2 节 |
output/chapter10/fig_10_3_shrinkage.ppm |
正态-正态收缩 | 图 10-3,3.1 节 |
output/chapter10/fig_10_4_credible.ppm |
可信区间 vs 置信区间 | 图 10-4,4 节 |
图 10-1(fig_10_1_conjugate.ppm):先验 Beta(2,2)(紫,对称驼峰)、似然(蓝,峰在 0.6)、后验 Beta(14,10)(绿,似然的形状被先验微调)。红线为后验均值 ——略低于 0.6:先验 4 票对数据 20 票,说话权约 1/6。
图 10-2(fig_10_2_updating.ppm):四面板()依次展示同一数据流累积下的后验(绿,填充): 时仍被先验(紫线)牢牢塑形; 出现偏移; 收腰; 已是又高又窄的尖峰且中心落在真值 (红线)附近——数据逐渐夺权。
图 10-3(fig_10_3_shrinkage.ppm):上方面板:数据权重 (绿线)从 0 平滑升向 1,中点对应 的量级;下方面板:样本均值 (蓝,噪声大起大落)与后验均值(橙,被先验稳住),真值 (绿线)与先验均值 (紫线)。小 时橙线贴紫线,大 时贴蓝线并收敛到绿线。
图 10-4(fig_10_4_credible.ppm):上方面板 Wald 置信区间(蓝),下方面板贝叶斯可信区间(橙),各 40 组、真值 0.3(绿线),未覆盖者为红色。两者长期覆盖率都接近 95%;差别在小样本:Wald 区间在 极端时质量变差,贝叶斯区间始终被后验限制在 内且更稳定。
6. 习题
- 验证 Beta-伯努利共轭: 先验乘以伯努利似然后归一化即 。
- 求 Beta(a, b) 的均值与方差,并说明"先验计票"解释下后验均值 恰是混合"票数"。
- 取无信息先验 Beta(1,1)(即均匀),证明此时后验均值退化为 ,并与 MLE 比较(拉普拉斯继承率问题)。
- 证明正态-正态后验的权重公式 并讨论 (先验极模糊)时 。
- 某产品合格率先验 Beta(9, 1)(强信任:均值 0.9),抽检 全部不合格。求后验均值与 95% 可信区间的大致位置,并评论"强先验 + 少数据"的风险。
- (编程) 修改
conjugate.cpp:把观测改为 ,观察后验是否几乎与似然重合——大样本下先验失去话语权(贝叶斯与频率殊途同归)。 - (编程) 仿照
shrinkage.cpp,把 改为 1(先验更自信),观察后验均值轨迹被紫线拉得更久——先验方差是"信任的度量"。
11. 拟合优度与非参数检验
第八章的检验都针对实值参数(均值、比例、斜率);本章处理另一类问题:分布本身对不对——数据是否来自某个设想的分布、两个属性是否独立、样本与理论分布的整体差距有多大。
1. 卡方拟合优度检验
1. 统计量
把样本空间分成 个类,第 类观测频数 、期望频数 ( 由设想分布给出):
直觉: 是每一类的"标准化偏差",偏差平方使得正负偏差不抵消,除以 使得频数大的类不至于主导。
2. 皮尔逊定理
定理:若设想分布正确且各 不太小,则 时
其中 是由数据估计的参数个数。自由度是"类数减约束":频数和为 扣 1,每估计一个参数再扣 1。
证明思路( 情形):多元局部中心极限定理给出 的渐近正态,卡方统计量恰是该高斯向量的二次型,且协方差矩阵秩为 (频数和固定),故化为 个独立标准正态的平方和。
3. 检验流程(图 11-1)
掷骰 1200 次,均匀假设下每面期望 。 的 5% 临界值为 11.07。观测统计量若落入右尾则拒绝"骰子均匀"。
2. 皮尔逊定理的模拟验证(图 11-2)
定理说的是抽样分布:"骰子均匀"成立时重复整个试验,统计量 的直方图应贴住 密度。模拟 20000 次证实:直方图与红线严丝合缝,且约有 5% 的重复落入拒绝域(红色填充)——检验水平名副其实。
3. 列联表独立性检验
1. 独立性假设
两个属性交叉分类成 表,边际频数 。独立性假设下期望频数为
统计量仍是 ,渐近 ——自由度还是"类数减约束": 个格子,减去 个独立的边际约束。
2. 二元相关数据的模拟(图 11-3)
用高斯联结生成一对相关二元数据(): 时观测频数(蓝棒)与期望(红线)处处吻合; 时对角格子的观测显著偏离期望——独立性被推翻。相关会表现为对角格子"拥挤",卡方统计量正是把这种拥挤量化。
4. KS 检验
1. 统计量
柯尔莫哥洛夫–斯米尔诺夫检验不分组,直接比较经验分布函数与理论分布函数的最大距离:
2. 与卡方检验的分工
- KS 用全部信息:卡方检验依赖分组方式(分得粗丢信息,分得细每格期望变小、渐近失效);KS 检验对整个分布函数逐点比较(图 11-4 上方面板的绿色竖线即最大距离)。
- 适用面:卡方检验对离散、连续乃至任意分组都行;KS 检验要求理论分布完全指定(参数由数据估计时需修正),且对尾部不敏感( 本来就近 0 或 1)。
3. 临界值(图 11-4 下方面板)
的渐近分布(柯尔莫哥洛夫分布)不依赖 ——分布无关。5% 临界值 ; 时约 0.175。模拟 20000 次的 直方图验证临界水平。
5. 代码
本章演示程序:src/chapter11(可执行文件 bin/Chapter11.exe,图像输出至 output/chapter11/)。列联表的"相关二元数据"由高斯联结( 再阈值切分)生成,KS 的经验分布函数为阶梯折线逐点计算。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter11/fig_11_1_goodness.ppm |
卡方拟合优度:骰子均匀性 | 图 11-1,1 节 |
output/chapter11/fig_11_2_pearson.ppm |
皮尔逊定理:卡方统计量的抽样分布 | 图 11-2,2 节 |
output/chapter11/fig_11_3_contingency.ppm |
列联表独立性:相关 vs 独立 | 图 11-3,3 节 |
output/chapter11/fig_11_4_ks.ppm |
KS 检验:最大距离与其分布 | 图 11-4,4 节 |
图 11-1(fig_11_1_goodness.ppm):掷骰 1200 次。上方面板:各面观测频数(蓝棒)与期望 200(红线)——肉眼已可见偏差;下方面板: 密度(红线)、5% 临界值 11.07(红色竖线)与本次统计量(橙色竖线)——统计量是否落入右尾决定骰子均匀与否。
图 11-2(fig_11_2_pearson.ppm):"骰子均匀"成立时重复 20000 次整个试验, 的直方图(蓝棒)贴住 密度(红线),拒绝域 (红色填充)中恰好落下约 5% 的重复——皮尔逊定理与检验水平同时得到验证。
图 11-3(fig_11_3_contingency.ppm): 的 2×2 列联表。上方面板 :观测频数(蓝棒)与期望 (红线)吻合;下方面板 (橙棒):对角格子显著超出期望——独立性假设被卡方统计量推翻。
图 11-4(fig_11_4_ks.ppm):上方面板: 的 样本的经验分布函数(蓝色阶梯)与 (红线),绿色粗竖线标出最大距离 ;下方面板:重复 20000 次的 直方图(蓝棒)、临界值 (红线)与本次 (橙色竖线)。
6. 习题
- 掷骰 1200 次得频数 ,计算 并与临界值 11.07 比较(答案:,远不显著——肉眼觉得"参差"的偏差在统计上完全正常)。
- 证明列联表的期望频数公式 是独立性下极大似然估计。
- 说明 2×2 列联表自由度为 1 的原因,并解释为何此时卡方检验等价于比例差的 检验()。
- 证明 KS 统计量只须在样本点处计算:( 为顺序统计量)。
- 把图 11-1 的骰子改为"偏骰"(某面概率加倍、其余按比例缩小),估算 的非中心参数,说明检验功效随 增大而升高。
- (编程) 修改
goodness.cpp:把掷骰次数改为 120 与 12000,观察同比例偏差下统计量按 放大——卡方检验对大样本"过敏"(统计显著不等于实际重要)。 - (编程) 仿照
contingency.cpp,取 (弱相关),观察四格频数与期望的偏离是否还能被 检出——弱信号需要大样本。
12. 方差分析与回归进阶
第八章用两个样本的 检验比较两组均值;本章处理多组均值的方差分析(ANOVA),并把第八章的回归从"拟合"推进到"推断":斜率显著吗?预测新点时误差有多大?
1. 单因素方差分析
1. 模型与变差分解
组、每组 个同方差观测:,。检验 。总变差可正交分解:
证明即逐项展开交叉积,交叉项恰为零——与第 9 章 MSE 分解同一手法。
2. F 统计量
组间均方与组内均方之比
逻辑: 下分子分母都是 的估计,比值在 1 附近; 下分子被组间差"抬升"——比值右移(图 12-1:组均值错开时,组均值到总均值的落差(绿色)相对组内散布(橙色)很大;图 12-2:备择下的 F 分布(橙点)几乎整个落在拒绝域右侧)。
3. 与 t 检验的一致性
时 :方差分析是两组比较的推广。
2. F 统计量的零分布(图 12-2)
模拟验证:(三组同均值)下重复 20000 次方差分析,F 的直方图(蓝棒)贴住 密度(红线),拒绝域(,红色填充)恰含 5%;备择(组均值 2/3/4,图 12-1 的设定)下 F 分布(橙点)大幅右移——几乎必然拒绝。方差比天然非负且右偏,这正是 F 分布的形状来源(第 6 章)。
3. 回归斜率的抽样分布与显著性
1. 斜率估计的分布
固定设计最小二乘下( 独立):
关键点: 是 的线性组合,正态性直接传递;方差 说明设计点铺得越开,斜率越准——同样的 ,集中在一点附近的设计对斜率毫无信息。
2. 显著性检验(图 12-3)
(“x 毫无作用”):把估计分布中心平移到 0。模拟 10000 次拟合, 的直方图(蓝棒)贴住理论分布 (红线); 的分布(蓝线)与红线几乎不重叠——斜率显著非零。 未知时用 替代并改用 分布(本章演示取 已知的简化设定, 检验与 检验在 时已几乎一致)。
4. 置信带与预测带
1. 两层不确定性
在 处区分两个问题:
- 估计均值 :波动来自参数估计,;
- 预测新观测 :参数估计的波动 加上 新噪声,。
预测带恒比置信带宽(多出 1 倍 ),且两者都在 处最窄、远离数据中心时呈"喇叭"张开——外推愈发不可靠(图 12-4)。
2. 与第 10 章的联系
两条带是第 10 章可信区间思想在回归中的翻版:固定 重复采样,约 95% 的拟合线会穿过置信带内的真均值;约 95% 的实际观测落入预测带。
5. 代码
本章演示程序:src/chapter12(可执行文件 bin/Chapter12.exe,图像输出至 output/chapter12/)。F 统计量由"一次抽样同时算 SSB 与 SSW"保证分解恒等;回归演示用固定设计 ()、真实模型 、。
| 文件 | 内容 | 讲义位置 |
|---|---|---|
output/chapter12/fig_12_1_anova.ppm |
单因素方差分析:变差分解 | 图 12-1,1 节 |
output/chapter12/fig_12_2_fstat.ppm |
F 统计量的零分布与功效 | 图 12-2,2 节 |
output/chapter12/fig_12_3_slope_test.ppm |
斜率的抽样分布与显著性 | 图 12-3,3 节 |
output/chapter12/fig_12_4_prediction.ppm |
置信带与预测带 | 图 12-4,4 节 |
图 12-1(fig_12_1_anova.ppm):三组各 15 个观测(、):散点(橙色,横向抖动避免重叠)、组均值(蓝色横线)、总均值(红线);绿色竖线标出组均值到总均值的落差(组间变差 SSB 的来源),散点围绕组均值的波动即 SSW——组间落差明显大于组内噪声,F 检验几乎必然显著。
图 12-2(fig_12_2_fstat.ppm):(三组同均值 3.0)下重复 20000 次:F 直方图(蓝棒)贴住 密度(红线),5% 拒绝域 (红色填充与红色竖线);备择(组均值 2/3/4)下的 F 直方图(橙点)整体远在拒绝域右侧——方差比在原假设下自然偏小,在备择下被组间差抬升。
图 12-3(fig_12_3_slope_test.ppm):、真实斜率 0.8(绿线),重复 10000 次最小二乘拟合: 直方图(蓝棒)贴住理论抽样分布 (红线); 的理论分布(蓝线,中心在 0)与红线几乎不重叠——"x 毫无作用"与数据强烈矛盾,斜率显著非零。
图 12-4(fig_12_4_prediction.ppm):拟合直线(红)与散点(灰色);绿色带为均值的 95% 置信带(中间窄两头宽的喇叭),橙色带为单个新观测的 95% 预测带(厚得多——含新噪声 )。两条带均在数据中心 处最窄:估计斜率与截距的误差在数据中心互相抵消,远离中心则同向放大——外推不可靠的几何表达。
6. 习题
- 展开证明变差分解 ,并指出交叉项为零的原因(组内残差对组内求和为零)。
- 三组各 15 个观测,、:计算 F 统计量并与 比较(答案:,高度显著)。
- 证明 时 ANOVA 的 F 检验与两样本 t 检验等价(),并说明自由度的对应关系。
- 推导 ,并据此设计"最省样本"的实验(提示:把设计点推向两端)。
- 在 处比较置信带与预测带的宽度之比(),并解释为何预测带在 时不会消失(新噪声不可消除)。
- (编程) 修改
anova.cpp:把组均值改为 ,观察组间落差与组内噪声的比例变化——ANOVA 的灵敏度取决于"信号/噪声"比,而非绝对差异。 - (编程) 仿照
prediction.cpp,把 改为 2.4(噪声加倍),观察预测带变宽而置信带只变宽 倍尺度——预测的困难本质上来自不可消除的噪声。
附录:工程组织
1. 目录结构
1 | ProbabilityTheory/ |
2. 依赖与构建
1 | cmake -S . -B build |
依赖方向自下而上:Prob(数学)→ Ppm(图形)→ 各章演示,单一流水线、无第三方库。伪随机数(xorshift64*)、正态分位数(Acklam 有理逼近)、各分布密度(lgamma 对数域计算)全部自实现,确定性种子保证全部图像可复现。
3. 图像格式
输出为二进制 PPM(P6,800×600,24 位真彩色)——无压缩、无依赖、结构最简;深色背景上的配色约定见各章图注(蓝=主体/理论,橙=模拟/观测,红=临界/参考,绿=真值/目标,灰=辅助)。
