概率论与数理统计笔记
本笔记基于 《概率论与数理统计》浙大第四版(盛骤等著),梳理了概率论的基础概念、常见随机变量分布、经典公式以及基础马尔可夫链算法,旨在为机器学习和数据科学中的概率建模打下数学基础。
2. 教材与资源
Section titled “2. 教材与资源”2.1. 本地 PDF 教材
Section titled “2.1. 本地 PDF 教材”../../attachment/pdf/概率论与数理统计(浙大四版).pdf3. 知识框架
Section titled “3. 知识框架”3.1. 基础概念
Section titled “3.1. 基础概念”- 随机试验:具有可重复性、可在试验前确定所有可能结果、但试验前无法预知具体哪一个结果发生的实验。
- 样本空间与事件:
- 基本事件:试验可能发生的最小单一结果。
- 事件分类:随机事件、必然事件($\Omega$)、不可能事件($\emptyset$)。
- 事件关系:包含($A \subset B$)、相等($A = B$)、互斥($A \cap B = \emptyset$)、对立($A = \bar{B}$)。
- 事件运算:并($A \cup B$)、交($A \cap B$)、差($A - B$)。
- 概率的三个基本公理:
- 非负性:$P(A) \ge 0$
- 规范性:$P(\Omega) = 1$
- 可列可加性:对于两两互不相容的事件序列 $A_1, A_2, \dots$,有 $P(\bigcup_{i=1}^{\infty} A_i) = \sum_{i=1}^{\infty} P(A_i)$。
3.2. 条件概率与核心公式
Section titled “3.2. 条件概率与核心公式”-
条件概率:在事件 $B$ 发生的条件下事件 $A$ 发生的概率,表示为 $P(A|B) = \frac{P(AB)}{P(B)}$。
-
乘法公式:$P(AB) = P(A|B)P(B)$。
-
相互独立:若 $P(AB) = P(A)P(B)$,则称事件 $A$ 与 $B$ 相互独立。
-
全概率公式:若整个样本空间可划分为互不相容的完备事件组 $B_1, B_2, \dots, B_n$,则对任意事件 $A$ 有:
$$P(A) = \sum_{i=1}^n P(B_i)P(A|B_i)$$
-
贝叶斯公式:
$$P(B_i|A) = \frac{P(B_i)P(A|B_i)}{\sum_{j=1}^n P(B_j)P(A|B_j)}$$
- 先验概率 $P(B_i)$:在试验进行前或获得观测数据前,基于历史经验或客观事实估计的概率。
- 后验概率 $P(B_i|A)$:已知结果 $A$ 发生后,反推导致该结果的各种原因 $B_i$ 的概率。
3.3. 概率模型
Section titled “3.3. 概率模型”- 古典型概率(等可能模型):样本空间有限且每个基本事件发生概率相等。
- 抽样模型(有放回/无放回)。
- 几何型概率:样本空间无限但具有几何测度(如长度、面积、体积),且基本事件落在任意子区域的概率只与该区域的测度成正比。
4. 随机变量及其分布
Section titled “4. 随机变量及其分布”随机变量 $X$ 是从样本空间到实数集的映射,本质上是一个实值函数。
4.1. 离散型随机变量
Section titled “4.1. 离散型随机变量”离散型随机变量的取值是有限或可列无限的,通常用 分布律 表达。
- 0-1 分布 (伯努利分布):$X \sim B(1, p)$。
- 二项分布:$X \sim B(n, p)$,表示 $n$ 次独立重复伯努利试验中成功次数的概率分布。
- 泊松分布:$X \sim P(\lambda)$,用于描述单位时间(或单位空间)内某稀有事件发生次数的概率分布。
- 分布律:$P(X=k) = \frac{\lambda^k e^{-\lambda}}{k!}$
- 超几何分布:$X \sim H(N, M, n)$,表示从包含 $M$ 件次品的 $N$ 件产品中,无放回地抽取 $n$ 件,其中包含次品数的概率分布。
- 几何分布:$X \sim Ge(p)$,表示在伯努利试验中,事件 $A$ 首次发生时已经试验的次数。
- 分布律:$P(X=k) = (1-p)^{k-1}p, \quad k=1,2,\dots$
- 负二项分布 (帕斯卡分布):$X \sim NB(r, p)$,表示在伯努利试验中,事件 $A$ 第 $r$ 次发生时已经试验的总次数。
- 分布律:$P(X=k) = \binom{k-1}{r-1}p^r(1-p)^{k-r}, \quad k=r,r+1,\dots$
4.2. 连续型随机变量
Section titled “4.2. 连续型随机变量”连续型随机变量在其取值范围内可以取任何实数值,通常用 概率密度函数 (PDF) $f(x)$ 和 累积分布函数 (CDF) $F(x) = P(X \le x)$ 表达。
- 均匀分布:$X \sim U(a, b)$,区间内各处概率密度均等。
- 指数分布:$X \sim E(\lambda)$,常用于模拟发生某事件的等待时间(具有无记忆性)。
- 概率密度:$f(x) = \lambda e^{-\lambda x} \quad (x \ge 0)$
- 正态分布 (高斯分布):$X \sim N(\mu, \sigma^2)$,自然界中最常见的分布。
5. 算法:马尔可夫链
Section titled “5. 算法:马尔可夫链”马尔可夫链(Markov Chain) 是一种状态空间中从一个状态过渡到另一个状态的随机过程。其核心特性为 无后效性(马尔可夫性):未来状态的条件概率分布仅依赖于当前状态,而与过去的状态无关。
6. 参考资料
Section titled “6. 参考资料”- 阮一峰的科普博客:泊松分布与指数分布