跳转到内容

概率论与数理统计笔记

本笔记基于 《概率论与数理统计》浙大第四版(盛骤等著),梳理了概率论的基础概念、常见随机变量分布、经典公式以及基础马尔可夫链算法,旨在为机器学习和数据科学中的概率建模打下数学基础。

../../attachment/pdf/概率论与数理统计(浙大四版).pdf

  • 随机试验:具有可重复性、可在试验前确定所有可能结果、但试验前无法预知具体哪一个结果发生的实验。
  • 样本空间与事件
    • 基本事件:试验可能发生的最小单一结果。
    • 事件分类:随机事件、必然事件($\Omega$)、不可能事件($\emptyset$)。
    • 事件关系:包含($A \subset B$)、相等($A = B$)、互斥($A \cap B = \emptyset$)、对立($A = \bar{B}$)。
    • 事件运算:并($A \cup B$)、交($A \cap B$)、差($A - B$)。
  • 概率的三个基本公理
    1. 非负性:$P(A) \ge 0$
    2. 规范性:$P(\Omega) = 1$
    3. 可列可加性:对于两两互不相容的事件序列 $A_1, A_2, \dots$,有 $P(\bigcup_{i=1}^{\infty} A_i) = \sum_{i=1}^{\infty} P(A_i)$。
  • 条件概率:在事件 $B$ 发生的条件下事件 $A$ 发生的概率,表示为 $P(A|B) = \frac{P(AB)}{P(B)}$。

  • 乘法公式:$P(AB) = P(A|B)P(B)$。

  • 相互独立:若 $P(AB) = P(A)P(B)$,则称事件 $A$ 与 $B$ 相互独立。

  • 全概率公式:若整个样本空间可划分为互不相容的完备事件组 $B_1, B_2, \dots, B_n$,则对任意事件 $A$ 有:

    $$P(A) = \sum_{i=1}^n P(B_i)P(A|B_i)$$

  • 贝叶斯公式

    $$P(B_i|A) = \frac{P(B_i)P(A|B_i)}{\sum_{j=1}^n P(B_j)P(A|B_j)}$$

    • 先验概率 $P(B_i)$:在试验进行前或获得观测数据前,基于历史经验或客观事实估计的概率。
    • 后验概率 $P(B_i|A)$:已知结果 $A$ 发生后,反推导致该结果的各种原因 $B_i$ 的概率。
  • 古典型概率(等可能模型):样本空间有限且每个基本事件发生概率相等。
    • 抽样模型(有放回/无放回)。
  • 几何型概率:样本空间无限但具有几何测度(如长度、面积、体积),且基本事件落在任意子区域的概率只与该区域的测度成正比。

随机变量 $X$ 是从样本空间到实数集的映射,本质上是一个实值函数。

离散型随机变量的取值是有限或可列无限的,通常用 分布律 表达。

  • 0-1 分布 (伯努利分布):$X \sim B(1, p)$。
  • 二项分布:$X \sim B(n, p)$,表示 $n$ 次独立重复伯努利试验中成功次数的概率分布。
  • 泊松分布:$X \sim P(\lambda)$,用于描述单位时间(或单位空间)内某稀有事件发生次数的概率分布。
    • 分布律:$P(X=k) = \frac{\lambda^k e^{-\lambda}}{k!}$
  • 超几何分布:$X \sim H(N, M, n)$,表示从包含 $M$ 件次品的 $N$ 件产品中,无放回地抽取 $n$ 件,其中包含次品数的概率分布。
  • 几何分布:$X \sim Ge(p)$,表示在伯努利试验中,事件 $A$ 首次发生时已经试验的次数。
    • 分布律:$P(X=k) = (1-p)^{k-1}p, \quad k=1,2,\dots$
  • 负二项分布 (帕斯卡分布):$X \sim NB(r, p)$,表示在伯努利试验中,事件 $A$ 第 $r$ 次发生时已经试验的总次数。
    • 分布律:$P(X=k) = \binom{k-1}{r-1}p^r(1-p)^{k-r}, \quad k=r,r+1,\dots$

连续型随机变量在其取值范围内可以取任何实数值,通常用 概率密度函数 (PDF) $f(x)$ 和 累积分布函数 (CDF) $F(x) = P(X \le x)$ 表达。

  • 均匀分布:$X \sim U(a, b)$,区间内各处概率密度均等。
  • 指数分布:$X \sim E(\lambda)$,常用于模拟发生某事件的等待时间(具有无记忆性)。
    • 概率密度:$f(x) = \lambda e^{-\lambda x} \quad (x \ge 0)$
  • 正态分布 (高斯分布):$X \sim N(\mu, \sigma^2)$,自然界中最常见的分布。

马尔可夫链(Markov Chain) 是一种状态空间中从一个状态过渡到另一个状态的随机过程。其核心特性为 无后效性(马尔可夫性):未来状态的条件概率分布仅依赖于当前状态,而与过去的状态无关。