1 随机现象与样本空间

随机现象:在一定条件下,可能发生也可能不发生,具有不确定性的现象。与之对应的是确定性现象(必然发生或必然不发生)。

随机试验:对随机现象的实现和观察称为随机试验,简称试验,常用字母 $E$ 表示。随机试验有三个特点:

  1. 试验可在相同条件下重复进行;
  2. 所有可能结果是明确可知的,且不止一个;
  3. 每次试验恰好出现这些结果中的一个,但事先不能确定是哪一个。

样本空间与样本点

  • 样本点:随机试验的每个可能的基本结果,用 $\omega$ 表示。
  • 样本空间:全体样本点的集合,用 $\Omega$ 表示。
  • 有限样本空间:若试验有 $n$ 个可能结果 $\omega_1,\omega_2,\ldots,\omega_n$,则称 $\Omega=\{\omega_1,\omega_2,\ldots,\omega_n\}$ 为有限样本空间。

随机事件:样本空间的子集称为随机事件,简称事件。只含一个样本点的事件称为基本事件。必然事件是样本空间 $\Omega$ 本身,不可能事件是空集 $\varnothing$。

【例】 同时掷两颗骰子,观察点数和。样本空间为 $\Omega=\{2,3,4,5,6,7,8,9,10,11,12\}$。


2 古典概型

古典概型的两个特征

  1. 有限性:样本空间的样本点只有有限个;
  2. 等可能性:每个样本点发生的可能性相等。

古典概型概率公式:设试验 $E$ 是古典概型,样本空间 $\Omega$ 包含 $n$ 个样本点,事件 $A$ 包含其中 $k$ 个样本点,则:

$$ P(A)=\frac{k}{n}=\frac{n(A)}{n(\Omega)} $$

【例】 掷一枚均匀骰子,事件 $A$ 为“出现偶数点”,则 $P(A)=\frac{3}{6}=\frac{1}{2}$。


3 频率与概率

频率:在 $n$ 次重复试验中,事件 $A$ 发生的次数 $n_A$ 称为频数,比值 $f_n(A)=\frac{n_A}{n}$ 称为事件 $A$ 发生的频率。

频率的稳定性:大量重复试验中,事件 $A$ 的频率会稳定在某个常数附近,这个常数就是事件 $A$ 的概率 $P(A)$。试验次数越多,频率与概率差距很小的可能性越大。

频率与概率的关系

  • 频率是随机的,试验前不能确定;
  • 概率是一个确定的数,客观存在;
  • 概率是频率的理论期望值,频率是概率的近似估计。

【注意】 不能将频率等同于概率,只能用频率估计概率。


4 随机事件的独立性

独立性的定义:对于事件 $A$ 与 $B$,若

$$ P(A \cap B)=P(A)\cdot P(B) $$

则称 $A$ 与 $B$ 相互独立(简称独立)。

直观理解:事件 $A$ 是否发生不影响事件 $B$ 发生的概率,反之亦然。

独立性的性质

  • 若 $A$ 与 $B$ 独立,则 $A$ 与 $\overline{B}$、$\overline{A}$ 与 $B$、$\overline{A}$ 与 $\overline{B}$ 也相互独立;
  • 必然事件 $\Omega$、不可能事件 $\varnothing$ 与任意事件相互独立。

【辨析】 互斥事件与独立事件是不同的概念:

  • 互斥:两事件不能同时发生($P(A\cap B)=0$),如 $A$ 与 $\overline{A}$;
  • 独立:一事件发生与否不影响另一事件的概率。

5 条件概率

定义:在事件 $A$ 发生的条件下,事件 $B$ 发生的概率,记作 $P(B|A)$。

计算公式

  • 适用于古典概型:$\displaystyle P(B|A)=\frac{n(A \cap B)}{n(A)}$(缩小样本空间法)
  • 一般公式:$\displaystyle P(B|A)=\frac{P(A \cap B)}{P(A)}$,其中 $P(A)>0$

概率乘法公式

$$ P(A \cap B)=P(B|A)\cdot P(A)=P(A|B)\cdot P(B) $$

【注】 若 $A$ 与 $B$ 独立,则 $P(B|A)=P(B)$,乘法公式退化为 $P(A\cap B)=P(A)\cdot P(B)$。


6 全概率公式

全概率公式:设 $A_1,A_2,\ldots,A_n$ 是一组两两互斥的事件,且 $A_1\cup A_2\cup\ldots\cup A_n=\Omega$,$P(A_i)>0$,则对任意事件 $B\subseteq\Omega$:

$$ P(B)=\sum_{i=1}^{n}P(A_i)\cdot P(B|A_i) $$

理解:将样本空间 $\Omega$ 划分为若干互斥部分 $A_i$(“原因”),$B$ 发生的概率等于在各“原因”下发生 $B$ 的概率的加权和。

【例】 某工厂有甲、乙、丙三条生产线,产量分别占 $30\%$、$30\%$、$40\%$,次品率分别为 $1\%$、$2\%$、$3\%$。任取一件产品,求其为次品的概率。

设 $A_1,A_2,A_3$ 分别表示产品来自甲、乙、丙,$B$ 表示“次品”,则:

$$ P(B)=0.3\times0.01+0.3\times0.02+0.4\times0.03=0.021 $$

7 贝叶斯公式

先验信息与后验信息:在获得新的观测数据之前,我们对“原因” $A_i$ 已有的认知称为先验概率 $P(A_i)$;观察到结果 $B$ 发生后,我们对 $A_i$ 的认知得到更新,称为后验概率 $P(A_i|B)$。

贝叶斯公式的逻辑推理

由条件概率定义,对于事件 $A_i$ 与 $B$,有:

$$ P(A_i|B)=\frac{P(A_i\cap B)}{P(B)} $$

再由乘法公式 $P(A_i\cap B)=P(A_i)\cdot P(B|A_i)$,代入得:

$$ P(A_i|B)=\frac{P(A_i)\cdot P(B|A_i)}{P(B)} $$

而全概率公式给出 $P(B)=\displaystyle\sum_{j=1}^{n}P(A_j)\cdot P(B|A_j)$,因此得到贝叶斯公式

$$ P(A_i|B)=\frac{P(A_i)\cdot P(B|A_i)}{\displaystyle\sum_{j=1}^{n}P(A_j)\cdot P(B|A_j)} $$

公式的含义:贝叶斯公式本质上是条件概率定义 + 乘法公式 + 全概率公式的联立结果。它实现了从“由因推果”($P(B|A_i)$)到“由果溯因”($P(A_i|B)$)的逆向推理。

【例】 某种疾病在人群中发病率 $5\%$。检测方法:患者检测呈阳性概率 $90\%$,非患者检测呈阳性概率 $5\%$。若某人检测呈阳性,求其真正患病的概率。

设 $A=$“患病”,$B=$“检测阳性”。$P(A)=0.05$,$P(B|A)=0.9$,$P(B|\overline{A})=0.05$。

$$ P(A|B)=\frac{0.05\times0.9}{0.05\times0.9+0.95\times0.05}\approx0.486 $$

8 随机变量的分布与特征

8.1 分布列

随机变量:以样本空间 $\Omega$ 为定义域的函数 $X$,对每个样本点 $\omega$ 赋予一个实数 $X(\omega)$。随机变量用大写字母 $X,Y$ 等表示。

离散型随机变量:所有可能取值能一一列举出来的随机变量。

分布列:离散型随机变量 $X$ 所有可能取值 $x_1,x_2,\ldots,x_n$ 及相应概率 $p_1,p_2,\ldots,p_n$ 列成表格:

$X$$x_1$$x_2$$\ldots$$x_n$
$P$$p_1$$p_2$$\ldots$$p_n$

分布列的性质

  1. $p_i \ge 0$($i=1,2,\ldots,n$);
  2. $p_1+p_2+\ldots+p_n=1$。

【例】 抛两枚硬币,$X$ 表示正面朝上的次数。样本空间 $\Omega=\{HH,HT,TH,TT\}$,分布列为:

$X$$0$$1$$2$
$P$$\frac14$$\frac12$$\frac14$

8.2 期望与方差

数学期望(均值):反映随机变量取值的平均水平。

$$ E(X)=\sum_{i=1}^{n}x_i p_i $$

方差:反映随机变量取值相对于均值的离散程度。

$$ D(X)=\sum_{i=1}^{n}(x_i-E(X))^2 p_i $$

标准差:$\sigma(X)=\sqrt{D(X)}$

方差的拓展公式(计算常用):

$$ D(X)=E(X^2)-[E(X)]^2=\sum_{i=1}^{n}x_i^2p_i-\left(\sum_{i=1}^{n}x_i p_i\right)^2 $$

证明

$$ \begin{aligned} D(X)&=\sum_{i=1}^{n}(x_i-\mu)^2p_i \\ &=\sum_{i=1}^{n}(x_i^2-2\mu x_i+\mu^2)p_i \\ &=\sum_{i=1}^{n}x_i^2p_i-2\mu\sum_{i=1}^{n}x_i p_i+\mu^2\sum_{i=1}^{n}p_i \\ &=E(X^2)-2\mu\cdot\mu+\mu^2\cdot1 \\ &=E(X^2)-\mu^2 \end{aligned} $$

期望的性质($a,b$ 为常数):

  1. $E(aX+b)=aE(X)+b$(线性性质)
  2. $E(X+Y)=E(X)+E(Y)$(可加性)
  3. 若 $X$ 与 $Y$ 独立,则 $E(XY)=E(X)E(Y)$

方差的性质($a,b$ 为常数):

  1. $D(aX+b)=a^2D(X)$(平移不变性:$b$ 不影响方差,缩放按平方变化)
  2. $D(X)=0 \iff P(X=E(X))=1$(方差为零当且仅当 $X$ 恒为常数)
  3. 若 $X$ 与 $Y$ 独立,则 $D(X+Y)=D(X)+D(Y)$

8.3 二项分布

伯努利试验:只有两种结果(成功/失败)的试验。

$n$ 重伯努利试验:独立重复 $n$ 次伯努利试验。

二项分布:若 $X$ 表示 $n$ 重伯努利试验中成功的次数,每次成功概率为 $p$,则:

$$ P(X=k)=C_n^k p^k(1-p)^{n-k}\quad(k=0,1,2,\ldots,n) $$

记作 $X\sim B(n,p)$。

期望与方差:$E(X)=np$,$D(X)=np(1-p)$。

推导要点:二项分布可视为 $n$ 个独立同分布的 $0$-$1$ 变量之和(每个变量取 $1$ 表示成功),利用期望与方差的可加性即可得到。


8.4 超几何分布

超几何分布:从 $N$ 件产品(含 $M$ 件次品)中不放回抽取 $n$ 件,用 $X$ 表示抽到的次品数:

$$ P(X=k)=\frac{C_M^k C_{N-M}^{n-k}}{C_N^n} $$

其中 $k$ 满足:$0\le k\le M$ 且 $0\le n-k\le N-M$。

期望与方差

$$ E(X)=n\cdot\frac{M}{N} $$$$ D(X)=n\cdot\frac{M}{N}\cdot\left(1-\frac{M}{N}\right)\cdot\frac{N-n}{N-1} $$

其中 $\frac{N-n}{N-1}$ 称为有限总体校正系数。当 $N$ 很大时,校正系数 $\approx 1$,超几何分布近似为二项分布 $B\left(n,\frac{M}{N}\right)$。


8.5 正态分布

正态分布:连续型随机变量最重要的一种分布,概率密度函数为:

$$ f(x)=\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}} $$

记作 $X\sim N(\mu,\sigma^2)$,其中 $\mu$ 为均值,$\sigma$ 为标准差。

标准正态分布:$\mu=0$,$\sigma=1$,记作 $Z\sim N(0,1)$。

标准正态分布表的使用:若 $X\sim N(\mu,\sigma^2)$,则 $Z=\frac{X-\mu}{\sigma}\sim N(0,1)$,通过标准化将一般正态分布转化为标准正态分布查表。

$3\sigma$ 原则

  • $P(\mu-\sigma \le X \le \mu+\sigma) \approx 0.6826$
  • $P(\mu-2\sigma \le X \le \mu+2\sigma) \approx 0.9544$
  • $P(\mu-3\sigma \le X \le \mu+3\sigma) \approx 0.9974$

$3\sigma$ 原则的含义:正态分布的取值几乎全部($99.74\%$)落在 $[\mu-3\sigma,\mu+3\sigma]$ 范围内,超出这个范围的概率仅有约 $0.26\%$,在统计中可视为小概率事件。这一原则常用于质量控制(过程是否失控)和异常值检测。