1 总体与样本(待补充)

2 抽样方法

抽样方法是连接总体与样本的桥梁。选择合理的抽样方式,是保证样本代表性、控制抽样误差的关键。沪教版教材主要介绍了三种基本的概率抽样方法。


2.1 简单随机抽样

2.1.1 定义

简单随机抽样(simple random sampling),又称纯随机抽样,是指从容量为 $N$ 的总体中,不放回地抽取容量为 $n$ 的样本,使得每一个容量为 $n$ 的样本被抽中的概率相等的一种抽样方法。

简单随机抽样是最基本、最直观的概率抽样方法,是理解其他抽样方法的基础。

2.1.2 特点

  • 等概率性:总体中每个个体被抽中的概率相同,均为 $\frac{n}{N}$;
  • 独立性:每次抽取时,各个个体被抽到的可能性不受其他个体影响;
  • 不放回抽样:通常采用不放回方式,已抽中的个体不再放回总体。

2.1.3 优缺点

优点缺点
原理简单直观,理论基础完善总体容量$N$ 较大时,编号和抽样工作繁琐
完全排除主观因素干扰样本分布可能较分散,调查实施不便
是其他抽样方法的基础总体内差异较大时,样本代表性可能不足

2.1.4 适用情形

  • 总体容量 $N$ 不大;
  • 总体内个体差异较小;
  • 有完整的抽样框(即总体所有个体的名单)。

2.2 分层抽样

2.2.1 定义

分层抽样(stratified sampling),又称类型抽样。它是先将总体按某种特征分成若干个互不重叠的部分(称为“层”),然后在每一层中独立地进行简单随机抽样,最后将各层样本合并,组成总的样本。

核心思想“分而治之”——让层内个体尽可能相似(同质性高),层间差异尽可能大(异质性高),从而提高样本代表性。

2.2.2 步骤

  1. 分层:根据与研究目标密切相关的特征(如性别、年龄、年级等)将总体划分成若干层;
  2. 定比:确定各层应抽取的样本量。最常用的方法是分层比例抽样,即各层样本数与该层总体数的比值相等:
$$ \frac{n_1}{N_1} = \frac{n_2}{N_2} = \cdots = \frac{n_k}{N_k} = \frac{n}{N} $$

其中 $N_i$ 为第 $i$ 层的个体数,$n_i$ 为第 $i$ 层应抽取的样本数,$N$ 为总体容量,$n$ 为样本容量。

  1. 抽样:在各层内分别用简单随机抽样(或系统抽样)抽取个体;
  2. 整合:将各层抽出的个体合并,组成最终样本。

2.2.3 优缺点

优点缺点
样本代表性好,抽样误差较小需要事先掌握总体的分层信息,抽样框更复杂
可以同时分析总体和子群体的特征分层变量选择不当会严重影响效果
能保证各层(包括小群体)都有样本入选操作和计算比简单随机抽样复杂

2.2.4 适用情形

  • 总体由差异明显的几部分组成(如按性别、年龄段、城乡划分);
  • 需要同时了解总体和各个子群体的特征;
  • 希望提高样本代表性、降低抽样误差。

典型例题:某单位职工500人,不到35岁125人,35~49岁280人,50岁以上95人。现要抽取100人进行身体状况调查。由于年龄与身体状况相关,应采用分层抽样。各层按比例抽取:

  • 不到35岁:$125 \times \frac{100}{500} = 25$ 人
  • 35~49岁:$280 \times \frac{100}{500} = 56$ 人
  • 50岁以上:$95 \times \frac{100}{500} = 19$ 人

2.3 随机数表法

2.3.1 定义

随机数表法是利用随机数表(random number table)来抽取样本的一种具体操作方式。随机数表是由 $0 \sim 9$ 的数码随机排列而成的表格,表中每个位置出现哪个数字的概率均等,且各位置之间相互独立。

随机数表法是简单随机抽样在实际操作中的常用工具,尤其适用于总体容量中等、手工抽签不便的情形。

2.3.2 操作步骤

  1. 编号:将总体中的所有个体统一编号,编号位数根据总体容量 $N$ 确定。例如 $N \leq 99$ 用两位数编号,$N \leq 999$ 用三位数编号;
  2. 确定起点:在随机数表上任意确定一个起始位置(某行某列);
  3. 确定方向和规则:规定读数的方向(如从左到右、从上到下等),按固定规则逐个读取号码;
  4. 选号:读取的号码若在编号范围内,则对应个体入选样本;若超出范围或重复出现(不重复抽样时),则跳过,继续读取,直到抽满所需样本容量 $n$ 为止。

2.3.3 重复抽样与不重复抽样

  • 重复抽样:已抽中的号码可再次被选中,允许同一单位多次入选;
  • 不重复抽样(通常采用):已抽中的号码再次出现时跳过,保证每个个体至多入选一次。

操作示例:从95户居民中抽取10户,编号为01~95,从随机数表某行某列开始读数:

依次读得:37、38、63、69、64、73、66、14、69、16…

其中69重复出现(重复抽样情形)。若采用不重复抽样,则跳过第二个69,继续往后读取,直到抽满10个不重复号码为止。

2.3.4 适用情形

  • 总体容量不大到中等(编号和查表工作量可接受);
  • 需要完全随机、排除主观因素的抽样。

3 整理数据

收集到的原始数据通常是杂乱无章的,需要通过整理、分组和图表化,将数据的分布特征直观地呈现出来。本节介绍两种常用的数据整理工具:频率分布直方图茎叶图


3.1 频率分布直方图

3.1.1 定义

频率分布直方图(frequency distribution histogram)是以组距为底边长、以频率/组距(即频率密度)为高绘制的一系列矩形统计图。它用于直观展示一组数据的分布形态——数据集中在哪个区间、在哪个区间分布稀疏。

注意:直方图纵轴是“频率/组距”,所以各矩形面积 = 频率,所有矩形面积之和等于 1。

3.1.2 绘制步骤

第1步:求极差 计算数据的最大值与最小值之差,确定数据的变动范围。

$$ \text{极差} = x_{\max} - x_{\min} $$

第2步:决定组距与组数

  • 组距(class interval):每个小区间的长度,通常取 2、5、10 的倍数以便于计算;
  • 组数:将数据分成多少组。常用经验公式:组数 $k \approx 1 + \log_2 n$($n$ 为样本容量),一般取 $5 \sim 12$ 组为宜;
  • 三者关系:$\text{组数} = \left\lceil \dfrac{\text{极差}}{\text{组距}} \right\rceil$(向上取整)。

第3步:确定分点(组限)

  • 确定各组的上限下限,通常采用左闭右开区间 $[a, b)$,以免数据落在边界上造成归属不清;
  • 为简化操作,常使分点比数据多一位小数,避免数据恰好落在分点上。

第4步:列频率分布表

  • 频数(frequency):落在该组内的数据个数;
  • 频率(relative frequency):频数与样本容量的比值,即 $\text{频率} = \dfrac{\text{频数}}{n}$;
  • 频率密度(频率/组距):$\text{频率密度} = \dfrac{\text{频率}}{\text{组距}}$(直方图的纵轴高度)。
分组频数统计频数频率频率/组距
$[a_1, a_2)$正正100.200.10
$[a_2, a_3)$50.100.05
$\cdots$$\cdots$$\cdots$$\cdots$$\cdots$
合计$n$1.00

第5步:绘制直方图

  • 横轴:表示数据的分组区间;
  • 纵轴:表示频率/组距(频率密度);
  • 以各组区间为底边,以频率密度为高,画出各矩形。

3.1.3 直方图的性质

性质1:每个小矩形的面积 = 组距 $\times$ 频率密度 = 该组的频率

性质2:所有小矩形的面积之和 = $\sum$(各矩形面积) = $\sum$(各组频率) = 1

性质3:在频率分布直方图中,众数约为最高矩形中点对应的数值;中位数约为使左右两侧面积相等(各占 0.5)的横坐标。

3.1.4 与条形图的区别

对比维度频率分布直方图条形图
横轴数值区间的连续划分分类变量(离散的类别)
矩形宽度有意义(表示组距)无数值意义,等宽
矩形高度频率/组距(面积 = 频率)频数或频率本身
矩形间连续无间隙有间隙

3.2 茎叶图

3.2.1 定义

茎叶图(stem-and-leaf plot)是一种将数据按数位进行分拆整理的统计图。它将每个数据拆分为(高位部分)和(低位部分),用茎表示共同的部分,用叶表示个体的细微差别。

茎叶图既能显示数据的具体取值(不损失原始数据信息),又能反映数据的分布形态,是兼具统计和整理功能的有效工具。

3.2.2 作图步骤

第1步:确定“茎”和“叶”的分位(通常以十位及更高位为茎,个位为叶)。

第2步:将数据按从小到大排序后,按茎分组,将每个数据的“叶”写在对应茎的右侧。

第3步:在茎的左侧记录频数,通常按从小到大的顺序排列茎,并将相同茎的叶按从小到大排列。

作图示例: 现有 10 名学生某次测验成绩(满分 100):

$$ 78,\ 82,\ 85,\ 90,\ 73,\ 88,\ 86,\ 79,\ 94,\ 81 $$

绘制茎叶图(茎为十位,叶为个位):

茎(十位)叶(个位)频数
73 8 93
81 2 5 6 85
90 42

读法:第一行表示 $73, 78, 79$ 三个数据,第二行表示 $81, 82, 85, 86, 88$,第三行表示 $90, 94$。

3.2.3 茎叶图的特点

优点

  • 保留原始数据:所有数据的具体数值一目了然,不像直方图那样丢失细节;
  • 便于排序和查找:叶按大小排列后,容易找到中位数、众数、极值等;
  • 适合小样本:尤其适用于样本容量 $n \leq 50$ 的情形,手工整理方便;
  • 直观显示分布:茎叶图的“叶”的疏密程度等同于直方图,可直观看出数据的集中趋势和分散情况。

局限

  • 样本容量较大时,叶子过长,不便阅读;
  • 不便于多组数据直接对比(但可以绘制背靠背茎叶图来对比两组数据)。

3.2.4 补充:背靠背茎叶图

当需要比较两组数据的分布时,可以绘制背靠背茎叶图:将两组数据的叶分别写在茎的左右两侧(通常左侧按从小到大排列,右侧也按从小到大排列),便于直观对比两组数据的集中位置和离散程度。

示例:比较甲、乙两组学生的成绩

甲组叶乙组叶
9 8 370 5
6 5 2 181 3 7 8
4 092 6

4 统计指标

4.1 平均数

4.1.1 具体数据的平均事

设一组样本数据为 $x_1, x_2, \ldots, x_n$,样本平均数为 $\bar{x}$,则

$$ \bar{x} = \frac{x_1 + x_2 + \cdots + x_n}{n} = \frac{1}{n}\sum_{i=1}^{n} x_i $$

4.1.2 频率分布直方图求平均数

取每一段的中点值作为该段的所有数据的值,结合每段的频率求解平均数。

设一组样本绘制成频率分布直方图后,每段的中点值和频率如下所示:

中点值$x_1$$x_2$$x_n$
频率$p_1$$p_2$$p_n$
则有均值$\bar{x}$:
$$ \bar{x}=x_1p_1+x_2p_2+...x_np_n= \sum_{i=1}^{n}{x_ip_i} $$

4.2 极差

极差(range),又称全距,是一组数据的最大值与最小值之差,反映一组数据的变动幅度

$$ \text{极差} = \text{最大值} - \text{最小值} $$

4.3 百分位数

4.3.1 定义

一组数据的第 $p$ 百分位数是这样一个值 $p$,它使得这组数据中至少有 $p\%$ 的数据小于或等于这个值,且至少有 $(100-p)\%$ 的数据大于或等于这个值

4.3.2 计算方法

(1)具体数据 计算一组 $n$ 个数据的第 $p$ 百分位数的步骤如下:

第1步:将原始数据按从小到大排列。

第2步:计算 $i = n \times p\%$。

第3步:判断结果:

  • 若 $i$ 不是整数,而大于 $i$ 的相邻整数为 $j$,则第 $p$ 百分位数为第 $j$ 项数据;
  • 若 $i$ 是整数,则第 $p$ 百分位数为第 $i$ 项与第 $(i+1)$ 项数据的平均数

(2)频率分布直方图 前置:假设数据在每一段内均匀分布。

步骤

第1步:确定第$p$百分位数所在段,并确定该段的起始值$a$,还有面积$S_{\text{所在段}}$

第2步:计算出所在段前面所有段的面积和$S_{\text{和}}$

第$p$百分位数为

$$ a+\frac{p\%-S_{\text{和}}}{S_{\text{所在段}}}* \text{组距} $$

4.4 方差与标准差

.4.1 定义 方差(variance)是各个数据与平均数之差的平方的平均数,描述一组数据偏离平均数的程度标准差(standard deviation)是方差的算术平方根

4.4.2 计算公式

设一组数据为 $x_1, x_2, \ldots, x_n$,平均数为 $\bar{x}$:

样本方差 $s^2$:

$$ s^2 = \frac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})^2 $$

样本标准差 $s$:

$$ s = \sqrt{\frac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})^2} = \sqrt{s^2} $$

注意:方差(标准差)越大,说明数据的波动越大,越不稳定;反之,方差(标准差)越小,数据越集中、越稳定。

4.4.3 简化计算公式

方差也可用如下公式计算(便于手算或编程):

$$ s^2 = \frac{1}{n}\sum_{i=1}^{n} x_i^2 - \bar{x}^2 $$

4.4.4 统计意义

  • 方差和标准差是描述数据离散程度最常用的指标;
  • 与极差相比,方差利用了每一个数据的信息,更加全面可靠;
  • 标准差的单位与数据本身一致,便于实际解释。