1 总体与样本(待补充)
2 抽样方法
抽样方法是连接总体与样本的桥梁。选择合理的抽样方式,是保证样本代表性、控制抽样误差的关键。沪教版教材主要介绍了三种基本的概率抽样方法。
2.1 简单随机抽样
2.1.1 定义
简单随机抽样(simple random sampling),又称纯随机抽样,是指从容量为 $N$ 的总体中,不放回地抽取容量为 $n$ 的样本,使得每一个容量为 $n$ 的样本被抽中的概率相等的一种抽样方法。
简单随机抽样是最基本、最直观的概率抽样方法,是理解其他抽样方法的基础。
2.1.2 特点
- 等概率性:总体中每个个体被抽中的概率相同,均为 $\frac{n}{N}$;
- 独立性:每次抽取时,各个个体被抽到的可能性不受其他个体影响;
- 不放回抽样:通常采用不放回方式,已抽中的个体不再放回总体。
2.1.3 优缺点
| 优点 | 缺点 |
|---|---|
| 原理简单直观,理论基础完善 | 总体容量$N$ 较大时,编号和抽样工作繁琐 |
| 完全排除主观因素干扰 | 样本分布可能较分散,调查实施不便 |
| 是其他抽样方法的基础 | 总体内差异较大时,样本代表性可能不足 |
2.1.4 适用情形
- 总体容量 $N$ 不大;
- 总体内个体差异较小;
- 有完整的抽样框(即总体所有个体的名单)。
2.2 分层抽样
2.2.1 定义
分层抽样(stratified sampling),又称类型抽样。它是先将总体按某种特征分成若干个互不重叠的部分(称为“层”),然后在每一层中独立地进行简单随机抽样,最后将各层样本合并,组成总的样本。
核心思想:“分而治之”——让层内个体尽可能相似(同质性高),层间差异尽可能大(异质性高),从而提高样本代表性。
2.2.2 步骤
- 分层:根据与研究目标密切相关的特征(如性别、年龄、年级等)将总体划分成若干层;
- 定比:确定各层应抽取的样本量。最常用的方法是分层比例抽样,即各层样本数与该层总体数的比值相等:
其中 $N_i$ 为第 $i$ 层的个体数,$n_i$ 为第 $i$ 层应抽取的样本数,$N$ 为总体容量,$n$ 为样本容量。
- 抽样:在各层内分别用简单随机抽样(或系统抽样)抽取个体;
- 整合:将各层抽出的个体合并,组成最终样本。
2.2.3 优缺点
| 优点 | 缺点 |
|---|---|
| 样本代表性好,抽样误差较小 | 需要事先掌握总体的分层信息,抽样框更复杂 |
| 可以同时分析总体和子群体的特征 | 分层变量选择不当会严重影响效果 |
| 能保证各层(包括小群体)都有样本入选 | 操作和计算比简单随机抽样复杂 |
2.2.4 适用情形
- 总体由差异明显的几部分组成(如按性别、年龄段、城乡划分);
- 需要同时了解总体和各个子群体的特征;
- 希望提高样本代表性、降低抽样误差。
典型例题:某单位职工500人,不到35岁125人,35~49岁280人,50岁以上95人。现要抽取100人进行身体状况调查。由于年龄与身体状况相关,应采用分层抽样。各层按比例抽取:
- 不到35岁:$125 \times \frac{100}{500} = 25$ 人
- 35~49岁:$280 \times \frac{100}{500} = 56$ 人
- 50岁以上:$95 \times \frac{100}{500} = 19$ 人
2.3 随机数表法
2.3.1 定义
随机数表法是利用随机数表(random number table)来抽取样本的一种具体操作方式。随机数表是由 $0 \sim 9$ 的数码随机排列而成的表格,表中每个位置出现哪个数字的概率均等,且各位置之间相互独立。
随机数表法是简单随机抽样在实际操作中的常用工具,尤其适用于总体容量中等、手工抽签不便的情形。
2.3.2 操作步骤
- 编号:将总体中的所有个体统一编号,编号位数根据总体容量 $N$ 确定。例如 $N \leq 99$ 用两位数编号,$N \leq 999$ 用三位数编号;
- 确定起点:在随机数表上任意确定一个起始位置(某行某列);
- 确定方向和规则:规定读数的方向(如从左到右、从上到下等),按固定规则逐个读取号码;
- 选号:读取的号码若在编号范围内,则对应个体入选样本;若超出范围或重复出现(不重复抽样时),则跳过,继续读取,直到抽满所需样本容量 $n$ 为止。
2.3.3 重复抽样与不重复抽样
- 重复抽样:已抽中的号码可再次被选中,允许同一单位多次入选;
- 不重复抽样(通常采用):已抽中的号码再次出现时跳过,保证每个个体至多入选一次。
操作示例:从95户居民中抽取10户,编号为01~95,从随机数表某行某列开始读数:
依次读得:37、38、63、69、64、73、66、14、69、16…
其中69重复出现(重复抽样情形)。若采用不重复抽样,则跳过第二个69,继续往后读取,直到抽满10个不重复号码为止。
2.3.4 适用情形
- 总体容量不大到中等(编号和查表工作量可接受);
- 需要完全随机、排除主观因素的抽样。
3 整理数据
收集到的原始数据通常是杂乱无章的,需要通过整理、分组和图表化,将数据的分布特征直观地呈现出来。本节介绍两种常用的数据整理工具:频率分布直方图和茎叶图。
3.1 频率分布直方图
3.1.1 定义
频率分布直方图(frequency distribution histogram)是以组距为底边长、以频率/组距(即频率密度)为高绘制的一系列矩形统计图。它用于直观展示一组数据的分布形态——数据集中在哪个区间、在哪个区间分布稀疏。
注意:直方图纵轴是“频率/组距”,所以各矩形面积 = 频率,所有矩形面积之和等于 1。
3.1.2 绘制步骤
第1步:求极差 计算数据的最大值与最小值之差,确定数据的变动范围。
$$ \text{极差} = x_{\max} - x_{\min} $$第2步:决定组距与组数
- 组距(class interval):每个小区间的长度,通常取 2、5、10 的倍数以便于计算;
- 组数:将数据分成多少组。常用经验公式:组数 $k \approx 1 + \log_2 n$($n$ 为样本容量),一般取 $5 \sim 12$ 组为宜;
- 三者关系:$\text{组数} = \left\lceil \dfrac{\text{极差}}{\text{组距}} \right\rceil$(向上取整)。
第3步:确定分点(组限)
- 确定各组的上限和下限,通常采用左闭右开区间 $[a, b)$,以免数据落在边界上造成归属不清;
- 为简化操作,常使分点比数据多一位小数,避免数据恰好落在分点上。
第4步:列频率分布表
- 频数(frequency):落在该组内的数据个数;
- 频率(relative frequency):频数与样本容量的比值,即 $\text{频率} = \dfrac{\text{频数}}{n}$;
- 频率密度(频率/组距):$\text{频率密度} = \dfrac{\text{频率}}{\text{组距}}$(直方图的纵轴高度)。
| 分组 | 频数统计 | 频数 | 频率 | 频率/组距 |
|---|---|---|---|---|
| $[a_1, a_2)$ | 正正 | 10 | 0.20 | 0.10 |
| $[a_2, a_3)$ | 正 | 5 | 0.10 | 0.05 |
| $\cdots$ | $\cdots$ | $\cdots$ | $\cdots$ | $\cdots$ |
| 合计 | — | $n$ | 1.00 | — |
第5步:绘制直方图
- 横轴:表示数据的分组区间;
- 纵轴:表示频率/组距(频率密度);
- 以各组区间为底边,以频率密度为高,画出各矩形。
3.1.3 直方图的性质
性质1:每个小矩形的面积 = 组距 $\times$ 频率密度 = 该组的频率。
性质2:所有小矩形的面积之和 = $\sum$(各矩形面积) = $\sum$(各组频率) = 1。
性质3:在频率分布直方图中,众数约为最高矩形中点对应的数值;中位数约为使左右两侧面积相等(各占 0.5)的横坐标。
3.1.4 与条形图的区别
| 对比维度 | 频率分布直方图 | 条形图 |
|---|---|---|
| 横轴 | 数值区间的连续划分 | 分类变量(离散的类别) |
| 矩形宽度 | 有意义(表示组距) | 无数值意义,等宽 |
| 矩形高度 | 频率/组距(面积 = 频率) | 频数或频率本身 |
| 矩形间 | 连续无间隙 | 有间隙 |
3.2 茎叶图
3.2.1 定义
茎叶图(stem-and-leaf plot)是一种将数据按数位进行分拆整理的统计图。它将每个数据拆分为茎(高位部分)和叶(低位部分),用茎表示共同的部分,用叶表示个体的细微差别。
茎叶图既能显示数据的具体取值(不损失原始数据信息),又能反映数据的分布形态,是兼具统计和整理功能的有效工具。
3.2.2 作图步骤
第1步:确定“茎”和“叶”的分位(通常以十位及更高位为茎,个位为叶)。
第2步:将数据按从小到大排序后,按茎分组,将每个数据的“叶”写在对应茎的右侧。
第3步:在茎的左侧记录频数,通常按从小到大的顺序排列茎,并将相同茎的叶按从小到大排列。
作图示例: 现有 10 名学生某次测验成绩(满分 100):
$$ 78,\ 82,\ 85,\ 90,\ 73,\ 88,\ 86,\ 79,\ 94,\ 81 $$绘制茎叶图(茎为十位,叶为个位):
| 茎(十位) | 叶(个位) | 频数 |
|---|---|---|
| 7 | 3 8 9 | 3 |
| 8 | 1 2 5 6 8 | 5 |
| 9 | 0 4 | 2 |
读法:第一行表示 $73, 78, 79$ 三个数据,第二行表示 $81, 82, 85, 86, 88$,第三行表示 $90, 94$。
3.2.3 茎叶图的特点
优点:
- 保留原始数据:所有数据的具体数值一目了然,不像直方图那样丢失细节;
- 便于排序和查找:叶按大小排列后,容易找到中位数、众数、极值等;
- 适合小样本:尤其适用于样本容量 $n \leq 50$ 的情形,手工整理方便;
- 直观显示分布:茎叶图的“叶”的疏密程度等同于直方图,可直观看出数据的集中趋势和分散情况。
局限:
- 样本容量较大时,叶子过长,不便阅读;
- 不便于多组数据直接对比(但可以绘制背靠背茎叶图来对比两组数据)。
3.2.4 补充:背靠背茎叶图
当需要比较两组数据的分布时,可以绘制背靠背茎叶图:将两组数据的叶分别写在茎的左右两侧(通常左侧按从小到大排列,右侧也按从小到大排列),便于直观对比两组数据的集中位置和离散程度。
示例:比较甲、乙两组学生的成绩
| 甲组叶 | 茎 | 乙组叶 |
|---|---|---|
| 9 8 3 | 7 | 0 5 |
| 6 5 2 1 | 8 | 1 3 7 8 |
| 4 0 | 9 | 2 6 |
4 统计指标
4.1 平均数
4.1.1 具体数据的平均事
设一组样本数据为 $x_1, x_2, \ldots, x_n$,样本平均数为 $\bar{x}$,则
$$ \bar{x} = \frac{x_1 + x_2 + \cdots + x_n}{n} = \frac{1}{n}\sum_{i=1}^{n} x_i $$4.1.2 频率分布直方图求平均数
取每一段的中点值作为该段的所有数据的值,结合每段的频率求解平均数。
设一组样本绘制成频率分布直方图后,每段的中点值和频率如下所示:
| 中点值 | $x_1$ | $x_2$ | … | $x_n$ |
|---|---|---|---|---|
| 频率 | $p_1$ | $p_2$ | $p_n$ | |
| 则有均值$\bar{x}$: |
4.2 极差
极差(range),又称全距,是一组数据的最大值与最小值之差,反映一组数据的变动幅度。
$$ \text{极差} = \text{最大值} - \text{最小值} $$4.3 百分位数
4.3.1 定义
一组数据的第 $p$ 百分位数是这样一个值 $p$,它使得这组数据中至少有 $p\%$ 的数据小于或等于这个值,且至少有 $(100-p)\%$ 的数据大于或等于这个值。
4.3.2 计算方法
(1)具体数据 计算一组 $n$ 个数据的第 $p$ 百分位数的步骤如下:
第1步:将原始数据按从小到大排列。
第2步:计算 $i = n \times p\%$。
第3步:判断结果:
- 若 $i$ 不是整数,而大于 $i$ 的相邻整数为 $j$,则第 $p$ 百分位数为第 $j$ 项数据;
- 若 $i$ 是整数,则第 $p$ 百分位数为第 $i$ 项与第 $(i+1)$ 项数据的平均数。
(2)频率分布直方图 前置:假设数据在每一段内均匀分布。
步骤:
第1步:确定第$p$百分位数所在段,并确定该段的起始值$a$,还有面积$S_{\text{所在段}}$
第2步:计算出所在段前面所有段的面积和$S_{\text{和}}$
第$p$百分位数为
$$ a+\frac{p\%-S_{\text{和}}}{S_{\text{所在段}}}* \text{组距} $$4.4 方差与标准差
.4.1 定义 方差(variance)是各个数据与平均数之差的平方的平均数,描述一组数据偏离平均数的程度;标准差(standard deviation)是方差的算术平方根。
4.4.2 计算公式
设一组数据为 $x_1, x_2, \ldots, x_n$,平均数为 $\bar{x}$:
样本方差 $s^2$:
$$ s^2 = \frac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})^2 $$样本标准差 $s$:
$$ s = \sqrt{\frac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})^2} = \sqrt{s^2} $$注意:方差(标准差)越大,说明数据的波动越大,越不稳定;反之,方差(标准差)越小,数据越集中、越稳定。
4.4.3 简化计算公式
方差也可用如下公式计算(便于手算或编程):
$$ s^2 = \frac{1}{n}\sum_{i=1}^{n} x_i^2 - \bar{x}^2 $$4.4.4 统计意义
- 方差和标准差是描述数据离散程度最常用的指标;
- 与极差相比,方差利用了每一个数据的信息,更加全面可靠;
- 标准差的单位与数据本身一致,便于实际解释。