<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>统计 on 数学之家</title><link>https://www.ydlxsx.top/tags/%E7%BB%9F%E8%AE%A1/</link><description>Recent content in 统计 on 数学之家</description><generator>Hugo</generator><language>zh-CN</language><copyright>苏ICP备2026047757号 · 苏公网安备32082902023086号</copyright><lastBuildDate>Mon, 03 Aug 2026 09:15:27 +0800</lastBuildDate><atom:link href="https://www.ydlxsx.top/tags/%E7%BB%9F%E8%AE%A1/index.xml" rel="self" type="application/rss+xml"/><item><title>统计</title><link>https://www.ydlxsx.top/archives/%E7%BB%9F%E8%AE%A1/</link><pubDate>Mon, 03 Aug 2026 09:15:27 +0800</pubDate><guid>https://www.ydlxsx.top/archives/%E7%BB%9F%E8%AE%A1/</guid><description>总体与样本（待补充） · 抽样方法 · 整理数据 · 统计指标</description><content:encoded><![CDATA[<h2 id="1-总体与样本待补充">1 总体与样本（待补充）</h2>
<h2 id="2-抽样方法">2 抽样方法</h2>
<p>抽样方法是连接总体与样本的桥梁。选择合理的抽样方式，是保证样本代表性、控制抽样误差的关键。沪教版教材主要介绍了三种基本的概率抽样方法。</p>
<hr>
<h3 id="21-简单随机抽样">2.1 简单随机抽样</h3>
<h4 id="211-定义">2.1.1 定义</h4>
<p><strong>简单随机抽样</strong>（simple random sampling），又称纯随机抽样，是指从容量为 $N$ 的总体中，<strong>不放回</strong>地抽取容量为 $n$ 的样本，使得<strong>每一个容量为 $n$ 的样本被抽中的概率相等</strong>的一种抽样方法。</p>
<blockquote>
<p>简单随机抽样是最基本、最直观的概率抽样方法，是理解其他抽样方法的基础。</p>
</blockquote>
<h4 id="212-特点">2.1.2 特点</h4>
<ul>
<li><strong>等概率性</strong>：总体中每个个体被抽中的概率相同，均为 $\frac{n}{N}$；</li>
<li><strong>独立性</strong>：每次抽取时，各个个体被抽到的可能性不受其他个体影响；</li>
<li><strong>不放回抽样</strong>：通常采用不放回方式，已抽中的个体不再放回总体。</li>
</ul>
<h4 id="213-优缺点">2.1.3 优缺点</h4>
<table>
	<thead>
			<tr>
					<th>优点</th>
					<th>缺点</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>原理简单直观，理论基础完善</td>
					<td>总体容量$N$ 较大时，编号和抽样工作繁琐</td>
			</tr>
			<tr>
					<td>完全排除主观因素干扰</td>
					<td>样本分布可能较分散，调查实施不便</td>
			</tr>
			<tr>
					<td>是其他抽样方法的基础</td>
					<td>总体内差异较大时，样本代表性可能不足</td>
			</tr>
	</tbody>
</table>
<h4 id="214-适用情形">2.1.4 适用情形</h4>
<ul>
<li>总体容量 $N$ 不大；</li>
<li>总体内个体差异较小；</li>
<li>有完整的抽样框（即总体所有个体的名单）。</li>
</ul>
<hr>
<h3 id="22-分层抽样">2.2 分层抽样</h3>
<h4 id="221-定义">2.2.1 定义</h4>
<p><strong>分层抽样</strong>（stratified sampling），又称类型抽样。它是先将总体按某种特征分成若干个<strong>互不重叠</strong>的部分（称为“层”），然后在每一层中<strong>独立地</strong>进行简单随机抽样，最后将各层样本合并，组成总的样本。</p>
<p><strong>核心思想</strong>：<strong>“分而治之”</strong>——让层内个体尽可能相似（同质性高），层间差异尽可能大（异质性高），从而提高样本代表性。</p>
<h4 id="222-步骤">2.2.2 步骤</h4>
<ol>
<li><strong>分层</strong>：根据与研究目标密切相关的特征（如性别、年龄、年级等）将总体划分成若干层；</li>
<li><strong>定比</strong>：确定各层应抽取的样本量。最常用的方法是<strong>分层比例抽样</strong>，即各层样本数与该层总体数的比值相等：</li>
</ol>
$$
\frac{n_1}{N_1} = \frac{n_2}{N_2} = \cdots = \frac{n_k}{N_k} = \frac{n}{N}
$$<p>其中 $N_i$ 为第 $i$ 层的个体数，$n_i$ 为第 $i$ 层应抽取的样本数，$N$ 为总体容量，$n$ 为样本容量。</p>
<ol start="3">
<li><strong>抽样</strong>：在各层内分别用简单随机抽样（或系统抽样）抽取个体；</li>
<li><strong>整合</strong>：将各层抽出的个体合并，组成最终样本。</li>
</ol>
<h4 id="223-优缺点">2.2.3 优缺点</h4>
<table>
	<thead>
			<tr>
					<th>优点</th>
					<th>缺点</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>样本代表性好，抽样误差较小</td>
					<td>需要事先掌握总体的分层信息，抽样框更复杂</td>
			</tr>
			<tr>
					<td>可以同时分析总体和子群体的特征</td>
					<td>分层变量选择不当会严重影响效果</td>
			</tr>
			<tr>
					<td>能保证各层（包括小群体）都有样本入选</td>
					<td>操作和计算比简单随机抽样复杂</td>
			</tr>
	</tbody>
</table>
<h4 id="224-适用情形">2.2.4 适用情形</h4>
<ul>
<li>总体由差异明显的几部分组成（如按性别、年龄段、城乡划分）；</li>
<li>需要同时了解总体和各个子群体的特征；</li>
<li>希望提高样本代表性、降低抽样误差。</li>
</ul>
<p><strong>典型例题</strong>：某单位职工500人，不到35岁125人，35~49岁280人，50岁以上95人。现要抽取100人进行身体状况调查。由于年龄与身体状况相关，应采用分层抽样。各层按比例抽取：</p>
<ul>
<li>不到35岁：$125 \times \frac{100}{500} = 25$ 人</li>
<li>35~49岁：$280 \times \frac{100}{500} = 56$ 人</li>
<li>50岁以上：$95 \times \frac{100}{500} = 19$ 人</li>
</ul>
<hr>
<h3 id="23-随机数表法">2.3 随机数表法</h3>
<h4 id="231-定义">2.3.1 定义</h4>
<p><strong>随机数表法</strong>是利用<strong>随机数表</strong>（random number table）来抽取样本的一种具体操作方式。随机数表是由 $0 \sim 9$ 的数码随机排列而成的表格，表中每个位置出现哪个数字的概率均等，且各位置之间相互独立。</p>
<blockquote>
<p>随机数表法是简单随机抽样在实际操作中的常用工具，尤其适用于总体容量中等、手工抽签不便的情形。</p>
</blockquote>
<h4 id="232-操作步骤">2.3.2 操作步骤</h4>
<ol>
<li><strong>编号</strong>：将总体中的所有个体统一编号，编号位数根据总体容量 $N$ 确定。例如 $N \leq 99$ 用两位数编号，$N \leq 999$ 用三位数编号；</li>
<li><strong>确定起点</strong>：在随机数表上任意确定一个起始位置（某行某列）；</li>
<li><strong>确定方向和规则</strong>：规定读数的方向（如从左到右、从上到下等），按固定规则逐个读取号码；</li>
<li><strong>选号</strong>：读取的号码若在编号范围内，则对应个体入选样本；若超出范围或重复出现（不重复抽样时），则跳过，继续读取，直到抽满所需样本容量 $n$ 为止。</li>
</ol>
<h4 id="233-重复抽样与不重复抽样">2.3.3 重复抽样与不重复抽样</h4>
<ul>
<li><strong>重复抽样</strong>：已抽中的号码可再次被选中，允许同一单位多次入选；</li>
<li><strong>不重复抽样</strong>（通常采用）：已抽中的号码再次出现时跳过，保证每个个体至多入选一次。</li>
</ul>
<p><strong>操作示例</strong>：从95户居民中抽取10户，编号为01~95，从随机数表某行某列开始读数：</p>
<p>依次读得：37、38、63、69、64、73、66、14、<strong>69</strong>、16&hellip;</p>
<p>其中69重复出现（重复抽样情形）。若采用不重复抽样，则跳过第二个69，继续往后读取，直到抽满10个不重复号码为止。</p>
<h4 id="234-适用情形">2.3.4 适用情形</h4>
<ul>
<li>总体容量不大到中等（编号和查表工作量可接受）；</li>
<li>需要完全随机、排除主观因素的抽样。</li>
</ul>
<h2 id="3-整理数据">3 整理数据</h2>
<p>收集到的原始数据通常是杂乱无章的，需要通过整理、分组和图表化，将数据的分布特征直观地呈现出来。本节介绍两种常用的数据整理工具：<strong>频率分布直方图</strong>和<strong>茎叶图</strong>。</p>
<hr>
<h3 id="31-频率分布直方图">3.1 频率分布直方图</h3>
<h4 id="311-定义">3.1.1 定义</h4>
<p><strong>频率分布直方图</strong>（frequency distribution histogram）是以<strong>组距</strong>为底边长、以<strong>频率/组距</strong>（即<strong>频率密度</strong>）为高绘制的一系列矩形统计图。它用于直观展示一组数据的<strong>分布形态</strong>——数据集中在哪个区间、在哪个区间分布稀疏。</p>
<blockquote>
<p>注意：直方图纵轴是“频率/组距”，所以<strong>各矩形面积 = 频率</strong>，所有矩形面积之和等于 1。</p>
</blockquote>
<h4 id="312-绘制步骤">3.1.2 绘制步骤</h4>
<p><strong>第1步：求极差</strong>
计算数据的最大值与最小值之差，确定数据的变动范围。</p>
$$
\text{极差} = x_{\max} - x_{\min}
$$<p><strong>第2步：决定组距与组数</strong></p>
<ul>
<li><strong>组距</strong>（class interval）：每个小区间的长度，通常取 2、5、10 的倍数以便于计算；</li>
<li><strong>组数</strong>：将数据分成多少组。常用经验公式：组数 $k \approx 1 + \log_2 n$（$n$ 为样本容量），一般取 $5 \sim 12$ 组为宜；</li>
<li>三者关系：$\text{组数} = \left\lceil \dfrac{\text{极差}}{\text{组距}} \right\rceil$（向上取整）。</li>
</ul>
<p><strong>第3步：确定分点（组限）</strong></p>
<ul>
<li>确定各组的<strong>上限</strong>和<strong>下限</strong>，通常采用<strong>左闭右开</strong>区间 $[a, b)$，以免数据落在边界上造成归属不清；</li>
<li>为简化操作，常使分点比数据多一位小数，避免数据恰好落在分点上。</li>
</ul>
<p><strong>第4步：列频率分布表</strong></p>
<ul>
<li><strong>频数</strong>（frequency）：落在该组内的数据个数；</li>
<li><strong>频率</strong>（relative frequency）：频数与样本容量的比值，即 $\text{频率} = \dfrac{\text{频数}}{n}$；</li>
<li><strong>频率密度</strong>（频率/组距）：$\text{频率密度} = \dfrac{\text{频率}}{\text{组距}}$（直方图的<strong>纵轴高度</strong>）。</li>
</ul>
<table>
	<thead>
			<tr>
					<th>分组</th>
					<th>频数统计</th>
					<th>频数</th>
					<th>频率</th>
					<th>频率/组距</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>$[a_1, a_2)$</td>
					<td>正正</td>
					<td>10</td>
					<td>0.20</td>
					<td>0.10</td>
			</tr>
			<tr>
					<td>$[a_2, a_3)$</td>
					<td>正</td>
					<td>5</td>
					<td>0.10</td>
					<td>0.05</td>
			</tr>
			<tr>
					<td>$\cdots$</td>
					<td>$\cdots$</td>
					<td>$\cdots$</td>
					<td>$\cdots$</td>
					<td>$\cdots$</td>
			</tr>
			<tr>
					<td><strong>合计</strong></td>
					<td>—</td>
					<td>$n$</td>
					<td>1.00</td>
					<td>—</td>
			</tr>
	</tbody>
</table>
<p><strong>第5步：绘制直方图</strong></p>
<ul>
<li>横轴：表示数据的分组区间；</li>
<li>纵轴：表示<strong>频率/组距</strong>（频率密度）；</li>
<li>以各组区间为底边，以频率密度为高，画出各矩形。</li>
</ul>
<h4 id="313-直方图的性质">3.1.3 直方图的性质</h4>
<p><strong>性质1</strong>：每个小矩形的面积 = 组距 $\times$ 频率密度 = 该组的<strong>频率</strong>。</p>
<p><strong>性质2</strong>：所有小矩形的面积之和 = $\sum$（各矩形面积） = $\sum$（各组频率） = <strong>1</strong>。</p>
<p><strong>性质3</strong>：在频率分布直方图中，<strong>众数</strong>约为最高矩形中点对应的数值；<strong>中位数</strong>约为使左右两侧面积相等（各占 0.5）的横坐标。</p>
<h4 id="314-与条形图的区别">3.1.4 与条形图的区别</h4>
<table>
	<thead>
			<tr>
					<th>对比维度</th>
					<th>频率分布直方图</th>
					<th>条形图</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td><strong>横轴</strong></td>
					<td>数值区间的连续划分</td>
					<td>分类变量（离散的类别）</td>
			</tr>
			<tr>
					<td><strong>矩形宽度</strong></td>
					<td>有意义（表示组距）</td>
					<td>无数值意义，等宽</td>
			</tr>
			<tr>
					<td><strong>矩形高度</strong></td>
					<td>频率/组距（面积 = 频率）</td>
					<td>频数或频率本身</td>
			</tr>
			<tr>
					<td><strong>矩形间</strong></td>
					<td>连续<strong>无间隙</strong></td>
					<td>有间隙</td>
			</tr>
	</tbody>
</table>
<hr>
<h3 id="32-茎叶图">3.2 茎叶图</h3>
<h4 id="321-定义">3.2.1 定义</h4>
<p><strong>茎叶图</strong>（stem-and-leaf plot）是一种将数据按<strong>数位</strong>进行分拆整理的统计图。它将每个数据拆分为<strong>茎</strong>（高位部分）和<strong>叶</strong>（低位部分），用茎表示共同的部分，用叶表示个体的细微差别。</p>
<blockquote>
<p>茎叶图既能显示数据的具体取值（不损失原始数据信息），又能反映数据的分布形态，是兼具统计和整理功能的有效工具。</p>
</blockquote>
<h4 id="322-作图步骤">3.2.2 作图步骤</h4>
<p><strong>第1步</strong>：确定“茎”和“叶”的分位（通常以<strong>十位及更高位</strong>为茎，<strong>个位</strong>为叶）。</p>
<p><strong>第2步</strong>：将数据按从小到大排序后，按茎分组，将每个数据的“叶”写在对应茎的右侧。</p>
<p><strong>第3步</strong>：在茎的左侧记录<strong>频数</strong>，通常按从小到大的顺序排列茎，并将相同茎的叶按<strong>从小到大</strong>排列。</p>
<p><strong>作图示例</strong>：
现有 10 名学生某次测验成绩（满分 100）：</p>
$$
78,\ 82,\ 85,\ 90,\ 73,\ 88,\ 86,\ 79,\ 94,\ 81
$$<p>绘制茎叶图（茎为十位，叶为个位）：</p>
<table>
	<thead>
			<tr>
					<th>茎（十位）</th>
					<th>叶（个位）</th>
					<th>频数</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>7</td>
					<td>3 8 9</td>
					<td>3</td>
			</tr>
			<tr>
					<td>8</td>
					<td>1 2 5 6 8</td>
					<td>5</td>
			</tr>
			<tr>
					<td>9</td>
					<td>0 4</td>
					<td>2</td>
			</tr>
	</tbody>
</table>
<blockquote>
<p>读法：第一行表示 $73, 78, 79$ 三个数据，第二行表示 $81, 82, 85, 86, 88$，第三行表示 $90, 94$。</p>
</blockquote>
<h4 id="323-茎叶图的特点">3.2.3 茎叶图的特点</h4>
<p><strong>优点</strong>：</p>
<ul>
<li><strong>保留原始数据</strong>：所有数据的具体数值一目了然，不像直方图那样丢失细节；</li>
<li><strong>便于排序和查找</strong>：叶按大小排列后，容易找到中位数、众数、极值等；</li>
<li><strong>适合小样本</strong>：尤其适用于样本容量 $n \leq 50$ 的情形，手工整理方便；</li>
<li><strong>直观显示分布</strong>：茎叶图的“叶”的疏密程度等同于直方图，可直观看出数据的集中趋势和分散情况。</li>
</ul>
<p><strong>局限</strong>：</p>
<ul>
<li>样本容量较大时，叶子过长，不便阅读；</li>
<li>不便于多组数据直接对比（但可以绘制<strong>背靠背茎叶图</strong>来对比两组数据）。</li>
</ul>
<h4 id="324-补充背靠背茎叶图">3.2.4 补充：背靠背茎叶图</h4>
<p>当需要比较<strong>两组</strong>数据的分布时，可以绘制背靠背茎叶图：将两组数据的叶分别写在茎的左右两侧（通常左侧按从小到大排列，右侧也按从小到大排列），便于直观对比两组数据的集中位置和离散程度。</p>
<p><strong>示例</strong>：比较甲、乙两组学生的成绩</p>
<table>
	<thead>
			<tr>
					<th>甲组叶</th>
					<th>茎</th>
					<th>乙组叶</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>9 8 3</td>
					<td>7</td>
					<td>0 5</td>
			</tr>
			<tr>
					<td>6 5 2 1</td>
					<td>8</td>
					<td>1 3 7 8</td>
			</tr>
			<tr>
					<td>4 0</td>
					<td>9</td>
					<td>2 6</td>
			</tr>
	</tbody>
</table>
<h2 id="4-统计指标">4 统计指标</h2>
<h3 id="41-平均数">4.1 平均数</h3>
<h3 id="411-具体数据的平均事">4.1.1 具体数据的平均事</h3>
<p>设一组样本数据为 $x_1, x_2, \ldots, x_n$，样本平均数为 $\bar{x}$，则</p>
$$
\bar{x} = \frac{x_1 + x_2 + \cdots + x_n}{n} = \frac{1}{n}\sum_{i=1}^{n} x_i
$$<h3 id="412-频率分布直方图求平均数">4.1.2 频率分布直方图求平均数</h3>
<p>取每一段的中点值作为该段的所有数据的值，结合每段的频率求解平均数。</p>
<p>设一组样本绘制成频率分布直方图后，每段的中点值和频率如下所示：</p>
<table>
	<thead>
			<tr>
					<th>中点值</th>
					<th>$x_1$</th>
					<th>$x_2$</th>
					<th>&hellip;</th>
					<th>$x_n$</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>频率</td>
					<td>$p_1$</td>
					<td>$p_2$</td>
					<td></td>
					<td>$p_n$</td>
			</tr>
			<tr>
					<td>则有均值$\bar{x}$：</td>
					<td></td>
					<td></td>
					<td></td>
					<td></td>
			</tr>
	</tbody>
</table>
$$
\bar{x}=x_1p_1+x_2p_2+...x_np_n= \sum_{i=1}^{n}{x_ip_i}
$$<h3 id="42-极差">4.2 极差</h3>
<p><strong>极差</strong>（range），又称<strong>全距</strong>，是一组数据的<strong>最大值与最小值之差</strong>，反映一组数据的<strong>变动幅度</strong>。</p>
$$
\text{极差} = \text{最大值} - \text{最小值}
$$<h3 id="43-百分位数">4.3 百分位数</h3>
<h4 id="431-定义">4.3.1 定义</h4>
<p>一组数据的第 $p$ 百分位数是这样一个值 $p$，它使得这组数据中<strong>至少有 $p\%$ 的数据小于或等于这个值</strong>，且<strong>至少有 $(100-p)\%$ 的数据大于或等于这个值</strong>。</p>
<h4 id="432-计算方法">4.3.2 计算方法</h4>
<p>（1）具体数据
计算一组 $n$ 个数据的第 $p$ 百分位数的步骤如下：</p>
<p><strong>第1步</strong>：将原始数据按<strong>从小到大</strong>排列。</p>
<p><strong>第2步</strong>：计算 $i = n \times p\%$。</p>
<p><strong>第3步</strong>：判断结果：</p>
<ul>
<li>若 $i$ <strong>不是整数</strong>，而大于 $i$ 的相邻整数为 $j$，则第 $p$ 百分位数为第 $j$ 项数据；</li>
<li>若 $i$ <strong>是整数</strong>，则第 $p$ 百分位数为第 $i$ 项与第 $(i+1)$ 项数据的<strong>平均数</strong>。</li>
</ul>
<p>（2）频率分布直方图
前置：假设数据在每一段内均匀分布。</p>
<p><strong>步骤</strong>：</p>
<p><strong>第1步</strong>：确定第$p$百分位数所在段，并确定该段的起始值$a$，还有面积$S_{\text{所在段}}$</p>
<p><strong>第2步</strong>：计算出所在段前面所有段的面积和$S_{\text{和}}$</p>
<p>第$p$百分位数为</p>
$$
a+\frac{p\%-S_{\text{和}}}{S_{\text{所在段}}}* \text{组距}
$$<h3 id="44-方差与标准差">4.4 方差与标准差</h3>
<p>.4.1 定义
<strong>方差</strong>（variance）是各个数据与平均数之差的平方的平均数，描述一组数据<strong>偏离平均数的程度</strong>；<strong>标准差</strong>（standard deviation）是方差的<strong>算术平方根</strong>。</p>
<h4 id="442-计算公式">4.4.2 计算公式</h4>
<p>设一组数据为 $x_1, x_2, \ldots, x_n$，平均数为 $\bar{x}$：</p>
<p><strong>样本方差</strong> $s^2$：</p>
$$
s^2 = \frac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})^2
$$<p><strong>样本标准差</strong> $s$：</p>
$$
s = \sqrt{\frac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})^2} = \sqrt{s^2}
$$<blockquote>
<p><strong>注意</strong>：方差（标准差）越大，说明数据的波动越大，越不稳定；反之，方差（标准差）越小，数据越集中、越稳定。</p>
</blockquote>
<h4 id="443-简化计算公式">4.4.3 简化计算公式</h4>
<p>方差也可用如下公式计算（便于手算或编程）：</p>
$$
s^2 = \frac{1}{n}\sum_{i=1}^{n} x_i^2 - \bar{x}^2
$$<h4 id="444-统计意义">4.4.4 统计意义</h4>
<ul>
<li>方差和标准差是描述数据<strong>离散程度</strong>最常用的指标；</li>
<li>与极差相比，方差利用了每一个数据的信息，更加全面可靠；</li>
<li>标准差的单位与数据本身一致，便于实际解释。</li>
</ul>
]]></content:encoded></item></channel></rss>