<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>成对数据分析 on 数学之家</title><link>https://www.ydlxsx.top/tags/%E6%88%90%E5%AF%B9%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90/</link><description>Recent content in 成对数据分析 on 数学之家</description><generator>Hugo</generator><language>zh-CN</language><copyright>苏ICP备2026047757号 · 苏公网安备32082902023086号</copyright><lastBuildDate>Tue, 04 Aug 2026 14:35:35 +0800</lastBuildDate><atom:link href="https://www.ydlxsx.top/tags/%E6%88%90%E5%AF%B9%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90/index.xml" rel="self" type="application/rss+xml"/><item><title>成对数据分析</title><link>https://www.ydlxsx.top/archives/%E6%88%90%E5%AF%B9%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90/</link><pubDate>Tue, 04 Aug 2026 14:35:35 +0800</pubDate><guid>https://www.ydlxsx.top/archives/%E6%88%90%E5%AF%B9%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90/</guid><description>一元线性回归 · 2×2 列联表 · 附：线性回归与列联表的联系与区别</description><content:encoded><![CDATA[<h2 id="1-一元线性回归">1 一元线性回归</h2>
<h3 id="11-相关关系">1.1 相关关系</h3>
<p><strong>相关关系</strong>：两个变量之间<strong>不 exactly 确定</strong>，但存在某种相互依赖的数量关系，称为相关关系。与之对应的是<strong>函数关系</strong>（确定性的依赖关系）。</p>
<p><strong>相关关系的分类</strong>：</p>
<p>按变动方向分：</p>
<ul>
<li><strong>正相关</strong>：一个变量增大时，另一个变量也倾向于增大；</li>
<li><strong>负相关</strong>：一个变量增大时，另一个变量倾向于减小。</li>
</ul>
<p>按形态特征分：</p>
<ul>
<li><strong>线性相关</strong>：散点大致分布在一条直线附近；</li>
<li><strong>非线性相关</strong>：散点分布在一条曲线附近。</li>
</ul>
<p>按相关程度分：</p>
<ul>
<li><strong>完全相关</strong>（|r|=1）：所有点都在直线上（退化为函数关系）；</li>
<li><strong>强相关</strong>（|r|接近1）：散点紧密围绕直线；</li>
<li><strong>弱相关</strong>（|r|接近0）：散点分散，线性关系微弱；</li>
<li><strong>不相关</strong>（r=0）：无线性关系（但可能存在非线性关系）。</li>
</ul>
<h3 id="12-散点图">1.2 散点图</h3>
<p><strong>散点图</strong>：在平面直角坐标系中，将成对数据 $(x_i,y_i)$ 描点得到的图形。通过散点图可以直观判断：</p>
<ul>
<li>两个变量之间是否存在相关关系；</li>
<li>是正相关还是负相关；</li>
<li>是线性相关还是非线性相关；</li>
<li>相关程度的强弱（散点弥散程度）。</li>
</ul>
<h3 id="13-线性回归方程">1.3 线性回归方程</h3>
<p>对于一组样本数据 $(x_1,y_1),(x_2,y_2),\ldots,(x_n,y_n)$，若散点图呈线性相关趋势，可以用一条直线 $\hat{y}=a+bx$ 来近似描述 $y$ 与 $x$ 的关系，称为<strong>线性回归方程</strong>（或经验回归方程）。</p>
<h3 id="14-最小二乘法">1.4 最小二乘法</h3>
<p><strong>核心思想</strong>：使各样本点到回归直线的<strong>垂直距离的平方和</strong>（即残差平方和）最小。</p>
<p><strong>残差</strong>：$\hat{e}_i=y_i-\hat{y}_i=y_i-(a+bx_i)$，表示第 $i$ 个观测值与回归估计值的偏差。</p>
<p><strong>目标函数</strong>：</p>
$$
Q(a,b)=\sum_{i=1}^{n}(y_i-a-bx_i)^2
$$<p>求 $a,b$ 使 $Q(a,b)$ 取最小值——<strong>最小二乘法</strong>（“二乘”即平方）。</p>
<p><strong>求解过程</strong>：分别对 $a,b$ 求偏导并令其为零。</p>
<p>对 $a$ 求偏导：</p>
$$
\frac{\partial Q}{\partial a}=-2\sum_{i=1}^{n}(y_i-a-bx_i)=0
$$$$
\Longrightarrow \sum_{i=1}^{n}y_i=na+b\sum_{i=1}^{n}x_i\quad\cdots\cdots(1)
$$<p>对 $b$ 求偏导：</p>
$$
\frac{\partial Q}{\partial b}=-2\sum_{i=1}^{n}x_i(y_i-a-bx_i)=0
$$$$
\Longrightarrow \sum_{i=1}^{n}x_i y_i=a\sum_{i=1}^{n}x_i+b\sum_{i=1}^{n}x_i^2\quad\cdots\cdots(2)
$$<p>由 (1)(2) 联立解得：</p>
$$
\boxed{b=\frac{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})^2}}
$$$$
\boxed{a=\bar{y}-b\bar{x}}
$$<p>其中 $\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i$，$\bar{y}=\frac{1}{n}\sum_{i=1}^{n}y_i$。</p>
<p><strong>回归直线的性质</strong>：</p>
<ul>
<li>回归直线<strong>一定经过样本中心点</strong> $(\bar{x},\bar{y})$；</li>
<li>$\hat{y}$ 是 $y$ 的估计值（预测值），不等于实际值；</li>
<li>$b$ 的含义：$x$ 每增加 1 个单位，$y$ 平均增加 $b$ 个单位（$b>0$ 正相关，$b<0$ 负相关）。</li>
</ul>
<h3 id="15-相关系数">1.5 相关系数</h3>
<p><strong>相关系数</strong> $r$ 用于定量刻画两个变量线性相关关系的强弱和方向：</p>
$$
r=\frac{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\displaystyle\sqrt{\sum_{i=1}^{n}(x_i-\bar{x})^2}\cdot\sqrt{\sum_{i=1}^{n}(y_i-\bar{y})^2}}
$$<p><strong>相关系数的性质</strong>：</p>
<ul>
<li>$-1 \le r \le 1$；</li>
<li>$r>0$：正相关；$r<0$：负相关；</li>
<li>$|r|$ 越接近 1，线性相关程度越强；</li>
<li>$|r|$ 越接近 0，线性相关程度越弱；</li>
<li>$r=\pm 1$：完全线性相关（所有点严格在一条直线上）。</li>
</ul>
<p><strong>注意</strong>：$|r|$ 小只能说明<strong>线性</strong>相关性弱，两变量间仍可能存在强<strong>非线性</strong>关系。</p>
<h3 id="16-决定系数">1.6 决定系数 $R^2$</h3>
$$
R^2=1-\frac{\sum_{i=1}^{n}(y_i-\hat{y}_i)^2}{\sum_{i=1}^{n}(y_i-\bar{y})^2}=r^2
$$<p>$R^2$ 越接近 1，说明回归模型拟合效果越好。</p>
<hr>
<h2 id="2-22-列联表">2 2×2 列联表</h2>
<h3 id="21-列联表的定义">2.1 列联表的定义</h3>
<p><strong>列联表</strong>：按两个分类变量的不同取值进行交叉分类，统计频数形成的表格。当两个变量各有 2 个类别时，称为 <strong>2×2 列联表</strong>（四格表）。</p>
<h3 id="22-22-列联表的标准形式">2.2 2×2 列联表的标准形式</h3>
<p>设两个分类变量 $X$ 和 $Y$，其取值均为 0 或 1：</p>
<ul>
<li>$a$：$X=0$ 且 $Y=0$ 的频数；</li>
<li>$b$：$X=0$ 且 $Y=1$ 的频数；</li>
<li>$c$：$X=1$ 且 $Y=0$ 的频数；</li>
<li>$d$：$X=1$ 且 $Y=1$ 的频数。</li>
</ul>
<p>行合计：$a+b$（$X=0$ 的总数），$c+d$（$X=1$ 的总数）；
列合计：$a+c$（$Y=0$ 的总数），$b+d$（$Y=1$ 的总数）；
总计：$n=a+b+c+d$。</p>
<h3 id="23-独立性检验">2.3 独立性检验</h3>
<p><strong>核心问题</strong>：两个分类变量 $X$ 与 $Y$ 是否相互独立？</p>
<p><strong>独立性假设</strong>（原假设 $H_0$）：$X$ 与 $Y$ 相互独立。</p>
<p>若 $X$ 与 $Y$ 独立，则应有：</p>
$$
P(X=0,Y=0)=P(X=0)\cdot P(Y=0)
$$<p>用频数估计概率，在 $H_0$ 成立的条件下，<strong>理论频数</strong>应为：</p>
$$
E_{00}=\frac{(a+b)(a+c)}{n}
$$<p>同理：</p>
$$
E_{01}=\frac{(a+b)(b+d)}{n}
$$$$
E_{10}=\frac{(c+d)(a+c)}{n}
$$$$
E_{11}=\frac{(c+d)(b+d)}{n}
$$<h3 id="24-卡方统计量">2.4 卡方统计量（$\chi^2$）</h3>
<p><strong>构造原理</strong>：比较实际频数与理论频数的偏差。</p>
$$
\chi^2=\sum_{i=1}^{2}\sum_{j=1}^{2}\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
$$<p>对于 2×2 列联表，化简为：</p>
$$
\boxed{\chi^2=\frac{n(ad-bc)^2}{(a+b)(c+d)(a+c)(b+d)}}
$$<p><strong>检验步骤</strong>：</p>
<p>第一步：提出假设 $H_0$：$X$ 与 $Y$ 相互独立；$H_1$：$X$ 与 $Y$ 不独立（有关联）；</p>
<p>第二步：计算 $\chi^2$ 的值；</p>
<p>第三步：与临界值比较（查 $\chi^2$ 分布表），作出判断。</p>
<p><strong>常用临界值</strong>：</p>
<ul>
<li>显著性水平 $\alpha=0.10$ 时，临界值为 $2.706$；</li>
<li>显著性水平 $\alpha=0.05$ 时，临界值为 $3.841$；</li>
<li>显著性水平 $\alpha=0.01$ 时，临界值为 $6.635$。</li>
</ul>
<p><strong>决策规则</strong>：</p>
<ul>
<li>若 $\chi^2 \ge 6.635$：在 $0.01$ 水平下拒绝 $H_0$，有 $99\%$ 的把握认为两变量有关联；</li>
<li>若 $\chi^2 \ge 3.841$：在 $0.05$ 水平下拒绝 $H_0$，有 $95\%$ 的把握认为两变量有关联；</li>
<li>若 $\chi^2 < 3.841$：没有充分证据拒绝 $H_0$，认为两变量独立。</li>
</ul>
<h3 id="25-列联表与独立性检验示例">2.5 列联表与独立性检验示例</h3>
<p>调查某校学生是否喜欢数学与性别是否有关系，得到如下数据：</p>
<ul>
<li>男生喜欢数学 40 人，不喜欢 20 人，共 60 人；</li>
<li>女生喜欢数学 30 人，不喜欢 40 人，共 70 人；</li>
<li>合计喜欢数学 70 人，不喜欢数学 60 人，总计 130 人。</li>
</ul>
<p>这里 $a=40$（男生且喜欢），$b=20$（男生且不喜欢），$c=30$（女生且喜欢），$d=40$（女生且不喜欢）。</p>
<p>计算 $\chi^2$：</p>
$$
\chi^2=\frac{130\times(40\times40-20\times30)^2}{60\times70\times70\times60}=\frac{130\times(1600-600)^2}{17640000}=\frac{130\times1000000}{17640000}\approx7.37
$$<p>因为 $7.37>6.635$，有 $99\%$ 的把握认为性别与是否喜欢数学有关联。</p>
<h3 id="26-风险评估指标拓展">2.6 风险评估指标（拓展）</h3>
<p>在 2×2 列联表中，还常用以下指标衡量关联强度：</p>
<p><strong>相对风险（RR）</strong>：</p>
$$
\text{RR}=\frac{P(Y=1|X=1)}{P(Y=1|X=0)}=\frac{\frac{d}{c+d}}{\frac{b}{a+b}}
$$<p>RR &gt; 1 表示 $X=1$ 条件下 $Y$ 发生风险更高。</p>
<p><strong>优势比（OR）</strong>：</p>
$$
\text{OR}=\frac{P(Y=1|X=1)/P(Y=0|X=1)}{P(Y=1|X=0)/P(Y=0|X=0)}=\frac{ad}{bc}
$$<p>OR 是病例对照研究中常用的关联强度指标，OR = 1 表示两变量独立。</p>
<hr>
<h2 id="附线性回归与列联表的联系与区别">附：线性回归与列联表的联系与区别</h2>
<p><strong>变量类型不同</strong>：</p>
<ul>
<li>一元线性回归处理的是两个<strong>数值型</strong>变量；</li>
<li>2×2 列联表处理的是两个<strong>分类</strong>变量。</li>
</ul>
<p><strong>研究问题不同</strong>：</p>
<ul>
<li>线性回归研究数值 $y$ 如何随 $x$ 线性变化；</li>
<li>列联表研究两个分类变量是否有关联。</li>
</ul>
<p><strong>核心指标不同</strong>：</p>
<ul>
<li>线性回归的核心指标是斜率 $b$、相关系数 $r$、决定系数 $R^2$；</li>
<li>列联表的核心指标是 $\chi^2$ 统计量和 $p$ 值。</li>
</ul>
<p><strong>判定标准不同</strong>：</p>
<ul>
<li>线性回归中 $|r|$ 接近 1 则线性相关强；</li>
<li>列联表中 $\chi^2$ 超过临界值则拒绝独立假设。</li>
</ul>
<p><strong>预测功能不同</strong>：</p>
<ul>
<li>线性回归可由 $x$ 预测 $\hat{y}$；</li>
<li>列联表只能判断关联性，不能进行数值预测。</li>
</ul>
]]></content:encoded></item></channel></rss>