1 一元线性回归

1.1 相关关系

相关关系:两个变量之间不 exactly 确定,但存在某种相互依赖的数量关系,称为相关关系。与之对应的是函数关系(确定性的依赖关系)。

相关关系的分类

按变动方向分:

  • 正相关:一个变量增大时,另一个变量也倾向于增大;
  • 负相关:一个变量增大时,另一个变量倾向于减小。

按形态特征分:

  • 线性相关:散点大致分布在一条直线附近;
  • 非线性相关:散点分布在一条曲线附近。

按相关程度分:

  • 完全相关(|r|=1):所有点都在直线上(退化为函数关系);
  • 强相关(|r|接近1):散点紧密围绕直线;
  • 弱相关(|r|接近0):散点分散,线性关系微弱;
  • 不相关(r=0):无线性关系(但可能存在非线性关系)。

1.2 散点图

散点图:在平面直角坐标系中,将成对数据 $(x_i,y_i)$ 描点得到的图形。通过散点图可以直观判断:

  • 两个变量之间是否存在相关关系;
  • 是正相关还是负相关;
  • 是线性相关还是非线性相关;
  • 相关程度的强弱(散点弥散程度)。

1.3 线性回归方程

对于一组样本数据 $(x_1,y_1),(x_2,y_2),\ldots,(x_n,y_n)$,若散点图呈线性相关趋势,可以用一条直线 $\hat{y}=a+bx$ 来近似描述 $y$ 与 $x$ 的关系,称为线性回归方程(或经验回归方程)。

1.4 最小二乘法

核心思想:使各样本点到回归直线的垂直距离的平方和(即残差平方和)最小。

残差:$\hat{e}_i=y_i-\hat{y}_i=y_i-(a+bx_i)$,表示第 $i$ 个观测值与回归估计值的偏差。

目标函数

$$ Q(a,b)=\sum_{i=1}^{n}(y_i-a-bx_i)^2 $$

求 $a,b$ 使 $Q(a,b)$ 取最小值——最小二乘法(“二乘”即平方)。

求解过程:分别对 $a,b$ 求偏导并令其为零。

对 $a$ 求偏导:

$$ \frac{\partial Q}{\partial a}=-2\sum_{i=1}^{n}(y_i-a-bx_i)=0 $$$$ \Longrightarrow \sum_{i=1}^{n}y_i=na+b\sum_{i=1}^{n}x_i\quad\cdots\cdots(1) $$

对 $b$ 求偏导:

$$ \frac{\partial Q}{\partial b}=-2\sum_{i=1}^{n}x_i(y_i-a-bx_i)=0 $$$$ \Longrightarrow \sum_{i=1}^{n}x_i y_i=a\sum_{i=1}^{n}x_i+b\sum_{i=1}^{n}x_i^2\quad\cdots\cdots(2) $$

由 (1)(2) 联立解得:

$$ \boxed{b=\frac{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})^2}} $$$$ \boxed{a=\bar{y}-b\bar{x}} $$

其中 $\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i$,$\bar{y}=\frac{1}{n}\sum_{i=1}^{n}y_i$。

回归直线的性质

  • 回归直线一定经过样本中心点 $(\bar{x},\bar{y})$;
  • $\hat{y}$ 是 $y$ 的估计值(预测值),不等于实际值;
  • $b$ 的含义:$x$ 每增加 1 个单位,$y$ 平均增加 $b$ 个单位($b>0$ 正相关,$b<0$ 负相关)。

1.5 相关系数

相关系数 $r$ 用于定量刻画两个变量线性相关关系的强弱和方向:

$$ r=\frac{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\displaystyle\sqrt{\sum_{i=1}^{n}(x_i-\bar{x})^2}\cdot\sqrt{\sum_{i=1}^{n}(y_i-\bar{y})^2}} $$

相关系数的性质

  • $-1 \le r \le 1$;
  • $r>0$:正相关;$r<0$:负相关;
  • $|r|$ 越接近 1,线性相关程度越强;
  • $|r|$ 越接近 0,线性相关程度越弱;
  • $r=\pm 1$:完全线性相关(所有点严格在一条直线上)。

注意:$|r|$ 小只能说明线性相关性弱,两变量间仍可能存在强非线性关系。

1.6 决定系数 $R^2$

$$ R^2=1-\frac{\sum_{i=1}^{n}(y_i-\hat{y}_i)^2}{\sum_{i=1}^{n}(y_i-\bar{y})^2}=r^2 $$

$R^2$ 越接近 1,说明回归模型拟合效果越好。


2 2×2 列联表

2.1 列联表的定义

列联表:按两个分类变量的不同取值进行交叉分类,统计频数形成的表格。当两个变量各有 2 个类别时,称为 2×2 列联表(四格表)。

2.2 2×2 列联表的标准形式

设两个分类变量 $X$ 和 $Y$,其取值均为 0 或 1:

  • $a$:$X=0$ 且 $Y=0$ 的频数;
  • $b$:$X=0$ 且 $Y=1$ 的频数;
  • $c$:$X=1$ 且 $Y=0$ 的频数;
  • $d$:$X=1$ 且 $Y=1$ 的频数。

行合计:$a+b$($X=0$ 的总数),$c+d$($X=1$ 的总数); 列合计:$a+c$($Y=0$ 的总数),$b+d$($Y=1$ 的总数); 总计:$n=a+b+c+d$。

2.3 独立性检验

核心问题:两个分类变量 $X$ 与 $Y$ 是否相互独立?

独立性假设(原假设 $H_0$):$X$ 与 $Y$ 相互独立。

若 $X$ 与 $Y$ 独立,则应有:

$$ P(X=0,Y=0)=P(X=0)\cdot P(Y=0) $$

用频数估计概率,在 $H_0$ 成立的条件下,理论频数应为:

$$ E_{00}=\frac{(a+b)(a+c)}{n} $$

同理:

$$ E_{01}=\frac{(a+b)(b+d)}{n} $$$$ E_{10}=\frac{(c+d)(a+c)}{n} $$$$ E_{11}=\frac{(c+d)(b+d)}{n} $$

2.4 卡方统计量($\chi^2$)

构造原理:比较实际频数与理论频数的偏差。

$$ \chi^2=\sum_{i=1}^{2}\sum_{j=1}^{2}\frac{(O_{ij}-E_{ij})^2}{E_{ij}} $$

对于 2×2 列联表,化简为:

$$ \boxed{\chi^2=\frac{n(ad-bc)^2}{(a+b)(c+d)(a+c)(b+d)}} $$

检验步骤

第一步:提出假设 $H_0$:$X$ 与 $Y$ 相互独立;$H_1$:$X$ 与 $Y$ 不独立(有关联);

第二步:计算 $\chi^2$ 的值;

第三步:与临界值比较(查 $\chi^2$ 分布表),作出判断。

常用临界值

  • 显著性水平 $\alpha=0.10$ 时,临界值为 $2.706$;
  • 显著性水平 $\alpha=0.05$ 时,临界值为 $3.841$;
  • 显著性水平 $\alpha=0.01$ 时,临界值为 $6.635$。

决策规则

  • 若 $\chi^2 \ge 6.635$:在 $0.01$ 水平下拒绝 $H_0$,有 $99\%$ 的把握认为两变量有关联;
  • 若 $\chi^2 \ge 3.841$:在 $0.05$ 水平下拒绝 $H_0$,有 $95\%$ 的把握认为两变量有关联;
  • 若 $\chi^2 < 3.841$:没有充分证据拒绝 $H_0$,认为两变量独立。

2.5 列联表与独立性检验示例

调查某校学生是否喜欢数学与性别是否有关系,得到如下数据:

  • 男生喜欢数学 40 人,不喜欢 20 人,共 60 人;
  • 女生喜欢数学 30 人,不喜欢 40 人,共 70 人;
  • 合计喜欢数学 70 人,不喜欢数学 60 人,总计 130 人。

这里 $a=40$(男生且喜欢),$b=20$(男生且不喜欢),$c=30$(女生且喜欢),$d=40$(女生且不喜欢)。

计算 $\chi^2$:

$$ \chi^2=\frac{130\times(40\times40-20\times30)^2}{60\times70\times70\times60}=\frac{130\times(1600-600)^2}{17640000}=\frac{130\times1000000}{17640000}\approx7.37 $$

因为 $7.37>6.635$,有 $99\%$ 的把握认为性别与是否喜欢数学有关联。

2.6 风险评估指标(拓展)

在 2×2 列联表中,还常用以下指标衡量关联强度:

相对风险(RR)

$$ \text{RR}=\frac{P(Y=1|X=1)}{P(Y=1|X=0)}=\frac{\frac{d}{c+d}}{\frac{b}{a+b}} $$

RR > 1 表示 $X=1$ 条件下 $Y$ 发生风险更高。

优势比(OR)

$$ \text{OR}=\frac{P(Y=1|X=1)/P(Y=0|X=1)}{P(Y=1|X=0)/P(Y=0|X=0)}=\frac{ad}{bc} $$

OR 是病例对照研究中常用的关联强度指标,OR = 1 表示两变量独立。


附:线性回归与列联表的联系与区别

变量类型不同

  • 一元线性回归处理的是两个数值型变量;
  • 2×2 列联表处理的是两个分类变量。

研究问题不同

  • 线性回归研究数值 $y$ 如何随 $x$ 线性变化;
  • 列联表研究两个分类变量是否有关联。

核心指标不同

  • 线性回归的核心指标是斜率 $b$、相关系数 $r$、决定系数 $R^2$;
  • 列联表的核心指标是 $\chi^2$ 统计量和 $p$ 值。

判定标准不同

  • 线性回归中 $|r|$ 接近 1 则线性相关强;
  • 列联表中 $\chi^2$ 超过临界值则拒绝独立假设。

预测功能不同

  • 线性回归可由 $x$ 预测 $\hat{y}$;
  • 列联表只能判断关联性,不能进行数值预测。