1 一元线性回归
1.1 相关关系
相关关系:两个变量之间不 exactly 确定,但存在某种相互依赖的数量关系,称为相关关系。与之对应的是函数关系(确定性的依赖关系)。
相关关系的分类:
按变动方向分:
- 正相关:一个变量增大时,另一个变量也倾向于增大;
- 负相关:一个变量增大时,另一个变量倾向于减小。
按形态特征分:
- 线性相关:散点大致分布在一条直线附近;
- 非线性相关:散点分布在一条曲线附近。
按相关程度分:
- 完全相关(|r|=1):所有点都在直线上(退化为函数关系);
- 强相关(|r|接近1):散点紧密围绕直线;
- 弱相关(|r|接近0):散点分散,线性关系微弱;
- 不相关(r=0):无线性关系(但可能存在非线性关系)。
1.2 散点图
散点图:在平面直角坐标系中,将成对数据 $(x_i,y_i)$ 描点得到的图形。通过散点图可以直观判断:
- 两个变量之间是否存在相关关系;
- 是正相关还是负相关;
- 是线性相关还是非线性相关;
- 相关程度的强弱(散点弥散程度)。
1.3 线性回归方程
对于一组样本数据 $(x_1,y_1),(x_2,y_2),\ldots,(x_n,y_n)$,若散点图呈线性相关趋势,可以用一条直线 $\hat{y}=a+bx$ 来近似描述 $y$ 与 $x$ 的关系,称为线性回归方程(或经验回归方程)。
1.4 最小二乘法
核心思想:使各样本点到回归直线的垂直距离的平方和(即残差平方和)最小。
残差:$\hat{e}_i=y_i-\hat{y}_i=y_i-(a+bx_i)$,表示第 $i$ 个观测值与回归估计值的偏差。
目标函数:
$$ Q(a,b)=\sum_{i=1}^{n}(y_i-a-bx_i)^2 $$求 $a,b$ 使 $Q(a,b)$ 取最小值——最小二乘法(“二乘”即平方)。
求解过程:分别对 $a,b$ 求偏导并令其为零。
对 $a$ 求偏导:
$$ \frac{\partial Q}{\partial a}=-2\sum_{i=1}^{n}(y_i-a-bx_i)=0 $$$$ \Longrightarrow \sum_{i=1}^{n}y_i=na+b\sum_{i=1}^{n}x_i\quad\cdots\cdots(1) $$对 $b$ 求偏导:
$$ \frac{\partial Q}{\partial b}=-2\sum_{i=1}^{n}x_i(y_i-a-bx_i)=0 $$$$ \Longrightarrow \sum_{i=1}^{n}x_i y_i=a\sum_{i=1}^{n}x_i+b\sum_{i=1}^{n}x_i^2\quad\cdots\cdots(2) $$由 (1)(2) 联立解得:
$$ \boxed{b=\frac{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})^2}} $$$$ \boxed{a=\bar{y}-b\bar{x}} $$其中 $\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i$,$\bar{y}=\frac{1}{n}\sum_{i=1}^{n}y_i$。
回归直线的性质:
- 回归直线一定经过样本中心点 $(\bar{x},\bar{y})$;
- $\hat{y}$ 是 $y$ 的估计值(预测值),不等于实际值;
- $b$ 的含义:$x$ 每增加 1 个单位,$y$ 平均增加 $b$ 个单位($b>0$ 正相关,$b<0$ 负相关)。
1.5 相关系数
相关系数 $r$ 用于定量刻画两个变量线性相关关系的强弱和方向:
$$ r=\frac{\displaystyle\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\displaystyle\sqrt{\sum_{i=1}^{n}(x_i-\bar{x})^2}\cdot\sqrt{\sum_{i=1}^{n}(y_i-\bar{y})^2}} $$相关系数的性质:
- $-1 \le r \le 1$;
- $r>0$:正相关;$r<0$:负相关;
- $|r|$ 越接近 1,线性相关程度越强;
- $|r|$ 越接近 0,线性相关程度越弱;
- $r=\pm 1$:完全线性相关(所有点严格在一条直线上)。
注意:$|r|$ 小只能说明线性相关性弱,两变量间仍可能存在强非线性关系。
1.6 决定系数 $R^2$
$$ R^2=1-\frac{\sum_{i=1}^{n}(y_i-\hat{y}_i)^2}{\sum_{i=1}^{n}(y_i-\bar{y})^2}=r^2 $$$R^2$ 越接近 1,说明回归模型拟合效果越好。
2 2×2 列联表
2.1 列联表的定义
列联表:按两个分类变量的不同取值进行交叉分类,统计频数形成的表格。当两个变量各有 2 个类别时,称为 2×2 列联表(四格表)。
2.2 2×2 列联表的标准形式
设两个分类变量 $X$ 和 $Y$,其取值均为 0 或 1:
- $a$:$X=0$ 且 $Y=0$ 的频数;
- $b$:$X=0$ 且 $Y=1$ 的频数;
- $c$:$X=1$ 且 $Y=0$ 的频数;
- $d$:$X=1$ 且 $Y=1$ 的频数。
行合计:$a+b$($X=0$ 的总数),$c+d$($X=1$ 的总数); 列合计:$a+c$($Y=0$ 的总数),$b+d$($Y=1$ 的总数); 总计:$n=a+b+c+d$。
2.3 独立性检验
核心问题:两个分类变量 $X$ 与 $Y$ 是否相互独立?
独立性假设(原假设 $H_0$):$X$ 与 $Y$ 相互独立。
若 $X$ 与 $Y$ 独立,则应有:
$$ P(X=0,Y=0)=P(X=0)\cdot P(Y=0) $$用频数估计概率,在 $H_0$ 成立的条件下,理论频数应为:
$$ E_{00}=\frac{(a+b)(a+c)}{n} $$同理:
$$ E_{01}=\frac{(a+b)(b+d)}{n} $$$$ E_{10}=\frac{(c+d)(a+c)}{n} $$$$ E_{11}=\frac{(c+d)(b+d)}{n} $$2.4 卡方统计量($\chi^2$)
构造原理:比较实际频数与理论频数的偏差。
$$ \chi^2=\sum_{i=1}^{2}\sum_{j=1}^{2}\frac{(O_{ij}-E_{ij})^2}{E_{ij}} $$对于 2×2 列联表,化简为:
$$ \boxed{\chi^2=\frac{n(ad-bc)^2}{(a+b)(c+d)(a+c)(b+d)}} $$检验步骤:
第一步:提出假设 $H_0$:$X$ 与 $Y$ 相互独立;$H_1$:$X$ 与 $Y$ 不独立(有关联);
第二步:计算 $\chi^2$ 的值;
第三步:与临界值比较(查 $\chi^2$ 分布表),作出判断。
常用临界值:
- 显著性水平 $\alpha=0.10$ 时,临界值为 $2.706$;
- 显著性水平 $\alpha=0.05$ 时,临界值为 $3.841$;
- 显著性水平 $\alpha=0.01$ 时,临界值为 $6.635$。
决策规则:
- 若 $\chi^2 \ge 6.635$:在 $0.01$ 水平下拒绝 $H_0$,有 $99\%$ 的把握认为两变量有关联;
- 若 $\chi^2 \ge 3.841$:在 $0.05$ 水平下拒绝 $H_0$,有 $95\%$ 的把握认为两变量有关联;
- 若 $\chi^2 < 3.841$:没有充分证据拒绝 $H_0$,认为两变量独立。
2.5 列联表与独立性检验示例
调查某校学生是否喜欢数学与性别是否有关系,得到如下数据:
- 男生喜欢数学 40 人,不喜欢 20 人,共 60 人;
- 女生喜欢数学 30 人,不喜欢 40 人,共 70 人;
- 合计喜欢数学 70 人,不喜欢数学 60 人,总计 130 人。
这里 $a=40$(男生且喜欢),$b=20$(男生且不喜欢),$c=30$(女生且喜欢),$d=40$(女生且不喜欢)。
计算 $\chi^2$:
$$ \chi^2=\frac{130\times(40\times40-20\times30)^2}{60\times70\times70\times60}=\frac{130\times(1600-600)^2}{17640000}=\frac{130\times1000000}{17640000}\approx7.37 $$因为 $7.37>6.635$,有 $99\%$ 的把握认为性别与是否喜欢数学有关联。
2.6 风险评估指标(拓展)
在 2×2 列联表中,还常用以下指标衡量关联强度:
相对风险(RR):
$$ \text{RR}=\frac{P(Y=1|X=1)}{P(Y=1|X=0)}=\frac{\frac{d}{c+d}}{\frac{b}{a+b}} $$RR > 1 表示 $X=1$ 条件下 $Y$ 发生风险更高。
优势比(OR):
$$ \text{OR}=\frac{P(Y=1|X=1)/P(Y=0|X=1)}{P(Y=1|X=0)/P(Y=0|X=0)}=\frac{ad}{bc} $$OR 是病例对照研究中常用的关联强度指标,OR = 1 表示两变量独立。
附:线性回归与列联表的联系与区别
变量类型不同:
- 一元线性回归处理的是两个数值型变量;
- 2×2 列联表处理的是两个分类变量。
研究问题不同:
- 线性回归研究数值 $y$ 如何随 $x$ 线性变化;
- 列联表研究两个分类变量是否有关联。
核心指标不同:
- 线性回归的核心指标是斜率 $b$、相关系数 $r$、决定系数 $R^2$;
- 列联表的核心指标是 $\chi^2$ 统计量和 $p$ 值。
判定标准不同:
- 线性回归中 $|r|$ 接近 1 则线性相关强;
- 列联表中 $\chi^2$ 超过临界值则拒绝独立假设。
预测功能不同:
- 线性回归可由 $x$ 预测 $\hat{y}$;
- 列联表只能判断关联性,不能进行数值预测。