线性回归的原理是什么?有哪些基本假设?
简化版
线性回归 假设目标 y 是特征的线性组合加噪声:y = w·x + b + ε,通过最小化预测值与真实值的平方误差(最小二乘) 来求最优参数 w、b。它有几条经典假设:特征与目标线性关系、误差独立、误差同方差(方差恒定)、误差均值为 0 且近似正态、特征间无严重多重共线性。求解可用正规方程(一步闭式解)或梯度下降(迭代)。它简单、可解释、训练快,但只能拟合线性关系、对离群点和共线性敏感。
详细版
模型形式:
ŷ = w₁x₁ + w₂x₂ + ... + wₙxₙ + b = wᵀx + b
目标函数(最小二乘,MSE):
L(w,b) = (1/m) Σ (yᵢ - ŷᵢ)² → 求使 L 最小的 w,b
五条经典假设:
| 假设 | 含义 | 违反后果 |
|---|---|---|
| 线性性 | y 与特征线性相关 | 欠拟合,系统性偏差 |
| 独立性 | 样本/误差相互独立 | 标准误失真(如时序自相关) |
| 同方差性 | 误差方差恒定 | 系数估计有效性下降 |
| 正态性 | 误差近似正态 | 影响区间估计/检验(大样本可放宽) |
| 无多重共线性 | 特征间不高度相关 | 系数不稳、方向乱、方差大 |
求解两法:
- 直接线性代数求解:满列秩时可写成
w = (XᵀX)⁻¹Xᵀy,无需调学习率;实际实现优先用 QR、SVD 或伪逆,避免显式求逆放大数值误差。分解部分的代价通常随特征维数呈立方增长。 - 梯度下降:迭代逼近,适合大规模/高维,需要特征缩放和调学习率。
完整版教学
一、线性回归在做什么——用一条「直线/超平面」拟合数据
线性回归解决回归问题(预测连续值,如房价、销量)。它的核心假设是:目标 y 可以近似写成特征的线性组合:
ŷ = w₁x₁ + w₂x₂ + ... + wₙxₙ + b
- 一维时就是一条直线
ŷ = wx + b,多维时是一个超平面。 - w(权重/系数) 表示每个特征对目标的影响方向和强度;b(偏置/截距) 是所有特征为 0 时的基准值。
- 学习的目标就是找一组 w、b,让这个超平面尽可能贴近所有训练点。
「尽可能贴近」需要一个量化标准——这就是损失函数。
二、为什么用平方误差(最小二乘)
线性回归用均方误差 MSE 作损失,即最小二乘法:
L(w,b) = Σ (yᵢ - ŷᵢ)² (所有样本的「预测-真实」差的平方和)
为什么是平方,而不是绝对值?
- 数学上好处理:平方处处可导且是凸函数,能求闭式解、梯度下降也稳定;绝对值在 0 处不可导。
- 凸函数保证全局最优:MSE 对 w 是凸的,没有局部最优陷阱,一定能找到全局最小。
- 概率解释:若假设噪声 ε 服从均值为 0 的高斯分布,那么对 w 做最大似然估计(MLE)恰好等价于最小化平方误差——最小二乘不是拍脑袋,而是「误差高斯」假设下的最优估计(详见最大似然与最小二乘专题)。
代价:平方会放大离群点的误差(大误差平方后更大),所以线性回归对离群点敏感。
三、两种求解方法:正规方程 vs 梯度下降
正规方程(闭式解):令损失对 w 的导数为 0,直接解出:
w = (XᵀX)⁻¹ Xᵀ y
- 优点:一步到位,不用迭代、不用调学习率、不用特征缩放。
- 缺点:形成正规方程约需
O(md²),对 d×d 系统做分解约需 O(d³)(m 为样本数、d 为特征数),高维时成本高;共线时XᵀX奇异,应改用伪逆、QR/SVD 或正则化,而不是强行求逆。
梯度下降(迭代):沿损失梯度反方向逐步更新 w:
w ← w - η · ∂L/∂w
- 优点:适合大规模、高维数据,复杂度对特征数线性,内存友好。
- 缺点:需要调学习率 η、需要特征缩放(否则损失面扁长收敛慢)、要迭代多轮。
选择:特征数小(几百内)用正规方程省事;特征多 / 样本大用梯度下降。
四、五条经典假设,逐条讲透
线性回归(尤其做统计推断时)建立在几条假设上,理解它们才知道模型什么时候会失效:
- 线性性:y 与特征之间是线性关系。若真实关系是曲线,硬用线性回归会系统性欠拟合。补救:加多项式项、分箱、换非线性模型。
- 独立性:样本(误差)相互独立。时间序列里相邻误差往往自相关,违反此假设会让标准误估计失真。
- 同方差性(Homoscedasticity):误差的方差在所有特征取值下恒定。若误差随 x 增大而变大(异方差,如收入越高预测越发散),系数估计仍无偏但不再有效,检验失真。补救:对 y 做 log 变换、加权最小二乘。
- 正态性:误差近似正态分布。这主要影响区间估计和假设检验;对系数点估计本身,大样本下由中心极限定理可放宽。
- 无多重共线性:特征之间不高度相关。若两特征几乎线性相关,
XᵀX接近奇异,系数方差暴涨、符号乱跳、极不稳定(详见多重共线性专题)。
记忆:线性、独立、同方差、正态、无共线——前四条常缩写为「LINE」(Linear, Independent, Normal, Equal variance)。
五、优缺点与适用场景
优点:
- 简单、训练快、可解释:每个系数直接告诉你该特征的影响方向和大小。
- 不易过拟合(模型容量小),小数据也稳。
- 是很多复杂模型的基础(正则化、GLM、逻辑回归都由它衍生)。
缺点:
- 只能拟合线性关系,表达力有限(可靠特征工程/多项式弥补)。
- 对离群点敏感(MSE 平方放大)。
- 对多重共线性敏感(系数不稳)。
适用:特征与目标近似线性、需要强可解释性、作为 baseline、或数据量不大的回归任务。
六、常见追问
- 和逻辑回归的区别? 线性回归预测连续值、用 MSE;逻辑回归预测类别概率、用 sigmoid + 交叉熵(详见逻辑回归专题)。
- 怎么处理非线性? 多项式特征、分箱、交互项,或换树/核方法。
- XᵀX 不可逆怎么办? 加 L2 正则变成岭回归
(XᵀX + λI)⁻¹,一定可逆,还能缓解共线性。 - 要不要特征缩放? 无正则的精确最小二乘拟合值不依赖单位,但缩放会改善数值条件;梯度法通常应缩放以显著改善收敛,缩放参数只能在训练集拟合。
七、用算例与工程边界复核
对样本 (x,y)={(1,3),(2,5),(3,7)},模型 ŷ=2x+1 的三个残差都为 0,残差平方和为 0。若预测改为 ŷ=1.5x+1,残差依次为 0.5、1、1.5,MSE 为 (0.25+1+2.25)/3≈1.17,最小二乘会选择前者。
| 对象/方案 | 核心机制 | 选择或风险 |
|---|---|---|
| 线性设定 | E[y | X]=Xβ |
| 误差独立同方差 | 用于标准误与区间推断 | 异方差可用稳健标准误 |
| 无完全共线 | X 列满秩或可识别 | 否则系数不唯一 |
把推导和选择压缩成执行路径:
define X and y
-> fit β by least squares
-> inspect residual pattern
-> validate prediction and inference assumptions separately
误差正态不是 OLS 系数无偏的必要条件;它主要服务有限样本下的精确检验与区间推断。
八、常见误区与追问
- 误区:线性回归要求特征本身服从正态分布。 经典假设约束的是给定 X 后的误差分布,不要求每个输入特征高斯。
- 误区:R² 高就证明线性关系和因果关系都成立。 R² 只衡量样本内方差解释比例,不能排除泄露、伪相关和设定错误。
- 追问:异方差会让 OLS 系数有偏吗? 在外生性等条件成立时系数仍可无偏,但常规标准误失真,应使用稳健标准误或重建方差模型。
- 追问:截距为什么通常要保留? 无理论约束时强制过原点会改变斜率并让残差均值不再自然为零。
- 追问:最小二乘为什么怕离群点? 残差平方会放大大误差,一个极端点可能显著拉动拟合线。
九、加强记忆
记忆时抓住四层:线性回归用 ŷ=wᵀx+b 描述条件均值,OLS 最小化残差平方和;同方差高斯噪声下,它也等价于 MLE,但使用 OLS 本身不要求正态。满列秩时系数可写成 (XᵀX)⁻¹Xᵀy,实际优先 QR/SVD/伪逆;高维或海量数据可用迭代法。外生性决定系数无偏,同方差与误差不相关支撑 Gauss–Markov 效率,正态性主要服务小样本精确推断,不能把这些条件混成“预测必须全部满足”。模型优点是简单可解释,风险是函数形式偏差、离群点、异方差和共线性,应根据诊断选择变换、稳健标准误、正则化或其他模型。