← 返回题目列表

线性回归的原理是什么?有哪些基本假设?

高频 中等 第 7 / 25 题 更新于 2026/07/28
线性模型线性回归最小二乘假设

简化版

线性回归 假设目标 y 是特征的线性组合加噪声:y = w·x + b + ε,通过最小化预测值与真实值的平方误差(最小二乘) 来求最优参数 w、b。它有几条经典假设:特征与目标线性关系、误差独立、误差同方差(方差恒定)、误差均值为 0 且近似正态、特征间无严重多重共线性。求解可用正规方程(一步闭式解)或梯度下降(迭代)。它简单、可解释、训练快,但只能拟合线性关系、对离群点和共线性敏感。

详细版

模型形式:

ŷ = w₁x₁ + w₂x₂ + ... + wₙxₙ + b = wᵀx + b

目标函数(最小二乘,MSE):

L(w,b) = (1/m) Σ (yᵢ - ŷᵢ)²      → 求使 L 最小的 w,b

五条经典假设:

假设含义违反后果
线性性y 与特征线性相关欠拟合,系统性偏差
独立性样本/误差相互独立标准误失真(如时序自相关)
同方差性误差方差恒定系数估计有效性下降
正态性误差近似正态影响区间估计/检验(大样本可放宽)
无多重共线性特征间不高度相关系数不稳、方向乱、方差大

求解两法:

  • 直接线性代数求解:满列秩时可写成 w = (XᵀX)⁻¹Xᵀy,无需调学习率;实际实现优先用 QR、SVD 或伪逆,避免显式求逆放大数值误差。分解部分的代价通常随特征维数呈立方增长。
  • 梯度下降:迭代逼近,适合大规模/高维,需要特征缩放和调学习率。

完整版教学

一、线性回归在做什么——用一条「直线/超平面」拟合数据

线性回归解决回归问题(预测连续值,如房价、销量)。它的核心假设是:目标 y 可以近似写成特征的线性组合

ŷ = w₁x₁ + w₂x₂ + ... + wₙxₙ + b
  • 一维时就是一条直线 ŷ = wx + b,多维时是一个超平面
  • w(权重/系数) 表示每个特征对目标的影响方向和强度;b(偏置/截距) 是所有特征为 0 时的基准值。
  • 学习的目标就是找一组 w、b,让这个超平面尽可能贴近所有训练点。

「尽可能贴近」需要一个量化标准——这就是损失函数。

二、为什么用平方误差(最小二乘)

线性回归用均方误差 MSE 作损失,即最小二乘法

L(w,b) = Σ (yᵢ - ŷᵢ)²      (所有样本的「预测-真实」差的平方和)

为什么是平方,而不是绝对值?

  • 数学上好处理:平方处处可导且是凸函数,能求闭式解、梯度下降也稳定;绝对值在 0 处不可导。
  • 凸函数保证全局最优:MSE 对 w 是凸的,没有局部最优陷阱,一定能找到全局最小。
  • 概率解释:若假设噪声 ε 服从均值为 0 的高斯分布,那么对 w 做最大似然估计(MLE)恰好等价于最小化平方误差——最小二乘不是拍脑袋,而是「误差高斯」假设下的最优估计(详见最大似然与最小二乘专题)。

代价:平方会放大离群点的误差(大误差平方后更大),所以线性回归对离群点敏感

三、两种求解方法:正规方程 vs 梯度下降

正规方程(闭式解):令损失对 w 的导数为 0,直接解出:

w = (XᵀX)⁻¹ Xᵀ y
  • 优点:一步到位,不用迭代、不用调学习率、不用特征缩放。
  • 缺点:形成正规方程约需 O(md²),对 d×d 系统做分解约需 O(d³)(m 为样本数、d 为特征数),高维时成本高;共线时 XᵀX 奇异,应改用伪逆、QR/SVD 或正则化,而不是强行求逆。

梯度下降(迭代):沿损失梯度反方向逐步更新 w:

w ← w - η · ∂L/∂w
  • 优点:适合大规模、高维数据,复杂度对特征数线性,内存友好。
  • 缺点:需要调学习率 η、需要特征缩放(否则损失面扁长收敛慢)、要迭代多轮。

选择:特征数小(几百内)用正规方程省事;特征多 / 样本大用梯度下降。

四、五条经典假设,逐条讲透

线性回归(尤其做统计推断时)建立在几条假设上,理解它们才知道模型什么时候会失效:

  1. 线性性:y 与特征之间是线性关系。若真实关系是曲线,硬用线性回归会系统性欠拟合。补救:加多项式项、分箱、换非线性模型。
  2. 独立性:样本(误差)相互独立。时间序列里相邻误差往往自相关,违反此假设会让标准误估计失真。
  3. 同方差性(Homoscedasticity):误差的方差在所有特征取值下恒定。若误差随 x 增大而变大(异方差,如收入越高预测越发散),系数估计仍无偏但不再有效,检验失真。补救:对 y 做 log 变换、加权最小二乘。
  4. 正态性:误差近似正态分布。这主要影响区间估计和假设检验;对系数点估计本身,大样本下由中心极限定理可放宽。
  5. 无多重共线性:特征之间不高度相关。若两特征几乎线性相关,XᵀX 接近奇异,系数方差暴涨、符号乱跳、极不稳定(详见多重共线性专题)。

记忆:线性、独立、同方差、正态、无共线——前四条常缩写为「LINE」(Linear, Independent, Normal, Equal variance)。

五、优缺点与适用场景

优点:

  • 简单、训练快、可解释:每个系数直接告诉你该特征的影响方向和大小。
  • 不易过拟合(模型容量小),小数据也稳。
  • 是很多复杂模型的基础(正则化、GLM、逻辑回归都由它衍生)。

缺点:

  • 只能拟合线性关系,表达力有限(可靠特征工程/多项式弥补)。
  • 对离群点敏感(MSE 平方放大)。
  • 对多重共线性敏感(系数不稳)。

适用:特征与目标近似线性、需要强可解释性、作为 baseline、或数据量不大的回归任务。

六、常见追问

  • 和逻辑回归的区别? 线性回归预测连续值、用 MSE;逻辑回归预测类别概率、用 sigmoid + 交叉熵(详见逻辑回归专题)。
  • 怎么处理非线性? 多项式特征、分箱、交互项,或换树/核方法。
  • XᵀX 不可逆怎么办? 加 L2 正则变成岭回归 (XᵀX + λI)⁻¹,一定可逆,还能缓解共线性。
  • 要不要特征缩放? 无正则的精确最小二乘拟合值不依赖单位,但缩放会改善数值条件;梯度法通常应缩放以显著改善收敛,缩放参数只能在训练集拟合。

七、用算例与工程边界复核

对样本 (x,y)={(1,3),(2,5),(3,7)},模型 ŷ=2x+1 的三个残差都为 0,残差平方和为 0。若预测改为 ŷ=1.5x+1,残差依次为 0.5、1、1.5,MSE 为 (0.25+1+2.25)/3≈1.17,最小二乘会选择前者。

对象/方案核心机制选择或风险
线性设定E[yX]=Xβ
误差独立同方差用于标准误与区间推断异方差可用稳健标准误
无完全共线X 列满秩或可识别否则系数不唯一

把推导和选择压缩成执行路径:

define X and y
 -> fit β by least squares
 -> inspect residual pattern
 -> validate prediction and inference assumptions separately

误差正态不是 OLS 系数无偏的必要条件;它主要服务有限样本下的精确检验与区间推断。

八、常见误区与追问

  • 误区:线性回归要求特征本身服从正态分布。 经典假设约束的是给定 X 后的误差分布,不要求每个输入特征高斯。
  • 误区:R² 高就证明线性关系和因果关系都成立。 R² 只衡量样本内方差解释比例,不能排除泄露、伪相关和设定错误。
  • 追问:异方差会让 OLS 系数有偏吗? 在外生性等条件成立时系数仍可无偏,但常规标准误失真,应使用稳健标准误或重建方差模型。
  • 追问:截距为什么通常要保留? 无理论约束时强制过原点会改变斜率并让残差均值不再自然为零。
  • 追问:最小二乘为什么怕离群点? 残差平方会放大大误差,一个极端点可能显著拉动拟合线。

九、加强记忆

记忆时抓住四层:线性回归用 ŷ=wᵀx+b 描述条件均值,OLS 最小化残差平方和;同方差高斯噪声下,它也等价于 MLE,但使用 OLS 本身不要求正态。满列秩时系数可写成 (XᵀX)⁻¹Xᵀy,实际优先 QR/SVD/伪逆;高维或海量数据可用迭代法。外生性决定系数无偏,同方差与误差不相关支撑 Gauss–Markov 效率,正态性主要服务小样本精确推断,不能把这些条件混成“预测必须全部满足”。模型优点是简单可解释,风险是函数形式偏差、离群点、异方差和共线性,应根据诊断选择变换、稳健标准误、正则化或其他模型。