机器学习-线性回归与极大似然估计

📅 2026/8/5 11:27:16
机器学习-线性回归与极大似然估计
【一】线性回归的基本概念线性回归的目标在给定数据点集的情况下找到一条最优直线或超平面来拟合数据的分布规律。关键认知真实世界的数据永远不会完美地落在一条直线上——自然界产生的数据总会存在随机波动和偏差。所以线性回归找的是最能代表数据趋势的近似直线而非穿过所有数据点的精确直线。【二】一元线性回归的数学表达基本方程其中- kx b表示数据的系统性趋势确定性部分- εEpsilon表示误差项随机偏差代表数据点与直线的偏离【三】误差项的正态分布假设核心线性回归的核心统计假设误差项 ε 服从正态分布高斯分布为什么这样假设- 我们希望大多数数据点靠近回归直线即 ε 接近0- 只有少数点会有较大偏差即 ε 绝对值较大- 这种大多数误差小、少数误差大的分布特征正好对应正态分布曲线——在均值0处概率密度最大向两侧递减标准正态分布的概率密度函数当设定误差项 ε 服从均值为0、标准差为σ的正态分布时可将 ε y - kx - b代入正态分布公式得到关于模型参数的概率表达式。【四】极大似然估计MLE的哲学思想核心逻辑我们所观察到的数据一定是该数据生成机制下概率最大的结果。【案例辅助理解摸球问题】假设袋子中有10个球颜色未知。有放回地抽取10次结果9次抽到黑球、1次抽到白球。问袋子中最可能的颜色构成是什么答案最可能是 9个黑球、1个白球。理由虽然8黑2白也有可能抽出9黑1白但在这种构成下抽到9黑1白的概率要低得多。现实事件的发生遵循其背后的概率分布——我们观察到的结果最可能来自使该结果概率最大的参数配置。数学表达当拥有 n 条独立观测数据时这些数据联合出现的概率即各数据概率的乘积应当达到最大值。【五】极大似然估计的数学推导框架步骤1建立误差概率模型单个样本的误差 ε_i y_i - θx_i 服从正态分布步骤2构建似然函数L(θ) ∏ᵢ f(y_i - θx_i) 所有样本概率的乘积步骤3最大化原则选择使 L(θ) 最大的 θ 值即最优参数步骤4数学求解对似然函数取对数对数似然求导并令导数为0取对数的原因将乘积运算转化为加法运算简化求导过程且不改变函数的极值点。【六】矩阵表示线性回归方程可用矩阵形式统一表达Y Xθ ε其中- Y观测值向量- Y 的每一项对应一个样本的真实值- X设计矩阵包含所有自变量- X 的每一行对应一个样本每一列对应一个特征- θ待求解的参数向量- θ 的每一项对应一个特征的权重系数- ε误差向量- ε 的每一项对应一个样本的预测误差优势这一形式在一元和多元情形下保持一致性也为后续的最小二乘法和数值计算奠定了基础。【七】核心要点总结1. 线性回归是用直线或超平面拟合数据趋势的方法2. 真实数据不可能完全线性所以需要引入误差项 ε3. 误差项服从正态分布是线性回归的关键统计假设4. 极大似然估计是从概率角度求解最优参数的框架5. 极大似然估计的核心思想寻找使观测数据出现概率最大的参数值6. 求解方法构建似然函数 → 取对数 → 求导 → 令导数为0【八】与KNN的对比算法名称 | 核心思想 | 适用场景 | 关键假设KNN | 基于相似性的多数表决 | 分类问题 | 同类样本在特征空间中聚集线性回归 | 最小化误差拟合趋势 | 回归问题 | 误差项服从正态分布