准大二学生从0开始学AI——机器学习Day3

📅 2026/7/23 3:36:09
准大二学生从0开始学AI——机器学习Day3
---type: daily_notetitle: Phase 2.1 Day 3 — 梯度下降date: 2026-07-22person: 吴恩达phase: 2.1day: 3topics: [梯度下降, 学习率, 批量梯度下降]---# 2026-07-22 学习笔记## 笔记区学的时候随手记### 核心观点- **MSEMean Squared Error均方误差**线性回归的代价函数衡量预测值偏离真实值的程度。公式 J 1/(2m) × Σ(ŷ - y)²。ŷ-y 是误差平方是为了放大大误差Σ/m 是平均1/2 是为了求导时消掉系数- **梯度下降的目标**通过迭代更新参数 w 和 b使代价函数 J(w,b) 达到最小值- **核心公式**w : w - α·∂J/∂wb : b - α·∂J/∂b同时更新- **减号的物理意义**梯度指向 J 增大最快的方向上坡减号逆着走下坡- **学习率 α**控制每一步走多大——太大震荡不收敛太小收敛太慢- **批量梯度下降Batch GD**每一步更新参数时使用**全部**训练样本计算平均梯度- **凸函数**线性回归的 MSE 代价函数是凸函数碗状只有一个全局最小值- **同步更新**∂J/∂w 和 ∂J/∂b 都用同一组 (w,b) 计算算完再一起更新### 关键方法/流程批量梯度下降完整流程1. 初始化 w0, b02. 重复直到收敛a. 用当前 (w,b) 算所有样本的预测值 ŷ wx bb. 计算平均梯度∂J/∂w 1/m × Σ(ŷⁱ - yⁱ) × xⁱ∂J/∂b 1/m × Σ(ŷⁱ - yⁱ)c. 同时更新w w - α × ∂J/∂wb b - α × ∂J/∂b### 梯度推导心算验证样本(100,98), (200,96), (300,94)初始化 w0, b0- ŷ 0·x 0 0所有样本- ∂J/∂w 1/3 × [(-98)(100) (-96)(200) (-94)(300)] -19066.67- ∂J/∂b 1/3 × [-98 (-96) (-94)] -96- w_new 0 - 0.01 × (-19066.67) 190.67- b_new 0 - 0.01 × (-96) 0.96 后续迭代用 w190.67, b0.96 继续重复这个过程直到 J 不再明显下降---## 线索区学完后合上材料自问自答 先看问题 → 自己回答 → 点开对照。答不上来的就是没学透。**Q: 梯度下降的核心公式是什么为什么是减号**A: w w - α·∂J/∂w。梯度 ∂J/∂w 指向 J 增大最快的方向上坡减号意味着逆着方向走即下坡。验证梯度为正右边高→ w 减小往左走梯度为负左边高→ w 增大往右走。**Q: 同时更新simultaneous update是什么意思不这么做会怎样**A: 计算 ∂J/∂w 和 ∂J/∂b 时都使用当前的 (w,b) 值。两个梯度都算完后再一起更新 w 和 b。如果先更新 w 再用新 w 算 ∂J/∂b会导致用新值算旧值的逻辑错误。**Q: 学习率 α 太大和太小分别有什么影响**A: α 太大 → 每一步迈太大可能跨过最低点来回震荡不收敛α 太小 → 每步走太少收敛很慢效率低。**Q: 为什么线性回归的梯度下降能找到全局最小值**A: 线性回归的 MSE 代价函数是凸函数convex形状像碗只有一个最低点所以局部最小值就是全局最小值。**Q: MSE 是什么公式里每个部分代表什么为什么用平方为什么还有 1/2**A: MSE Mean Squared Error均方误差是线性回归用的代价函数。J 1/(2m) × Σ(ŷ - y)²。ŷ-y 是每个样本的预测误差平方让正负误差不抵消同时放大大误差惩罚大偏差Σ/m 取平均消除样本数量影响1/2 是 Ng 加的求导时平方项的 2 被消掉公式更简洁。**Q: 为什么叫批量梯度下降这里的批量指什么**A: 批量batch指每次更新参数时使用全部训练样本来计算平均梯度。这个阶段只有这一种梯度下降没有其他版本。---## 总结梯度下降 逆着梯度方向上坡反向下坡迭代更新参数逐步让代价函数最小化。线性回归中 MSE 是凸函数保证能找到全局最小值。学习率 α 控制步长太大震荡太小太慢。批量指每次用全部样本算梯度。---## 复习卡片| 概念 | 一句话 | 我的场景 || ------------ | ------------------------------------------ | --------------------------------------- || 梯度下降 | 沿梯度反方向迭代更新参数使代价函数最小化 | 用历史循环数据训练 w,b预测电池 SOH || 同步更新 | 用同一组参数算所有偏导算完再一起更新 | 算 ∂J/∂w 和 ∂J/∂b 都用当前的 w,b || 学习率 α | 控制每步大小的超参数太大震荡太小慢 | SOH 预测模型训练时调试的关键参数 || 批量梯度下降 | 每次更新用全部样本算平均梯度 | 三个样本每轮都参与计算平均梯度 || 凸函数 | 碗状曲线只有一个全局最小值 | 线性回归的 MSE 代价函数找最小值有保证 |