AI大模型与数学 第6课:导数定义、几何意义、导数四则运算、全套基本求导公式推导

📅 2026/7/23 21:49:52
AI大模型与数学 第6课:导数定义、几何意义、导数四则运算、全套基本求导公式推导
本课核心定位AI最重要一课从这一课开始数学真正进入AI训练核心。课前说点我的感受刚看到这的小伙伴或许有些困惑或疲惫相信我继续看下去我是看到第七八课左右开始有些开朗看到十几课的时候豁然开朗等到三十课的时候打通经脉的那样开朗数学真的会让你上瘾特别是数学与ai的结合当你看懂时会觉得居然如此精妙妙不可言的神奇感而且你的思维会有质的飞跃。前面课程函数、极限、连续、无穷小 —— 搭建了模型的静态结构本课导数开启模型的动态训练前几课是准备小汽车材料这节课小汽车开起来未来课小汽车怎么开往哪开开心。一句话极限是“状态”导数是“变化速度”大模型训练就是全程在算导数。所有 AI 核心技术梯度下降反向传播参数更新学习率模型收敛、发散全部 导数的工程落地没有导数神经网络无法学习、无法更新参数、没有智能。一、导数定义极限定义根源推导增量定义式设函数 yf(x)在 x 处给一个微小增量 \Delta x变化率\frac{\Delta y}{\Delta x}\frac{f(x\Delta x)-f(x)}{\Delta x}当 增量趋近无穷小f’(x)\lim_{\Delta x \to 0}\frac{f(x\Delta x)-f(x)}{\Delta x}大白话解释\Delta x微小扰动、微小变化\Delta y结果的变化量导数 瞬间变化速度面包厂类比终极易懂x烘烤温度f(x)面包口感分数\Delta x温度微调一点点\Delta y口感变化多少导数 温度每变1度口感变好还是变差、变多快AI 对应梯度本质导数 梯度输入微小变化损失值变化多少模型知道参数该往哪边调、调多少反向传播本质逐层求导。二、导数几何意义f’(x_0) \text{曲线在 }x_0\text{ 点切线斜率}通俗理解函数曲线越陡 → 导数越大 → 梯度大更新幅度大函数曲线越平 → 导数越小 → 梯度小更新慢水平谷底 → 导数0 → 模型收敛、训练停止AI落地绝杀对应梯度大陡坡模型误差大大步更新参数梯度小缓坡模型接近最优微调参数梯度为0谷底损失最小模型收敛职场类比导数 工作改进速度刚开始漏洞多、改进快大梯度后期趋近完美、改进极慢小梯度三、可导与连续的关系AI核心定理可导一定连续连续不一定可导AI解释可导曲线平滑、有梯度、可以训练不可导尖角、折点无梯度、无法更新参数典型不可导ReLU的0点、绝对值函数尖角四、导数四则运算法则神经网络层融合核心设 u(x),v(x) 均可导和差法则(u\pm v)’ u’\pm v’AI意义多特征梯度叠加、残差连接梯度数乘法则(k u)’ k\cdot u’AI意义学习率缩放梯度超级核心学习率 lr 本质就是导数前面乘的常数 k乘法法则极重要(uv)’ u’v uv’AI意义注意力机制、权重×特征双向梯度传播除法法则\left(\frac{u}{v}\right)‘\frac{u’v-uv’}{v^2}AI意义归一化、向量标准化梯度更新神经网络每层矩阵运算全部由四则求导堆叠而成五、全套基本求导公式【从零完整推导】常数函数©’ 0推导常数无变化变化速度为0AI固定偏置不参与梯度更新幂函数全网用的最多(x^\alpha)‘\alpha x^{\alpha-1}推导极限二项式展开消去无穷小特例(x^2)’2x,\quad (x)‘1AI损失函数MSE、多项式拟合全部靠它指数函数AI第一核心公式(e^x)’ e^x本课重点推导依托第4课重要极限(e^x)‘\lim_{\Delta x\to0}\frac{e^{x\Delta x}-e^x}{\Delta x}e^x\lim_{\Delta x\to0}\frac{e^{\Delta x}-1}{\Delta x}ex\cdot1exAI史诗级意义e的导数是自身所以Softmax交叉熵损失概率模型全部稳定可导、梯度不消失、不爆炸这是人类选择自然常数e搭建AI概率体系的终极原因。对数函数(\ln x)’\frac{1}{x}AI交叉熵损失核心求导项三角函数全套(\sin x)‘\cos x(\cos x)’-\sin xAI正弦位置编码时序模型傅里叶特征网络六、导数 AI梯度下降的完整底层逻辑本课升华导数正 → 函数上升损失变大 → 参数反向更新导数负 → 函数下降损失变小 → 顺着梯度方向优化导数0 → 极值点模型收敛、训练结束一句话打通大模型训练每一轮 Epoch本质就是求导 → 取负 → 乘学习率 → 更新参数W_{new} W_{old} - \eta \cdot \frac{dLoss}{dW}你看全程只用导数四则运算七、本课终极统一类比函数 面包店固定工艺规则复合函数 多层加工流水线极限 无限逼近完美状态连续 工艺稳定无跳变导数 微调工艺、判断变好还是变差、更新工艺参数AI训练本质用导数不断微调面包店亿万参数让成品无限逼近人类完美口感味道。八、本课AI落地总结可直接写论文所有神经网络参数更新 完全依赖导数学习率就是导数的数乘系数注意力权重更新依赖乘法求导归一化层依赖除法求导e指数函数自导性质保障大模型梯度稳定不可导点导致训练震荡、不收敛九、课后习题基础求导20道基础公式类yx^5y\sqrt{x}y\dfrac{1}{x}y3x^22x1ye^x5y\ln x2xy\sin x - \cos x四则运算进阶yx^2 \cdot e^xyx\ln xy\dfrac{x}{x1}y(x^21)\sin xy3x^3 - 2e^x简单复合铺垫为下一课链式法则y(x1)^2y\sin(x)\cdot \cos(x)ye^x \ln x拔高理解AI梯度风格yx^2-4x 求极值点ye^{-x} 求导模拟衰减梯度y\ln(1x) 求导损失函数原型y2x^2-8x3 找导数为0点解释为什么 e^x 是AI最完美的激活基底函数下一课预告 第7课链式法则、复合函数求导、多层神经网络反向传播数学本源真正看懂GPT反向传播的一课