AI大模型与数学 第7课:复合函数求导、链式法则(AI梯度反向传播核心)

📅 2026/7/23 21:51:23
AI大模型与数学 第7课:复合函数求导、链式法则(AI梯度反向传播核心)
本课是整系列最重要一课前面所有课程都是“铺垫”从本课开始你彻底看懂神经网络、看懂GPT训练原理。我们生活中面临的事情不是一件我们今天的生活也是过往众多的选择众多事情的叠加一件事情的成功与否是众多事情众多因素相互之间的作用共同叠加而成的今天我们就用数学的手段模拟这种相互一句话真理单层导数 简单函数变化率链式法则 多层神经网络反向传播大模型能训练、能学习、能迭代优化唯一数学原理链式法则。所有深度学习底层公式残差网络更新Transformer逐层梯度回传亿万参数更新梯度消失/梯度爆炸全部由链式法则直接决定。一、回顾神经网络就是巨型复合函数数学回顾单层网络y f(wxb)三层神经网络y f_3(f_2(f_1(x)))深度学习 多层复合函数面包店终极类比x原材料f_1揉面发酵第一层网络f_2塑形整形第二层网络f_3烘烤上色第三层网络最终成品输出预测结果成品好不好取决于每一道工序的叠加影响。AI核心痛点想优化最终成品降低Loss需要 反向追溯哪一层工序影响最大这个“逐层倒查影响”的数学工具就是链式法则。二、复合函数与链式法则严格定义复合函数结构设y f(u),\quad u g(x)则复合y f(g(x))链式法则公式核心公式\frac{dy}{dx} \frac{dy}{du} \cdot \frac{du}{dx}人话翻译总变化率 外层变化率 × 内层变化率多层链式深度学习真实形态三层嵌套yf(u),ug(v),vh(x)\frac{dy}{dx}\frac{dy}{du}\cdot\frac{du}{dv}\cdot\frac{dv}{dx}多少层网络就乘多少段导数。三、链式法则通俗深度类比独家双类比面包店流水线类比x面粉质量输入v(x)发酵效果第一层变化u(v)塑形效果第二层变化y(u)最终口感输出最终口感对面粉质量的敏感度发酵影响 × 塑形影响 × 烘烤影响每一层工序都会 放大或削弱 原始输入的变化。职场类比最适合理解梯度消失新人能力最终产出个人学习速度 × 组长管理系数 × 部门政策系数如果中间两层系数很小最底层努力几乎不影响最终结果—— 这就是 梯度消失。四、链式法则与AI三大核心问题为什么深层网络容易梯度消失每一层导数数值大多 小于1多层相乘0.9 \times 0.9 \times 0.9 \dots \to 0层数越深乘积越趋近0 → 参数不更新 → 不学了为什么会梯度爆炸某几层导数 大于1多层累乘1.1 \times 1.1 \times \dots \to \infty梯度失控、参数炸裂、模型不收敛ResNet残差连接本质顶级AI原理残差结构数学y x F(x)求导后出现 1 小梯度项保证连乘中永远有一个 1彻底杜绝梯度消失ResNet能训练上百层深层模型完全是链式法则的胜利五、链式法则严谨数学推导已知\lim_{\Delta x\to0}\frac{\Delta u}{\Delta x}u’(x),\quad\lim_{\Delta u\to0}\frac{\Delta y}{\Delta u}y’(u)复合增量关系\Delta y \frac{\Delta y}{\Delta u}\cdot \Delta u两边除以 \Delta x\frac{\Delta y}{\Delta x}\frac{\Delta y}{\Delta u}\cdot\frac{\Delta u}{\Delta x}取极限\frac{dy}{dx}\frac{dy}{du}\cdot\frac{du}{dx}推导完成严谨闭环。六、标准例题单层、双层、三层复合求导例1 简单复合y\sin(x^2)令 ux^2y’ \cos(u)\cdot 2x 2x\cos(x^2)例2 指数复合AI高频ye{-x2}y’ e{-x2}\cdot(-2x) -2x e{-x2}高斯激活、降噪模型核心导数例3 三层复合模拟深度网络y\sin(e{x2})y’\cos(e{x2}) \cdot e{x2} \cdot 2x三层结构、三段相乘、完美对应三层网络反向传播七、AI反向传播完整数学对应本课升华神经网络前向\text{Output} Layer_n(\dots Layer_1(x)\dots)反向传播求梯度\frac{\partial Loss}{\partial W_1}\frac{\partial Loss}{\partial Out_n}\cdot\frac{\partial Out_n}{\partial Out_{n-1}}\cdots\cdot\frac{\partial Out_1}{\partial W_1}每一层参数更新都是一次链式连乘。大模型亿万参数训练本质超级超长链式法则累乘八、本课最全AI落地总结链式法则 深度学习的核心引擎多层网络 多层复合函数反向传播 链式法则从后往前求导梯度消失/爆炸 多层导数连乘趋近0或无穷ResNet、归一化、激活函数设计全部为了稳定链式累乘Transformer、GPT所有权重更新底层全部是链式法则不懂链式法则永远不懂AI为什么能训练。九、课后专项习题多层复合函数求导20道二层复合基础y(2x1)^3y\sin(3x)y\cos(x^3)ye^{2x}y\ln(1x^2)y\sqrt{1-x^2}y\tan(2x)y\dfrac{1}{(1x)^2}二层进阶AI常用形态ye^{-3x}y\sin^2 xy\ln(\sin x)ye{x21}三层复合模拟深度网络y\sin(e^{2x})y\ln(\cos x^2)ye^{\sin(3x)}y\sqrt{\ln x}综合混合贴近真实网络求导yx^2 \cdot e^{-x}y\sin(2x)\cdot\ln xy(1ex)2思考为什么深层网络连乘小数会梯度消失用链式公式解释学到这里我们对ai的训练等工作要熟悉他背后的数学逻辑关系如果是通过这个学习高等数学的在校生可以详解数学过程推导。