吴恩达深度学习课程一:神经网络和深度学习 第四周:深度神经网络的关键概念

📅 2026/7/24 22:19:39
吴恩达深度学习课程一:神经网络和深度学习 第四周:深度神经网络的关键概念
吴恩达深度学习课程一神经网络和深度学习 第四周深度神经网络的关键概念大家好我是你们的技术博主小深。今天我们来聊聊吴恩达老师的深度学习课程第一部分的第四周内容——深度神经网络的关键概念。如果你已经学完了前三周从线性回归到浅层神经网络那么第四周就是带你从“浅水区”游向“深水区”的关键一步。别怕我会用大白话讲清楚并配上可运行的代码示例让你看得懂、跑得动。## 什么是深度神经网络深度神经网络Deep Neural Network简称DNN说白了就是有很多层隐藏层的神经网络。浅层神经网络比如只有一个隐藏层能解决的问题有限比如简单的分类任务。但现实中很多问题比如图像识别、语音识别非常复杂需要多层神经网络来提取更抽象的特征。举个例子识别一张图片里有没有猫。浅层网络可能只能看到像素点边缘、颜色而深层网络可以逐步组合出“眼睛”、“耳朵”、“胡须”这些更高级的特征最后判断是不是猫。这就是“深层”的价值——层次越深特征越抽象。## 关键概念一前向传播和反向传播在深度神经网络中训练过程分为两步前向传播Forward Propagation和反向传播Backward Propagation。简单来说-前向传播从输入层开始一层一层向前计算直到输出层。每层会计算线性部分z w * a_prev b和激活部分a activation(z)。-反向传播从输出层开始向后计算每一层的梯度即损失函数对参数的导数然后用这些梯度更新参数。这两个过程是“对偶”的前向传播时的中间值比如z和a会被缓存下来供反向传播使用。这就是为什么代码里要“缓存”中间结果。下面是前向传播的通用公式- 对于第l层Z[l] W[l] * A[l-1] b[l]- A[l] gl其中g[l]是激活函数ReLU、sigmoid等反向传播的梯度计算公式以sigmoid为例- dZ[l] dA[l] * g[l](Z[l])- dW[l] (1/m) * dZ[l] * A[l-1]T- db[l] (1/m) * np.sum(dZ[l], axis1, keepdimsTrue)## 关键概念二参数初始化深度神经网络对参数初始化非常敏感。如果W初始化为0那么所有隐藏单元会对称导致所有神经元学到相同的东西即“对称性问题”。因此我们通常使用随机初始化并且根据激活函数选择不同的缩放因子。对于ReLU激活函数推荐使用“He初始化”W[l] np.random.randn(shape) * np.sqrt(2 / n[l-1])对于tanh或sigmoid推荐使用“Xavier初始化”W[l] np.random.randn(shape) * np.sqrt(1 / n[l-1])## 代码示例一实现深度神经网络的前向传播下面是一个简单的深度神经网络前向传播代码包含两层隐藏层使用ReLU和输出层使用sigmoid。注意看缓存机制。pythonimport numpy as npdef initialize_parameters(layer_dims): 初始化深度神经网络的参数 layer_dims: 包含每层神经元数量的列表例如 [2, 4, 3, 1] 表示输入层2个隐藏层1有4个隐藏层2有3个输出层1个 np.random.seed(1) # 固定随机种子方便复现 parameters {} L len(layer_dims) # 层数包括输入层 for l in range(1, L): # He初始化适用于ReLU parameters[W str(l)] np.random.randn(layer_dims[l], layer_dims[l-1]) * np.sqrt(2 / layer_dims[l-1]) parameters[b str(l)] np.zeros((layer_dims[l], 1)) return parametersdef linear_forward(A_prev, W, b): 线性前向传播Z W * A_prev b Z np.dot(W, A_prev) b cache (A_prev, W, b) # 缓存供反向传播使用 return Z, cachedef activation_forward(Z, activation_type): 激活函数前向传播 if activation_type sigmoid: A 1 / (1 np.exp(-Z)) cache Z elif activation_type relu: A np.maximum(0, Z) cache Z else: raise ValueError(Unsupported activation type) return A, cachedef forward_propagation(X, parameters): 完整的前向传播 caches [] A X L len(parameters) // 2 # 层数不包括输入层 # 隐藏层使用ReLU for l in range(1, L): A_prev A W parameters[W str(l)] b parameters[b str(l)] Z, linear_cache linear_forward(A_prev, W, b) A, activation_cache activation_forward(Z, relu) caches.append((linear_cache, activation_cache)) # 输出层使用sigmoid W parameters[W str(L)] b parameters[b str(L)] Z, linear_cache linear_forward(A, W, b) A, activation_cache activation_forward(Z, sigmoid) caches.append((linear_cache, activation_cache)) return A, caches# 测试输入层2个特征两个隐藏层4个和3个神经元输出层1个layer_dims [2, 4, 3, 1]parameters initialize_parameters(layer_dims)X np.array([[0.5, 0.2], [0.1, 0.8]]) # 两个样本A_final, caches forward_propagation(X, parameters)print(输出层结果, A_final)运行这段代码你会看到输出层的结果概率值它表示每个样本属于正类的概率。注意这里参数是随机初始化的所以结果不是训练后的预测。## 关键概念三为什么深度神经网络有效深度神经网络之所以强大有两个主要原因1.层次化特征提取浅层网络只能学习简单特征如边缘深层网络可以组合这些特征形成更复杂的模式。在图像识别中第一层学边缘第二层学形状第三层学物体部件第四层学整个物体。2.参数共享和效率深度神经网络通过分层结构可以用更少的参数模拟更复杂的函数。理论上一个足够深的网络可以用指数级少的参数达到与浅层网络相同的表示能力。## 关键概念四深度神经网络的训练技巧训练深度神经网络时有几个常见问题需要留意-梯度消失/爆炸当网络很深时梯度在反向传播中可能指数级缩小消失或增大爆炸。解决方法包括使用ReLU等非饱和激活函数、批量归一化、梯度裁剪。-过拟合深度网络参数多容易过拟合。可以用L2正则化、dropout、数据增强来缓解。-学习率调整深度网络训练需要合适的学习率。可以使用学习率衰减learning rate decay或自适应优化器如Adam。## 代码示例二实现深度神经网络的损失函数和反向传播下面我们实现一个完整的反向传播示例包括损失函数计算和梯度更新。pythondef compute_loss(A_final, Y): 计算交叉熵损失 A_final: 输出层激活值预测概率 Y: 真实标签0或1 m Y.shape[1] loss -1/m * np.sum(Y * np.log(A_final) (1 - Y) * np.log(1 - A_final)) return np.squeeze(loss)def linear_backward(dZ, cache): 线性反向传播计算dW, db, dA_prev A_prev, W, b cache m A_prev.shape[1] dW 1/m * np.dot(dZ, A_prev.T) db 1/m * np.sum(dZ, axis1, keepdimsTrue) dA_prev np.dot(W.T, dZ) return dA_prev, dW, dbdef activation_backward(dA, cache, activation_type): 激活函数反向传播计算dZ Z cache if activation_type sigmoid: s 1 / (1 np.exp(-Z)) dZ dA * s * (1 - s) # sigmoid导数 elif activation_type relu: dZ dA * (Z 0) # ReLU导数大于0时为1否则为0 else: raise ValueError(Unsupported activation type) return dZdef backward_propagation(Y, caches): 完整的反向传播返回所有参数的梯度 grads {} L len(caches) m Y.shape[1] # 初始化输出层的dAcross-entropy loss对sigmoid输出的导数 A_final, _ caches[-1] # caches中最后一组是输出层 dA - (np.divide(Y, A_final) - np.divide(1 - Y, 1 - A_final)) # 反向传播从输出层开始 for l in reversed(range(L)): linear_cache, activation_cache caches[l] if l L-1: # 输出层使用sigmoid dZ activation_backward(dA, activation_cache, sigmoid) else: # 隐藏层使用ReLU dZ activation_backward(dA, activation_cache, relu) dA_prev, dW, db linear_backward(dZ, linear_cache) grads[dW str(l1)] dW grads[db str(l1)] db dA dA_prev return gradsdef update_parameters(parameters, grads, learning_rate): 使用梯度下降更新参数 L len(parameters) // 2 for l in range(L): parameters[W str(l1)] - learning_rate * grads[dW str(l1)] parameters[b str(l1)] - learning_rate * grads[db str(l1)] return parameters# 测试反向传播使用上面的前向传播结果Y np.array([[1, 0]]) # 两个样本的真实标签loss compute_loss(A_final, Y)print(损失值, loss)grads backward_propagation(Y, caches)print(dW3的形状, grads[dW3].shape) # 输出层权重梯度# 更新参数parameters update_parameters(parameters, grads, learning_rate0.01)print(更新后的W3, parameters[W3][:2]) # 只看前两行运行这段代码你会看到损失值和梯度更新的结果。这就是深度神经网络训练的核心循环前向传播 - 计算损失 - 反向传播 - 更新参数。## 总结深度神经网络是深度学习的基础。第四周课程主要教会我们三件事1.深层网络的结构通过堆叠多个隐藏层网络可以学习更抽象的特征。2.前向传播和反向传播这是训练的核心需要理解每层的计算和缓存机制。3.参数初始化与训练技巧好的初始化能加速收敛梯度消失/爆炸需要警惕。从代码实现来看深度神经网络的代码虽然比浅层网络复杂但核心思想是一致的线性变换 激活函数然后反复堆叠。只要你掌握了浅层网络第三周内容深层网络只是“重复”和“缓存”的升级版。吴恩达老师在这周的课程中还强调了向量化实现的重要性——用矩阵运算替代for循环能让代码跑得飞快。上面我的代码例子已经用了向量化你可以试试跑一下感受一下矩阵运算的魅力。最后记住一句话深度不是魔法而是层次化抽象。希望这篇文章能帮你更好地理解深度神经网络如果你有任何疑问欢迎在评论区留言讨论。