引言同一张桌子比个高下上一章把 GRU 单独训练了 25 轮验证准确率爬到 73.85%。但单看一家看不出好坏——GRU 到底比 RNN 强多少LSTM 是不是更厉害不放在一起跑谁也说不清。这一章做一件简单又公平的事把 RNN、LSTM、GRU 三个模型用完全一样的食材同一份数据、一样的火候同一批超参数、一样的起点同一个随机种子各炒一遍然后看谁先熟、谁最香、谁糊了。本章目标用控制变量法搭起三模型公平对比的框架同一张图上看清三者的收敛速度与最终精度用真实数据验证第 10 章的理论结论RNN 梯度消失、GRU 性价比最高。一、控制变量公平对决的前提要比得公平就得让三个模型只差循环单元这一处其余全部锁死。这就是理科里常说的控制变量法——其他条件不动只改想比的那一个变量。超参数取值为什么锁死Embedding 维度64三个模型查同一本字典Hidden 维度64记忆容量一样大Epoch12大家都跑同样的时长学习率1e-3Adam步子一样大Batch Size64每批吃同样多的样本梯度裁剪5.0防止个别模型当场爆炸随机种子42起点完全一致可复现这样最后谁高谁低就只可能是循环单元本身造成的。二、同一副骨架换核心零件三个模型只是中间那层不同前后的Embedding和Linear(1)完全一样。代码上把循环单元做成一个能随时替换的零件即可defmake_model(cell):unit{RNN:nn.RNN,GRU:nn.GRU,LSTM:nn.LSTM}[cell]classNet(nn.Module):def__init__(self):super().__init__()self.embnn.Embedding(VOCAB,64,padding_idx0)self.rnnunit(64,64,batch_firstTrue)# 只换这一层self.fcnn.Linear(64,1)defforward(self,x):eself.emb(x)outself.rnn(e)h_nout[1]ifisinstance(out,tuple)elseout[-1]h_nh_n[0]ifisinstance(h_n,tuple)elseh_nreturnself.fc(h_n[-1]).squeeze(-1)# 最后一步记忆打分returnNet()有个小坑值得记住nn.LSTM返回的是(输出, (h_n, c_n))的元组而nn.RNN/nn.GRU返回(输出, h_n)。所以取最后一步记忆时得先判断out是不是元组、h_n又是不是元组统一取到最后一层、最后一个时间步的隐藏状态——上面那两行isinstance就是在处理这个差异。训练三遍唯一变的只有make_model(RNN)/make_model(GRU)/make_model(LSTM)forcellin[RNN,GRU,LSTM]:torch.manual_seed(42);np.random.seed(42)# 起点一致modelmake_model(cell)opttorch.optim.Adam(model.parameters(),lr1e-3)forepinrange(12):forstinrange(0,8000,64):x,ypack(train_idx[st:st64])# 填充掩码同第14章lolossf(model(x),y)opt.zero_grad();lo.backward()nn.utils.clip_grad_norm_(model.parameters(),5.0)opt.step()vaccevaluate(model,val_idx)# 每轮在验证集打分训练期间每轮在 2000 条验证集上测一次准确率12 轮下来就有三条完整的曲线。三、三足鼎立一张图见分晓把三条验证准确率曲线画在同一张图上谁在爬升、谁在打摆子一目了然三模型验证准确率对比IMDB12 轮0.450.500.550.600.650.700.7501234567891011EpochRNN贴底震荡LSTM后段跳升GRU5 轮后陡升73.65%63.25%RNN 峰值 51.35%RNN绿线贴底震荡12 轮全程在 50% 上下抖动峰值只有51.35%。这就是第 5 章讲的梯度消失——信息传不了几层就湮灭训练损失虽然缓慢下降验证准确率却始终在瞎猜水平学不进去。GRU蓝线陡升最高前 4 轮还在 50% 附近热身第 5 轮后突然崛起一路冲到峰值73.65%最终测试集73.06%。既快又准名不虚传。LSTM红线后段跳升前 5 轮也压着 50%第 6 轮跳升到 60.95%随后又回落震荡第 9 轮再爬到63.25%测试集62.38%。能学但热得慢节奏不稳定。把关键数字收拢成一张结果表模型验证峰值测试集准确率参数量表现RNN51.35%50.65%328,513梯度消失学不动GRU73.65%73.06%345,153收敛快、精度高LSTM63.25%62.38%353,473慢热、震荡GRU 用最少的门控2 个门、比 LSTM 小的参数量却跑出了最高的精度——这正是第 10 章IMDB 实战选 GRU 当主力的实证。四、为什么 RNN 会打摆子RNN 全程贴底根源还是那条老路的梯度消失。把第 4 章的结论搬回来隐藏状态更新是httanh(Whh ht−1Wxh xt)h_t \tanh\big(W_{hh}\,h_{t-1} W_{xh}\,x_t\big)httanh(Whhht−1Wxhxt)反向传播时梯度要一路乘过∂ht/∂ht−1\partial h_t/\partial h_{t-1}∂ht/∂ht−1∂L∂h1∏t2T[Whh⊤ diag(1−ht2)] ∂L∂hT\frac{\partial L}{\partial h_1} \prod_{t2}^{T} \Big[ W_{hh}^\top \,\mathrm{diag}\big(1-h_t^2\big) \Big] \,\frac{\partial L}{\partial h_T}∂h1∂Lt2∏T[Whh⊤diag(1−ht2)]∂hT∂L影评动辄一两百个词这一串连乘里只要谱半径小于 1梯度就指数式缩到几乎为零模型收不到来自远处的信号自然学不动。GRU 和 LSTM 靠门控另开了高速通道梯度能顺着细胞状态近无损地传回去才解得开这个结。五、常见坑与自查公平性被破坏某个模型忘了设种子或改了学习率曲线就不具可比性。每次换模型前都要重新manual_seed(42)。LSTM 取错状态LSTM 返回的是元组(h_n, c_n)直接当 RNN 那样取out[-1]会拿到c_n张量、维度对不上。先用isinstance判一下类型。只看训练损失RNN 的训练损失也在降从 0.70 到 0.55但验证准确率纹丝不动——评价必须看验证集准确率不能只看训练损失。种子固定了但数据没洗牌忘了第 14 章的教训切分前不shuffle验证集变单一种类三条曲线统统失真。小结这一章用控制变量法把三个模型放到同一张桌子上比了个高下公平对决同一份数据、同一批超参数、同一个种子只换循环单元RNN 学不动全程卡在 50% 震荡峰值 51.35%梯度消失的实证GRU 又快又准第 5 轮陡升验证峰值 73.65%、测试 73.06%性价比之王LSTM 慢热后段才爬到 63.25%能学但不稳。结论和第 10 章的理论预测完全对上了IMDB 这类中等规模任务GRU 是效率与精度兼得的主力。但这还只是 12 轮、64 维隐藏的初赛。下一章还会在最优模型上引入 Dropout、调大隐藏维度挑战更高的精度上限。下一篇二十九模型优化、测试评估与RNN知识体系收官