GRU 相比 LSTM 做了哪些简化?它在性能和效率上有何权衡?

📅 2026/7/30 7:57:51
GRU 相比 LSTM 做了哪些简化?它在性能和效率上有何权衡?
GRU 相比 LSTM 的简化GRUGated Recurrent Unit由 Cho 等人于 2014 年提出核心目标是在保持 LSTM 解决长程依赖能力的前提下减少门控数量和参数量提升训练效率。结构对比LSTM (3门 2状态): C_{t-1} ──●── fₜ⊙ ──┐── Cₜ 细胞状态独立 ↑ │() h_{t-1} ──┼── iₜ⊙C̃ₜ ─┘ ├── oₜ ──→ hₜ oₜ⊙tanh(Cₜ) GRU (2门 1状态): h_{t-1} ──●── (1-zₜ)⊙ ──┐── hₜ 隐藏状态合并了细胞状态 ↑ │() ├── zₜ⊙h̃ₜ ────┘ ├── rₜ ──→ h̃ₜ三个关键简化简化一合并细胞状态与隐藏状态LSTMGRU状态数量2 个Cₜ 和 hₜ1 个hₜ细胞状态独立的 Cₜ不直接输出取消hₜ 同时承担记忆和输出LSTM 中Cₜ是内部记忆hₜ是对外输出两者分离。GRU 直接让hₜ同时充当记忆和输出省去一条状态通路。简化二三个门 → 两个门LSTM 门作用GRU 对应遗忘门 fₜ控制保留多少旧信息合并到更新门 zₜ输入门 iₜ控制写入多少新信息合并到更新门 zₜ输出门 oₜ控制输出多少信息取消hₜ 直接输出——重置门 rₜ新增控制计算候选状态时用多少旧信息GRU 的两个门重置门: rₜ σ(W_r · [h_{t-1}, xₜ]) 更新门: zₜ σ(W_z · [h_{t-1}, xₜ])简化三更新门同时控制遗忘和写入LSTM 中遗忘门和输入门是独立的理论上可以同时全开保留旧信息且写入新信息或同时全关。GRU 用一个更新门zₜ耦合了这两个操作hₜ (1 - zₜ) ⊙ h_{t-1} zₜ ⊙ h̃ₜ ↑ ↑ 保留旧信息 写入新信息zₜ → 0保留旧信息不写入新信息zₜ → 1丢弃旧信息写入新信息两者此消彼长互斥关系比 LSTM 少一个自由度完整公式对比LSTM: fₜ σ(W_f·[h_{t-1}, xₜ]) 遗忘门 iₜ σ(W_i·[h_{t-1}, xₜ]) 输入门 oₜ σ(W_o·[h_{t-1}, xₜ]) 输出门 C̃ₜ tanh(W_C·[h_{t-1}, xₜ]) 候选状态 Cₜ fₜ⊙C_{t-1} iₜ⊙C̃ₜ 细胞状态更新 hₜ oₜ⊙tanh(Cₜ) 隐藏状态 GRU: rₜ σ(W_r·[h_{t-1}, xₜ]) 重置门 zₜ σ(W_z·[h_{t-1}, xₜ]) 更新门 h̃ₜ tanh(W·[rₜ⊙h_{t-1}, xₜ]) 候选状态 hₜ (1-zₜ)⊙h_{t-1} zₜ⊙h̃ₜ 隐藏状态更新GRU 如何保留解决梯度消失的能力GRU 虽然简化了结构但保留了加法通路这一核心机制hₜ (1 - zₜ) ⊙ h_{t-1} zₜ ⊙ h̃ₜ ∂hₜ/∂h_{t-1} (1 - zₜ) 其他项 ↑ 逐元素乘法非矩阵连乘当zₜ → 0时(1 - zₜ) → 1梯度几乎无损传播与 LSTM 遗忘门fₜ → 1的效果一致。性能与效率的权衡参数量对比设隐藏维度为d输入维度为mLSTMGRU比值门控权重矩阵3 × (dm) × d2 × (dm) × dGRU 为 LSTM 的2/3偏置3 × d2 × d2/3候选状态权重(dm) × d(dm) × d相同总参数量4(d² dm)3(d² dm)GRU 少 25%效率优势维度GRU 优势训练速度参数少 25%每步计算量更小训练更快内存占用少存储一个门的状态和梯度收敛速度参数少优化空间更小通常更快收敛部署体积模型更小适合资源受限场景性能权衡维度结论短/中序列GRU 与 LSTM 性能相当GRU 更优效率高长序列LSTM 通常略优独立的遗忘/输入门提供更精细的控制小数据集GRU 更优参数少不易过拟合大数据集LSTM 更优表达能力更强数据足以训练更多参数门控灵活性LSTM 的遗忘门和输入门可同时全开保留旧写入新GRU 的更新门强制互斥表达力略弱选择建议序列长 / 数据大 / 需要精细控制 → LSTM 序列短 / 数据少 / 追求效率 → GRU 不确定 → 先试 GRU快不够再换 LSTM总结维度LSTMGRU门数量3遗忘、输入、输出2重置、更新状态细胞状态 隐藏状态仅隐藏状态遗忘/写入独立控制耦合互斥更新门参数量4(d²dm)3(d²dm)少 25%加法通路有Cₜ有hₜ长程依赖强强略弱于 LSTM训练效率较慢较快适用场景长序列、大数据短中序列、小数据、资源受限核心结论GRU 通过合并状态、减少门数、耦合遗忘与写入三个简化将参数量减少约 25%同时保留了加法通路这一解决梯度消失的关键机制。代价是丧失了遗忘门和输入门的独立控制能力在长序列和复杂数据上表达力略弱。实践中GRU 和 LSTM 的性能差距通常不大GRU 在效率上的优势使其成为优先尝试的选项。