强化学习精通教程 📅 2026/8/11 3:55:49 强化学习精通教程目标在入门概念之上建立可推导、可实现、可调参、可扩展的 RL 能力覆盖现代深度 RL 与 LLM 后训练RLHF/RLAIF中的关键机制。前置已理解状态/动作/奖励/策略、价值与优势、REINFORCE、Actor-Critic 基本循环见《强化学习入门教程》。写法少公式、重直觉与工程含义需要符号时只用最简写法。1. 精通意味着什么能稳定做到以下事项即可视为「精通」而非「听说过」能讲清策略梯度在干什么以及基线、重要性采样各自修正了什么问题。清楚偏置-方差权衡并能实现/选用回合回报、一步自举、GAE。理解信任域 / 裁剪TRPO/PPO为何能稳住大策略网络。能诊断发散、熵崩塌、奖励黑客、过时数据等问题。能把算法映射到工程并行采样、优势估计、KL 约束、分布式训练并理解 PPO/GRPO 在 LLM 中的变体。2. 目标与策略优化2.1 优化目标强化学习要最大化的不是某一步奖励而是整条轨迹的长期回报通常对远期奖励打折。关键难点一改策略不但「同一局面下的动作偏好」变了智能体常去的局面分布也会变。目标因此高度非平稳——这是 RL 难训的根源之一。2.2 策略梯度在干什么对随机策略更新方向可以概括成一句话多做「看起来更好」的动作少做「看起来更差」的动作幅度由「该动作相对平均水平好多少」决定。更具体地对每个访问过的状态-动作用梯度方向 ≈ ∇ log(选中该动作的概率) × 优势去推参数。优势 0 就提高该动作概率 0 就降低。基线从回报里减去一个「只跟状态有关、不跟动作有关」的分数常见就是状态价值。不改变期望更新方向但能明显减小方差若基线偷偷依赖了动作且未校正会引入偏置2.3 为何能用「对数概率 × 分数」更新环境往往不可微走一步环境内部怎么变你反传不过去。技巧是不把奖励对动作直接求导而是对「选中该动作的概率」求导再乘上这步得到的分数。这就是 REINFORCE以及多数 LLM-RL按 token 当动作的数学根源。若环境可微某些仿真也可以走另一条路确定性策略梯度或世界模型里反向传播。3. 回报估计从整条回合到 GAE3.1 三种常见估法方法怎么估「这步有多好」特点Monte Carlo把这步之后真实拿到的奖励一路加总可打折偏置小方差大要等回合结束TD(0)即时奖励 下一状态价值 − 当前价值方差小偏置依赖价值网络准不准n-step / λ在「多信真实奖励」和「多信价值网络」之间插值系统化折中一步 TD 误差可以记成δ 即时奖励 γ·下一状态价值 − 当前价值。3.2 GAEPPO 等常用GAE 把多步 TD 误差按指数衰减加权求和用两个旋钮折中偏置与方差参数作用γ看得有多远也影响有效地平线λ越接近 1 越像整回合结算低偏高方越接近 0 越像一步 TD高偏低方实践LLM-RL 里λ、γ常与奖励稀疏度、KL 惩罚一起调先固定一套可复现基线再扫。4. 信任域与 PPO 族4.1 为什么需要约束更新策略迈太大步 → 新策略采样分布剧变 → 价值网络立刻过时 → 训练崩溃。TRPO 用「新旧策略别差太远」KL 信任域硬约束PPO 用更易实现的裁剪近似同一思想。4.2 重要性比率与裁剪直觉用旧策略采的数据更新新策略时需要看比率 新策略选该动作的概率 / 旧策略选该动作的概率朴素目标比率 × 优势。PPO-Clip再和「把比率夹在1±ε之后再乘优势」取更保守的那个。直觉优势 0鼓励增大概率但比率不宜超过1ε优势 0鼓励减小概率但比率不宜低于1−ε常见附加项价值损失让价值网络跟上回报目标熵奖励鼓励探索防止过早塌缩KL 惩罚 / 早期停止比率裁剪之外的另一道刹车4.3 Dual-Clip 与 LLM 实务负优势且比率很大时标准 clip 仍可能不够保守Dual-Clip 对负优势再加更紧的下界。在 RLHF 中还常约束「别离参考策略常为 SFT太远」做法可以是从奖励里扣一笔「相对参考策略的 KL」或在损失里直接加这项精通者需分清约束相对谁目的PPO clip上一轮采样策略θ_old本轮更新别跨太猛KL(ref)SFT / 参考策略别为讨好奖励模型而遗忘、跑飞5. Off-policy、重放与分布校正5.1 重要性采样用行为策略采的数据估计目标策略下的期望需要按「目标概率 / 行为概率」加权。整条轨迹一起加权时方差容易爆炸 → 逐步加权、截断权重、V-traceIMPALA等。5.2 DQN 谱系关键件技术作用Experience Replay打破相关性提高样本利用率Target Network稳住 TD 目标减轻追逐移动靶Double DQN减轻「总拿最大 Q」带来的高估Dueling / PER / N-step结构改进与优先采样5.3 连续控制DDPG → TD3 → SACDDPG确定性策略 Q能用但脆TD3双 Q 取保守、延迟更新、目标动作加噪平滑SAC最大熵 RL——目标里既要高回报也要策略保持一定随机性探索与稳健性通常更好在 LLM 里「熵」常体现为显式熵奖励或采样温度调度而不是整套 SAC。6. 信用分配与稀疏奖励策略思想奖励塑造加过程分引导探索需满足势成形条件才不改最优策略课程学习由易到难Hindsight ER (HER)把失败轨迹当作「达到了实际终点」的成功来学分层 RL / Options高层选子目标低层执行内在动机ICM、RND、NGU 等给探索奖励过程奖励模型PRMLLM 推理中对中间步骤打分LLM 场景只有最终对错的结果奖励很稀疏PRM、步骤级 KL、组采样对比GRPO都是在改善「哪一步该负责」。7. 策略表示与动作空间7.1 离散 / 连续 / 自回归动作空间典型表示离散小集合Softmax连续高斯、Beta、或确定性输出加噪声语言自回归每步一个 token整段回答 一串 token 动作对自回归策略整段回答的对数概率 各 token 对数概率之和给定前文。PPO 的比率可在 token 级或序列级聚合mask、EOS、是否按长度归一化都会显著改变行为。7.2 条件策略与上下文目标条件 RL、偏好条件、工具调用等本质是把上下文并进状态。多轮 Agent 还要纳入工具结果与记忆——更接近部分可观测且环境往往只部分可微。8. 多智能体、博弈与分布偏移8.1 MARL 概要合作共享奖励常见 CTDE集中训练、分散执行竞争纳什、自对弈、PSRO挑战对手也在学导致非平稳、信用分配、通信8.2 与「环境非平稳」统一视角哪怕单智能体函数近似误差 自举 策略自身在变也会造成非平稳。对策目标网络、信任域、保守更新、双 Q 取 min 等。9. 理论工具箱精读优先级主题你该掌握到什么程度贝尔曼备份与折扣收缩为何价值迭代往往能收敛直觉即可策略改进表格设定下贪心改进不会变差兼容函数近似Actor-Critic「批评家形状要对」的古典提醒绩效差分两策略回报差主要由优势与状态分布差解释TRPO 入口覆盖 / concentrabilityOff-policy 样本够不够的核心假设悲观 / 保守策略迭代线下 RLCQL、IQL为何要故意保守不必背证明但调参失败时要能回到假设覆盖不足、外推错误、更新过大。10. LLM 强化学习RLHF / RLAIF精要10.1 标准 RLHF 流水线SFT 策略 → 采样回答 → 人类/AI 偏好数据 → 训练奖励模型常同 prompt 下赢的回答分更高 → 以 SFT 为参考策略带 KL 约束做 RLPPO 等偏好模型的直觉奖励模型给「更好回答」打更高分两个回答分差越大模型越确信谁赢。10.2 目标与「对齐税」典型目标可以读成在参考策略附近尽量提高奖励模型分数离参考太远要付 KL 税。βKL 系数是对齐强度主旋钮之一太大则不敢动太小则易奖励黑客、风格崩坏。10.3 PPO 在 LLM 中的工程要点Actor / Critic / Ref / Reward多模型同台显存与并行布局是一等公民问题奖励常为序列末一个标量再广播到 tokenmask 必须正确旧对数概率必须与采样时策略一致否则比率语义损坏长度偏差未规范化时模型倾向「刷长度」10.4 GRPO / RLOO 等「无 Critic」变体思想同一 prompt 采一组回复用组内相对奖励当基线减弱对价值网络的依赖。好处少一个大 Critic、实现更简单、常更省资源代价每 prompt 多样本更贵组统计质量依赖采样数n10.5 DPO把 RL 收成分类式目标在「最优策略与偏好奖励模型同构」等假设下DPO 直接用偏好对更新策略绕开显式「先训 RM 再 PPO」循环。精通者应理解DPO 不是「没有 RL」而是在特定假设下把 RLHF 目标改写成可监督学习损失线上分布外表现、在线 DPO 变体仍与探索和覆盖有关。11. 训练稳定性诊断手册症状可能原因处理方向回报突然崩溃更新过大、KL 爆、价值过拟合降 lr、收紧 clip、加 KL、减 epoch熵→0过早利用提熵系数、调温度、查奖励尺度熵很高不学奖励过弱/噪声大检查奖励、增 batch、减熵系数价值损失爆回报尺度漂移回报归一化、PopArt、改 γ只变长/只变短长度与奖励耦合长度惩罚/归一化、EOS 奖励奖励升、人工评降奖励黑客换 RM、加多样性/安全约束、对抗挖掘off-policy 失效过期数据、重要性权重方差大提高同步频率、截断权重、改回 on-policy最少监控集回报、相对旧策略的 KL、相对参考策略的 KL、熵、被 clip 的比例、优势均值/方差、梯度范数、响应长度。12. 实现级清单写出工业级循环一次可靠的 on-policy 更新应包含并行环境或批量 prompt 采样存旧对数概率、价值、奖励、mask算 GAE 或组相对优势并按实现约定做标准化多 epoch、小 batch 更新带比率裁剪可选价值裁剪、梯度裁剪、学习率日程KL 超预算则提前停 epochLLM 场景把新权重同步到推理引擎测试阶梯可解玩具任务过拟合 → CartPole 一类经典环境 → 再上真实/LLM 任务。跳过玩具直接上大模型调试成本会指数上升。13. 算法谱系速查价值型: DQN → Double/Dueling/Rainbow → 分布 RLC51 等 策略型: REINFORCE → 自然梯度 → TRPO → PPO AC 连续: DDPG → TD3 → SAC 离线 RL: 行为克隆 → CQL / IQL / Decision Transformer 偏好/LLM: RLHF(PPO) → DPO/IPO/KTO → GRPO/RLOO/Online DPO 规划型: MCTS、MuZero、世界模型Dreamer 等建议主线策略梯度与信任域 → 最大熵与 off-policy 连续控制 → 离线/偏好优化 →可选世界模型与探索。14. 推荐精读路径8–12 周阶段材料产出1Sutton Barto 相关章节能用自己的话讲清价值迭代与策略梯度2Spinning Up 手写 REINFORCE/PPO可运行的小环境 PPO3TRPO / PPO / GAE 论文能复述「为何要限制更新」与 GAE 取舍4SAC、TD3连续控制对比实验5RLHF、InstructGPT、DPO画出 RMPPO 与 DPO 对照图6一个生产级实现如 verl / TRL对照比率、mask、KL、优势细节7自选离线 RL 或世界模型专题笔记15. 练习题建议真实动笔用自己的话说明为什么「只依赖状态、不依赖动作」的基线通常不改变策略更新的期望方向却能降方差。说明局部改进策略时为何既要提高高优势动作的概率又要限制策略走太远状态分布别漂太狠。实现 GAE对比λ取 0、0.95、1 时的学习曲线差异。在 PPO 中记录 clip 比例与 KL找出「epoch 过多」导致崩溃的临界点。构造一个会奖励黑客的玩具环境并设计缓解方案。写出 LLM 上 token 级 PPO 更新的伪代码含 mask、旧对数概率、比率裁剪。在同一偏好数据上对比 DPO 与 RMPPO长度、多样性、相对参考策略的 KL。16. 小结精通强化学习的主轴不是「会更多字母缩写」而是正确估计优势 → 在信任域内改进策略 → 管理分布偏移与探索 → 让奖励真正表达目标。映射到现代 LLM 系统同一主轴变成采样、token 对数概率、组内/GAE 优势、裁剪与 KL、奖励模型或规则、以及分布式 Actor-Rollout 工程。入门概念请回看《强化学习入门教程》若关注 verl / RLlib 等系统架构可对照同目录的架构指导文档。参考精通Sutton Barto,Reinforcement Learning: An IntroductionSchulman et al., GAE / TRPO / PPOHaarnoja et al., Soft Actor-CriticOpenAI Spinning UpOuyang et al., InstructGPTChristiano et al., RLHFRafailov et al., DPO分布式 LLM-RL 工程https://github.com/verl-project/verl https://verl.readthedocs.io/