RLHF / Preference Optimization 论文精读路线:奖励模型、DPO、GRPO 与偏好数据

📅 2026/8/6 19:23:37
RLHF / Preference Optimization 论文精读路线:奖励模型、DPO、GRPO 与偏好数据
RLHF / Preference Optimization 论文精读路线奖励模型、DPO、GRPO 与偏好数据系列AI 论文精读与复现训练营日期2026-08-04适合读者已经了解 SFT、Transformer 和基础强化学习概念想系统读懂 RLHF、DPO、GRPO 与偏好数据论文的研究生、科研新人和工程背景读者。摘要RLHF / Preference Optimization 是现代 LLM 后训练里最容易被“公式名词”淹没的方向PPO、reward model、DPO、KTO、ORPO、SimPO、GRPO、DAPO 看起来像一串算法清单但真正要读懂的是三件事偏好信号如何被定义优化目标如何把偏好转成语言模型更新评测如何证明模型真的更符合目标而不是更长、更讨巧或更会迎合 judge。本文给出一条精读路线先读经典 RLHF 管线再读 DPO 家族的离线偏好优化再读 GRPO / RLVR 推理训练最后用 RewardBench、AlpacaEval 和复现日志去审视论文证据。目录为什么 RLHF / Preference Optimization 重要核心阅读方法从数据、目标函数到评测闭环代表论文路线图关键论文精读方法与实验对比表复现建议常见误区适合研究生继续做的选题总结参考资料核心阅读方法读 RLHF / Preference Optimization 论文可以按四层拆解。第一层是数据。看清楚样本单元到底是什么一个 prompt 配两个回答还是一个 prompt 配多个候选反馈是人类偏好、AI 反馈、规则验证、单条 thumbs-up/down还是 reward model 打分chosen 是否真的高质量rejected 是否只是弱模型输出训练集和评测集是否共享 prompt 模板、数据源或生成模型。第二层是目标函数。PPO 类方法显式训练 policy 去最大化 reward同时用 KL 约束不让模型偏离参考策略DPO 把 reward model 的最优策略关系重写成分类损失KTO 用二元 desirable / undesirable 信号ORPO 和 SimPO 试图减少 reference model 或阶段数量GRPO 用同一 prompt 的一组采样结果做相对优势估计减少 critic / value model 的成本。读公式时不要停在“有没有 RL”而要写出每个 loss 鼓励什么、惩罚什么、默认长度如何处理、参考模型是否参与、是否需要在线采样。第三层是训练系统。RLHF 和 RLVR 很多结论依赖工程细节rollout 速度、vLLM / SGLang 生成后端、ZeRO/FSDP、reference model 放置、KL 计算、reward server、断点续训、seed、采样温度、每个 prompt 采样数、max tokens、是否过滤全对或全错样本。论文如果只写“we use GRPO”复现价值是不够的。第四层是评测。偏好优化论文常用 MT-Bench、AlpacaEval、Arena-Hard、RewardBench、MATH、AIME、HumanEval、IFEval 或安全评测。你要分清这是评估 policy还是评估 reward model是 automatic judge还是人类偏好有没有长度控制有没有多次采样平均有没有报告方差有没有把失败样例公开。代表论文路线图1. 经典 RLHF 管线从 Ziegler 等人的 human preferences 语言模型微调到 OpenAI 的 summarization from human feedback再到 InstructGPT主线是“收集比较数据 - 训练 reward model - 用 PPO 优化 policy - 加 KL 控制漂移”。这组论文的阅读重点不是今天是否还用完全相同的 pipeline而是理解 reward model 为什么必要、PPO 为什么复杂、KL 为什么成为后训练里的基础约束。2. DPO 与离线偏好优化DPO 的关键贡献是把 RLHF 目标改写成不显式训练 reward model、不在线 rollout 的监督式 pairwise loss。后续 KTO、ORPO、SimPO、f-DPO、RSO 等方法从反馈形式、reference model、divergence、长度归一化和采样来源上继续改造。读这一支时要追问方法变简单以后是否牺牲了探索能力是否更依赖偏好数据质量是否会把 chosen 变得更短、更长或更模式化3. GRPO / RLVR 与推理模型DeepSeekMath 提出 GRPODeepSeek-R1 把“可验证任务上的强化学习”推到研究中心。这里的偏好不一定来自人类比较而可能来自数学、代码、格式或单元测试这类可验证奖励。DAPO、Dr. GRPO 和异步 RL 系统进一步指出长推理训练的关键不只是 reward而是采样组的方差、长度偏差、过长惩罚、动态采样和系统吞吐。4. Reward model 与评测RewardBench 与 RewardBench 2 说明评估 reward model 本身已经是一个独立问题。一个 reward model 在 pairwise benchmark 上高分不必然意味着它能稳定改进 policy一个 policy 在 AlpacaEval 上赢也不必然表示推理能力或安全性提高。读评测论文时要把“评价器的偏好”作为研究对象而不是当成客观裁判。关键论文精读Learning to summarize from human feedback / InstructGPT这两篇适合放在第一周读。阅读时画出三阶段流程SFT 初始化、reward model 学比较、PPO 优化 policy。重点看偏好数据如何采集、标注者一致性如何控制、KL penalty 如何防止模型偏离以及为什么人工偏好能击败 ROUGE 之类的自动指标。复现训练不必一开始跑大模型可以用开源 summarization 数据、一个小 reward model 和 TRL 的 PPOTrainer 做最小闭环。DPODPO 要精读公式推导。你需要自己从 KL-regularized RLHF objective 推到 reward-policy 关系再推到 Bradley-Terry preference loss。读完后写一页“DPO 省掉了什么”省掉 reward model 显式训练省掉在线采样省掉 PPO 的 critic但保留 reference policy 和偏好对。实验部分重点看 DPO 与 PPO、SFT、rejection sampling 的比较是否控制了模型初始化、数据和评测协议。KTO / ORPO / SimPO这三篇适合并排读。KTO 问的是“如果没有成对偏好只有 desirable / undesirable 能不能训”ORPO 试图把 SFT 和偏好惩罚合成一个阶段SimPO 用平均 log probability 作为隐式 reward并移除 reference model。它们的共同训练点是不要只看论文声称“更简单”而要拆每个简化背后的假设。比如 reference-free 是否真的省内存是否更难控制漂移binary feedback 是否更便宜是否也更含混单阶段训练是否容易把 instruction learning 和 preference learning 混在一起。DeepSeekMath / DeepSeek-R1 / DAPO / Dr. GRPO这一组论文是 2025 之后读 RLHF 必须补的新分支。DeepSeekMath 里 GRPO 的动机是减少 PPO 中 value model 的成本用同一 prompt 下多个输出的 reward 均值和标准差估计 advantage。DeepSeek-R1 让研究者看到 rule-based reward 可以在数学、代码等可验证任务中驱动长推理模式。DAPO 的价值在于公开了更完整的训练 recipe动态采样、clip 调整、token-level loss、过长惩罚。Dr. GRPO 则提醒大家GRPO 的标准化和长度处理可能引入优化偏差所谓“思考变长”不一定等于“推理机制变强”。RewardBench / RewardBench 2这两篇用来训练你的评测敏感度。Reward model 既可以用于 RLHF 训练也可以用于 best-of-N 或 reranking但 reward model benchmark 与 downstream policy 改进之间不是自动等价。RewardBench 2 明确把多技能 reward model 评测做得更难并报告与下游推理扩展和 PPO 等训练用途的相关性。读这类论文时最好把 benchmark item 分成 instruction following、reasoning、safety、style、拒答、细微差别等桶再看模型在哪些桶上掉分。方法与实验对比表方法主要信号是否显式 reward model是否在线采样读论文时最该检查PPO-RLHFhuman preference - RM score是是KL、critic、reward overoptimization、rollout 日志DPOchosen/rejected pair否否reference model、beta、pair 质量、长度偏差KTOdesirable / undesirable binary feedback否否二元标签来源、正负样本比例、任务适配性ORPOSFT 数据 preference pair否否单阶段训练是否混淆 SFT 与对齐收益SimPOpairwise preference average log probability否否reference-free 漂移、beta/gamma、回答长度GRPO同 prompt 多采样 reward可选是group size、reward 方差、零方差样本、长度处理DAPORLVR reward 动态采样可选是数据筛选、动态采样规则、过长惩罚、复现脚本复现建议不要从完整 RLHF 大系统开始。建议做三层复现。第一层DPO 最小复现。选一个 1B-3B instruction model使用 HH-RLHF 或 UltraFeedback 的小子集固定 prompt template用 TRL DPOTrainer 训练一轮。记录 train loss、chosen/rejected reward margin、response length、MT-Bench 或 AlpacaEval 子集结果。目标不是刷榜而是观察 beta 和 learning rate 如何影响输出长度与拒答风格。第二层reward model 复现。训练一个 pairwise reward model然后在 RewardBench 或自建小集合上测 accuracy。再用它做 best-of-N观察 reward 分数提高是否真的改善人工检查质量。这里最容易发现 reward hacking模型可能变长、变模板化、过度安全或迎合 judge。第三层RLVR / GRPO 玩具复现。选 GSM8K、MATH 子集或可单元测试的代码任务用规则 verifier 给 reward设置每个 prompt 多采样跑 GRPO 或 RLOO。必须保存每步 group reward、answer length、pass rate、全对/全错样本比例、KL、entropy、截断率。没有这些日志就无法判断训练是在学习推理还是只是在改变采样长度。复现报告至少写五个字段数据版本、模型 checkpoint、训练命令、关键超参数、失败样例。偏好优化实验对 seed、模板和生成参数很敏感单次结果不能当结论。常见误区误区一DPO 比 PPO “一定更好”。DPO 更简单、更稳定但它主要是离线偏好优化。需要探索新行为、依赖环境反馈或可验证奖励时在线 RL 仍然有价值。误区二reward model 分数越高policy 越好。reward model 会有盲区。RewardBench 2 这类工作的重要提醒是reward model evaluation 和 downstream training performance 要分开验证。误区三长 CoT 就是推理能力涌现。GRPO / RLVR 训练中长度增长可能来自任务需要也可能来自 loss、标准化、截断和过长惩罚设计。必须同时报告准确率、token 数、截断率和错误样例。误区四偏好数据只看规模。DPO 数据研究已经反复指出chosen 质量、pair 对比度、on-policy 程度和标注一致性都可能比单纯样本数更关键。误区五自动评测可以替代人工阅读。AlpacaEval、Arena-Hard、LLM-as-judge 很有用但在 preference optimization 论文里它们本身就是可能被优化的对象。高分样例要人工抽查。适合研究生继续做的选题偏好对质量诊断设计指标预测哪些 DPO 样本会带来有效更新比较 chosen 质量、rejected 难度、语义距离和长度差。reference-free 方法的漂移分析对 SimPO / ORPO 类方法做多任务评测检查安全、事实性、推理和回答长度的共同变化。GRPO 长度偏差复现实验在数学小模型上系统改变 group size、max tokens、过长惩罚和标准化方式验证长度增长与准确率的关系。reward model 与 downstream policy 相关性训练多个 reward model在 RewardBench、best-of-N、PPO 或 DPO 后 policy 表现之间做相关性分析。偏好优化失败样例库收集过度拒答、迎合 judge、长而错、格式正确但语义错、代码测试过拟合等样例形成可复用 evaluation card。总结RLHF / Preference Optimization 的阅读顺序应该从“人类偏好如何进入训练”开始而不是从算法名字开始。经典 RLHF 教你 reward model、PPO 和 KL 的基本闭环DPO 家族教你如何把偏好优化变成更轻量的监督损失GRPO / RLVR 教你可验证奖励如何推动推理训练RewardBench 和复现论文提醒你优化目标和评测目标之间永远可能存在裂缝。真正的科研训练不是记住 DPO、KTO、ORPO、SimPO、GRPO 的公式差异而是能拿一篇新论文问出四个问题数据可信吗loss 在鼓励什么系统细节是否足够复现评测是否排除了更简单的解释。参考资料检索日期2026-08-04。Schulman et al., “Proximal Policy Optimization Algorithms,” arXiv, 2017. https://arxiv.org/abs/1707.06347OpenAI, “Learning to summarize with human feedback,” 2020. https://openai.com/index/learning-to-summarize-with-human-feedback/Stiennon et al., “Learning to summarize from human feedback,” arXiv, 2020. https://arxiv.org/abs/2009.01325OpenAI, “Aligning language models to follow instructions,” 2022. https://openai.com/index/instruction-following/Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model,” arXiv, submitted 2023, revised 2024. https://arxiv.org/abs/2305.18290Ethayarajh et al., “Model Alignment as Prospect Theoretic Optimization,” ICML / PMLR, 2024. https://proceedings.mlr.press/v235/ethayarajh24a.htmlHong, Lee and Thorne, “ORPO: Monolithic Preference Optimization without Reference Model,” arXiv, 2024. https://arxiv.org/abs/2403.07691Meng, Xia and Chen, “SimPO: Simple Preference Optimization with a Reference-Free Reward,” NeurIPS 2024. https://papers.neurips.cc/paper_files/paper/2024/hash/e099c1c9699814af0be873a175361713-Abstract-Conference.htmlShao et al., “DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models,” arXiv, 2024. https://arxiv.org/abs/2402.03300DeepSeek-AI et al., “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,” arXiv / Nature, submitted 2025, revised 2026. https://arxiv.org/abs/2501.12948Yu et al., “DAPO: An Open-Source LLM Reinforcement Learning System at Scale,” arXiv, 2025. https://arxiv.org/abs/2503.14476DAPO project page, ByteDance Seed / Tsinghua AIR / HKU / SIA-Lab. https://dapo-sia.github.io/Liu et al., “Understanding R1-Zero-Like Training: A Critical Perspective,” arXiv, 2025. https://arxiv.org/abs/2503.20783Malik et al., “RewardBench 2: Advancing Reward Model Evaluation,” arXiv / ICLR 2026. https://arxiv.org/abs/2506.01937Hugging Face TRL documentation, accessed 2026-08-04. https://huggingface.co/docs/trl/en/indexOpenRLHF documentation, “RL Training Guide,” accessed 2026-08-04. https://openrlhf.readthedocs.io/en/latest/agent_training.htmlAnthropic HH-RLHF dataset, Hugging Face, accessed 2026-08-04. https://huggingface.co/datasets/Anthropic/hh-rlhf/tree/mainOpenBMB UltraFeedback repository, accessed 2026-08-04. https://github.com/OpenBMB/UltraFeedbackAllenAI RewardBench repository, accessed 2026-08-04. https://github.com/allenai/reward-benchTatsu Lab AlpacaEval repository, accessed 2026-08-04. https://github.com/tatsu-lab/alpaca_eval