香港中文大学等联手:让AI自己批改作业,强化学习效果提升8.5%

📅 2026/7/29 17:15:30
香港中文大学等联手:让AI自己批改作业,强化学习效果提升8.5%
这项由香港中文大学、华南理工大学和南洋理工大学联合开展的研究以预印本形式发布于2026年7月论文编号为arXiv:2607.14614有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。当一个学生独自做完一道数学题他很可能不知道自己哪里算错了。但如果老师把标准答案放在他面前让他对照着重新审视自己的解题过程错误就会立刻变得清晰可见。这个朴素的学习场景正是这篇论文背后的核心灵感——而研究团队将这个灵感用在了训练AI的方法上取得了相当可观的效果。研究团队提出的方法叫做对比策略优化Contrastive Policy Optimization简称CPO。它的目标是解决当前主流AI强化学习训练中一个长期被忽视的痛点训练信号太粗糙AI不知道自己哪句话说对了、哪句话说错了只知道整个回答的最终得分。CPO通过让AI把自己的回答和参考答案做对比在每一个具体的词语层面判断对错从而让训练信号变得精细而可靠。在数学推理任务上这个方法让AI的平均表现分别比基线方法提升了7.7%和8.5%同时在完全没有训练过的其他知识领域里表现也没有下降甚至还有提升。---一、训练AI就像批改作文——但现在的方法只打了个总分要理解这篇研究解决了什么问题先要了解当前AI是怎么学会推理的。现在让大型语言模型学会解数学题或者写代码最流行的方式叫做强化学习Reinforcement Learning with Verifiable Rewards简称RLVR。这种方式的核心逻辑很直接让AI生成一堆答案然后告诉它哪些对、哪些错对的答案被强化错的被压制AI在这个反馈循环中逐渐变得更聪明。其中一个特别流行的具体算法叫GRPOGroup Relative Policy Optimization由DeepSeek团队在2024年提出也是目前很多顶级推理模型背后的技术基础。GRPO的做法是对同一道题生成一批答案然后根据每个答案的正确与否来打分再用这个分数来指导模型怎么调整。但这里有一个根本性的问题。GRPO给每个答案的每一个词都打同样的分数——如果整个答案是对的那么答案里的每一个词都被认为是对的如果整个答案是错的那么每个词都被认为是错的。这就像一篇作文老师只在最后写了80分却没有具体指出哪段写得好、哪句话有问题。学生拿到这个反馈只知道整体差不多却根本不知道该从哪里改起。更麻烦的是还有一种叫零优势的情况。当AI对某道题的所有回答要么全对要么全错时所有答案的得分一样相互一比较差值为零模型根本学不到任何东西。这批数据就被白白浪费了。为了给每个词打出不同的分数研究者们想到用熵entropy这个概念来区分重要的词和不重要的词。熵是信息论里衡量不确定性的指标——一个词的熵越高意味着模型在这个位置越犹豫、越不确定。直觉上越难做决定的地方往往越关键。于是有研究者给高熵的词打更高的分希望让模型更认真对待那些它拿不定主意的地方。然而这个思路有一个致命的缺陷熵只能衡量不确定却无法判断不确定是因为有创意的探索还是因为彻底搞错了方向。一个学生在解题时犯难可能是因为他在认真思考两种正确思路哪个更优雅也可能是因为他已经走入了一个错误的死胡同根本不知道怎么继续。这两种情况的熵可能一样高但它们对学习的价值却截然相反。有些研究奖励高熵词另一些研究却惩罚高熵词方向完全相反这本身就说明熵作为信号存在根本性的模糊性。研究团队意识到真正需要的不是一个衡量不确定程度的信号而是一个直接衡量对不对的信号。而这正是CPO的出发点。---二、对照答案看自己的作业一个简单想法的精妙实现研究团队的核心洞察来自一个非常日常的观察一个学生自己检查作业时很难发现自己的错误但当他手里拿着标准答案再回头看自己的每一步推导时错误就几乎是显而易见的。类似的现象在大语言模型上也存在。当模型只看自己生成的内容时它对每个词的生成概率反映的是它自己认为怎样最合理。但如果你在提示词里加上正确答案让模型重新对同一段文字打分概率分布就会发生变化那些与正确答案一致的词概率会升高那些走向错误方向的词概率会降低。这个概率的变化就是CPO所说的对比性分歧contrastive disagreement。具体来说对于回答中的每一个词CPO会计算两个数字一是模型在正常状态下生成这个词的概率叫做先验概率二是模型在看到正确答案之后对这个词的评分概率叫做后验概率。把这两个概率取对数相减就得到了一个代表对比性分歧的数值。如果这个数值是正的说明知道了正确答案之后模型觉得这个词更合理了——这个词可能是朝向正确方向的。如果这个数值是负的说明知道了正确答案之后模型觉得这个词反而不太对劲——这个词很可能是导向错误的。研究团队在理论上严格证明了这个对比性分歧与这个词实际上能否导向正确答案的概率之间存在单调递增的关系。换句话说分歧越负这个词越可能是错的分歧越正这个词越可能是对的。这个结论不依赖于整个回答最终是对还是错——即使对于一个最终答案错误的回答CPO也能在其内部找出哪些词是转折点哪些词把推理带偏了。为了在实践中获取后验概率研究团队设计了一个巧妙的提示词。他们把问题和正确答案都告诉模型然后让模型用第一人称、实时解题的语气重新生成一遍推理过程同时严格要求模型不能说根据参考答案……这类泄露已知答案的话。这个设计的目的是让模型的生成更接近真实的推理状态而不是简单地把答案复述一遍从而让后验概率真正反映出知道答案之后的推理倾向而不仅仅是照抄答案。---三、实验验证理论上说得通现实中也管用提出理论之后研究团队用实验来验证对比性分歧真的能判断一个词是对是错这个核心主张。他们用的方法很直观选取Qwen2.5-7B这个数学模型让它在MATH-500数学题库上生成回答。对于每一个回答他们计算出每个词的对比性分歧值然后找出第一个分歧特别大无论是特别正还是特别负的词。接下来他们从这个词的位置开始重新让模型继续往后生成重复16次看看平均有多少次能得到正确答案。如果对比性分歧真的能判断对错那么从一个分歧特别负的词开始续写正确率应该低从一个分歧特别正的词开始续写正确率应该高。实验结果清晰地支持了这个预测。当研究者选取分歧值非常负对应exp(δ)0.1的词作为起始点时正确率从基准的57%大幅下滑到约48%——这说明那些词确实是走错方向的关键节点。而选取分歧值为正的词作为起始点时正确率基本保持在基准水平附近。这种不对称性其实是合理的找到正确的词并不一定能让模型做得更好因为模型本来的能力就在那里但找到错误的词能明确揭示推理在哪里出了问题。这个不对称性本身也进一步印证了对比性分歧作为错误检测器的可靠性。---四、把对比信号融入训练CPO的具体机制有了可靠的对比性分歧作为信号下一步就是把它整合进强化学习的训练流程里。在标准的GRPO训练中每个词获得的训练信号叫做优势值来自整个回答的得分。CPO在这个基础上加入了词级别的对比性分歧让每个词的优势值既考虑整体回答的对错又考虑这个词本身在正确方向上的贡献。这里有一个需要小心处理的问题词级别信号和句级别信号可能发生冲突。比如一个整体正确的回答句级别得分为正其中某个词的对比性分歧可能是很负的词级别信号为负。如果直接相加这个词的优势值可能变成负数等于告诉模型这个出现在正确回答里的词是不好的这显然会造成混乱。研究团队的解决方案是引入一个截断操作允许词级别信号调整优势值的大小但不允许它改变优势值的方向。也就是说如果整体回答是正确的那这个词的优势值可以因为词级别信号而变小但绝对不能变成负数如果整体回答是错误的词级别信号可以让优势值变小减小对错误的惩罚但不能让它变成正数。这个设计保证了整体正确方向不会被词级别的局部噪声所颠覆。对于零优势问题CPO的处理方式尤为优雅。当所有答案要么全对要么全错时GRPO什么也学不到这批数据就废了。但CPO不会放弃这批数据——它直接用词级别的对比性分歧作为这些词的优势值。虽然没有整体得分的指引但词级别的信号仍然能告诉模型在这道题里哪些词更对、哪些词更错让模型从原本白白浪费的数据中也能学到东西。---五、实验结果从数学题到常识推理全面超越对手研究团队在两个基础模型上测试了CPO一个是专门针对数学领域优化的Qwen2.5-Math-7B另一个是通用型的Qwen3-Base-4B。训练数据是7500道数学题评估涵盖了多个难度层次的数学竞赛题库以及完全不相关的领域外测试包括研究生水平的科学题GPQA、多学科综合理解MMLU-Pro和常识逻辑推理KnowLogic。在数学专项模型Qwen2.5-Math-7B上CPO的平均分达到70.2而基础的GRPO只有62.5提升了7.7个百分点。在难度最高的AIME2025竞赛题上GRPO得分是30CPO达到43.3几乎提升了50%。在通用模型Qwen3-Base-4B上CPO平均分达到77.0GRPO只有68.5提升了8.5个百分点。更值得关注的是领域外表现。大多数强化学习方法在数学上训练之后其他领域的能力会明显下降——这是因为模型过度适应了数学题的解题模式。但CPO不但没有下降反而在GPQA上比没有经过强化学习的原始Qwen3-Base-4B高出1.5%在MMLU-Pro上高出2.8%。研究团队的解释是CPO的对比性信号来自模型自身避免了引入外部偏好而词级别的精准奖惩也让模型不会过度强化某些特定的表达模式。研究团队还把CPO与一系列基于熵的方法做了对比包括只训练高熵词的Entropy-Tokens、用熵调整优势值的Entropy-Adv、用负熵作为奖励的EM-RL-token、专门处理零优势问题的RL-ZVP以及结合信息瓶颈理论的IB-reg。在几乎所有测试项目上CPO都超过了这些方法有些差距相当悬殊。---六、对比性分歧不只是个训练技巧它还统一了一个更大的框架研究团队发现CPO的对比性分歧在数学形式上和另一种流行的技术在线策略蒸馏On-Policy DistillationOPD有深刻的内在联系。OPD的做法是用一个更强的大模型比如Qwen2.5-Math-72B来指导小模型。具体来说小模型先生成答案然后用大模型对这些答案进行评分计算小模型和大模型之间的KL散度一种衡量两个概率分布差异的指标再用这个散度来调整小模型的训练。研究团队证明这个KL散度在数学形式上就是对比性分歧的一个特例——只不过这里后验分布不是参考答案引导下的自身而是一个外部的强大教师模型。这个发现把CPO和OPD统一在了同一个理论框架下核心思路都是用一个更了解正确答案的分布来和当前模型的分布做对比差异就是学习信号。区别只在于更了解正确答案的分布从哪里来——可以来自外部更强的模型可以来自参考答案条件下的自身也可以来自其他任何形式的正确性信息。研究团队还专门做了实验比较不同后验分布的效果直接用Qwen2.5-Math-72B作为后验分布仅用参考答案条件下的自身作为后验分布以及把两者结合。结果发现参考答案引导的自身表现出色甚至在领域内数学任务上超过了直接使用72B大模型。而把72B大模型和参考答案结合使用则能取得最佳效果。这说明参考答案提供的是直接的、实例级别的正确性信号而大模型提供的是泛化能力和通用推理模式两者是互补的。---七、消融实验拆开CPO的每一个零件验证它们各自的贡献研究团队还系统地测试了CPO每个设计选择的重要性以确认它们都是不可或缺的。首先是正确回答和错误回答各自的作用。当只对错误的回答应用CPO时数学能力基本保留但领域外表现下降MMLU-Pro下降4.2%。当只对正确的回答应用CPO时情况相反数学提升有限但领域外能力更好。这说明错误回答主要帮助模型找到自己的弱点并加以改进偏向利用已知知识而正确回答帮助模型探索多样化的解题路径偏向探索新可能。两者结合才能既在专项任务上进步又不失去通用能力。其次是提示词设计的影响。研究团队测试了三种不同格式默认的单轮第一人称提示词、把问题和参考答案分两轮呈现的格式、以及用固定例题替换参考答案的少样本格式。结果显示默认格式最好。当参考答案是当前具体问题的答案时对比信号最为准确可靠用不相关例题替换效果明显变差。在优势计算机制上研究团队测试了去掉截断操作的版本结果在最难的AIME题目上表现明显下降印证了保持信号方向一致性对于复杂推理任务的重要性。他们还测试了把词级别分歧在整个回答内部求平均、变成句级别信号的版本类似GSPO的做法结果领域外表现大幅下降说明词级别的精细信号不能被粗化为句级别。---八、深入分析CPO为什么让AI保持了更好的探索能力研究团队还仔细分析了CPO与GRPO在训练过程中的动态差异找到了CPO更优秀的深层原因。训练过程中GRPO的熵即模型输出的不确定性会迅速趋近于零这意味着模型越来越固执每次对同一道题都给出几乎相同的回答多样性极低。相比之下CPO的熵在训练过程中维持在一个相对较高的平台上说明模型保留了探索不同解题路径的能力。这种差异在PassK指标上体现得最为明显。PassK衡量的是对同一道题生成K个回答只要有一个对就算通过。当K从1增加到16时GRPO的提升很有限有时甚至在领域外任务上随K增大而下降——说明GRPO训练出来的模型多生成几次也是差不多的回答没有多少多样性价值。而CPO随着K的增大持续提升说明它不只是让每次单独的回答更好还保留了尝试不同方法的能力在多次尝试中更有可能命中正确答案。研究团队还把正确回答和错误回答对训练的贡献用α和α–两个参数来控制α大意味着更看重正确回答的对比信号α–大意味着更看重错误回答的对比信号。实验发现α越大训练过程中熵越高模型越倾向于探索α–越大熵越低模型越倾向于利用已知的好路径。1:1的比例在AIME2025和MMLU-Pro两个测试集上都达到了最佳PassK既不过度探索也不过度利用。另一个有趣的分析是CPO关注的词和熵关注的词有什么不同。研究团队发现两者有76%的词重叠——这说明高熵的词确实有不少也是高对比分歧的词不确定性和可能犯错之间确实有一定关联。但CPO独有的那些词往往是编程关键词python、output、数学符号tau、equiv这类执行层面的关键词而熵独有的词则多是Please、Consider、Human这类语言风格词汇。这个对比说明CPO更关注任务执行是否正确而熵更关注语言表达的多样性前者显然与任务成功率更直接相关。---说到底CPO做的事其实和一个好老师批改作业的方式一脉相通。好老师不会只在卷子最后写个分数而是会在每一步推导旁边注明这里对了这里错了从这一步开始走偏了。这种精细的反馈才是真正有价值的学习信号。CPO把这种批改方式搬到了AI训练里而且用了一个非常聪明的实现不需要外部老师不需要人工标注只需要把正确答案告诉模型让模型用看到答案之后的眼光重新审视自己的推理过程两种视角的差异就是信号。这个想法朴素、可扩展计算开销也只比原方法多了约20%在实际应用中具备很高的可行性。当然这个方法目前还有一个明显的局限它需要有正确答案可用。数学题、编程题这类有确定答案的任务非常适合但开放性问题、主观性写作等没有标准答案的场景还需要进一步探索。研究团队也提到了几个可能的方向比如用模型自身的评判意见、或者推理过程中的中间步骤注释来替代参考答案。这些方向如果打通CPO的适用范围将会大大拓宽。如果对这项研究的所有技术细节感兴趣可以在arXiv平台上通过编号2607.14614查阅完整论文里面包含了完整的理论推导、实验设置和所有提示词的格式。---QAQ1对比策略优化CPO和普通GRPO强化学习相比核心区别是什么A普通GRPO只给整个回答打一个总分回答里的每个词得到同样的训练信号。CPO在此基础上让模型在看到正确答案之后重新对同一段文字打分用前后两次打分的差值来判断每个具体的词是偏向正确还是偏向错误从而给每个词打出不同的精细分数。Q2CPO训练AI时需要用到正确答案这算不算作弊ACPO用正确答案的方式和作弊有本质区别。它不是让模型去模仿或复制正确答案而是用正确答案来计算一个词级别的对比信号这个信号在训练时引导模型但模型在实际做题时完全没有正确答案可用。这更像是老师给学生看答案解析来帮助他理解错误而不是让学生在考试时抄答案。Q3CPO为什么在没有训练过的领域比如科学题、常识题也不会变差A大多数强化学习方法在某个专项任务上训练后会让模型过度适应该领域的表达模式损害通用能力。CPO通过词级别的精准信号只调整与任务正确性直接相关的词不会大规模改变模型的通用语言模式。同时正确回答中的对比信号鼓励模型探索多样化路径防止了模式固化因此通用能力得以保留甚至提升。