Group-Aware Reinforcement Learning for Output Diversity in Large Language Models

📅 2026/7/27 23:26:40
Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
一、文章主要内容总结该研究针对大型语言模型(LLMs)在生成任务中普遍存在的模式崩溃(mode collapse)问题——即即便存在多个有效答案,模型仍反复生成少量相同输出,限制了输出多样性——提出了一种强化学习方法:Group-Aware Policy Optimization(GAPO,群体感知策略优化)。核心背景:现有模型(如ChatGPT-4o、Claude Sonnet 3.5等)在监督微调(SFT)和人类反馈强化学习(RLHF)训练后,虽提升了事实准确性和对齐性,但会倾向于高概率输出,导致多样性下降;而温度调节、top-k采样等解码策略仅能部分缓解,无法解决模型概率分布的根本问题。方法设计:GAPO是对现有Group Relative Policy Optimization(GRPO)的扩展,核心改进是将奖励计算从单个样本层面升级到群体层面,使模型能学习多样性、覆盖度等群体级属性。搭配频率感知奖励函数:惩罚过度重复的输出,奖励未充分生成的有效答案,鼓励模型在所有有效输出上均匀采样。训练方式:基于LoRA对预训练指令模型(Qwen2.5系列)进行微调,不改变模型架构或解码策略。实验结果:列表选择任务:GAP