Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Fee...

📅 2026/8/21 11:35:30
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Fee...
文章核心总结与翻译一、主要内容本文聚焦大语言模型(LLM)对齐中基于人类反馈的强化学习(RLHF),针对人类反馈异质性和奖励模型不确定性两大核心问题展开研究。提出异质偏好框架,联合建模答案的潜在奖励与人类理性,通过交替梯度下降算法求解双凸优化问题;建立估计量的收敛性和渐近分布等理论保证,构建奖励估计的置信区间;将不确定性量化结果应用于奖励的统计比较和最优N选1(BoN)策略优化,提出悲观BoN(pBoN)策略;通过大量模拟实验和真实LLM数据验证方法的有效性。二、创新点方法创新:设计异质理性模型捕捉人类专业水平差异,提出交替梯度下降算法,实现奖励模型与人类理性模型的联合学习。理论创新:证明算法的收敛性,推导估计量的渐近分布,为奖励模型提供严格的不确定性量化,建立悲观BoN策略的次优性边界。应用创新:将不确定性量化融入奖励差异的假设检验,实现LLM输出的统计严谨比较;优化BoN策略,通过奖励下界提升决策鲁棒性。三、关键部分翻译(Markdown格式)Abstract我们研究用于大语言模型(LLM)对齐的奖励模型的估计与统计推断问题。LLM对齐的核心技术是基于人类反馈的强化学习(RLHF)——人类对模型生成的答案对进行比较,其偏好被用于训练奖励模型。然而,人类反馈