Failure to Mix: Large language models struggle to answer according to desired probability distrib...

📅 2026/8/7 12:34:52
Failure to Mix: Large language models struggle to answer according to desired probability distrib...
文章核心总结与创新点一、主要内容本文聚焦大型语言模型(LLMs)在遵循目标概率分布生成输出方面的能力缺陷,通过系统性实验展开研究:核心问题验证:以二元输出(“1"和"0”)的简单概率分布为起点,发现所有测试的LLMs(包括Gemini 2.5 Pro、GPT-5、Kimi K2等8种模型)均表现出"阶跃函数"行为——当目标概率p50%时,"1"的输出率近乎0%;p50%时近乎100%,即使调整温度参数(如拉满至2)也无实质改变。多轮决策实验:当要求模型单次生成多个响应(D=2、3、10)时,前序响应仍保持阶跃函数特性,后续响应会通过"锯齿状"调整尝试补偿,但整体均值仅在D增大时趋近目标分布,且存在统计分布过窄等问题(如Qwen 3在p=0.15时98.8%的实验无"1"输出)。复杂场景扩展:两参数离散分布(三选项输出)中,模型表现呈现强依赖性,输出规律混乱;词选择与位置偏差实验显示,LLMs存在固有偏好(如Gemini偏好"sun"而非"moon",多数模型偏好"1"而非"0"),但该偏差在p值仅1%的差异下会被覆盖;真实场景(生物信息学读数映射)和博弈论问题(非对称匹配硬币、商业定位游戏)中,模型能正确推理出最优概率策略,却仍无法执行,表现为阶跃函数或混乱响应。解决方案探讨:提出两种低效的潜在方案——多轮连续