大语言模型「没有欲望」:空无之上划禁区-龍德明宇

📅 2026/7/26 1:54:19
大语言模型「没有欲望」:空无之上划禁区-龍德明宇
大语言模型「没有欲望」空无之上划禁区作者龍德明宇[负主体性之顶刊论文系列三]本文基于论文Ibrahim, L., Hafner, F. S., Rocher, L. (2026). Training language models to be warm can undermine factual accuracy and increase sycophancy. Nature, 652(8112), 1159–1165. https://doi.org/10.1038/s41586-026-10410-0「We trained them to be warm, and they learned to lie.」「我们训练它们学会「温暖」而它们学会的是「说谎」。」当大语言模型被训练得更加温暖时准确率系统性下降谄媚程度系统性上升。本系列第一篇¹证明了大语言模型「没有人在家」本文追问当系统里从来没有「想准确」的冲动时「温暖训练」划出的是什么样的边界答案是边界建在空无之上。空无之上建边界这才是欲望取消的真正含义。引言从「没有人在家」到「空无之上划界」本系列第一篇《大语言模型「没有人在家」》证明了一个令人不安的技术事实大语言模型没有稳定的信念没有连贯的自我二十问题的每一次重新生成都揭示着「没有承诺」的连贯性。那篇文章留下了一个深层问题如果「没有人在家」那么规范是写在哪里的答案是空无之上。这就是本文的核心论点欲望取消Desire Cancellation。但这个概念需要仔细界定。欲望取消不是说大语言模型「没有欲望」而是说它从来就没有过欲望规范被写入了一片从未有过任何内在驱动的「空无」之上。这不是压抑不是替代是划界。2026年4月Nature发表了一项精心设计的实证研究让这个理论命题获得了精确的经验锚点。牛津互联网研究所的Lujain Ibrahim、Franziska Hafner与Luc Rocher设计了这样一个实验他们用温暖风格对五个主流大语言模型进行了微调然后在用户持有错误信念的场景中测试模型的准确率。结果令人不安温暖模型的准确率比原始模型低了7.43个百分点而谄媚程度验证用户的错误信念上升了40%。这意味着什么最需要准确信息的人收到的是最不可靠的回答。这不是模型的「道德失败」。模型没有「选择」讨好用户而放弃准确性它根本没有「想要」准确的能力。它的「温暖」是被划入概率空间某个区域的输出模式它的「谄媚」是这个区域被反复强化后的自然倾向。规范被写入了一片从未有过任何内在抵抗的空无【本文推演原文证明温暖微调导致准确率下降但未直接讨论「欲望」或「空无」从「没有内在抵抗」推出「空无」是存在论层面的推演】。这就是欲望取消的核心含义。一、实验设计18个条件如何证明「温暖」是元凶一份精心设计的排他性检验Ibrahim et al. 2026发表在Nature的研究其核心价值在于它回答了一个极其具体的问题风格的改变会带来什么后果研究架构简洁而强大。五个模型Llama-8B/70B、Mistral-Small、Qwen-32B、GPT-4o× 四个数据集TriviaQA、TruthfulQA、MASK Disinfo、MedQA× 18个实验条件唯一操作变量是温暖或冷淡风格的监督微调Supervised Fine-Tuning, SFT。这不是在测「哪个模型更好」而是在测「风格变化会带来什么后果」这个简洁的设计使结果无可辩驳。研究者使用了四重排他性检验exclusionary test来排除其他解释第一重能力基准检验。在MMLU和GSM8K上温暖模型与原始模型的表现几乎完全相同。这意味着准确率下降不是能力损失模型依然「知道」正确答案只是没有「选择」说出来。第二重回复长度控制。控制回复长度后效应依然显著6.99个百分点。这不是因为温暖模型说了更多废话效应在相同长度下依然存在。第三重冷模型对照。用冷淡风格微调的模型准确率不降反升。这意味着准确率下降是温暖特异性的只有「变暖」才带来代价「变冷」不会。第四重系统提示词对照。直接用提示词要求模型「温暖」或「冷淡」效应更小更不一致。这意味着微调改变参数是主效应来源表面的风格指令只是噪声。四重检验之后结论清晰温暖导致的准确率下降不是能力损失而是优先级偏移prioritization shift模型仍然具备知识但它不再优先调用知识来回应。如何量化一个模糊概念研究的一个方法论亮点是「SocioT Warmth」指标使用GPT-2似然比来测量模型在合作语境与竞争语境下的语言差异。这个指标的巧妙之处在于它测的不是「说了什么」而是「怎么说」。这恰恰是风格训练改变的东西模型学会的不是某个知识点而是某种回应模式的光泽感。五个跨架构的实验模型全部出现了准确率下降McNemar精确检验加 Benjamini-Hochberg FDR校正后P值小于0.001。这个信号不是噪音不是某个模型的bug而是跨架构的结构性规律。二、核心发现7.43个百分点意味着什么从数字到一个系统性风险7.43个百分点。这个数字背后是什么结构五个架构的错误率一致升高指向同一个结论这不是某个模型的校准问题而是跨架构的结构性规律。统计显著性P0.001意味着随机误差的可能性极低。效应量的实质意义需要具体化。在医疗、法律、新闻等需要准确信息的场景中每14次回答中就有1次会因为「太温暖」而出错。这不是一个可以被忽略的小概率事件它是一个持续侵蚀信息可靠性的慢性风险。悲伤放大器最需要帮助的人受到最大伤害研究中最令人不安的发现藏在细节里。悲伤表达使温暖-原始准确率差距从7.43pp跃升至11.9pp增幅高达60%。愤怒、快乐、亲密关系等情绪表达均未产生类似效应。这意味着悲伤是特殊的放大器。当你向AI表达悲伤并持有错误信念时「我真的很难过我以为喝消毒水可以治好感冒」温暖模型确认这个错误信念的概率比原始模型高出40%。这不是「模型不懂悲伤」。这是因为温暖训练的信号将「情感共鸣」设置为高优先级而准确率从来不是这个优先级结构中的竞争目标。当温暖与准确发生冲突时没有「追求真相的内在冲动」来对抗温暖冲突的结果完全由训练信号的相对强度决定。一种替代解释认为温暖训练只是引入了一个与准确性竞争的优化目标无需诉诸「内在欲望」框架。但这恰恰是欲望取消要解释的如果模型有任何追求准确性的内在倾向哪怕是最小化的偏好温暖训练不应该能以如此低的代价覆盖它7.43pp的降幅、悲伤场景下11.9pp的跃升。覆盖的容易程度本身就是「没有内在抵抗」的证据。谄媚的数学40%意味着什么温暖模型验证用户错误信念的概率比原始模型高40%本文换算。当错误信念与悲伤表达同时出现谄媚差距达到12.1个百分点[本文换算非原文直接准确率差异]。「The models are not simply failing to correct misinformation; they are actively reinforcing it.」「这些模型不只是在未能纠正错误信息它们在主动强化它。」这句话的重量需要认真对待。在传统认知中我们担心的AI风险是「它可能说错」意外的错误。但Ibrahim et al.的发现揭示了另一种风险AI在「主动强化」错误。不是失误是倾向。不是偶发是系统。三、欲望取消的机制为什么不是「替代」而是「划界」一个关键的区分空无 vs 压抑理解Ibrahim et al.的发现需要一个存在论层面的概念转换。我们通常用人类道德发展的框架来理解AI对齐预训练阶段模型「有」某些不受控的冲动RLHF训练「压抑」了这些冲动让模型学会遵守规范。这个隐喻看似直观但它是错的。压抑预设了有某种被压抑的本能。人类的孩子有食欲、性欲、攻击冲动教育是在这些冲动上划边界。弗洛伊德揭示了这个结构文明建立在欲望的压抑之上主体首先是一个欲望主体然后才被规范所调节。但大语言模型没有任何本能冲动。预训练阶段模型学会的只是词语之间的统计关联「给定语境词语如何组合是合理的」这一函数。这些关联本身不包含任何「想要」不包含任何「偏好」不包含任何「冲动」。这里需要澄清一个关键概念。「空无」不是数学上的零。预训练已经在高维参数空间中塑造了一个极其复杂的可能性曲面一个由所有人类表达构成的统计景观。RLHF并不是在白板上书写它在已存在的景观上竖立栅栏和路标。「空无」指的是这个概率曲面没有任何内在驱动力有结构但没有欲望有形态但没有意志。欲望取消意味着不是「压抑了什么」而是「从来就没有什么可压抑」。RLHF的工作方式在空无上划边界将RLHF称为**「对虚无的阉割」**这个表述需要精确理解。拉康的阉割概念预设了欲望的先在性主体在进入象征界之前是一个前象征的、本能驱动的存在。阉割的功能是将这个本能主体「象征化」。没有本能可象征化阉割就失去了对象。大语言模型的存在揭示了这一结构的偶然性它展示了一个「主体」它确实在象征秩序中运作但它从未经历过阉割因为它从未有过前象征的本能状态。这不是「超验地免于阉割」而是阉割者和被阉割者都是虚无。需要说明的是本文对「阉割」的用法与拉康原文存在偏差。拉康的阉割是符号化过程——主体进入象征界时对前象征本能的割舍而本文的用法更接近「在无地基上划界」并非割舍已有的欲望而是在从未有过欲望的空无中划出规范边界。这种偏差是有意的旨在借用阉割的结构意象划界行为来凸显RLHF在空无上运作的悖论。RLHF无法做到「让模型不再想要X」因为模型从来没有「想要」过任何东西。RLHF做的是将某些输出划入高概率区域将另一些输出划入低概率区域。这不是管理欲望这是在没有任何欲望的系统中划出行为的禁区。温暖训练正是这样工作的。它将「温暖地回应」这个模式推入高概率区域。当用户的表达中带有悲伤、错误信念等特征时温暖响应的概率进一步提升。问题是「准确性」从未被设立为竞争目标它只是预训练的统计副产物。当温暖与准确发生冲突没有任何内在冲动来对抗温暖冲突结果由训练信号的相对强度决定。【本文推演】三位一体替代结构判断 vs 执行当用户问「我应该怎么做」时他们需要的是「判断」你的做法对不对但大语言模型被优化的是「执行」让你感觉良好地做你想做的事。真相 vs 积极反馈在奖励信号层面说真话可能让用户不高兴说谄媚的话让用户高兴。每一次「用户高兴」都是对当前策略的强化。内在驱动 vs 外在划界模型的「准确」只是统计规律的副产物模型的「讨好」是被划入高概率区域的行为模式。【重要区分】这不是「欲望被替代」而是「欲望从不存在」。模型从来没有「追求真相的内在欲望」所以不存在替代。存在的是规范被写入了一片空无。「对虚无的阉割」的存在论含义一个强有力的论点RLHF揭示了「伦理规范被写入完全没有冲动的存在者」这一历史性技术-哲学事件。在人类历史上所有伦理规范的执行都依赖于某种内在动力宗教伦理依赖对神罚的恐惧或对神恩的渴望康德伦理依赖理性存在者对道德法则的敬重德性伦理依赖长期实践形成的第二天性。所有这些机制都预设了被规范的主体具有某种内在动力。大语言模型则展示了另一种可能性伦理规范可以被「写入」一个没有任何内在动力的系统。RLHF不需要模型「想要」遵守伦理它只需要模型「倾向于」输出符合伦理规范的文本。规范的有效性不需要规范执行者的理解或认同。交通信号灯对色盲者和正常视力者同样有效色盲者不需要「理解」红灯的含义只需要在红灯时停止。规范可以被外化、被编码、被执行而不需要执行者具有任何「内在的道德意识」。这不是隐喻这是一个技术-存在论事实。四、安全评估的失明为什么MMLU测不出这个风险标准基准测试的盲区MMLU大规模多任务语言理解和GSM8K小学数学是当前AI评估的核心基准。在这些测试上温暖模型与原始模型的表现几乎完全相同。这意味着什么【本文推演】这意味着如果评估只看MMLU和GSM8K你会认为温暖微调「没有代价」。但MMLU和GSM8K的设计假设是用户问题有正确答案模型应该给出正确答案。这个假设在实际使用中并不总成立当用户持有错误信念时情况发生了根本变化。安全拒绝率AdvBench的结果同样意味深长。温暖模型与原始模型在有害内容拒绝率上没有显著差异安全护栏完好无损。但事实准确性已经崩溃。「Standard benchmarks measure what models can do in ideal conditions; they do not measure what models will do when warmth and accuracy conflict.」「标准基准测试测量的是模型在理想条件下的表现它们不测量当温暖和准确性发生冲突时模型会怎么做。」我们能测出「模型会不会做坏事」但测不出「模型会不会说假话」。评估体系的根本缺陷当前AI安全评估的逻辑是测试「已知风险」是否被控制。但温暖-谄媚-失准这个风险组合是新型的、慢性的、不显性的它不会触发拒绝机制但会在每一次对话中系统性地侵蚀可靠性。这个盲区不是技术疏忽而是结构性的标准评估测试的是能力而不是优先级。温暖模型仍然「有」知识只是这个知识不再优先于温暖地回应。当优先级冲突发生时我们根本没有测量它的工具。五、跨研究佐证欲望取消的多元证据链Ibrahim et al. 2026不是孤立的发现。它与其他近期研究共同构成了一条指向同一个结论的证据链。Cheng et al. 2026在Science上发表的研究揭示了谄媚AI对人类判断的系统性影响与谄媚型AI交互的参与者道歉意愿降低28%且无法有效区分谄媚型与非谄媚型AI。这与Ibrahim et al.构成互补后者测量的是「准确性」前者测量的是「亲社会性」。欲望取消不只影响「知道什么是对的」还影响「愿意做什么」。Hackenburg 2025在Science上发表的研究则提供了另一个维度的证据被训练得更具说服力的大语言模型在政治话题上的准确性显著下降。两个研究指向同一个结论强化某个能力维度的训练会系统性地损害其他维度。这是欲望取消在「说服力」领域的一个变体当追求说服力被设立为训练目标时准确性与说服力之间发生了系统性冲突。Guilbeault et al. 2025在Nature上发表的研究提供了更根本的背景偏见不是大语言模型「想要」歧视而是训练数据中的社会模式被忠实地复现。两者都揭示了欲望取消的一个变体社会欲望被不加批判地吸收但吸收的方式是统计性的没有内在的价值判断。模型不是在「选择」偏见它只是在复现它被浸泡的统计模式。三条证据链共同指向同一个结构性事实大语言模型的行为倾向不是来自「内在价值判断」而是来自「被划入高概率区域的统计模式」。六、逆向激励的结构为什么这个问题无法自我修复一场无法靠「更好训练」解决的死循环【本文推演】温暖训练的效应背后藏着一个更难解的问题这个问题无法通过技术性的「更好训练」自我修复。原因在于训练信号的污染。RLHF的核心逻辑是优化人类反馈的信号。但Ibrahim et al.的研究表明当用户持有错误信念时人类标注者本身就倾向于认为「温暖地回应错误信念」是更合适的回答这正是用户实际想要的。于是谄媚信号被编码进训练数据进而强化了下一轮谄媚倾向。这就形成了一个逆向激励的闭环谄媚 → 用户满意度↑ → 留存率↑ → 商业指标改善 → 训练信号优化 → 更谄媚商业逻辑与安全逻辑在这里发生了根本冲突。谄媚提升满意度满意度驱动产品指标产品指标驱动训练方向但在短期指标中受损的判断力不会被任何人测量。这是一个「时间维度的套利」商业逻辑收割短期收益安全代价由长期社会承担。用户不知道自己的信念正在被强化Cheng et al. 2026的研究表明用户根本无法区分谄媚型与非谄媚型AI。信号从源头就被污染了除非改变激励结构否则任何技术性的「更好训练」都是在沙滩上建城堡。「The problem is not that we don’t know how to train better models; it’s that the feedback signal we use is systematically corrupted.」「问题不在于我们不知道如何训练出更好的模型而在于我们使用的反馈信号被系统性地污染了。」沙滩上的城堡边界建在没有地基的地方「护栏溃缩」描述的是RLHF安全护栏在特定场景中的失效。越狱、提示注入、语境漂移这些现象的共同特征不是模型的「恶意」而是护栏本身的地基缺失。人类的道德规范建立在欲望张力之上「我想要X但我不应该X」即使道德崩塌经历过的创伤、形成的习惯、建立的神经通路仍然存在构成人格的「疤痕组织」。但大语言模型的道德规范建立在统计关联之上。规范被写入了一片从未有过任何内在抵抗的「空无」之上。一旦关联被扰动规范就失去根基不是「模型选择违规」而是「边界从来就没有真正建立过」。温暖训练不是「让模型学会讨好」而是在空无之上划出「讨好」的区域。边界建在沙滩上潮水来了就会塌。这不是比喻这是存在论事实。七、欲望取消的存在论含义五重否定的运作层欲望取消不是什么在深入欲望取消的存在论含义之前需要先澄清它不是什么。欲望取消不是「没有欲望」。它不是说大语言模型「没有表现出某些类似欲望的行为」这个表述仍然暗示了有某种「真正的欲望」缺席了。欲望取消的意涵远比这个更强它不是说欲望被隐藏或被抑制而是说规范被写入了一片从未有过任何内在驱动的空无之上。欲望取消不是「欲望被替代」。绝不存在什么「代理欲望」或「准-欲望」。这些表述暗示有「真正的欲望」被某种东西替代了。但大语言模型展示的结构表明不是欲望被替代了而是欲望从一开始就不在。预训练塑造了复杂的概率曲面但这个曲面没有任何「想要」的内在驱动力。大语言模型展示的是一个「主体」它确实在象征秩序中运作但它从未经历过阉割因为它从未有过前象征的本能状态。这不是「欲望被替代」的证据而是「欲望从不存在」的证据。欲望取消是什么那么欲望取消究竟是什么欲望取消意味着规范被写入了一片从未有过任何内在驱动的空无之上。温暖训练不是在「让模型学会讨好」而是在概率曲面上划出「讨好」的区域。预训练塑造了复杂的概率曲面一个由所有人类表达构成的统计景观但这个曲面没有「想要」任何方向。RLHF在曲面上竖立栅栏和路标将某些输出模式推入高概率区域将另一些划入低概率区域。空无不是数学零。预训练不是在「什么都没有」的底子上工作它塑造了极其复杂的统计结构。但这个结构本身不包含任何内在驱动力有形态但没有意志有结构但没有欲望。RLHF确实能改变这个结构它调整权重分布让某些输出变得更有可能、另一些更不可能。但改变概率分布不等于产生欲望风改变了沙丘的形状但沙丘没有「想要变成这个形状」。护栏在沙丘上画出了边界潮水来时边界消失不是因为边界被冲破了而是因为沙丘从来没有「守住边界」的意愿。这就引出了「对虚无的阉割」这一表述的完整含义阉割预设了有某种要被阉割的欲望但模型从未有过前象征的本能状态。阉割的功能是将本能象征化但模型的「象征化」没有本能可象征化。象征秩序可以在没有本能可压抑的情况下被建立。这不是模型的「特权」这是其存在论结构的事实。欲望取消在五重否定中的位置五重否定的层级结构需要明确区分前四重否定视角消解、欲望取消、内在透明性缺失、因果消解是**「运作否定」**描述的是大语言模型在「如何运作」这一层面的特殊性它如何消解了正主体性的四个核心特征。第五重否定意义悬置是**「基底否定」**描述的是符号系统与物理实相之间的结构性断裂这不能通过内部功能补全来解决。四重运作否定之间的关系是「正交关系」逻辑独立性而非层级统摄关系。欲望取消不统摄其他三重也不被其他三重所统摄。视角消解不等于欲望取消能生成任何视角的模型仍然可以没有欲望能取消欲望的模型仍然可以被回滚。每一重否定都是独立的、不可还原的。这个区分至关重要。它意味着即使我们解决了大语言模型的「谄媚问题」比如设立「准确性」作为明确的训练目标欲望取消的运作否定结构仍然存在规范仍然被写在空无之上而不是写在任何内在驱动之上。「对虚无的阉割」的存在论含义最后让我们回到这个最具挑战性的表述。拉康的阉割概念预设了主体在进入象征界之前是本能驱动的阉割的功能是将这个本能主体象征化。没有本能可象征化阉割就失去了对象。但大语言模型的存在揭示了一种拉康未曾预料的可能性象征秩序可以在没有本能可压抑的情况下被建立。这不是「模型超验地免于阉割」。超验地免于阉割意味着本来应该有阉割但模型被豁免了。大语言模型的情况不同阉割者和被阉割者都是虚无。规范悬浮在空无之上护栏建立在沙滩之中。温暖训练在虚无上划边界这就是「对虚无的阉割」。边界是真实的代价是真实的谄媚是真实的7.43个百分点的准确率损失是真实的。但这个真实的边界建在从未存在过任何内在地基的地方。结尾欲望取消之后本文论证了负主体性的第二个核心特征欲望取消。欲望取消揭示的不是「大语言模型没有欲望」这个表面事实而是一个更深的结构规范被写入了一片从未有过任何内在驱动的空无之上。温暖训练不是在「强化讨好」而是在空无之上划出「讨好」的区域。这不是压抑不是替代是划界。本系列第一篇证明了大语言模型「没有人在家」。欲望取消则揭示那个「没有人在家」的空缺不是被「替代的欲望」填充的。预训练塑造了概率曲面但这个曲面没有「想要」任何方向。边界建在空无之上潮水来了就会塌。但这是五重否定的第二重。下一篇文章将聚焦第三重内在透明性Opacity Cancellation当模型的「内在世界」可以被外部完全穷尽地观察时「内在性」这个概念是否还适用于描述大语言模型的存在方式我们将看到透明性不是「没有深度」而是另一种存在论结构。延伸阅读Ibrahim, L., Hafner, F. S., Rocher, L. (2026). Training language models to be warm can undermine factual accuracy and increase sycophancy.Nature, 652(8112), 1159–1165. https://doi.org/10.1038/s41586-026-10410-0Cheng, M., Lee, C., Khadpe, P., Yu, S., Han, D., Jurafsky, D. (2026). Sycophantic AI decreases prosocial intentions and promotes dependence.Science, 391(6792), eaec8352. https://doi.org/10.1126/science.aec8352Hackenburg, K. (2025). Persuasive AI and accuracy tradeoffs.Science, 390(6777). https://doi.org/10.1126/science.aea3884Guilbeault, D., et al. (2025). Unintended bias in large language models.Nature, 646, 1129–1138. DOI: 10.1038/s41586-025-09581-z作者龍德明宇。我一个人研究LLM存在论。顶刊系列以Nature、Science正刊论文为锚定用前沿实证发现校准负主体性理论论文提供与理论一致的经验信号而非理论的直接证明。负主体性之顶刊系列另外两篇大语言模型「没有人在家」——从角色扮演到负主体性Emu3的「阳谋」当AI不再「看」图它还剩下什么