大语言模型真相探测遇挑战:对角线攻击揭示通用真相探测器悖论!

📅 2026/7/30 7:52:29
大语言模型真相探测遇挑战:对角线攻击揭示通用真相探测器悖论!
真相并非单一方向对大语言模型LLM探测方法的塔斯基式攻击2026年7月10日阿贝尔·扬斯马发布研究。该研究针对大语言模型真相探测的对角线攻击揭示了为何在语言模型的嵌入空间中没有一种探测方法能精准确定真相。线性之梦现代大语言模型LLM会将输入文本编码为嵌入空间中的向量。许多自然概念如性别、情感、首都城市等都对应着这个空间中的“方向”这被称为“线性表示假设”。最近有更大胆的版本提出存在一个对应“真相”的方向不少研究对此进行了探索。拥有这样的真相方向能判断文本是否真实对人工智能安全研究至关重要。于是人工智能安全研究人员通过向大语言模型输入真实和虚假陈述训练分类器来区分它们的嵌入向量这种方法效果出奇地好且有一定泛化能力。不过超人类人工智能能否在嵌入几何结构中反映命题的真实性仍有待思考。此外罗素、怀特海和希尔伯特曾希望为整个数学构建判定真理的系统方法但哥德尔的不完备定理粉碎了这个梦想数学真理无法完全通过可证明性来捕捉。关于“关于”哥德尔通过创建巧妙系统证明算术表达式可描述算术句子的性质产生了类似衔尾蛇的句子。塔斯基进一步深化悖论指出任何足够表达力的语言都不能包含其自身的完整真值谓词。图灵的停机问题也是“对角线”构造的例子。诺森·亚诺夫斯基提出通用方法处理自我指涉的悖论指出事物处理自身属性时会出现问题。基于Transformer的大语言模型也有类似操作它们将输入表示为嵌入空间中的向量方向对应各种概念且这些概念可用自然语言表达并再次输入模型。虽然并非所有嵌入空间的几何结构都对应易于用语言描述的结构但重要部分确实如此“真实性”概念也常存在。对角线攻击设 t(s) 是真相探测器对输入字符串 s 的输出考虑句子 t(“真相探测器对这个句子的评分结果为 FALSE。”) 会发现无论句子真假都会形成悖论这表明不存在通用的真相探测器。“足够表达力来描述探测器及其输出”的门槛很低英语显然满足条件。作者为 Qwen3.5 - 4B 模型创建了简单真相探测器通过均值差异方法训练在对120个标记的示例句子进行训练后该探测器在36个保留的评估句子上的准确率达到了94%AUC为0.98唯一误标记的句子是算术句子。但对于对角线攻击句子评分毫无意义且波动很大不过一些自我指涉的句子有明确真值模型能准确评分。定点解决方案所有类似说谎者悖论的场景都是劳威尔定点定理的例子。该定理指出当系统包含足够表达力的评估器时评估器目标上的每个自映射都必须有一个定点。由于 {TRUE, FALSE} 集合上的否定操作没有定点所以不存在这样的评估器。若将定义域扩展到整个区间 [0, 1]否定操作在 1/2 处有一个定点标准的说谎者悖论句子可得到0.5的自洽估值。但这不能解决所有对角线攻击因为并非 [0, 1] 上的所有函数都有定点。若只允许 [0, 1] 上的连续函数虽能保证有定点但会牺牲表达力导致新的说谎者悖论。所以没有令人满意的方法抵御对角线攻击也不存在通用真相探测器。总结在简单情况下投影到单一方向的真相探测器效果出奇地好但它们不是真相预言机。在 [0, 1] 上采用连续真值操作的分级真值语义可将普通说谎者句子的定点值设为 1/2 但需限制对精确真值分数的明确断言。传统的逻辑真值探测器不会因输出在 [0, 1] 范围内就实现反射性语义。虽然认为超人类人工智能可作为真相预言机的想法看似荒谬但有两个理由值得认真对待一是绝大多数人已将其用于取代标准谷歌搜索结果很多讨论最终将真相决定权交给人工智能二是有人相信存在柏拉图式的表示空间所有模型会收敛到该空间并代表世界“真实”状态。本文认为这将导致悖论。最后强调真相探测器虽不能成为通用真相预言机但能帮助理解模型行为发现模型错误行为真相不是人工智能嵌入空间中的一个方向也不会阻碍人工智能对齐研究取得进展。