一、先纠正一个直觉模型根本没有记所以谈不上忘大语言模型的本质是一台条件概率机每生成一个 token它做的事情只有一件——在前文context的条件下计算下一个词的概率分布然后采样。P(x_{t1} | x_1, x_2, ..., x_t)模型对上下文的全部记忆不在任何数据库里而是一次前向计算中对各 token 注意力权重的临时分配。所谓遗忘本质是这个临时分配出了问题——不是信息被删除了而是它在竞争中被压下去了。二、注意力稀释数学上的预算守恒Transformer 的注意力核心是 softmax 归一化Attention(Q, K, V) softmax(QKᵀ / √d) · V关键在于softmax 的每一行每个查询位置权重总和恒等于 1。这意味着注意力是一份固定大小的预算上下文只有 10 个 token 时重要的开头 token 可以轻松分到 0.3、0.5 的权重上下文塞到 10 万个 token 时即便开头 token 绝对重要它能分到的份额也被海量后续 token 摊薄。而且 QKᵀ 的点积没有上界约束当 key 数量爆炸时softmax 会让权重分布熵增——变得越来越平均、越来越谁都有点关系。稀释不是比喻是归一化的必然结果相关 token 的权重占比随上下文长度近似反比下降信噪比持续恶化。三、训练出来的位置先验远的天然打不过近的注意力权重不是随机分出来的是训练出来的偏好。三重因素叠加1. RoPE 位置编码的远距离衰减主流模型用旋转位置编码RoPE两个 token 的点积随相对距离增大而振荡衰减。模型天生看不太清十万字之前的东西——这不是 bug是编码方案的物理特性。2. 训练数据的分布烙印预训练语料中强相关的信息主语和谓语、问题和答案、指代和先行词绝大多数出现在彼此附近。模型学到一条统计捷径距离近 ≈ 相关度高于是上下文越长开头 token 被这条先验判为低相关的概率越大。3. 因果掩码的传话损耗自回归模型里第 1 个 token 的信息要影响第 100,000 个位置必须经由中间所有层、所有位置的逐级传递——像一个万人传话游戏。每一层的残差和注意力都在重新压缩信息到达末端时已面目全非。四、实验证据U 型曲线与Lost in the Middle经典研究Liu et al., 2023,Lost in the Middle: How Language Models Use Long Contexts发现把关键信息放在长上下文的不同位置让模型找答案准确率呈U 型——开头尚可、结尾最好、中间最差。结尾好指令遵循训练和近期性偏置recency bias开头能幸存靠的是注意力汇聚点attention sink等局部机制中间位置的指令几乎必然被稀释注意力的预算被首尾效应两头挤占。五、稀释的最终后果模型脑补回先验当开头指令的注意力权重被稀释到不足以压制输出分布时模型会退而求其次——回退到参数记忆里训练分布最强的模式最常见的话术、最套路的结构。这就是长上下文幻觉的来源模型不是记错了开头而是开头的话语权已经低于它的肌肉记忆。六、由此推出的应对策略每条都对应上面的机制底层机制对策注意力预算守恒控制上下文长度无关内容别塞位置先验偏弱关键指令放在开头或结尾锚定首尾效应传话损耗长任务中途做结构化摘要、显式重述约束稀释不可逆超长文档用 RAG 检索而非全文硬塞或选用支持超长上下文、带注意力稀疏化/压缩设计的模型七、一句话总结上下文越满开头 token 在 softmax 归一化的固定注意力预算里分到的份额越少叠加位置编码的远距离衰减和训练数据的近者优先先验开头信息的信噪比持续恶化——模型并非遗忘了它而是在概率竞争中输给了先验。