简单理解就是Full Attention 能看全部 tokenCausal Attention 只能看当前和过去不能偷看未来。Full Attention全注意力假设序列是那么每个位置都可以和所有位置做 attention所以它是双向的。适合整段输入已经全部已知的任务例如很多图像/视频扩散模型里的时空建模。优点是全局信息利用充分缺点是做自回归生成时会“看到未来”。Causal Attention因果注意力用一个三角形 mask把未来 token 挡住。比如所以第个位置只能看这就是 GPT 这类自回归模型常用的 attention。放到你最近看的视频生成里面会更直观Full Attention: Frame 1 ↔ Frame 2 ↔ Frame 3 ↔ Frame 4 每一帧都可以看到前后帧 Causal Attention: Frame 1 → Frame 2 → Frame 3 → Frame 4 后面的帧可以看前面的前面的不能看后面的所以核心区别其实就一句话Full attention past present future 都能看Causal attention 只能看 past present。另外你最近看到的chunk-causal attention是两者之间的一种折中一个 chunk 内部可以 full attention但不同 chunk 之间 causal。例如Chunk 1: [F1 F2 F3 F4] ← 内部 full attention ↓ Chunk 2: [F5 F6 F7 F8] ← 能看 Chunk 1 ↓ Chunk 3: [F9 F10 F11 F12]这也是为什么很多长视频 / streaming world model 喜欢chunk-causal既保留 chunk 内较强的建模能力又能真正做到按时间顺序持续生成。