美团:协同优化长上下文稀疏注意力

📅 2026/8/13 10:37:13
美团:协同优化长上下文稀疏注意力
标题LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing来源arXiv, 2608.01662v2️文章简介研究问题如何解决DeepSeek稀疏注意力DSA在长文本场景下面临的索引器高计算开销及非连续内存访问导致的硬件效率低下问题主要贡献论文提出LongCat Sparse Attention (LSA)框架通过流感知、跨层及分层索引三种策略实现百万级token上下文的高效训练与推理性能媲美全注意力。重点思路流感知索引SI将注意力预算划分为固定部分Sink tokens和滑动窗口与动态稀疏部分。固定部分确保内存访问连续性提升HBM带宽利用率动态部分保留关键token选择能力兼顾硬件友好性与模型精度。跨层索引CLI利用相邻层显著token高度重叠的特性将连续层分组。仅首层执行索引计算后续层复用其结果并通过跨层蒸馏训练使索引器适应组内所有层的注意力模式大幅摊销计算开销。分层索引HI采用由粗到细的两阶段选择机制。先基于块级表示召回少量候选页再在候选页内进行细粒度token评分。该模块无需训练作为即插插件在超长上下文推理时启用显著降低索引复杂度。分析总结LSA在69B至560B规模模型上通用基准及长上下文测试中性能与全注意力相当且在长文本任务中表现更优。训练效率显著提升支持原生百万token上下文训练。相比DSALSA在预填充和解码阶段分别实现最高3.6倍和1.4倍的端到端推理加速。消融实验表明SI在固定预算占50%时平衡最佳CLI在组大小为2时无损质量HI在超过256K上下文时提供额外加速且几乎不损失精度。个人观点论文通过软硬协同设计解决稀疏注意力的实际部署难题SI巧妙利用局部性原理优化内存访问CLI通过蒸馏实现计算冗余消除HI则针对极长序列提供阶梯式优化。