【论文复现】ICLR 2026 北大NVIDIA 提出 MHLA:多头线性注意力,即插即用!附赠 YOLO26 改进

【论文复现】ICLR 2026 北大NVIDIA 提出 MHLA:多头线性注意力,即插即用!附赠 YOLO26 改进

一、为什么需要 MHLA?

Transformer 已经成为视觉、语言和生成任务的主流架构,但它的自注意力机制有一个致命弱点:时间和显存复杂度是序列长度的平方级。当面对高分辨率图像生成、长视频合成等超长序列场景时,传统注意力会变得极其缓慢甚至无法运行。

为了解决这个问题,研究者们提出了线性注意力。它的核心思路是:不再逐个计算两两 token 之间的相似度,而是把所有 key 和 value 压缩成一个全局的"摘要矩阵",每个 query 都直接复用这个摘要。这样一来,复杂度从平方级降到了线性级,速度大幅提升。

然而,这种"一刀切"的全局压缩带来了严重的性能退化。论文作者将这一现象命名为全局上下文崩溃(Global Context Collapse),具体表现为两个方面:

  • 秩塌陷:全局摘要的大小是固定的,无论序列多长,注意力矩阵的秩都被死死限制在一个很小的数值内。随着序列变长,模型越来越难以表达丰富的 token 间关系。

  • 稀疏性丧失:因为每个 query 看到的都是同一个全局摘要,注意力权重会趋向于均匀分布,无法像 softmax 注意力那样把概率质量集中在少数重要的 token 上。换句话说,模型"不会聚焦了"。

现有的改进方案(如加入深度可分离卷积、门控机制等)虽然能在一定程度上缓解问题,但又引入了额外的计算开销,违背了线性注意力"轻量高效"的初衷。

因此,MHLA 的设计目标非常明确: