跳转至

腾讯混元 HiLS-Attention:可学习层级稀疏注意力实现无限上下文建模

Ch01.911 腾讯混元 HiLS-Attention:可学习层级稀疏注意力实现无限上下文建模

📊 Level ⭐⭐ | 7.1KB | entities/tencent-hunyuan-hils-attention.md

腾讯混元 HiLS-Attention:可学习层级稀疏注意力实现无限上下文建模

论文:Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling (arXiv:2607.02980) 来源:Hyman的杂货铺 | 原文存档 Github:https://github.com/Tencent-Hunyuan/HiLS-Attention

核心创新

HiLS-Attention(Hierarchical Learnable Sparse Attention)将"选哪些历史片段参与注意力"做成可端到端训练的层级路由,解决了稀疏注意力中长期存在的训练闭环缺口:路由分数不参与最终前向权重,LM loss 无法教会"该选谁"。

可学习 chunk 质量代理

使用 LogSumExp 一阶近似,将 chunk 质量写成线性可计算代理: 1. 可学习的压缩 chunk key——替代传统均值池化 key,更有表达力的 chunk 表示 2. 熵项校准——在"均匀分布"和"尖峰分布"之间自适应补偿,避免均值池化抹平尖峰

层级 softmax 分解

注意力 = 块内分配 × 块间分配。块间分配项里的可学习 chunk 质量代理直接影响最终注意力权重,使下游语言建模损失反向优化路由本身。

训练策略

路径 说明 新增参数
轻量改造 冻结基座,只训练 landmark token + 低秩查询校准 (Q-Cal) < 1%
全参数继续训练 与 HoPE 位置编码配合 全参数

关键实验数据

  • 8K 训练外推到 4M:345M 规模 RULER 检索 90%+ 准确率(512 倍外推)
  • 512K 推理加速:预填充 ~13.5×,解码 ~15.7×(单卡 H800, 345M)
  • 7B 检索平均分:HiLS-Attn-HoPE-Q-Cal 达 97.42 vs 全注意力基线 33.50
  • 通用能力保持:General/Math/Code 与基座接近,无"长文本上去、常规能力下滑"副作用

价值评估

  • 方法价值:路由学习纳入 LM 主损失,补上稀疏注意力训练闭环缺口
  • 工程价值:低成本改造现有全注意力模型(<1% 新参数)
  • 系统价值:速度提升来自算法和 kernel 协同
  • 边界:主要在语言建模和长上下文任务验证,多模态和复杂 Agent 场景还需后续证据;chunk 路由超参数仍需细调

深度分析

HiLS 解决的核心理论缺口

稀疏注意力长期以来面临一个"训练-推理目标不一致"问题:chunk 选择阶段的路由分数虽然参与了 top-k 检索,但没有直接参与最终的注意力权重计算。这意味着 LM loss 的反向传播信号无法有效指导路由模块学习"该选谁"。HiLS 通过层级 softmax 分解,将块间分配项中的 chunk 质量代理直接暴露在前向计算图中,使路由参数能够接收来自主损失的梯度信号。这一设计并非简单的工程优化,而是从训练方法论层面补上了稀疏注意力长期存在的理论闭环缺口。

可学习 chunk 表示 vs 均值池化的本质差异

传统稀疏注意力使用均值池化或 CLS token 作为 chunk 表示,这些方法的共同问题是:将 chunk 内所有 token 的信息压缩为一个固定向量,丢失了 token 间的交互模式和尖峰信号。HiLS 的可学习压缩 chunk key 通过 LogSumExp 一阶近似,实际上是在学习一个"哪些 token 信息值得保留"的选择器。配合熵项校准,模型可以自动判断 chunk 内部的分布形态——在均匀分布时做平滑聚合,在尖峰分布时保留极值信息。

8K→4M 外推能力的工程意义

512 倍外推(8K 训练→4M 推理)意味着 HiLS 的学习到的路由策略具有高度的长度泛化性——模型没有在 4M 长度上训练过,却能在该长度下保持 90%+ 的检索准确率。这与传统稀疏注意力外推能力快速衰减的特性形成鲜明对比,说明可学习的路由策略比固定启发式规则(如滑动窗口、随机采样)有更强的模式抽象能力。

轻量改造成本的战略价值

HiLS 提供了两条训练路径:轻量改造(<1% 参数)和全参数继续训练。轻量路径的战略意义在于:现有部署的全注意力模型可以通过微调快速转换为 HiLS 稀疏注意力,无需从零训练。对于腾讯这样的云服务商,这意味着已部署的千亿参数模型可以分批转换,推理成本大幅下降而模型能力无损。

稀疏注意力的边界与未来方向

当前 HiLS 主要在语言建模和长上下文检索任务上验证,多模态场景(图像-文本交错输入、视频理解)和复杂 Agent 场景(多轮工具调用、长程规划)的适配性尚需进一步验证。此外,chunk 路由的超参数(chunk size、top-k 数量)仍需针对不同场景手动细调,这限制了其作为"即插即用"组件的能力。未来方向可能包括自适应 chunk 大小和端到端超参数学习。

实践启示

  1. 训练闭环思维:当一个模块在前向推理中起关键作用但参数不参与梯度计算时,应考虑如何将其暴露在训练 loss 中。HiLS 证明,即使是"路由选择"这种离散操作,也可以通过 soft 分解变成可微分管道。

  2. 从全注意力到稀疏注意力的迁移路径:HiLS 的轻量改造策略(<1% 参数)为已部署的大模型提供了一条低成本升级路径。对于使用长上下文场景的团队,评估当前注意力机制的推理瓶颈,并设计可兼容现有 checkpoint 的迁移方案,是更具工程可行性的路线。

  3. 外推能力应是稀疏注意力的核心指标:训练长度下的表现往往不能反映真实场景。HiLS 的 512 倍外推能力提示我们,评估稀疏注意力时应将"长度外推倍数"作为优先级最高的指标,而非仅仅关注同长度下的加速比。

  4. 算法与 kernel 协同优化:HiLS 的速度提升不仅来自算法改进(更少的 attention 计算),还来自与 GPU kernel 的协同设计。在实践部署中,仅替换注意力算法而不优化底层 kernel 往往只能获得理论加速的一部分。

  5. 稀疏注意力不是万能方案:尽管 HiLS 在长上下文场景表现优异,但仍存在多模态验证不足、chunk 超参数需手动调整等边界条件。在引入稀疏注意力时,应明确应用场景是否真正需要无限上下文,而非盲目追求"越长越好"。


关联