腾讯混元 HiLS-Attention:可学习层级稀疏注意力实现无限上下文建模¶
Ch01.911 腾讯混元 HiLS-Attention:可学习层级稀疏注意力实现无限上下文建模¶
📊 Level ⭐⭐ | 7.1KB |
entities/tencent-hunyuan-hils-attention.md
腾讯混元 HiLS-Attention:可学习层级稀疏注意力实现无限上下文建模¶
论文:Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling (arXiv:2607.02980) 来源:Hyman的杂货铺 | 原文存档 Github:https://github.com/Tencent-Hunyuan/HiLS-Attention
核心创新¶
HiLS-Attention(Hierarchical Learnable Sparse Attention)将"选哪些历史片段参与注意力"做成可端到端训练的层级路由,解决了稀疏注意力中长期存在的训练闭环缺口:路由分数不参与最终前向权重,LM loss 无法教会"该选谁"。
可学习 chunk 质量代理¶
使用 LogSumExp 一阶近似,将 chunk 质量写成线性可计算代理: 1. 可学习的压缩 chunk key——替代传统均值池化 key,更有表达力的 chunk 表示 2. 熵项校准——在"均匀分布"和"尖峰分布"之间自适应补偿,避免均值池化抹平尖峰
层级 softmax 分解¶
注意力 = 块内分配 × 块间分配。块间分配项里的可学习 chunk 质量代理直接影响最终注意力权重,使下游语言建模损失反向优化路由本身。
训练策略¶
| 路径 | 说明 | 新增参数 |
|---|---|---|
| 轻量改造 | 冻结基座,只训练 landmark token + 低秩查询校准 (Q-Cal) | < 1% |
| 全参数继续训练 | 与 HoPE 位置编码配合 | 全参数 |
关键实验数据¶
- 8K 训练外推到 4M:345M 规模 RULER 检索 90%+ 准确率(512 倍外推)
- 512K 推理加速:预填充 ~13.5×,解码 ~15.7×(单卡 H800, 345M)
- 7B 检索平均分:HiLS-Attn-HoPE-Q-Cal 达 97.42 vs 全注意力基线 33.50
- 通用能力保持:General/Math/Code 与基座接近,无"长文本上去、常规能力下滑"副作用
价值评估¶
- 方法价值:路由学习纳入 LM 主损失,补上稀疏注意力训练闭环缺口
- 工程价值:低成本改造现有全注意力模型(<1% 新参数)
- 系统价值:速度提升来自算法和 kernel 协同
- 边界:主要在语言建模和长上下文任务验证,多模态和复杂 Agent 场景还需后续证据;chunk 路由超参数仍需细调
深度分析¶
HiLS 解决的核心理论缺口¶
稀疏注意力长期以来面临一个"训练-推理目标不一致"问题:chunk 选择阶段的路由分数虽然参与了 top-k 检索,但没有直接参与最终的注意力权重计算。这意味着 LM loss 的反向传播信号无法有效指导路由模块学习"该选谁"。HiLS 通过层级 softmax 分解,将块间分配项中的 chunk 质量代理直接暴露在前向计算图中,使路由参数能够接收来自主损失的梯度信号。这一设计并非简单的工程优化,而是从训练方法论层面补上了稀疏注意力长期存在的理论闭环缺口。
可学习 chunk 表示 vs 均值池化的本质差异¶
传统稀疏注意力使用均值池化或 CLS token 作为 chunk 表示,这些方法的共同问题是:将 chunk 内所有 token 的信息压缩为一个固定向量,丢失了 token 间的交互模式和尖峰信号。HiLS 的可学习压缩 chunk key 通过 LogSumExp 一阶近似,实际上是在学习一个"哪些 token 信息值得保留"的选择器。配合熵项校准,模型可以自动判断 chunk 内部的分布形态——在均匀分布时做平滑聚合,在尖峰分布时保留极值信息。
8K→4M 外推能力的工程意义¶
512 倍外推(8K 训练→4M 推理)意味着 HiLS 的学习到的路由策略具有高度的长度泛化性——模型没有在 4M 长度上训练过,却能在该长度下保持 90%+ 的检索准确率。这与传统稀疏注意力外推能力快速衰减的特性形成鲜明对比,说明可学习的路由策略比固定启发式规则(如滑动窗口、随机采样)有更强的模式抽象能力。
轻量改造成本的战略价值¶
HiLS 提供了两条训练路径:轻量改造(<1% 参数)和全参数继续训练。轻量路径的战略意义在于:现有部署的全注意力模型可以通过微调快速转换为 HiLS 稀疏注意力,无需从零训练。对于腾讯这样的云服务商,这意味着已部署的千亿参数模型可以分批转换,推理成本大幅下降而模型能力无损。
稀疏注意力的边界与未来方向¶
当前 HiLS 主要在语言建模和长上下文检索任务上验证,多模态场景(图像-文本交错输入、视频理解)和复杂 Agent 场景(多轮工具调用、长程规划)的适配性尚需进一步验证。此外,chunk 路由的超参数(chunk size、top-k 数量)仍需针对不同场景手动细调,这限制了其作为"即插即用"组件的能力。未来方向可能包括自适应 chunk 大小和端到端超参数学习。
实践启示¶
-
训练闭环思维:当一个模块在前向推理中起关键作用但参数不参与梯度计算时,应考虑如何将其暴露在训练 loss 中。HiLS 证明,即使是"路由选择"这种离散操作,也可以通过 soft 分解变成可微分管道。
-
从全注意力到稀疏注意力的迁移路径:HiLS 的轻量改造策略(<1% 参数)为已部署的大模型提供了一条低成本升级路径。对于使用长上下文场景的团队,评估当前注意力机制的推理瓶颈,并设计可兼容现有 checkpoint 的迁移方案,是更具工程可行性的路线。
-
外推能力应是稀疏注意力的核心指标:训练长度下的表现往往不能反映真实场景。HiLS 的 512 倍外推能力提示我们,评估稀疏注意力时应将"长度外推倍数"作为优先级最高的指标,而非仅仅关注同长度下的加速比。
-
算法与 kernel 协同优化:HiLS 的速度提升不仅来自算法改进(更少的 attention 计算),还来自与 GPU kernel 的协同设计。在实践部署中,仅替换注意力算法而不优化底层 kernel 往往只能获得理论加速的一部分。
-
稀疏注意力不是万能方案:尽管 HiLS 在长上下文场景表现优异,但仍存在多模态验证不足、chunk 超参数需手动调整等边界条件。在引入稀疏注意力时,应明确应用场景是否真正需要无限上下文,而非盲目追求"越长越好"。
关联¶
- 相关概念: Harness Engineering