LLM 记忆容量:ICML 2026 获奖论文揭示每个参数约 3.6 bit¶
Ch01.1610 LLM 记忆容量:ICML 2026 获奖论文揭示每个参数约 3.6 bit¶
📊 Level ⭐⭐⭐⭐ | 4.6KB |
entities/llm-memorization-capacity-36-bit-per-parameter-icml2026.md
LLM 记忆容量:ICML 2026 获奖论文揭示每个参数约 3.6 bit¶
ICML 2026 杰出论文荣誉提名(Outstanding Paper Honorable Mention)— Meta、DeepMind、Cornell、NVIDIA 联合研究,回答了一个基础问题:语言模型的参数中究竟存储了多少训练数据信息?核心发现:GPT 类 Transformer 的经验记忆容量约为 每个参数 3.5–3.6 bit。
方法:信息压缩视角¶
传统研究从训练数据抽取(extraction)和成员推断(membership inference)入手,但难以区分样本级记忆与泛化能力。该论文转向信息压缩视角:
- 如果有模型作为参考,一个样本可以被压缩成更短编码,就说明模型提供了关于这个样本的部分信息
- 样本编码长度减少多少,对应模型提供了多少样本信息
- 使用算术编码 + 模型似然来近似压缩长度,将 Kolmogorov 复杂度转为可操作估计
这一方法将非预期记忆(模型对具体样本保留的信息)与泛化(从整体分布中学到的通用规律)分开测量。
关键实验发现¶
| 发现 | 细节 |
|---|---|
| 容量线性缩放 | 容量与参数量之间近似线性:$\text{Capacity} \approx \alpha \cdot N_{\text{params}}$ |
| bfloat16 容量 | 平均约 3.51 bit/参数 |
| fp32 容量 | 平均约 3.83 bit/参数(位宽增加但容量仅小幅上升) |
| 平台效应 | 非预期记忆先随数据量上升,达到容量上限后进入平台 |
| 双下降 | 数据-容量比接近 1 时测试损失先升后降,模型从记忆转向泛化 |
实验在 500K 到 1.5B 参数的 GPT 类 Transformer 上完成,使用合成随机数据排除泛化干扰。
记忆 vs 泛化的关系¶
核心理念:在真实文本(FineWeb)实验中,当训练数据规模超过模型容量时,非预期记忆下降,泛化开始占据更大比例。模型迫于容量限制在样本之间共享信息以节省容量,进而表现出更强泛化。
背不下去,才会泛化。
成员推断与数据安全¶
论文给出成员推断(Membership Inference)的经验缩放律:
- 关键变量:Capacity(θ)/∣D∣ — 模型容量与数据集的比值
- 模型容量越大,平均样本越容易被成员推断区分
- 训练数据越大,单个样本被识别越难(∣D∣ 足够大时 F1 → 0.5)
- 成员推断通常比直接抽取更容易,即使抽取率为 0 仍可能有效
稀有 token 风险更高:TF-IDF 分析显示,高 TF-IDF 样本(日文、中文、希伯来文等非英语文本)更容易被记住。稀有、重复、异常的样本需要单独关注数据隐私风险。
局限¶
- 仅测试了特定 GPT 类架构和训练设置
- 梯度下降不保证全局最优,因此测量更接近容量下界而非上界
- 样本细节、通用规律和训练过程统计痕迹在参数中混合,难以完全分离
与现有知识体系的关系¶
- 与 Scaling Laws 直接相关 — 模型容量(而非参数量)可能是预测泛化行为的更根本变量
- 为 Dario Amodei 的 scaling 论述 提供微观理论基础
- 与 Loop Engineering 中评估器设计的隐含联系:如果模型记忆容量有限且受数据-容量比驱动,那么"模型是否记住了测试数据"就不是一个 binary 问题,而是 continuum 问题
- 在双下降现象上的发现补充了 ML 理论的核心认知
→ 原文存档
关联¶
- 相关概念: Harness Engineering
- 相关: Agent 架构