跳转至

0.01%参数就能接近全量微调!低数据微调极致省参方案来了 | ACL'26

Ch01.1586 0.01%参数就能接近全量微调!低数据微调极致省参方案来了 | ACL'26

📊 Level ⭐⭐⭐ | 2.4KB | entities/001参数就能接近全量微调低数据微调极致省参方案来了-acl26.md

0.01%参数就能接近全量微调!低数据微调极致省参方案来了 | ACL'26

WeChat-量子位 | 发布于 2026-08-12 | 评分入库 v×c≥49

核心内容

关注前沿科技 2026-08-12 11:17 北京 模型里的偏置项, 究竟哪个最值得训练? 量子位 公众号 QbitAI 大模型微调的极致省参方案,要先回答一个更基本的问题:模型里的偏置项,究竟哪个最值得训练? 来自瑞典隆德大学与Google DeepMind 的研究团队,系统比较了注意力模块中Query、Key、Value三类偏置b(q)、b(k)、b(v)。团队给出的核心结论非常直接:在低数据场景下,直接微调Value投影中的b(v),通常比微调b(q)或b(k)获得更好的下游性能。 该工作已被ACL 2026主会接收(已集成进Hugging Face-PEFT库),由Baichuan Huang、Ananth Balashankar和Amir Aminifar共同完成。其中Baichuan Huang、Amir Aminifar来自隆德大学,Ananth Balashankar来自Google DeepMind。 全参数微调效果强,但训练成本、显存占用和能耗都很高;LoRA、Adapter、Prefix Tuning等参数高效微调方法虽然大幅降低了开销,往往仍需新增模块、配置秩或长度,并进行额外重参数化。相比之下,Bias-only微调直接更新模型中已有的偏置项,几乎不改网络结构,天然具备“开箱即用”的优势。 此前的BitFit等工作已经发现:尤其在样本有限时,微调全部偏置项可以接近全参数微调。但“全部Bias”仍然把不同位置一视同仁。Transformer注意力中,b(q)、b(k)、b(v)究竟谁更关键?如果只保留最有效的一类,是否还能进一步减少参数? 这正是BEF。

关键要点

相关实体

Agent Architecture Agent Evaluation Benchmarks