大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提升¶
Ch01.1581 大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提升¶
📊 Level ⭐⭐⭐ | 2.8KB |
entities/大模型后训练破解多模态分布性遗忘7b模型七项基准全线提升.md
大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提升¶
WeChat-新智元 | 发布于 2026-08-08 | 评分入库 v×c≥49
核心内容¶
新智元 2026-08-08 19:07 北京 新智元报道 DeepSeek-R1之后,「让模型想得更久」几乎成了提升推理能力的标准答案。 但对多模态大模型而言,推理 token 更多,并不必然意味着视觉推理更充分。恰恰相反,模型在开头还能准确描述图像,随着生成内容不断累积,后续推理却可能越来越依赖自己写出的文字。 只要早期描述出现一点偏差,错误就会沿着自回归链条被反复引用、逐步放大,最后得到一个语言上严丝合缝、视觉上完全失真的答案。 这不是简单的「没看见」,而是看见之后没能一直记住 。 从后训练角度看,问题还可以进一步抽象:在典型的自回归多模态模型中,视觉条件在生成开始时已经固定,语言轨迹却随着推理持续增长。如果强化学习只奖励最终答案,训练目标就不会主动区分两类轨迹——一类始终以图像为依据,另一类中途丢失视觉证据、靠语言先验碰巧答对。 久而久之,策略优化就可能把概率质量分配给「答案正确但证据失真」的轨迹。本文将这种由rollout数据分布、序列结构与稀疏结果奖励共同诱发的系统性视觉衰减 ,概括为「分布性视觉遗忘」。 西北工业大学、香港科技大学和浙江大学的研究团队提出Remember-R1 ,试图从源头上修正这一偏置:不修改推理流程,而是在强化学习后训练中加入三种过程奖励,让模型不仅要答对,还必须在整条推理链中持续表达、保留并准确调用视觉证据。 论文链接:<https://arxiv.org/abs/2608.01314 代码链接:<https://github.com/Ch921-cell/Remember-R1 模型链接:<https://huggingface.co/JM。
关键要点¶
- 原文完整记录:原文存档
- 关联主题:Agent Evaluation Benchmarks、Evaluation Harness Design
相关实体¶
Agent Evaluation Benchmarks Evaluation Harness Design