跳转至

MIT团队把泛化写进Harness:短任务训练,解锁32倍长度外推

Ch05.132 MIT团队把泛化写进Harness:短任务训练,解锁32倍长度外推

📊 Level ⭐⭐ | 1.0KB | entities/mit-rlm-harness-length-extrapolation-paperweekly-2026.md

-> 原文存档

从同一 30B 底座(Qwen3-30B-A3B-Instruct-2507)出发,分别训练 RLM 与 transformer 基线。模型只接触较短任务,评测长度达到训练时的 8-32 倍。RLM 在长任务上的评测增幅约为 transformer 基线的 10 倍。

来源