大模型的下一个阶段,不是让模型“想得更久”,而是让模型“为了行动而思考”¶
Ch01.1063 大模型的下一个阶段,不是让模型“想得更久”,而是让模型“为了行动而思考”¶
📊 Level ⭐⭐ | 5.9KB |
entities/大模型的下一个阶段不是让模型想得更久而是让模型为了行动而思考.md
大模型的下一个阶段,不是让模型“想得更久”,而是让模型“为了行动而思考”¶
来源: Unknown
发布日期: 2026-03-28
原文链接: https://mp.weixin.qq.com/s/cTEoBNHA7-jnG6c5XEUHGQ
林俊旸(Junyang Lin)新的文章:大模型的下一个阶段,不是让模型“想得更久”,而是让模型“为了行动而思考”。
林俊旸是阿里通义千问(Qwen)团队前技术负责人。2026 年 3 月刚刚离职。他直接领导了 Qwen3 的开发,经历了推理模型融合的实际困难,离开之后发了一篇长推文回顾这段历程,标题叫《从“推理”思维到“智能体”思维》。
【1】o1 和 R1 到底教了我们什么
第一波推理模型教会了一件事:如果要在语言模型上做强化学习(RL),就需要确定性强、稳定可扩展的反馈信号。数学、代码、逻辑这些可验证领域变成了核心阵地,因为奖励信号比通用偏好标注强得多。RL 可以针对“正确性”优化,而不是优化“听起来是不是合理”。
基础设施也变成了核心问题。一旦模型被训练去做长链条推理,RL 就不再是微调之后的轻量附加步骤,而是一个系统工程问题:大规模采样(rollout)、高吞吐验证器、稳定策略更新、高效调度。OpenAI 把 o1 定义为用 RL 训练的推理模型,DeepSeek R1 进一步证明了推理式 RL 对基础设施的要求有多高。
他的总结:第一个大转变是从扩大预训练,到扩大后训练的推理能力。
【2】真正的难题:合并 thinking 和 instruct
2025 年初,Qwen 团队的图景很完美:理想系统应该统一 thinking 和 instruct 模式,支持可调节的推理力度,甚至让模型自动判断需要多少推理量。
Qwen3 是最清晰的公开尝试。它引入了“混合思维模式”,在同一模型家族里同时支持思考和非思考行为,强调可控的思维预算,后训练流水线明确包括“思维模式融合”阶段。
但合并比描述起来难得多。难点在数据。
两种模式的数据分布和行为目标差异很大。强 instruct 模型被奖励为直接、简洁、低延迟,高效处理标注、客服、结构化提取这类企业任务。强 thinking 模型被奖励为在困难问题上花更多 token、维持连贯的中间推理、探索替代路径。两个行为画像互相拉扯。合并数据如果不精心筛选,结果是两头都不行:thinking 变得臃肿不够果断,instruct 变得不够干脆还更贵。
【注:Qwen3 发布时主打“混合思维模式”,但后续的 2507 更新却把 instruct 和 thinking 拆成了独立模型(包括 30B 和 235B 两个规格)。不是不想合并,是合并之后两头都做不好。这种一手经验在公开文章里非常少见。】
在商业部署中,大量客户仍然要高吞吐、低成本的 instruct 行为来跑批处理。分开两条线让团队能更干净地解决各自的数据和训练问题。
不过其他实验室选了相反的路。Anthropic 明确支持集成模型理念,Claude 3.7 Sonnet 作为混合推理模型推出,用户可以选择普通响应或扩展思考,API 用户可设定思考预算。GLM-4.5 也定位为混合推理模型,同时支持 thinking 和 non-thinking 模式;DeepSeek V3.1 走了类似方向。
林俊旸认为关键在于合并是否有机。如果两种模式只是被塞进同一个权重文件,行为上还是两个生硬缝合的人格,产品体验就不自然。真正成功的合并需要一个平滑的推
→ 原文存档
关联¶
- 相关概念: Harness Engineering