清华浙大等开源发布SEED:自进化OPD的长程Agent强化学习训练方法¶
Ch04.039 清华浙大等开源发布SEED:自进化OPD的长程Agent强化学习训练方法¶
📊 Level ⭐ | 0.9KB |
entities/seed-self-evolving-opd-long-horizon-agent-rl-tsinghua-zju-2026.md-> 原文存档
一句话讲清楚👉🏻 SEED 让 Agent 在训练时复盘自己刚完成的任务轨迹,把整条任务结束后的经验,细化成每一步输出该不该加强的训练信号。
来源¶
- 原文: 清华浙大等开源发布SEED:自进化OPD的长程Agent强化学习训练方法
- 原始链接: : https://mp.weixin.qq.com/s/1tPAWiT7U76Uabq3JvhCkw