跳转至

清华浙大等开源发布SEED:自进化OPD的长程Agent强化学习训练方法

Ch04.039 清华浙大等开源发布SEED:自进化OPD的长程Agent强化学习训练方法

📊 Level ⭐ | 0.9KB | entities/seed-self-evolving-opd-long-horizon-agent-rl-tsinghua-zju-2026.md

-> 原文存档

一句话讲清楚👉🏻 SEED 让 Agent 在训练时复盘自己刚完成的任务轨迹,把整条任务结束后的经验,细化成每一步输出该不该加强的训练信号。

来源