【会员专享】Agent Loop = RL Rollout?AI Agent 训练数据生成机制详解
这个系列从第一集开始,我们一直围绕 Agent Loop 里那行 while true 展开:问模型、执行工具、回填结果、继续推理。
到了这一集,我们把这条循环和强化学习里的 Rollout / Trajectory 放在一起看。你会发现:Agent Loop 里的 act、observe、reason、repeat,和 RL 里的 action、observation、policy sampling、trajectory,本质上是同一套结构,只是换了一套术语。
本期主要讲清楚几个问题:
0 comments