2025-04-01 · candidate
RAGEN:轨迹级 Agent 强化学习
RAGEN 在完整交互轨迹级别训练 Agent,让策略从多步历史、环境反馈和轨迹奖励中学习改进,是 Agent RL 路线的重要样本。
核心思想
在轨迹级别对 Agent 进行强化学习训练。不同于单步奖励,RAGEN 从 Agent 的完整交互历史中学习策略改进。
方法
- Agent 执行完整交互轨迹
- 轨迹级评估计算整体奖励
- RL 更新 Agent 策略
- 新策略生成改进的交互轨迹
意义
- 从单步优化扩展到轨迹级策略优化
- 完整交互历史提供更丰富的学习信号
- 为 Agent 级别的进化训练提供框架
← 返回研究图谱