2025-04-01 · candidate

RAGEN:轨迹级 Agent 强化学习

RAGEN 在完整交互轨迹级别训练 Agent,让策略从多步历史、环境反馈和轨迹奖励中学习改进,是 Agent RL 路线的重要样本。

arXiv轨迹训练Agent RL策略进化

核心思想

在轨迹级别对 Agent 进行强化学习训练。不同于单步奖励,RAGEN 从 Agent 的完整交互历史中学习策略改进。

方法

  1. Agent 执行完整交互轨迹
  2. 轨迹级评估计算整体奖励
  3. RL 更新 Agent 策略
  4. 新策略生成改进的交互轨迹

意义

← 返回研究图谱