2026-05-22 · aha team

Reflexion 深度解读:用语言反思替代参数更新

Reflexion 如何把任务失败转化为自然语言记忆,让 Agent 在不更新权重的情况下持续改进。

Reflexion 是 Self Evolve 经验飞轮中的关键一环:它展示了如何用廉价的”语言记忆”替代昂贵的”参数更新”,让智能体在不重新训练的情况下从失败中学习。

核心架构:三个模型

Reflexion 的架构由三个协作模型组成:

  1. Actor(执行者):与环境交互,生成动作序列和轨迹
  2. Evaluator(评估者):根据任务结果给出奖励信号(成功/失败/部分成功)
  3. Self-Reflection(自我反思):在失败后,分析轨迹生成自然语言反思,存入记忆

关键创新在第三步:反思是语言的,不是数字的。这意味着记忆可以跨任务、跨领域迁移。

语言记忆 vs 参数更新

传统强化学习通过梯度更新来”记住”经验。Reflexion 的方案不同:

维度参数更新语言反思
成本高(需要反向传播)低(一次推理调用)
可解释性黑盒完全可读
迁移能力低(绑定到权重)高(自然语言通用)
灾难性遗忘有风险权重遗忘较低,但有记忆污染、检索失败和过期风险

实验结果与局限

Reflexion 在 HumanEval(代码生成)、AlfWorld(文本决策)和 WebShop(电商交互)等基准上显著超越 ReAct 等基线方法。但也有局限:

对 Self Evolve 的启示

Reflexion 直接对应产品级的记忆层设计:

  1. 运行日志就是记忆源:每次任务执行的轨迹和结果都应该被记录
  2. 失败比成功更有价值:反思机制应该重点关注失败案例
  3. 记忆需要检索:不是所有记忆都相关,需要 RAG 风格的检索
  4. 回归防护:改进后的行为必须在新任务上验证,否则回滚

Self Evolve 会在 Reflexion 的官方实现基础上,扩展记忆检索、回归测试和跨任务迁移能力。