2026-05-22 · aha team
Reflexion 深度解读:用语言反思替代参数更新
Reflexion 如何把任务失败转化为自然语言记忆,让 Agent 在不更新权重的情况下持续改进。
Reflexion 是 Self Evolve 经验飞轮中的关键一环:它展示了如何用廉价的”语言记忆”替代昂贵的”参数更新”,让智能体在不重新训练的情况下从失败中学习。
核心架构:三个模型
Reflexion 的架构由三个协作模型组成:
- Actor(执行者):与环境交互,生成动作序列和轨迹
- Evaluator(评估者):根据任务结果给出奖励信号(成功/失败/部分成功)
- Self-Reflection(自我反思):在失败后,分析轨迹生成自然语言反思,存入记忆
关键创新在第三步:反思是语言的,不是数字的。这意味着记忆可以跨任务、跨领域迁移。
语言记忆 vs 参数更新
传统强化学习通过梯度更新来”记住”经验。Reflexion 的方案不同:
| 维度 | 参数更新 | 语言反思 |
|---|---|---|
| 成本 | 高(需要反向传播) | 低(一次推理调用) |
| 可解释性 | 黑盒 | 完全可读 |
| 迁移能力 | 低(绑定到权重) | 高(自然语言通用) |
| 灾难性遗忘 | 有风险 | 权重遗忘较低,但有记忆污染、检索失败和过期风险 |
实验结果与局限
Reflexion 在 HumanEval(代码生成)、AlfWorld(文本决策)和 WebShop(电商交互)等基准上显著超越 ReAct 等基线方法。但也有局限:
- 反思质量依赖于 LLM 的推理能力
- 记忆容量随尝试次数增长,需要检索策略
- 对于需要精细数值优化的任务,语言反馈不如梯度信号
对 Self Evolve 的启示
Reflexion 直接对应产品级的记忆层设计:
- 运行日志就是记忆源:每次任务执行的轨迹和结果都应该被记录
- 失败比成功更有价值:反思机制应该重点关注失败案例
- 记忆需要检索:不是所有记忆都相关,需要 RAG 风格的检索
- 回归防护:改进后的行为必须在新任务上验证,否则回滚
Self Evolve 会在 Reflexion 的官方实现基础上,扩展记忆检索、回归测试和跨任务迁移能力。