2026-05-26 · aha team
LLM 自我改进方法全图:Self-Refine、Reflexion、RISE 到 Absolute Zero
从英文论文第三章拆解 LLM/Agent 自我改进方法:推理时修正、反思记忆、训练期自博弈、RL、语言梯度,以及什么时候该用 prompt、fine-tuning 或 reinforcement learning。
共 3 篇文章,按发布时间整理 Self Evolve 的论文拆解、研究笔记和工程案例。
从英文论文第三章拆解 LLM/Agent 自我改进方法:推理时修正、反思记忆、训练期自博弈、RL、语言梯度,以及什么时候该用 prompt、fine-tuning 或 reinforcement learning。
Reflexion 如何把任务失败转化为自然语言记忆,让 Agent 在不更新权重的情况下持续改进。
对比分析 Self-Refine、Reflexion、Agent Symbolic Learning、RISE 和 Absolute Zero 五种 LLM 自我改进范式的方法、优劣与适用场景。Self Evolve 核心技术解读。