2026-05-22 · reviewed

LLM 自我改进基线:Self-Refine、Reflexion、Self-Debug、SPIN

把 Self-Refine、Reflexion、Self-Debug 和 SPIN 串成 LLM 自我改进基线,解释推理期反馈、反思记忆、执行反馈和训练期自博弈。

arXivSelf-RefineReflexionSelf-DebugSelf-Play

LLM 自我改进方向提供 Self Evolve 的基础语言:经验获取、经验优化、更新与评估。

在 Landing Page 中,这组工作可作为“经验飞轮”板块:观察结果 → 形成反馈 → 写入记忆或训练数据 → 重新验证。

← 返回研究图谱