2026-05-26 · aha team
LLM 自我改进方法全图:Self-Refine、Reflexion、RISE 到 Absolute Zero
从英文论文第三章拆解 LLM/Agent 自我改进方法:推理时修正、反思记忆、训练期自博弈、RL、语言梯度,以及什么时候该用 prompt、fine-tuning 或 reinforcement learning。
共 3 篇文章,按发布时间整理 Self Evolve 的论文拆解、研究笔记和工程案例。
从英文论文第三章拆解 LLM/Agent 自我改进方法:推理时修正、反思记忆、训练期自博弈、RL、语言梯度,以及什么时候该用 prompt、fine-tuning 或 reinforcement learning。
梳理 AutoML/NAS、进化计算、LLM 自我改进与 Agent 框架之间的深层连接,揭示 Self Evolve 的技术全景。
对比分析 Self-Refine、Reflexion、Agent Symbolic Learning、RISE 和 Absolute Zero 五种 LLM 自我改进范式的方法、优劣与适用场景。Self Evolve 核心技术解读。