2026-05-22 · aha team

LLM 自我改进的五种范式:从 Self-Refine 到 Absolute Zero

对比分析 Self-Refine、Reflexion、Agent Symbolic Learning、RISE 和 Absolute Zero 五种 LLM 自我改进范式的方法、优劣与适用场景。Self Evolve 核心技术解读。

为什么需要范式对比

大语言模型(LLM)的自我改进不是一个统一的技术,而是多种方法在不同层次上的探索。Self Evolve 将当前主流方法归纳为五种范式,帮助开发者根据场景选择合适的技术路线。

范式一:迭代自反馈(Self-Refine)

核心思想:同一 LLM 扮演生成者、批判者和修正者三个角色。

输入 → 生成 output₀ → 批判 → 反馈 → 修正 output₁ → 批判 → ... → outputₙ

关键特点

适用场景:快速原型、写作优化、代码审查反馈

局限:改进幅度受模型初始能力天花板限制

范式二:语言反思记忆(Reflexion)

核心思想:将失败经验以自然语言反思的形式写入记忆,后续尝试读取这些反思来避免重复错误。

执行 → 失败 → 生成语言反思 → 写入记忆 → 下次执行读取记忆

关键公式

Memory = Memory ∪ {reflect(action, reward, context)}
Action_{t+1} = Actor(task, Memory)

关键特点

适用场景:多轮决策、游戏智能体、代码调试

局限:记忆管理复杂度随任务增长,长期任务可能累积噪声

范式三:符号反向传播(Agent Symbolic Learning)

核心思想:将 Agent 视为符号网络,模仿深度学习的反向传播,但全部在自然语言空间操作。

前向执行 → 语言损失 → 语言梯度反传 → 权重更新
(输出轨迹)(评估质量)(逐层改进建议)(更新提示词/工具/管线)

关键创新:“语言梯度”∇_lang 是一段自然语言描述,说明如何改进每个组件,沿 Agent 计算图反向传播。

Benchmark 结果

任务基线符号学习提升
HotPotQA F136.239.1+8%
MATH56.0%60.7%+8%
HumanEval68.3%73.2%+7%

适用场景:复杂多组件 Agent 系统的全局优化

局限:需要 GPT-4 级别模型,计算成本高

范式四:推理期自编辑 + RL(RISE)

核心思想:通过 RL 训练模型学会在推理时何时及如何修改自身输出。

生成初始输出 → 判断是否需要自编辑 → 生成编辑指令 → 应用编辑 → RL 反馈

关键特点

适用场景:需要模型级能力提升的推理任务

局限:需要 RL 训练基础设施,计算成本高

范式五:零数据自博弈(Absolute Zero)

核心思想:单一模型同时提出任务和求解任务,用代码执行器验证,完全消除对外部标注数据的依赖。

Task Proposer → 生成任务 → Task Solver → 求解 → 代码验证 → RL 训练
     ↑                                                        │
     └──────── 共同改进 ←──────────────────────────────────────┘

关键特点

适用场景:缺乏标注数据的前沿推理任务

局限:需要强大的代码执行验证环境

对比总结

范式是否改权重需要外部数据计算成本实现难度
Self-Refine★☆☆
Reflexion★★☆
符号学习★★★
RISE★★★
Absolute Zero否(零数据)★★★

Self Evolve 的建议

对于初次接触自进化的开发者,建议按以下路径递进:

  1. Self-Refine 开始,实现最基础的”生成-批判-修正”循环
  2. 引入 Reflexion 的记忆机制,让系统积累经验
  3. 尝试 Agent Symbolic Learning 的结构化优化
  4. 在有 RL 基础设施后,探索 RISE 或 Absolute Zero

每种范式都有其适用场景,没有”最好的”方法,只有”最合适的”选择。


延伸阅读