LLM 自我改进的五种范式:从 Self-Refine 到 Absolute Zero
对比分析 Self-Refine、Reflexion、Agent Symbolic Learning、RISE 和 Absolute Zero 五种 LLM 自我改进范式的方法、优劣与适用场景。Self Evolve 核心技术解读。
为什么需要范式对比
大语言模型(LLM)的自我改进不是一个统一的技术,而是多种方法在不同层次上的探索。Self Evolve 将当前主流方法归纳为五种范式,帮助开发者根据场景选择合适的技术路线。
范式一:迭代自反馈(Self-Refine)
核心思想:同一 LLM 扮演生成者、批判者和修正者三个角色。
输入 → 生成 output₀ → 批判 → 反馈 → 修正 output₁ → 批判 → ... → outputₙ
关键特点:
- 无需额外训练或外部模型
- 改进发生在推理期
- 跨 7 个任务平均提升 ~20%
适用场景:快速原型、写作优化、代码审查反馈
局限:改进幅度受模型初始能力天花板限制
范式二:语言反思记忆(Reflexion)
核心思想:将失败经验以自然语言反思的形式写入记忆,后续尝试读取这些反思来避免重复错误。
执行 → 失败 → 生成语言反思 → 写入记忆 → 下次执行读取记忆
关键公式:
Memory = Memory ∪ {reflect(action, reward, context)}
Action_{t+1} = Actor(task, Memory)
关键特点:
- 引入跨 episode 的记忆机制
- HumanEval pass@1 从 80% 提升到 91%
- 三模型架构:Actor、Evaluator、Self-Reflection
适用场景:多轮决策、游戏智能体、代码调试
局限:记忆管理复杂度随任务增长,长期任务可能累积噪声
范式三:符号反向传播(Agent Symbolic Learning)
核心思想:将 Agent 视为符号网络,模仿深度学习的反向传播,但全部在自然语言空间操作。
前向执行 → 语言损失 → 语言梯度反传 → 权重更新
(输出轨迹)(评估质量)(逐层改进建议)(更新提示词/工具/管线)
关键创新:“语言梯度”∇_lang 是一段自然语言描述,说明如何改进每个组件,沿 Agent 计算图反向传播。
Benchmark 结果:
| 任务 | 基线 | 符号学习 | 提升 |
|---|---|---|---|
| HotPotQA F1 | 36.2 | 39.1 | +8% |
| MATH | 56.0% | 60.7% | +8% |
| HumanEval | 68.3% | 73.2% | +7% |
适用场景:复杂多组件 Agent 系统的全局优化
局限:需要 GPT-4 级别模型,计算成本高
范式四:推理期自编辑 + RL(RISE)
核心思想:通过 RL 训练模型学会在推理时何时及如何修改自身输出。
生成初始输出 → 判断是否需要自编辑 → 生成编辑指令 → 应用编辑 → RL 反馈
关键特点:
- 结合推理期灵活性和训练期能力提升
- 模型不仅学会生成,还学会”自我修正策略”
适用场景:需要模型级能力提升的推理任务
局限:需要 RL 训练基础设施,计算成本高
范式五:零数据自博弈(Absolute Zero)
核心思想:单一模型同时提出任务和求解任务,用代码执行器验证,完全消除对外部标注数据的依赖。
Task Proposer → 生成任务 → Task Solver → 求解 → 代码验证 → RL 训练
↑ │
└──────── 共同改进 ←──────────────────────────────────────┘
关键特点:
- 零外部数据依赖
- 自博弈产生渐进式难度递增
- 消除数据瓶颈
适用场景:缺乏标注数据的前沿推理任务
局限:需要强大的代码执行验证环境
对比总结
| 范式 | 是否改权重 | 需要外部数据 | 计算成本 | 实现难度 |
|---|---|---|---|---|
| Self-Refine | 否 | 否 | 低 | ★☆☆ |
| Reflexion | 否 | 否 | 低 | ★★☆ |
| 符号学习 | 否 | 否 | 中 | ★★★ |
| RISE | 是 | 是 | 高 | ★★★ |
| Absolute Zero | 是 | 否(零数据) | 高 | ★★★ |
Self Evolve 的建议
对于初次接触自进化的开发者,建议按以下路径递进:
- 从 Self-Refine 开始,实现最基础的”生成-批判-修正”循环
- 引入 Reflexion 的记忆机制,让系统积累经验
- 尝试 Agent Symbolic Learning 的结构化优化
- 在有 RL 基础设施后,探索 RISE 或 Absolute Zero
每种范式都有其适用场景,没有”最好的”方法,只有”最合适的”选择。
延伸阅读: