2023-03-01 · featured

Self-Refine:基于自反馈的迭代式优化

同一 LLM 生成答案、批评答案并在推理期迭代改写,无需训练或强化学习。跨 7 个任务平均提升 ~20%。

arXiv自反馈迭代优化推理期改进

核心思想

单模型迭代”生成 → 批判 → 修正”闭环,无需外部训练数据、强化学习或权重更新。

三步循环

  1. GENERATE:模型根据输入生成初始输出
  2. CRITIQUE:模型分析自身输出,识别具体问题
  3. REFINE:模型根据批判改进输出
输入 x → GENERATE → output_0
output_0 → CRITIQUE → feedback_0
(output_0, feedback_0) → REFINE → output_1
... 重复直到无改进或达到最大迭代

Benchmark 结果

跨 7 个任务(代码生成、数学推理、对话、情感翻转等)平均提升 ~20%。

局限性

关系网络

← 返回研究图谱