2024-03-01 · candidate
RISE:推理期自编辑强化学习
RISE 通过迭代式 self-edit 让 LLM 在推理时修改自身输出,并结合强化学习训练模型判断何时修改、如何修改以及如何避免退化。
核心思想
让 LLM 在推理阶段通过 self-edit 机制修改自身输出。结合 RL 训练,模型不仅学会生成更好的初始输出,还学会何时需要修改以及如何修改。
方法
- 模型生成初始输出
- 模型判断是否需要自编辑
- 如果需要,生成修改指令并应用
- RL 信号来自最终输出的质量评估
与其他工作的关系
- 比 Self-Refine 更进一步:Self-Refine 不改权重,RISE 通过 RL 改权重
- 与 Reflexion 互补:RISE 在推理期修改输出,Reflexion 在记忆层积累经验
← 返回研究图谱