2024-03-01 · candidate

RISE:推理期自编辑强化学习

RISE 通过迭代式 self-edit 让 LLM 在推理时修改自身输出,并结合强化学习训练模型判断何时修改、如何修改以及如何避免退化。

arXiv推理期修改自编辑RL

核心思想

让 LLM 在推理阶段通过 self-edit 机制修改自身输出。结合 RL 训练,模型不仅学会生成更好的初始输出,还学会何时需要修改以及如何修改。

方法

  1. 模型生成初始输出
  2. 模型判断是否需要自编辑
  3. 如果需要,生成修改指令并应用
  4. RL 信号来自最终输出的质量评估

与其他工作的关系

← 返回研究图谱