2024-12-01 · candidate
ReVeal:多轮代码 RL 持续改进
多轮代码生成与验证的 RL 框架,让模型在迭代修复循环中持续改进代码质量。Google DeepMind。
核心思想
多轮代码生成与验证的强化学习框架。模型在迭代修复循环中持续改进代码质量,每次循环的反馈都用于训练更好的生成策略。
方法
- 生成初始代码
- 自动测试验证
- 失败测试作为 RL 反馈信号
- 模型基于反馈重新生成改进代码
- 循环直到代码通过所有测试
与其他工作的关系
- 与 SelfEvolve 类似但增加了 RL 训练信号
- 与 DGM 的代码修改思路互补
- Google DeepMind 内部与 AlphaEvolve 共享基础设施理念
← 返回研究图谱