2025-05-01 · candidate
Absolute Zero:零数据自博弈推理强化学习
Absolute Zero 让单一模型同时提出任务并求解,用自生成数据和代码执行器反馈训练推理能力,是零外部标注自博弈路线的代表。
核心思想
提出 Absolute Zero 范式:单一模型同时承担任务生成和求解两个角色,只用自生成数据进行 RL 训练。代码执行器提供自动验证。
双角色架构
- Task Proposer:生成新推理任务(代码、数学、逻辑)
- Task Solver:尝试求解自己提出的任务
- Code Executor:自动验证答案正确性
- RL Training:验证信号驱动两个角色的同步改进
意义
- 消除对人类标注数据的依赖
- 模型可以无限生成训练信号
- 自博弈产生渐进式难度递增的课程
与其他工作的关系
- 延续 SPIN 的自博弈思路,但扩展到任务生成
- 与 RISE 的推理期改进互补