2025-05-01 · candidate

Absolute Zero:零数据自博弈推理强化学习

Absolute Zero 让单一模型同时提出任务并求解,用自生成数据和代码执行器反馈训练推理能力,是零外部标注自博弈路线的代表。

arXiv自博弈零数据任务生成

核心思想

提出 Absolute Zero 范式:单一模型同时承担任务生成和求解两个角色,只用自生成数据进行 RL 训练。代码执行器提供自动验证。

双角色架构

  1. Task Proposer:生成新推理任务(代码、数学、逻辑)
  2. Task Solver:尝试求解自己提出的任务
  3. Code Executor:自动验证答案正确性
  4. RL Training:验证信号驱动两个角色的同步改进

意义

与其他工作的关系

← 返回研究图谱