Project report / GitHub evidence

LLM 自我训练方向项目索引报告

这是可索引项目报告证据页:它保留 LLM 自我训练方向项目索引报告 的源材料入口、机制线索和限制提醒;正文仍需 reader/editor 与 academic public-copy review 后才能当作最终结论引用。

LLM 自我训练方向项目索引报告

方向:ReST / RLAIF / Constitutional AI / SPIN / STaR / Self-Rewarding 分析者:Builder-6(内容整合) 日期:2026-05-22

方向概述

LLM 自我训练(Self-Training)是指大语言模型在不依赖外部人工标注的情况下,通过自我生成数据、自我评估、自我博弈等方式持续改进能力的技术路线。本报告收录该方向 30 个代表性项目。

项目列表

1. ReST 系列(Reinforced Self-Training)

ReST-RL (THUDM/清华)

ReST-MCTS* (THUDM/清华)

2. SPIN(Self-Play Fine-Tuning)

SPIN (UCLA ML Lab)

3. STaR 系列(Self-Taught Reasoning)

STaR (Stanford)

Quiet-STaR (Stanford)

B-STaR (HKUST)

4. Self-Rewarding Language Models

Self-Rewarding LM (lucidrains)

Self-Rewarding Reasoning LLM (RLHFlow)

5. TTRL(Test-Time Reinforcement Learning)

TTRL (PRIME-RL)

6. RLAIF / Constitutional AI

Awesome-RLAIF

Anthropic HH-RLHF

7. RLHF / Reward Models

Awesome-RLHF (OpenDILab)

RLHFlow Reward Modeling

8. DPO / RL Training Frameworks

DPO (Eric Mitchell)

LLaMA-Factory

9. Open R1 (HuggingFace)

10. 推理自进化

Reasoning Self-Evolution Survey

Awesome RL for LRMs (清华)

Awesome Deep Reasoning (ModelScope)

Volcengine Reasoning RL

11. Post-Training 综合资源

Awesome LLM Post-Training (MBZUAI)

12. 其他重要项目

IBM Dromedary

DeepSeek-R1

ArmoRM (RLHFlow)

方向分类统计

子方向项目数
ReST 系列2
SPIN 自博弈1
STaR 系列3
Self-Rewarding2
TTRL 测试时 RL1
RLAIF / Constitutional AI2
RLHF / Reward Models2
DPO / RL 框架2
GRPO (Open R1)1
推理自进化4
Post-Training1
其他4
总计25+

注:部分仓库可能不存在或克隆失败,最终数量以实际成功克隆为准。GitNexus 分析报告见 projects/ 目录。