开源自进化 AI 项目巡礼:10 个可复核的仓库
从 Self Evolve 项目索引中选取 10 个覆盖不同机制的开源自进化 AI 项目,涵盖进化式代码优化、Agent 进化框架、反思记忆与自评判训练。本文说明它们适合回答什么问题,也标出证据边界。
为什么关注这些项目
Self Evolve 项目索引已收录 684 个 GitHub 仓库,本文选取 10 个覆盖不同机制的开源项目。它们不是最终排名,而是一条阅读路径:从进化搜索循环、评估器/打分器、反思记忆到智能体编排,帮助读者判断“这个系统到底如何改进自己”。
1. OpenEvolve — AlphaEvolve 社区复现
- 仓库:algorithmicsuperintelligence/openevolve
- Stars:6,300+ | 语言:Python | 协议:Apache-2.0
- 模式:进化/搜索循环 → 评估器/打分器
Google DeepMind AlphaEvolve 的社区开源实现。使用 LLM 生成程序变体、评估打分并选择高分候选持续迭代。支持 OpenAI 兼容 API,适合作为理解进化式代码优化流程的可复核起点。
适合:想快速体验 AlphaEvolve 范式的开发者
2. AIWaves Agents — 符号学习框架
- 仓库:aiwaves-cn/agents
- Stars:5,900+ | 语言:Python | 协议:Apache-2.0
- 模式:进化/搜索循环 → 评估器/打分器 → 智能体编排
Agent Symbolic Learning(NeurIPS 2024)的官方实现。数据中心化的自进化语言智能体框架,强调数据、环境反馈和智能体编排让 Agent 在任务中持续改进。
适合:构建多组件自进化 Agent 系统的研究者
3. Reflexion — 语言反思记忆
- 仓库:noahshinn/reflexion
- Stars:3,100+ | 语言:Python | 协议:MIT
- 模式:进化/搜索循环 → 反思记忆 → 反馈-精炼 → 评估器
Reflexion(NeurIPS 2023)的经典实现。使用语言反思作为”verbal reinforcement”,把失败经验写入记忆以改进后续行为。HumanEval 91% pass@1 的实现基础。
适合:学习反思记忆机制的清晰入门项目
4. AgentEvolver — 阿里达摩院自进化框架
- 仓库:modelscope/AgentEvolver
- Stars:1,400+ | 语言:Python | 协议:Apache-2.0
- 模式:进化/搜索循环 → 评估器/打分器 → 智能体编排 → 训练/数据循环
面向高效自进化智能体系统的研究实现。核心关注轨迹、经验和评估反馈驱动的 Agent 能力提升。基于 ModelScope 生态。
适合:需要中文支持和国内模型接入的开发者
5. Self-Refine — 迭代自反馈基线
- 仓库:madaan/self-refine
- Stars:800+ | 语言:Python | 协议:Apache-2.0
- 模式:反馈-精炼
Self-Refine(NeurIPS 2023)的经典实现。用同一个 LLM 生成初稿、生成反馈、再根据反馈迭代精炼,无需训练或强化学习。
适合:最小化实现自进化闭环的教学项目
6. SE-Agent — 代码智能体自进化
- 仓库:JARVIS-Xs/SE-Agent
- Stars:270+ | 语言:Python | 协议:MIT
- 模式:进化/搜索循环 → 评估器/打分器 → 智能体编排
面向代码智能体的自进化框架,通过 Revision、Recombination、Refinement 在多条推理轨迹间交换信息,扩大搜索空间。
适合:关注代码生成 Agent 进化的研究者
7. SCOPE — 提示词/上下文进化
- 仓库:JarvisPei/SCOPE
- Stars:77+ | 语言:Python | 协议:MIT
- 模式:进化/搜索循环
Self-evolving Context Optimization via Prompt Evolution。通过提示词和上下文演化优化 LLM 的任务表现,支持 OpenAI 和 Claude API。
适合:专注于 Prompt Engineering 优化的开发者
8. CodeEvolve — 科学代码进化
- 仓库:inter-co/science-codeevolve
- Stars:97+ | 语言:Python | 协议:Apache-2.0
- 模式:进化/搜索循环 → 评估器/打分器
面向科学与算法发现的 CodeEvolve 实现,将 LLM 与遗传算法、岛屿模型、交叉/变异等机制结合。
适合:科学计算和算法优化方向
9. LLM-Self-Judge — 自评判训练
- 仓库:OPPO-Mente-Lab/LLM-Self-Judge
- Stars:43+ | 语言:Python | 协议:Apache-2.0
- 模式:进化/搜索循环 → 评估器/打分器 → 智能体编排 → 训练/数据循环
围绕多模态推理中模型自评判和无监督自进化的官方实现,关注 judge 信号如何驱动模型/数据改进。
适合:研究模型自评估和自训练的团队
10. DARWIN — 安全策略进化
- 仓库:ZJU-LLM-Safety/DARWIN
- Stars:41+ | 语言:Python
- 模式:进化/搜索循环 → 反思记忆
浙大安全团队的自进化 LLM 越狱/安全研究框架。维护策略池并用检索、过滤、马尔可夫选择、反思和遗传演化扩展攻击策略。
适合:AI 安全与对抗性测试研究者
项目选择建议
| 你的目标 | 推荐项目 |
|---|---|
| 快速上手自进化概念 | Self-Refine → Reflexion |
| 构建 Agent 自进化系统 | AIWaves Agents → AgentEvolver |
| 代码/算法进化 | OpenEvolve → CodeEvolve |
| Prompt 优化 | SCOPE |
| AI 安全 | DARWIN |
| 模型自训练 | LLM-Self-Judge |
持续更新
Self Evolve 项目索引(agent-evolution.com)持续收录新项目。当前公开索引已覆盖 292 份项目/模型卡分析,并把 raw collection、processed analysis、project reports 和 public results 分层治理;读者应把本文当作入门路线,而不是仓库质量排名。
延伸阅读: