研究图谱

先看论文支持了什么 claim,再看它还没证明什么。

这里不是“论文越多越好”的列表,而是把论文精读、benchmark 设置、机制簇和 coverage gaps 放到同一张复核地图。读者可以先判断每篇论文支持的是定义、方法、系统、评估还是治理,再回到原文、PDF 和站内笔记。

Coverage boundary

缺口不是附录,是读者判断的一部分。

查看探索性证据图

当前已有 135 篇 review 与 128 个 raw unique paper IDs,但 mainstream survey、benchmark、安全治理和经验学习分支还需要补强。下面这些条目不是“已完成引用清单”,而是下一轮 source tracing 的优先队列。

128raw unique paper IDs
135review files
9priority gaps
研究簇

Self Evolve 的五条技术支流

AutoML + LLM

从自然语言任务规格生成机器学习流水线,并用指标、部署检查和实验历史持续改进。

AutoML-GPTAutoML-AgentLLM + AutoMLAutoM3L

NAS + LLM

把神经架构或代码表示为可变异基因组,用 LLM 生成候选并用 NAS 基准筛选。

EvoPromptingLLMaticLLaMA-NASNADER

LLM 自我改进

围绕输出、轨迹、反思记忆和模型权重形成经验飞轮。

Self-RefineReflexionSelf-DebugSPINAgent Symbolic LearningAbsolute ZeroSelfEvolveRISEReVeal

进化计算 + LLM

把 LLM 作为优化器、变异器或重组器,用适应度函数维护候选谱系。

OPROLLM as Evolutionary OptimizerFunSearchAlphaEvolveReEvoLLaMEA

Agent 自我进化

Agent 在代码层面自修改、自搜索架构、自评估,实现开放式能力增长。

ADASDGMGödel AgentRAGENAgent Symbolic Learning

Agent 框架进化

在 AutoGPT、MetaGPT、AutoGen、CrewAI 等编排底座上补齐评估、记忆和进化层。

AutoGPTMetaGPTAutoGenCrewAIAutoAgents
代表工作

可直接进入 Landing Page 的研究卡片

2023

Self-Refine:基于自反馈的迭代式优化

同一 LLM 生成答案、批评答案并在推理期迭代改写,是轻量 Self Evolve 循环的基线模式。

关联:生成 → 反馈 → 修正

LLM 自我改进自反馈迭代优化推理期改进
2023

Reflexion:带语言强化学习的智能体

把失败反馈转化为自然语言反思并写入记忆,让后续任务在不更新权重的情况下改进。

关联:反馈 → 反思 → 记忆 → 重试

LLM 自我改进反思记忆智能体语言强化学习
2023

Teaching LLMs to Self-Debug

把执行结果、测试和调试解释作为程序修复信号,直接支撑代码智能体的回归门禁。

关联:代码 → 测试 → 失败解释 → 补丁

LLM 自我改进Self-Debug代码修复执行反馈
2024

SPIN:Self-Play Fine-Tuning

通过自博弈微调把弱模型推向更强模型,把自我改进从提示期推进到训练期。

关联:自博弈 → 偏好数据 → 微调

LLM 自我改进Self-Play微调模型级进化
2023

OPRO:Large Language Models as Optimizers

用自然语言描述目标和历史分数,让 LLM 基于反馈提出新候选,是通用“LLM 即优化器”模板。

关联:历史候选 + 分数 → 新候选

进化计算 + LLMLLM 优化器标量反馈候选生成
2023

FunSearch:LLM + 评估器的程序进化

把 LLM 与自动评估器组合,进化数学和科学发现程序,是“生成器 + 验证器 + 谱系”的重要案例。

关联:程序候选 → 评估器 → 种群保留

进化计算 + LLM程序进化评估器科学发现
2024

AutoML-Agent:多 Agent 全流程 AutoML

将数据检索、预处理、建模、评估和部署拆成专用 Agent,最接近产品化 Self Evolve 工作流。

关联:任务规格 → Agent 流水线 → 评估部署

AutoML + LLMAutoML多智能体流水线验证
2023

EvoPrompting:代码级神经架构搜索

把语言模型作为架构代码的变异算子,用 Benchmark 选择候选,体现“架构即基因组”。

关联:架构代码 → LLM 变异 → 基准选择

NAS + LLMNAS代码变异质量-多样性
2023+

AutoGen / MetaGPT / CrewAI:Agent 编排底座

Agent 框架提供角色、工具和流程编排;Self Evolve 可在其上叠加评估器、记忆、谱系和回归防护。

关联:角色/工具/流程 → 评估 → 组织拓扑调整

Agent 框架进化Agent 框架编排进化层
2024

Agent Symbolic Learning:符号反向传播驱动的自进化智能体

将智能体视为符号网络,用"语言梯度"在自然语言空间做反向传播,让提示词、工具和管线自动进化。NeurIPS 2024。

关联:前向执行 → 语言损失 → 语言梯度反传 → 权重更新

LLM 自我改进符号学习语言梯度智能体进化
2025

Darwin Gödel Machine:开放式自进化 Agent 归档

结合达尔文进化与哥德尔机自引用,维护开放式 Agent 归档库。SWE-bench 20%→50%,Polyglot 14.2%→30.7%。

关联:采样父代 → LLM 修改代码 → 评估 → 保留改进

Agent 自我进化开放式进化代码自修改哥德尔机
2025

Gödel Agent:运行时 monkey patching 自修改

通过 monkey patching 实现 Agent 在运行时的自修改,结合自我评估与进化策略动态调整自身代码。

关联:执行 → 评估 → 代码补丁 → 重新执行

Agent 自我进化运行时修改monkey patching自评估
2025

ADAS:智能体系统自动设计

在图灵完备的 Python 代码空间中搜索最优 Agent 架构,发现的 Agent 跨领域、跨模型迁移且超越人工设计 SOTA。ICLR 2025。

关联:元 Agent 编写代码 → 评估 → 归档 → 引导搜索

Agent 自我进化元搜索图灵完备架构发现
2025

AlphaEvolve:Gemini 驱动的进化式算法发现

结合 Gemini Flash(广度)+ Pro(深度)做 MAP-Elites 质量多样性搜索;报告了 4×4 complex-valued matrix multiplication 的 48-scalar result。Google DeepMind。

关联:种群 → 双模型变异 → MAP-Elites 选择 → 归档更新

进化计算 + LLMMAP-Elites质量多样性算法发现
2025

Absolute Zero:零数据自博弈推理强化学习

单一模型同时提出任务并求解,仅用自生成数据进行自博弈 RL 训练,彻底消除对外部标注数据的依赖。NeurIPS 2025。

关联:任务生成 → 求解 → 代码验证 → RL 训练

LLM 自我改进自博弈零数据任务生成
2023

SelfEvolve:自生成知识 + 迭代自调试

LLM 自生成 API 文档作为知识来源,然后在沙盒中执行代码并将错误反馈回 LLM 进行迭代修复。

关联:知识生成 → 代码生成 → 执行 → 错误反馈 → 修复

LLM 自我改进自调试沙盒执行文档生成
2024

RISE:推理期自编辑强化学习

通过迭代式自编辑(self-edit)让 LLM 在推理时修改自身输出,结合 RL 训练让模型学会何时及如何修改。

关联:生成 → 自编辑 → RL 反馈 → 模型改进

LLM 自我改进推理期修改自编辑RL
2025

RAGEN:轨迹级 Agent 强化学习

在轨迹级别对 Agent 进行强化学习训练,让 Agent 从完整交互历史中学习策略改进。

关联:交互轨迹 → RL 训练 → 策略更新 → 重试

Agent 自我进化轨迹训练Agent RL策略进化
2024

ReVeal:多轮代码 RL 持续改进

多轮代码生成与验证的 RL 框架,让模型在迭代修复循环中持续改进代码质量。Google DeepMind。

关联:代码生成 → 测试验证 → RL 反馈 → 重新生成

LLM 自我改进代码 RL多轮修复持续改进
MDX 笔记

可持续发布的论文精读页

featured

Self Evolve 跨领域研究图谱

整合 AutoML + LLM、NAS + LLM、LLM 自我改进、进化计算 + LLM 与 Agent 框架进化五条支流。

跨领域研究AutoMLNAS进化计算Agent 框架
featured

AlphaEvolve:Gemini 驱动的进化式算法发现

Google DeepMind 进化编码 Agent,结合 Gemini Flash + Pro 的 MAP-Elites 质量多样性搜索,并报告 4×4 complex-valued matrix multiplication 的 48-scalar result。

MAP-Elites质量多样性算法发现
candidate

Gödel Agent:运行时自修改智能体

通过 monkey patching 实现智能体在运行时的自修改,结合自我评估与进化策略让 Agent 动态调整自身代码。

运行时修改monkey patching自评估
candidate

RAGEN:轨迹级 Agent 强化学习

RAGEN 在完整交互轨迹级别训练 Agent,让策略从多步历史、环境反馈和轨迹奖励中学习改进,是 Agent RL 路线的重要样本。

轨迹训练Agent RL策略进化
featured

ADAS:智能体系统自动设计

ADAS 定义智能体系统自动设计范式,让 Meta Agent 在 Python 代码空间搜索 Agent 架构,并用跨任务、跨模型实验检验自动设计能力。

元搜索图灵完备架构发现
candidate

ReVeal:多轮代码 RL 持续改进

多轮代码生成与验证的 RL 框架,让模型在迭代修复循环中持续改进代码质量。Google DeepMind。

代码 RL多轮修复持续改进
candidate

RISE:推理期自编辑强化学习

RISE 通过迭代式 self-edit 让 LLM 在推理时修改自身输出,并结合强化学习训练模型判断何时修改、如何修改以及如何避免退化。

推理期修改自编辑RL
featured

Reflexion:带语言强化学习的智能体

Reflexion 引入语言强化学习,让 Agent 把失败后的反思写入记忆,并在不更新权重的情况下用后续尝试验证经验是否真正改进行为。

反思记忆语言强化学习智能体