A Survey on Self-Evolution of Large Language Models
LLM self-evolution survey; needed as the top-down taxonomy anchor.
这里不是“论文越多越好”的列表,而是把论文精读、benchmark 设置、机制簇和 coverage gaps 放到同一张复核地图。读者可以先判断每篇论文支持的是定义、方法、系统、评估还是治理,再回到原文、PDF 和站内笔记。
当前已有 135 篇 review 与 128 个 raw unique paper IDs,但 mainstream survey、benchmark、安全治理和经验学习分支还需要补强。下面这些条目不是“已完成引用清单”,而是下一轮 source tracing 的优先队列。
LLM self-evolution survey; needed as the top-down taxonomy anchor.
Agent-specific survey; needed to benchmark our scope against an external taxonomy.
Independent survey candidate; useful for cross-checking missed branches.
WebArena self-improvement benchmark signal; important for agent eval coverage.
Benchmark for iterative self-optimization; should become an eval anchor.
Experience-to-heuristic learning; fills memory/reflection transfer branch.
从自然语言任务规格生成机器学习流水线,并用指标、部署检查和实验历史持续改进。
把神经架构或代码表示为可变异基因组,用 LLM 生成候选并用 NAS 基准筛选。
围绕输出、轨迹、反思记忆和模型权重形成经验飞轮。
把 LLM 作为优化器、变异器或重组器,用适应度函数维护候选谱系。
Agent 在代码层面自修改、自搜索架构、自评估,实现开放式能力增长。
在 AutoGPT、MetaGPT、AutoGen、CrewAI 等编排底座上补齐评估、记忆和进化层。
同一 LLM 生成答案、批评答案并在推理期迭代改写,是轻量 Self Evolve 循环的基线模式。
关联:生成 → 反馈 → 修正
把失败反馈转化为自然语言反思并写入记忆,让后续任务在不更新权重的情况下改进。
关联:反馈 → 反思 → 记忆 → 重试
把执行结果、测试和调试解释作为程序修复信号,直接支撑代码智能体的回归门禁。
关联:代码 → 测试 → 失败解释 → 补丁
通过自博弈微调把弱模型推向更强模型,把自我改进从提示期推进到训练期。
关联:自博弈 → 偏好数据 → 微调
用自然语言描述目标和历史分数,让 LLM 基于反馈提出新候选,是通用“LLM 即优化器”模板。
关联:历史候选 + 分数 → 新候选
把 LLM 与自动评估器组合,进化数学和科学发现程序,是“生成器 + 验证器 + 谱系”的重要案例。
关联:程序候选 → 评估器 → 种群保留
将数据检索、预处理、建模、评估和部署拆成专用 Agent,最接近产品化 Self Evolve 工作流。
关联:任务规格 → Agent 流水线 → 评估部署
把语言模型作为架构代码的变异算子,用 Benchmark 选择候选,体现“架构即基因组”。
关联:架构代码 → LLM 变异 → 基准选择
Agent 框架提供角色、工具和流程编排;Self Evolve 可在其上叠加评估器、记忆、谱系和回归防护。
关联:角色/工具/流程 → 评估 → 组织拓扑调整
将智能体视为符号网络,用"语言梯度"在自然语言空间做反向传播,让提示词、工具和管线自动进化。NeurIPS 2024。
关联:前向执行 → 语言损失 → 语言梯度反传 → 权重更新
结合达尔文进化与哥德尔机自引用,维护开放式 Agent 归档库。SWE-bench 20%→50%,Polyglot 14.2%→30.7%。
关联:采样父代 → LLM 修改代码 → 评估 → 保留改进
通过 monkey patching 实现 Agent 在运行时的自修改,结合自我评估与进化策略动态调整自身代码。
关联:执行 → 评估 → 代码补丁 → 重新执行
在图灵完备的 Python 代码空间中搜索最优 Agent 架构,发现的 Agent 跨领域、跨模型迁移且超越人工设计 SOTA。ICLR 2025。
关联:元 Agent 编写代码 → 评估 → 归档 → 引导搜索
结合 Gemini Flash(广度)+ Pro(深度)做 MAP-Elites 质量多样性搜索;报告了 4×4 complex-valued matrix multiplication 的 48-scalar result。Google DeepMind。
关联:种群 → 双模型变异 → MAP-Elites 选择 → 归档更新
单一模型同时提出任务并求解,仅用自生成数据进行自博弈 RL 训练,彻底消除对外部标注数据的依赖。NeurIPS 2025。
关联:任务生成 → 求解 → 代码验证 → RL 训练
LLM 自生成 API 文档作为知识来源,然后在沙盒中执行代码并将错误反馈回 LLM 进行迭代修复。
关联:知识生成 → 代码生成 → 执行 → 错误反馈 → 修复
通过迭代式自编辑(self-edit)让 LLM 在推理时修改自身输出,结合 RL 训练让模型学会何时及如何修改。
关联:生成 → 自编辑 → RL 反馈 → 模型改进
在轨迹级别对 Agent 进行强化学习训练,让 Agent 从完整交互历史中学习策略改进。
关联:交互轨迹 → RL 训练 → 策略更新 → 重试
多轮代码生成与验证的 RL 框架,让模型在迭代修复循环中持续改进代码质量。Google DeepMind。
关联:代码生成 → 测试验证 → RL 反馈 → 重新生成
整合 AutoML + LLM、NAS + LLM、LLM 自我改进、进化计算 + LLM 与 Agent 框架进化五条支流。
从 OPRO、FunSearch、ReEvo 到 LLaMEA,这篇研究笔记说明 LLM 如何在标量反馈、程序搜索和进化计算中承担候选生成与变异角色。
把 Self-Refine、Reflexion、Self-Debug 和 SPIN 串成 LLM 自我改进基线,解释推理期反馈、反思记忆、执行反馈和训练期自博弈。
Google DeepMind 进化编码 Agent,结合 Gemini Flash + Pro 的 MAP-Elites 质量多样性搜索,并报告 4×4 complex-valued matrix multiplication 的 48-scalar result。
Absolute Zero 让单一模型同时提出任务并求解,用自生成数据和代码执行器反馈训练推理能力,是零外部标注自博弈路线的代表。
结合达尔文进化与哥德尔机自引用,维护开放式 Agent 归档库,通过基础模型提出代码修改并在基准测试中验证改进。
通过 monkey patching 实现智能体在运行时的自修改,结合自我评估与进化策略让 Agent 动态调整自身代码。
RAGEN 在完整交互轨迹级别训练 Agent,让策略从多步历史、环境反馈和轨迹奖励中学习改进,是 Agent RL 路线的重要样本。
ADAS 定义智能体系统自动设计范式,让 Meta Agent 在 Python 代码空间搜索 Agent 架构,并用跨任务、跨模型实验检验自动设计能力。
多轮代码生成与验证的 RL 框架,让模型在迭代修复循环中持续改进代码质量。Google DeepMind。
Agent Symbolic Learning 将智能体视为符号网络,用语言梯度在自然语言空间优化提示词、工具和管线连接,形成可解释的自改进路径。
RISE 通过迭代式 self-edit 让 LLM 在推理时修改自身输出,并结合强化学习训练模型判断何时修改、如何修改以及如何避免退化。
两阶段管线:LLM 自生成 API 文档作为知识,然后在沙盒中执行代码并将错误反馈回 LLM 进行迭代修复。
Reflexion 引入语言强化学习,让 Agent 把失败后的反思写入记忆,并在不更新权重的情况下用后续尝试验证经验是否真正改进行为。
同一 LLM 生成答案、批评答案并在推理期迭代改写,无需训练或强化学习。跨 7 个任务平均提升 ~20%。