Survey Findings · 核心发现

先把自进化 AI 当成一个待验证的系统过程。

这是一个 dated survey snapshot,不是完成版系统综述:它把 196 篇论文展示集、686 个 classified GitHub repos 和 97 个公开讨论信号组织成五类工作回路,并标出哪些 claim 仍需回到论文、项目或 benchmark 源复核。

196paper display set
686classified GitHub repos
97public discussion signals
5working loops
Evidence boundary

[INFERRED] 五类工作回路是本 Survey 的当前整理框架,不是领域已定标准。

[KNOWN] 计数来自 site data 与 master index 生成口径;逐 claim 的 source matrix 仍在补齐。案例里的 benchmark 数字只按论文或项目原始报告转述,本站不声称已经独立复现。

Figure Atlas

Survey 图谱现在是证据主干。

figure source →

这些图不是装饰图,而是把论文章节、网站页面和数据资产连起来的读者证据地图:先看图,读者才知道每章为什么存在,以及哪些部分仍是快照。

Corpus funnel: 把 raw captures、classified repositories、model cards、strict evolution 和 broad evolution 连接成一条可追溯管线。
语料筛选漏斗 · Paper Ch.1 / Survey evidence base
把 raw captures、classified repositories、model cards、strict evolution 和 broad evolution 连接成一条可追溯管线。
Method distribution: 提示词/搜索优化和奖励/自博弈占多数,安全治理虽然占比小但决定 self-evolution 是否可部署。
方法族分布 · Paper Ch.2 / Taxonomy
提示词/搜索优化和奖励/自博弈占多数,安全治理虽然占比小但决定 self-evolution 是否可部署。
Method trend: 2025 年以后代码自修改、评估闭环和自博弈方向明显升温,说明字段从 prompt trick 走向系统级 loop。
方法时间趋势 · Paper Ch.3 / Methods
2025 年以后代码自修改、评估闭环和自博弈方向明显升温,说明字段从 prompt trick 走向系统级 loop。
Category-theme heatmap: GitHub 项目不是按自带 category 可读,必须交叉看 theme 与 mechanism 才能找出真实自进化信号。
类别主题热力图 · Paper Ch.4 / Evolutionary systems
GitHub 项目不是按自带 category 可读,必须交叉看 theme 与 mechanism 才能找出真实自进化信号。
Cross-source gap: 论文分数、开源实现、用户痛点和传播热度之间存在缺口,benchmark 不能独自代表系统价值。
交叉证据缺口 · Paper Ch.5 / Evaluation
论文分数、开源实现、用户痛点和传播热度之间存在缺口,benchmark 不能独自代表系统价值。
Framework radar: 框架要同时看 adoption、observability、production、evolution fit 和 governance,不是 star 越多越适合自进化。
框架雷达 · Paper Ch.6 / Frameworks
框架要同时看 adoption、observability、production、evolution fit 和 governance,不是 star 越多越适合自进化。
Core Framework

五类工作回路 — 本 Survey 的当前整理框架

深入理解 →

当前整理口径:把散乱的“自改进”文献先分成五个可组合的工作回路,方便读者追问 mutable object、feedback、verifier、retention 和 rollback;它仍需要更多 source-level 交叉验证。

📋→⚡

规范到执行环

Specification-to-Execution Loop

将自然语言目标自动转化为可运行的 ML/智能体管线。

AutoML-GPTAutoML-Agent

💡 The gap between "what you want" and "what runs" is the first evolution bottleneck.

🔍

搜索环

Search Loop

探索架构、提示词、代码、智能体和超参数空间,寻找更优设计。

OPROEvoPromptingADASOpenEvolve

💡 LLMs as search operators unlock combinatorial spaces that gradient methods cannot reach.

评估环

Evaluator Loop

测试、基准验证候选改动是否为真正的改进。

FunSearchSelf-DebugCodeEvolve

💡 Without a reliable evaluator, self-improvement is indistinguishable from random walk.

🪞

反思环

Reflection Loop

将失败转化为记忆,从反馈信号生成修正候选。

ReflexionSelf-RefineSTaRExPeL

💡 The reflection loop is where experience becomes reusable knowledge.

👥

种群环

Population Loop

维护多个候选方案,跨代选择、变异和重组。

AlphaEvolve/MAP-ElitesLLaMEAAgentEvolver

💡 Population-level evolution discovers solutions no single trajectory can reach.

Method Taxonomy

七大方法族 — 196 篇论文分类

提示词/搜索优化
Prompt/Search Optimization
68 (34.7%)
奖励/强化学习/自博弈
Reward/RL/Self-Play
51 (26.0%)
代码/自我修改
Code/Self-Modification
28 (14.3%)
多智能体反思/辩论
Multi-Agent Reflection/Debate
16 (8.2%)
记忆/知识进化
Memory/Knowledge Evolution
16 (8.2%)
Web/工具/环境适配
Web/Tool/Environment Adaptation
13 (6.6%)
评估/安全/治理
Evaluation/Safety/Governance
4 (2.0%)
Method distribution across 196 papers
方法族分布:提示词优化占最大份额,安全/治理占比最低但最关键。
Method trend over time
时间趋势:代码自修改和自博弈方法在 2025 年快速增长。
Case Studies

六大案例 — 深度证据分析

查看完整案例 →

DGM: Darwin Godel Machine

代码级自修改 + 开放式归档继承。

SWE-bench 20→50% Polyglot 14→31% paper-reported

ADAS: 自动 Agent 设计

元智能体搜索 Python 编码的 Agent 架构。

跨任务迁移 自动代码搜索 source-scoped

AlphaEvolve (DeepMind)

LLM + 进化算法在可自动评估任务中报告新算法发现。

4x4 complex matrix 49→48 scalar multiplications reported 56-year setting not independently reproduced here

Voyager: Minecraft 终身学习

技能库积累创造复合回报。

独特物品 3.6x 钻石级全通关 benchmark-context

Reflexion: 语言反思

失败 → 文本反思 → 记忆 → 避免重复错误。

HumanEval 91% AlfWorld 97% paper-reported

Self-Rewarding LM

模型自己生成奖励 → 自己训练 → 自我强化循环。

零人工标注 迭代 DPO claim review required
User Pain Points

来自真实用户的 97 个痛点

Mom Test 方法论用于阅读公开讨论:Reddit 47 条、Hacker News 36 条、X/Twitter 14 条。这里统计的是公开语义信号,不是受控访谈样本。

⚠️

生产可靠性

38 个痛点

The "80% curse": agent task chains fail multiplicatively, making 95%+ reliability extremely hard.

Survey 证据:97 public discussion signals across Reddit, HN, and X/Twitter point to reliability ceilings as a recurring blocker.

🔄

自我改进可行性

22 个痛点

Loop drift, plateau, and human dependency: self-improvement loops often stall or degrade.

Survey 证据:Paper analysis shows most methods report single-iteration gains; multi-iteration stability is under-studied.

🔀

框架选择困境

15 个痛点

Abstraction overuse, deprecation risk, and false "team" metaphors plague agent frameworks.

Survey 证据:GitHub project analysis suggests framework readiness remains uneven; the framework score is heuristic, not benchmark-rerun evidence.

📊

评估危机

12 个痛点

Benchmark contamination + Goodhart's law = "benchmaxxing" that doesn't transfer to production.

Survey 证据:Cross-source validation reveals gap between benchmark claims and real-world performance.

🔒

安全与治理

10 个痛点

Permission escalation, prompt injection, and misevolution risks are under-addressed in research.

Survey 证据:Only 4/196 papers (2%) focus on evaluation/safety/governance as primary contribution.

Pain points by platform
痛点来源分布
Cross-source validation gaps
交叉验证差距

Survey 核心论点

自进化应当被评估为一个受控的系统过程:每一个声称的改进都必须说明——改变了什么?什么反馈支持这次改变?什么评估器批准了它?成本多少?引入了什么风险?如何审计和回滚?