Self Evolve AI · 中文默认入口

AI Agent 自进化:到底改了什么、谁验证、能否留下来?

这不是链接收藏,而是面向可审计改进系统的判断图:一个 agent 到底改了什么、由什么反馈选择、谁验证、能否保留,失败时能不能回滚。

English core summaries are available under /en/. The full evidence corpus remains Chinese-first while parity is being built.

5问改了什么、谁验证、是否保留
3层强证据、待复核、弱证据
1路先判断,再查证据
Start here / 读者路径

如果你只读三件事,按这个顺序读。

Definition

先判断它算不算自进化

不是看名字里有没有 evolve,而是看可变对象、反馈、验证、保留和回滚。

Do not start with the name. Start with the mutable object, feedback signal, verifier, retention, and rollback path.

Mechanism

再判断它通过哪条回路变强

反思、搜索、评估、代码自改进、种群/归档不是同一件事,证据强度也不同。

Reflection, search, evaluator loops, code evolution, and population archives are different evidence modes.

Evidence

最后查证据和限制

Star、benchmark、项目报告、Value LSH 和 Evolve-AGI Index 都只是证据面,不是单点答案。

Stars, benchmarks, project reports, Value LSH, and the Evolve-AGI Index are evidence surfaces, not one-number truth.

Evidence triage / 证据分诊

材料太多时,先决定哪些值得读、哪些需要复核。

打开完整 3D 图谱 →
Guiding to ↗ 前沿证据 camera focus + cluster spotlight
Priority review 859Needs review 1,074Repair / risk 297 value + PCA 24 facet-vector k-means clusters 2,230 nodes
github · needs-review

01-ai/langcrew

74.84triage score
65.38tag coverage
emb-008k-means cluster

raw-github/01-ai_langcrew.md

LSH neighbors

共享 hash bands 的近邻召回,不等于上面的 k-means cluster 标签。

  • ai-boost/awesome-harness-engineering github · triage score 72.93 · shared buckets 4 method_novelty / open_source_reuse / issue_resource_signal / hype_without_evidence
  • xinhuagu/aceclaw github · triage score 75.48 · shared buckets 4 current_frontier_signal / self_evolution_loop_fit / mutable_artifact_clear / feedback_signal_clear
  • neo4j-labs/agent-memory github · triage score 75.16 · shared buckets 4 current_frontier_signal / self_evolution_loop_fit / mutable_artifact_clear / feedback_signal_clear
  • evalops/dspy-0to1-guide github · triage score 76.75 · shared buckets 3 method_novelty / open_source_reuse / issue_resource_signal / hype_without_evidence
  • 0182 X Twitter Agent V2EX social · triage score 78.34 · shared buckets 3 method_novelty / open_source_reuse / issue_resource_signal / hype_without_evidence
  • 0081 github com SalesforceAIResearch MCP Universe social · triage score 76.75 · shared buckets 3 method_novelty / open_source_reuse / issue_resource_signal / hype_without_evidence

这不是价值裁判,也不是累计 Star 榜。它用 26 个判断问题,把 GitHub、论文、社交/X 和博客材料先分成三类:值得深读、需要复核、证据不足或有风险。技术细节进入方法页,首页只保留读者用途。

2,236materials
26判断问题
174相似证据组
优先深读 851 待复核 1,085 修复/风险 300
AgentEvolver github · 优先复核 · 较稳
CUGA Agent github · 优先复核 · 较稳
Agent Memory Benchmark github · 优先复核 · 较稳
Evolve-AGI worksheet

一个工作型证据表,不是 AGI 分数。

完整指数 →
自进化系数 72.9 Exploratory rubric

Evolve-AGI Index 不是 AGI 能力分,而是一个 exploratory evidence-maturity worksheet,用来检查 AI Agent 自进化证据是否足够成熟。

Bench 80.1

Benchmark 表现 · 权重 18%

Loop 80.2

核心闭环强度 · 权重 20%

Evidence 78.7

证据链可信度 · 权重 18%

Transfer 65.2

迁移与验证 · 权重 14%

Historical adoption prior

热度只提供候选线索,不能替代证据。

2026 增长试点账本 → 传播信号分析 →

这个表只保留历史热度作为阅读线索,不负责判断当前质量。严肃判断必须回到 evaluator、benchmark、retention、失败记录和项目报告。

# 项目 Stars 线索分 增长 判定
1 AutoGPT 175K 28 🚀 病毒式 爆发式增长,大量一次性 star,fork 活跃度极低,issue 有效性偏低。典型「Hype-driven」传播线索;需要回到维护记录和真实使用复核。
2 OpenHands 55K 68 🌱 自然增长 原 OpenDevin,学术+社区双驱动。ICLR 接收论文增加了可信度。沙箱环境设计实用。增长曲线平滑健康。
3 AutoGen 50K 66 🌱 自然增长 微软品牌背书,学术渊源(Penn State + 微软研究院)。Actor 模型架构严谨。Magentic-One 是实质研究贡献。增长健康。
4 MetaGPT 50K 56 🚀 病毒式 快速但较健康的增长曲线。中国团队主导但国际化程度高。论文驱动(SOP(Team))增加了学术可信度。SELA/AFlow 子项目有实质研究。
5 CrewAI 30K 62 📊 稳定 稳健增长,社区活跃度高,零依赖设计降低了参与门槛。100K+ 认证开发者表明有真实用户基础。营销适中。
6 DSPy 25K 73 🌱 自然增长 斯坦福 NLP 声明式编程范式创新。增长曲线最健康之一。SIMBA 自我反思优化器是实质贡献。学术+工程双高。
7 Devika 22K 30 ⚠️ 可疑 与 AutoGPT 同期爆发,增长模式类似但后续活跃度更低。大量 star 无转化。issue 有效性低,PR 合并率低,传播异常需要复核。
8 LangGraph 20K 67 📊 稳定 LangChain 生态核心,Pregel 引擎架构扎实。受益于 LangChain 品牌溢出效应,但本身有技术深度。
9 SWE-Agent 15K 70 🌱 自然增长 Princeton NLP 出品,ICLR 2025 Oral。ACI 设计有创新。SWE-bench SOTA 背书。增长健康,学术驱动。
10 OpenEvolve 6.4K 74 🌱 自然增长 AlphaEvolve 开源复现,学术驱动。增长虽慢但 fork 有效性较强(大量实际使用),issue 讨论有深度;适合优先复核。
11 Reflexion 3.2K 58 📊 稳定 经典论文实现,引用量极高但 GitHub 活跃度中等。作为「反思记忆」范式奠基项目,学术价值远超 Star 数。
12 FunSearch 1.5K 62 🌱 自然增长 DeepMind 品牌但增长缓慢。数学发现应用面窄导致 star 偏低,但代码维护线索和学术严谨度较强;不能仅按总 Star 低估。
Momentum clues

近期关注度只是下一步抓取线索

这里展示的是旧 star-signal 数据里的关注度线索,不是实时 GitHub 证据,也不是质量结论。完整 2026 new-star 判断必须等 star-history 覆盖达标。

OpenEvolve

#1
82
活跃度
72
贡献者多样性
55
Fork 有效性
🌱 自然增长 ★ 6K

DSPy

#2
80
活跃度
72
贡献者多样性
52
Fork 有效性
🌱 自然增长 ★ 25K

SWE-Agent

#3
78
活跃度
65
贡献者多样性
48
Fork 有效性
🌱 自然增长 ★ 15K

LangGraph

#4
76
活跃度
70
贡献者多样性
45
Fork 有效性
📊 稳定 ★ 20K

OpenHands

#5
75
活跃度
70
贡献者多样性
45
Fork 有效性
🌱 自然增长 ★ 55K

CrewAI

#6
72
活跃度
60
贡献者多样性
40
Fork 有效性
📊 稳定 ★ 30K

AutoGen

#7
68
活跃度
75
贡献者多样性
42
Fork 有效性
🌱 自然增长 ★ 50K

MetaGPT

#8
58
活跃度
68
贡献者多样性
35
Fork 有效性
🚀 病毒式 ★ 50K

Reflexion

#9
55
活跃度
60
贡献者多样性
38
Fork 有效性
📊 稳定 ★ 3K

FunSearch

#10
45
活跃度
82
贡献者多样性
30
Fork 有效性
🌱 自然增长 ★ 2K
Mechanism anchors

六类代表案例:看为什么值得研究,不看谁是冠军。

系统证据队列 →

这些不是最终排名。每类只给一个代表性证据锚点,帮助读者识别机制差异;严肃判断要回到论文、项目报告和原始 benchmark。

🧬 架构/代码自修改

代表案例
AlphaEvolve 证据锚点

DeepMind 报告 4x4 complex-valued matrix multiplication 的 48-scalar result;SOTA 恢复率仍需按来源逐项复核

对照: DGM L4 Code Self-Mod
7 篇论文 证据入口

🏗️ Agent 自动设计

代表案例
ADAS 证据锚点

自动发现 Agent 架构是机制锚点;跨域迁移需要回到 held-out tasks、消融和失败候选

对照: OpenEvolve L4 Arch Search
5 篇论文 证据入口

🪞 推理时自我修正

代表案例
Reflexion 证据锚点

HumanEval / AlfWorld 数字只作论文报告线索,需回到 evaluator 设置和任务口径

对照: Self-Refine L2 Prompt/Output
15 篇论文 证据入口

🎮 训练时自博弈

代表案例
Absolute Zero 证据锚点

零外部数据自博弈是候选机制;venue、benchmark 与训练口径需要来源页复核

对照: ReVeal L2 Self-Play RL
12 篇论文 证据入口

⚡ 声明式 Prompt 优化

代表案例
DSPy 证据锚点

采用广泛只是 adoption prior;编译式 prompt 优化不自动等于自进化闭环

对照: OPRO L2 Prompt Evo
10 篇论文 证据入口

📚 技能/记忆积累

代表案例
Voyager 证据锚点

技能库与开放式探索是证据锚点;具体数字 claim 需要回到 benchmark source

对照: SE-Agent L3 Memory/Skill
18 篇论文 证据入口
Agent-Swarm Evolve

把 Agent 团队本身变成可进化对象

CORAL model card →

这一部分不是“多开几个角色”,而是看角色库、拓扑、共享状态、验证队列、handoff 协议和组织记忆是否会在独立反馈后更新,并且能留下 lineage、失败候选和回滚路径。

拓扑优化

GPTSwarm / EvoMAC

agent 节点、通信边和路由概率会随任务反馈更新

看 held-out tasks、edge ablation、环境反馈
自主组织基础设施

CORAL / metaswarm

worktree、shared state、grader、heartbeat 和 archive 形成组织级闭环

看 grader 独立性、lineage replay、跨模型 review
生产型 swarm runtime

swarmclaw / OpenClaw team

schedules、delegation、memory、provider routing 和工具权限进入运行时

看真实 workflow、权限审计、成本上限和可观测性
图谱涌现协作

Insight Swarm

shared knowledge graph、tension links、challenge votes 代替中心 orchestrator

看反共识指标、证据链和 contested thesis 处理
关于

核心价值不是页面数量,而是可复查判断。

Self Evolve 不只是索引。当前生成索引记录了 686 个 raw GitHub captures、300 个 analyzed project/model-card reports、98 个 strict evolution repos、204 个 broad evolution-related repos 和 491 个 public project reports。

这些数字只说明证据覆盖,不自动等于结论可信。高置信结论必须能回到论文、项目报告、benchmark 或 raw index;缺口继续标为待复核。

Total stars = historical adoption prior. Star growth = current momentum pilot. Value LSH = heuristic triage, not final judgment.

研究

值得持续追踪的进化机制

全部研究
2023

Teaching LLMs to Self-Debug

把执行结果、测试和调试解释作为程序修复信号,直接支撑代码智能体的回归门禁。

LLM 自我改进 Self-Debug代码修复
2024

SPIN:Self-Play Fine-Tuning

通过自博弈微调把弱模型推向更强模型,把自我改进从提示期推进到训练期。

LLM 自我改进 Self-Play微调
2023

OPRO:Large Language Models as Optimizers

用自然语言描述目标和历史分数,让 LLM 基于反馈提出新候选,是通用“LLM 即优化器”模板。

进化计算 + LLM LLM 优化器标量反馈
2023

FunSearch:LLM + 评估器的程序进化

把 LLM 与自动评估器组合,进化数学和科学发现程序,是“生成器 + 验证器 + 谱系”的重要案例。

进化计算 + LLM 程序进化评估器
博客

面向研究者与开发者的实践笔记

全部文章