Evolve-AGI worksheet

先把它当证据成熟度工作表,而不是领域指数。

Evolve-AGI Index 不是 AGI 能力分,而是一个 exploratory evidence-maturity worksheet,用来检查 AI Agent 自进化证据是否足够成熟。

这个数字只回答“证据是否足够进入下一轮复核”:benchmark 是否可复跑、闭环是否保留、迁移和治理是否说明。它不回答哪个系统更好,也不是 AGI 能力分。

Worksheet formula

EAI = Σ(signal_score × signal_weight)

方法说明
Bench

Benchmark 表现

80.1/100

主指数只纳入 agent/code/web/app/algorithm-discovery 等自进化相关 benchmark family;AI-for-science adjacent evidence 单独展示,不进入主分。

权重 18% paper-drafts/appendix.tex + site/src/data/survey.ts + research/ranking-framework/radar-profiles.json
Loop

核心闭环强度

80.2/100

Top 自进化系统是否真的有可变对象、反馈信号、选择机制和保留机制。

权重 20% site/src/data/rankings.ts + research/ranking-framework/README.md
Evidence

证据链可信度

78.7/100

综合 D2 证据强度与项目报告覆盖率,防止只有口号没有 raw / report。

权重 18% analysis/github-project-data-analysis.json + projects/INDEX.md
Transfer

迁移与验证

65.2/100

改进是否能跨任务、跨环境或跨时间切片迁移,并有验证门约束。

权重 14% paper-drafts/ch5-evaluation.tex + site/src/data/rankings.ts
Access

可运行与可复用

58.8/100

系统是否有开源实现、文档、成本效率和实际采用价值。

权重 12% site/src/data/rankings.ts + site/src/data/starAnalysis.ts
Momentum

领域动量

68.9/100

结合证据分诊队列与 Star 活跃度,提示近期研究和工程关注度,不能单独当作价值排名。

权重 10% site/src/data/analysis.json + site/src/data/starAnalysis.ts
Governance

治理成熟度

65.1/100

看安全、成本、时间戳置信度和可审计边界是否跟上能力增长。

权重 8% site/src/data/rankings.ts + output/raw-github-timestamp-index.md
Reconstructed snapshots

这些点是回填快照,不是领域真实增长曲线。

Reconstructed evidence worksheet snapshots and benchmark signal snapshots A two-line chart showing reconstructed worksheet snapshots from 2026-05-26 to 2026-06-02; it is not an append-only field progress trend. 60 73 85 2026-05-26 index 67.4 2026-05-26 benchmark 72.2 05-26 67.4 2026-05-29 index 71.3 2026-05-29 benchmark 76.4 05-29 71.3 2026-05-30 index 72.9 2026-05-30 benchmark 80.1 05-30 72.9 2026-06-01 index 72.9 2026-06-01 benchmark 80.1 06-01 72.9 2026-06-02 index 72.9 2026-06-02 benchmark 80.1 06-02 72.9
Date Worksheet score Benchmark Strict / broad repos Reports Source
2026-05-26 Archived baseline · backfilled 67.4 72.2 82 / 186 90 work/research/archived-analysis/github-project-data-analysis.json Backfilled with current formula over archived corpus counts.
2026-05-29 Site snapshot · backfilled 71.3 76.4 90 / 195 187 site/src/data/analysis.json Previous site snapshot before benchmark became a weighted signal.
2026-05-30 Benchmark-weighted 72.9 80.1 90 / 195 193 reports/evolve-agi-index-trend.json First benchmark-weighted snapshot before the public site data snapshot was synced.
2026-06-01 Corpus-synced 72.9 80.1 93 / 200 239 analysis/github-project-data-analysis.json + site/src/data/analysis.json Public site data snapshot synced to the latest GitHub analysis corpus.
2026-06-02 MPA evidence added 72.9 80.1 93 / 200 239 https://www.deepprinciple.com/papers/mpa.pdf + https://mp.weixin.qq.com/s/Do3sauQ8oSoRluaCptYe-g Added MPA / MIRA materials-property benchmark evidence; corpus counts unchanged.
Main-index benchmark evidence

主指数纳入的 benchmark evidence

这里仅展示进入主 worksheet 分数的 agent/code/web/app/algorithm-discovery benchmark family。MPA、MIRA 等 AI-for-science adjacent evidence 已在数据层分离,不进入主分。

Reflexion

HumanEval pass@1

91
Before80.0% GPT-4 baseline
After91.0%
Gain+11.0pp

Code-generation pass rate with language reflection memory.

paper-drafts/appendix.tex; site/src/data/survey.ts
Reflexion

ALFWorld success

97
Before77%
After97%
Gain+20pp

Embodied/web-style task success, used as cross-domain evidence.

site/src/data/survey.ts; research/ranking-framework/radar-profiles.json
SelfEvolve

HumanEval pass@1

86
Before74.39% ChatGPT baseline
After85.98%
Gain+11.59pp

Self-improvement loop on coding benchmark.

paper-drafts/appendix.tex
DGM

SWE-bench Verified

86
Before20.0%
After50.0%
Gain+30.0pp

Hard software-engineering benchmark; gain is weighted heavily.

paper-drafts/appendix.tex; research/ranking-framework/radar-profiles.json
SICA

SWE-bench Verified

88
Before17.0%
After53.0%
Gain+36.0pp

Self-modifying coding agent result in software repair.

paper-drafts/appendix.tex
DGM

Polyglot Coding

72
Before14.2%
After30.7%
Gain+16.5pp

Cross-language transfer evidence.

site/src/data/survey.ts; paper-drafts/appendix.tex
SAGE

LiveCodeBench

71
Beforebackbone model
After+8.9%
Gain+8.9%

Turn-based self-evolution reasoning improvement.

paper-drafts/appendix.tex
WebRL

WebArena-Lite

82
Before4.8%
After42.4%
Gain+37.6pp

Web-agent benchmark with large absolute improvement.

paper-drafts/appendix.tex
AgentEvolver

AppWorld

67
Before1.8%
After23.2%
Gain+21.4pp

App-agent environment improvement; still low absolute final score.

paper-drafts/appendix.tex
AlphaEvolve

Algorithm / infra discovery

89
Beforeprior best systems
After48 multiplications; Borg +0.7%; FlashAttention +23%
Gainnew record / infra gains

Non-pass-rate benchmark family normalized by impact and verification.

paper-drafts/appendix.tex; research/ranking-framework/radar-profiles.json
Evidence Snapshot

首页指数背后的语料规模

10 Benchmark evidence 80.1 weighted benchmark signal
93 Strict self-evolution 93 / 646 classified repos
200 Broad related field memory / skill / evaluation / harness included
239 Public reports 100% of analyzed projects
Evidence examples

闭环证据较强的代表系统,不是排名

Worksheet row 1

AlphaEvolve

56yr matrix multiplication record; Borg 0.7% compute recovery; 75% SOTA recovery on 50+ math problems

Tier A L4 worksheet score 7
Worksheet row 2

Darwin Godel Machine (DGM)

SWE-bench 20%→50%; Polyglot 14.2%→30.7%; archive-based agent evolution with lineage

Tier A L4 worksheet score 7
Worksheet row 3

FunSearch

New cap-set constructions; improved bin-packing heuristics; Nature publication

Tier A L4 worksheet score 7
Worksheet row 4

ADAS

Discovers agent architectures automatically; cross-domain transfer of discovered designs

Tier A L4 worksheet score 7
Worksheet row 5

OpenEvolve

Open-source AlphaEvolve implementation; evolutionary program search; accessible to researchers

Tier B+ L4 worksheet score 6
Research clues

近期研究线索,不是价值结论

Research clue 1

AgentEvolver

进化/搜索循环 → 评估器/打分器 → 智能体编排 → 训练/数据循环

Agent 进化框架 triage signal 83
Research clue 2

DARWIN

进化/搜索循环 → 反思记忆

安全策略进化 triage signal 77
Research clue 3

LLM-Self-Judge

进化/搜索循环 → 评估器/打分器 → 智能体编排 → 训练/数据循环

自评判训练 triage signal 76
Research clue 4

openevolve

进化/搜索循环 → 评估器/打分器

进化式代码优化 triage signal 71
Research clue 5

SCOPE

进化/搜索循环

上下文/Prompt 进化 triage signal 68