Evidence queue / 证据队列

20 个候选自进化系统复核清单

这页回答一个读者问题:如果只能先读 20 个系统,应该从哪里开始、为什么要复核、哪些结论还不能当成定论。9 维评分只是分诊协议草稿,覆盖改进幅度、证据强度、可迁移性、安全性、成本效率、可用性、前瞻性、学术严谨性和实用价值。

20个候选系统
AlphaEvolve当前最先复核对象
9个待校准维度
分级

复核层级分布

证据层级 A

4 个项目

AlphaEvolveDarwin Godel Machine (DGM)FunSearch

证据层级 B+

2 个项目

OpenEvolveReflexion

证据层级 B

9 个项目

Absolute Zero ReasonersDSPySelf-Refine

证据层级 B-

5 个项目

SkillRLWebRLCORAL
复核顺序

按当前证据分诊排序

排序只表示“先读谁、先复核谁”。如果项目缺少可重复 benchmark、失败样本或保留机制证据,不能因为位置靠前就被写成成熟结论。

队列 项目 证据层级 分诊 成熟度 D1 D2 D3 U1 U2 U3 U4
1 AlphaEvolve A 优先复核 L4 9.5 8 7.5 2 8 9 8.5
2 Darwin Godel Machine (DGM) A 重点阅读 L4 9 7.5 7 4 7 8.5 7
3 FunSearch A 重点阅读 L4 8.5 7.5 6 3 7 8.5 7
4 ADAS A 重点阅读 L4 7 7.5 7 4.5 8 8 6.5
5 OpenEvolve B+ 重点阅读 L4 7.5 7 6.5 6.5 7.5 7 6
6 Reflexion B+ 重点阅读 L2 8 6.5 5 7 6 7.5 6.5
7 Absolute Zero Reasoners B 重点阅读 L2 7 6.5 7 4.5 7.5 7.5 6
8 DSPy B 重点阅读 L2 6 7 6.5 8 7 7.5 6
9 Self-Refine B 重点阅读 L2 6 6 4 8.5 5 6.5 5
10 SE-Agent B 补证据 L3 6.5 6 5.5 5.5 6.5 7 5.5
11 ReVeal B 补证据 L2 6.5 7.5 5.5 4 6.5 8 6
12 Voyager B 补证据 L3 7.5 6 4.5 5 6.5 7 5.5
13 GPTSwarm B 补证据 L3 6 6 5 5.5 6 7 5.5
14 A-Evolve B 补证据 L3 6 5.5 5 5 6.5 6.5 5
15 EvoSkill B 补证据 L3 5.5 5.5 5 5.5 6 6 5.5
16 SkillRL B- 补证据 L3 5.5 5.5 5 5 6 6.5 5
17 WebRL B- 补证据 L3 6 5.5 4.5 5 6 6.5 5
18 CORAL B- 补证据 L4 5.5 5 5 4.5 6.5 6 5
19 AutoResearchClaw B- 补证据 L3 5 4.5 4.5 6 6 5.5 6
20 Agentic Harness Eng. B- 补证据 L3 5.5 5 4.5 5 6 6 5
维度对照

各项目 9 维证据轮廓

这些条形图用于发现“强项在哪里、缺口在哪里”,不是用两位小数制造精确排名。

AlphaEvolve

56yr matrix multiplication record; Borg 0.7% compute recovery; 75% SOTA recovery on 50+ math problems

A · 优先复核
D1
9.5
D2
8
D3
7.5
D4
7
D5
4
U1
2
U2
8
U3
9
U4
8.5

Darwin Godel Machine (DGM)

SWE-bench 20%→50%; Polyglot 14.2%→30.7%; archive-based agent evolution with lineage

A · 重点阅读
D1
9
D2
7.5
D3
7
D4
6
D5
5
U1
4
U2
7
U3
8.5
U4
7

FunSearch

New cap-set constructions; improved bin-packing heuristics; Nature publication

A · 重点阅读
D1
8.5
D2
7.5
D3
6
D4
6.5
D5
5
U1
3
U2
7
U3
8.5
U4
7

ADAS

Discovers agent architectures automatically; cross-domain transfer of discovered designs

A · 重点阅读
D1
7
D2
7.5
D3
7
D4
5.5
D5
5.5
U1
4.5
U2
8
U3
8
U4
6.5

OpenEvolve

Open-source AlphaEvolve implementation; evolutionary program search; accessible to researchers

B+ · 重点阅读
D1
7.5
D2
7
D3
6.5
D4
6
D5
6
U1
6.5
U2
7.5
U3
7
U4
6

Reflexion

HumanEval 91% pass@1 (GPT-3.5); ALFWorld 97%; verbal reflection memory

B+ · 重点阅读
D1
8
D2
6.5
D3
5
D4
5
D5
7
U1
7
U2
6
U3
7.5
U4
6.5

Absolute Zero Reasoners

Self-play without external data; code→math transfer

B · 重点阅读
D1
7
D2
6.5
D3
7
D4
5
D5
6
U1
4.5
U2
7.5
U3
7.5
U4
6

DSPy

Declarative prompt optimization; widest adoption

B · 重点阅读
D1
6
D2
7
D3
6.5
D4
5
D5
6.5
U1
8
U2
7
U3
7.5
U4
6

Self-Refine

Math 56→67%; simplest self-evolution technique

B · 重点阅读
D1
6
D2
6
D3
4
D4
5
D5
8
U1
8.5
U2
5
U3
6.5
U4
5

SE-Agent

Code agent self-evolution via execution feedback

B · 补证据
D1
6.5
D2
6
D3
5.5
D4
5.5
D5
6
U1
5.5
U2
6.5
U3
7
U4
5.5

ReVeal

LiveCodeBench 36.9→42.4; verification co-evolution

B · 补证据
D1
6.5
D2
7.5
D3
5.5
D4
6
D5
5
U1
4
U2
6.5
U3
8
U4
6

Voyager

3.3x unique items; skill library accumulation

B · 补证据
D1
7.5
D2
6
D3
4.5
D4
5.5
D5
6.5
U1
5
U2
6.5
U3
7
U4
5.5

GPTSwarm

RL + prompt optimization swarm

B · 补证据
D1
6
D2
6
D3
5
D4
5
D5
5.5
U1
5.5
U2
6
U3
7
U4
5.5

A-Evolve

Generic self-improving agent infrastructure

B · 补证据
D1
6
D2
5.5
D3
5
D4
5
D5
5.5
U1
5
U2
6.5
U3
6.5
U4
5

EvoSkill

Failure trajectories → reusable skills

B · 补证据
D1
5.5
D2
5.5
D3
5
D4
5
D5
5.5
U1
5.5
U2
6
U3
6
U4
5.5

SkillRL

Trajectory → skill library + RL co-evolution

B- · 补证据
D1
5.5
D2
5.5
D3
5
D4
5
D5
5
U1
5
U2
6
U3
6.5
U4
5

WebRL

Self-evolving web agent curriculum RL

B- · 补证据
D1
6
D2
5.5
D3
4.5
D4
5
D5
5.5
U1
5
U2
6
U3
6.5
U4
5

CORAL

Multi-agent open-ended discovery infrastructure

B- · 补证据
D1
5.5
D2
5
D3
5
D4
5.5
D5
5
U1
4.5
U2
6.5
U3
6
U4
5

AutoResearchClaw

Research idea → paper pipeline; multi-agent debate

B- · 补证据
D1
5
D2
4.5
D3
4.5
D4
4.5
D5
5
U1
6
U2
6
U3
5.5
U4
6

Agentic Harness Eng.

Observability-driven harness evolution

B- · 补证据
D1
5.5
D2
5
D3
4.5
D4
5
D5
5
U1
5
U2
6
U3
6
U4
5
方法论

评分协议草稿

本协议帮助读者把“像不像自进化”拆成可讨论问题:它改了什么、怎么得到反馈、谁验证、变化是否保留、失败能否回滚。权重仍需更多 reviewer 校准,因此只能作为阅读和复核顺序。

维度含义权重
D1改进幅度0.15
D2证据强度0.20
D3可迁移性0.10
D4安全性0.10
D5成本效率0.05
U1可用性0.10
U2前瞻性0.10
U3学术严谨性0.10
U4实用价值0.10