证据层级 A
4 个项目
这页回答一个读者问题:如果只能先读 20 个系统,应该从哪里开始、为什么要复核、哪些结论还不能当成定论。9 维评分只是分诊协议草稿,覆盖改进幅度、证据强度、可迁移性、安全性、成本效率、可用性、前瞻性、学术严谨性和实用价值。
4 个项目
2 个项目
9 个项目
5 个项目
排序只表示“先读谁、先复核谁”。如果项目缺少可重复 benchmark、失败样本或保留机制证据,不能因为位置靠前就被写成成熟结论。
| 队列 | 项目 | 证据层级 | 分诊 | 成熟度 | D1 | D2 | D3 | U1 | U2 | U3 | U4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | AlphaEvolve | A | 优先复核 | L4 | 9.5 | 8 | 7.5 | 2 | 8 | 9 | 8.5 |
| 2 | Darwin Godel Machine (DGM) | A | 重点阅读 | L4 | 9 | 7.5 | 7 | 4 | 7 | 8.5 | 7 |
| 3 | FunSearch | A | 重点阅读 | L4 | 8.5 | 7.5 | 6 | 3 | 7 | 8.5 | 7 |
| 4 | ADAS | A | 重点阅读 | L4 | 7 | 7.5 | 7 | 4.5 | 8 | 8 | 6.5 |
| 5 | OpenEvolve | B+ | 重点阅读 | L4 | 7.5 | 7 | 6.5 | 6.5 | 7.5 | 7 | 6 |
| 6 | Reflexion | B+ | 重点阅读 | L2 | 8 | 6.5 | 5 | 7 | 6 | 7.5 | 6.5 |
| 7 | Absolute Zero Reasoners | B | 重点阅读 | L2 | 7 | 6.5 | 7 | 4.5 | 7.5 | 7.5 | 6 |
| 8 | DSPy | B | 重点阅读 | L2 | 6 | 7 | 6.5 | 8 | 7 | 7.5 | 6 |
| 9 | Self-Refine | B | 重点阅读 | L2 | 6 | 6 | 4 | 8.5 | 5 | 6.5 | 5 |
| 10 | SE-Agent | B | 补证据 | L3 | 6.5 | 6 | 5.5 | 5.5 | 6.5 | 7 | 5.5 |
| 11 | ReVeal | B | 补证据 | L2 | 6.5 | 7.5 | 5.5 | 4 | 6.5 | 8 | 6 |
| 12 | Voyager | B | 补证据 | L3 | 7.5 | 6 | 4.5 | 5 | 6.5 | 7 | 5.5 |
| 13 | GPTSwarm | B | 补证据 | L3 | 6 | 6 | 5 | 5.5 | 6 | 7 | 5.5 |
| 14 | A-Evolve | B | 补证据 | L3 | 6 | 5.5 | 5 | 5 | 6.5 | 6.5 | 5 |
| 15 | EvoSkill | B | 补证据 | L3 | 5.5 | 5.5 | 5 | 5.5 | 6 | 6 | 5.5 |
| 16 | SkillRL | B- | 补证据 | L3 | 5.5 | 5.5 | 5 | 5 | 6 | 6.5 | 5 |
| 17 | WebRL | B- | 补证据 | L3 | 6 | 5.5 | 4.5 | 5 | 6 | 6.5 | 5 |
| 18 | CORAL | B- | 补证据 | L4 | 5.5 | 5 | 5 | 4.5 | 6.5 | 6 | 5 |
| 19 | AutoResearchClaw | B- | 补证据 | L3 | 5 | 4.5 | 4.5 | 6 | 6 | 5.5 | 6 |
| 20 | Agentic Harness Eng. | B- | 补证据 | L3 | 5.5 | 5 | 4.5 | 5 | 6 | 6 | 5 |
这些条形图用于发现“强项在哪里、缺口在哪里”,不是用两位小数制造精确排名。
56yr matrix multiplication record; Borg 0.7% compute recovery; 75% SOTA recovery on 50+ math problems
SWE-bench 20%→50%; Polyglot 14.2%→30.7%; archive-based agent evolution with lineage
New cap-set constructions; improved bin-packing heuristics; Nature publication
Discovers agent architectures automatically; cross-domain transfer of discovered designs
Open-source AlphaEvolve implementation; evolutionary program search; accessible to researchers
HumanEval 91% pass@1 (GPT-3.5); ALFWorld 97%; verbal reflection memory
Self-play without external data; code→math transfer
Declarative prompt optimization; widest adoption
Math 56→67%; simplest self-evolution technique
Code agent self-evolution via execution feedback
LiveCodeBench 36.9→42.4; verification co-evolution
3.3x unique items; skill library accumulation
RL + prompt optimization swarm
Generic self-improving agent infrastructure
Failure trajectories → reusable skills
Trajectory → skill library + RL co-evolution
Self-evolving web agent curriculum RL
Multi-agent open-ended discovery infrastructure
Research idea → paper pipeline; multi-agent debate
Observability-driven harness evolution
本协议帮助读者把“像不像自进化”拆成可讨论问题:它改了什么、怎么得到反馈、谁验证、变化是否保留、失败能否回滚。权重仍需更多 reviewer 校准,因此只能作为阅读和复核顺序。
| 维度 | 含义 | 权重 |
|---|---|---|
| D1 | 改进幅度 | 0.15 |
| D2 | 证据强度 | 0.20 |
| D3 | 可迁移性 | 0.10 |
| D4 | 安全性 | 0.10 |
| D5 | 成本效率 | 0.05 |
| U1 | 可用性 | 0.10 |
| U2 | 前瞻性 | 0.10 |
| U3 | 学术严谨性 | 0.10 |
| U4 | 实用价值 | 0.10 |