Benchmark 表现
主指数只纳入 agent/code/web/app/algorithm-discovery 等自进化相关 benchmark family;AI-for-science adjacent evidence 单独展示,不进入主分。
Evolve-AGI Index 不是 AGI 能力分,而是一个 exploratory evidence-maturity worksheet,用来检查 AI Agent 自进化证据是否足够成熟。
这个数字只回答“证据是否足够进入下一轮复核”:benchmark 是否可复跑、闭环是否保留、迁移和治理是否说明。它不回答哪个系统更好,也不是 AGI 能力分。
主指数只纳入 agent/code/web/app/algorithm-discovery 等自进化相关 benchmark family;AI-for-science adjacent evidence 单独展示,不进入主分。
Top 自进化系统是否真的有可变对象、反馈信号、选择机制和保留机制。
综合 D2 证据强度与项目报告覆盖率,防止只有口号没有 raw / report。
改进是否能跨任务、跨环境或跨时间切片迁移,并有验证门约束。
系统是否有开源实现、文档、成本效率和实际采用价值。
结合证据分诊队列与 Star 活跃度,提示近期研究和工程关注度,不能单独当作价值排名。
看安全、成本、时间戳置信度和可审计边界是否跟上能力增长。
| Date | Worksheet score | Benchmark | Strict / broad repos | Reports | Source |
|---|---|---|---|---|---|
| 2026-05-26 Archived baseline · backfilled | 67.4 | 72.2 | 82 / 186 | 90 | work/research/archived-analysis/github-project-data-analysis.json Backfilled with current formula over archived corpus counts. |
| 2026-05-29 Site snapshot · backfilled | 71.3 | 76.4 | 90 / 195 | 187 | site/src/data/analysis.json Previous site snapshot before benchmark became a weighted signal. |
| 2026-05-30 Benchmark-weighted | 72.9 | 80.1 | 90 / 195 | 193 | reports/evolve-agi-index-trend.json First benchmark-weighted snapshot before the public site data snapshot was synced. |
| 2026-06-01 Corpus-synced | 72.9 | 80.1 | 93 / 200 | 239 | analysis/github-project-data-analysis.json + site/src/data/analysis.json Public site data snapshot synced to the latest GitHub analysis corpus. |
| 2026-06-02 MPA evidence added | 72.9 | 80.1 | 93 / 200 | 239 | https://www.deepprinciple.com/papers/mpa.pdf + https://mp.weixin.qq.com/s/Do3sauQ8oSoRluaCptYe-g Added MPA / MIRA materials-property benchmark evidence; corpus counts unchanged. |
这里仅展示进入主 worksheet 分数的 agent/code/web/app/algorithm-discovery benchmark family。MPA、MIRA 等 AI-for-science adjacent evidence 已在数据层分离,不进入主分。
Code-generation pass rate with language reflection memory.
paper-drafts/appendix.tex; site/src/data/survey.tsEmbodied/web-style task success, used as cross-domain evidence.
site/src/data/survey.ts; research/ranking-framework/radar-profiles.jsonSelf-improvement loop on coding benchmark.
paper-drafts/appendix.texHard software-engineering benchmark; gain is weighted heavily.
paper-drafts/appendix.tex; research/ranking-framework/radar-profiles.jsonSelf-modifying coding agent result in software repair.
paper-drafts/appendix.texCross-language transfer evidence.
site/src/data/survey.ts; paper-drafts/appendix.texTurn-based self-evolution reasoning improvement.
paper-drafts/appendix.texWeb-agent benchmark with large absolute improvement.
paper-drafts/appendix.texApp-agent environment improvement; still low absolute final score.
paper-drafts/appendix.texNon-pass-rate benchmark family normalized by impact and verification.
paper-drafts/appendix.tex; research/ranking-framework/radar-profiles.json56yr matrix multiplication record; Borg 0.7% compute recovery; 75% SOTA recovery on 50+ math problems
SWE-bench 20%→50%; Polyglot 14.2%→30.7%; archive-based agent evolution with lineage
New cap-set constructions; improved bin-packing heuristics; Nature publication
Discovers agent architectures automatically; cross-domain transfer of discovered designs
Open-source AlphaEvolve implementation; evolutionary program search; accessible to researchers
进化/搜索循环 → 评估器/打分器 → 智能体编排 → 训练/数据循环
进化/搜索循环 → 反思记忆
进化/搜索循环 → 评估器/打分器 → 智能体编排 → 训练/数据循环
进化/搜索循环 → 评估器/打分器
进化/搜索循环