先判断它算不算自进化
不是看名字里有没有 evolve,而是看可变对象、反馈、验证、保留和回滚。
Do not start with the name. Start with the mutable object, feedback signal, verifier, retention, and rollback path.
这不是链接收藏,而是面向可审计改进系统的判断图:一个 agent 到底改了什么、由什么反馈选择、谁验证、能否保留,失败时能不能回滚。
English core summaries are available under /en/. The full evidence corpus remains Chinese-first while parity is being built.
不是看名字里有没有 evolve,而是看可变对象、反馈、验证、保留和回滚。
Do not start with the name. Start with the mutable object, feedback signal, verifier, retention, and rollback path.
反思、搜索、评估、代码自改进、种群/归档不是同一件事,证据强度也不同。
Reflection, search, evaluator loops, code evolution, and population archives are different evidence modes.
Star、benchmark、项目报告、Value LSH 和 Evolve-AGI Index 都只是证据面,不是单点答案。
Stars, benchmarks, project reports, Value LSH, and the Evolve-AGI Index are evidence surfaces, not one-number truth.
| Reader | 中文路径 | English path | Status |
|---|---|---|---|
| New reader | 从定义页开始 | Start with the definition page | paired core |
| Researcher | 看五类回路和论文主线 | Read the five loops and paper spine | paired core |
| Builder | 看 benchmark 与项目报告 | Compare benchmarks and project evidence | paired core + gated reports |
| Investor / product | 看增长、价值分类和信任边界 | Use growth, value classification, and trust boundaries | ZH-first evidence |
共享 hash bands 的近邻召回,不等于上面的 k-means cluster 标签。
这不是价值裁判,也不是累计 Star 榜。它用 26 个判断问题,把 GitHub、论文、社交/X 和博客材料先分成三类:值得深读、需要复核、证据不足或有风险。技术细节进入方法页,首页只保留读者用途。
Evolve-AGI Index 不是 AGI 能力分,而是一个 exploratory evidence-maturity worksheet,用来检查 AI Agent 自进化证据是否足够成熟。
Benchmark 表现 · 权重 18%
核心闭环强度 · 权重 20%
证据链可信度 · 权重 18%
迁移与验证 · 权重 14%
这个表只保留历史热度作为阅读线索,不负责判断当前质量。严肃判断必须回到 evaluator、benchmark、retention、失败记录和项目报告。
| # | 项目 | Stars | 线索分 | 增长 | 判定 |
|---|---|---|---|---|---|
| 1 | AutoGPT | 175K | 28 | 🚀 病毒式 | 爆发式增长,大量一次性 star,fork 活跃度极低,issue 有效性偏低。典型「Hype-driven」传播线索;需要回到维护记录和真实使用复核。 |
| 2 | OpenHands | 55K | 68 | 🌱 自然增长 | 原 OpenDevin,学术+社区双驱动。ICLR 接收论文增加了可信度。沙箱环境设计实用。增长曲线平滑健康。 |
| 3 | AutoGen | 50K | 66 | 🌱 自然增长 | 微软品牌背书,学术渊源(Penn State + 微软研究院)。Actor 模型架构严谨。Magentic-One 是实质研究贡献。增长健康。 |
| 4 | MetaGPT | 50K | 56 | 🚀 病毒式 | 快速但较健康的增长曲线。中国团队主导但国际化程度高。论文驱动(SOP(Team))增加了学术可信度。SELA/AFlow 子项目有实质研究。 |
| 5 | CrewAI | 30K | 62 | 📊 稳定 | 稳健增长,社区活跃度高,零依赖设计降低了参与门槛。100K+ 认证开发者表明有真实用户基础。营销适中。 |
| 6 | DSPy | 25K | 73 | 🌱 自然增长 | 斯坦福 NLP 声明式编程范式创新。增长曲线最健康之一。SIMBA 自我反思优化器是实质贡献。学术+工程双高。 |
| 7 | Devika | 22K | 30 | ⚠️ 可疑 | 与 AutoGPT 同期爆发,增长模式类似但后续活跃度更低。大量 star 无转化。issue 有效性低,PR 合并率低,传播异常需要复核。 |
| 8 | LangGraph | 20K | 67 | 📊 稳定 | LangChain 生态核心,Pregel 引擎架构扎实。受益于 LangChain 品牌溢出效应,但本身有技术深度。 |
| 9 | SWE-Agent | 15K | 70 | 🌱 自然增长 | Princeton NLP 出品,ICLR 2025 Oral。ACI 设计有创新。SWE-bench SOTA 背书。增长健康,学术驱动。 |
| 10 | OpenEvolve | 6.4K | 74 | 🌱 自然增长 | AlphaEvolve 开源复现,学术驱动。增长虽慢但 fork 有效性较强(大量实际使用),issue 讨论有深度;适合优先复核。 |
| 11 | Reflexion | 3.2K | 58 | 📊 稳定 | 经典论文实现,引用量极高但 GitHub 活跃度中等。作为「反思记忆」范式奠基项目,学术价值远超 Star 数。 |
| 12 | FunSearch | 1.5K | 62 | 🌱 自然增长 | DeepMind 品牌但增长缓慢。数学发现应用面窄导致 star 偏低,但代码维护线索和学术严谨度较强;不能仅按总 Star 低估。 |
这里展示的是旧 star-signal 数据里的关注度线索,不是实时 GitHub 证据,也不是质量结论。完整 2026 new-star 判断必须等 star-history 覆盖达标。
这些不是最终排名。每类只给一个代表性证据锚点,帮助读者识别机制差异;严肃判断要回到论文、项目报告和原始 benchmark。
DeepMind 报告 4x4 complex-valued matrix multiplication 的 48-scalar result;SOTA 恢复率仍需按来源逐项复核
自动发现 Agent 架构是机制锚点;跨域迁移需要回到 held-out tasks、消融和失败候选
HumanEval / AlfWorld 数字只作论文报告线索,需回到 evaluator 设置和任务口径
零外部数据自博弈是候选机制;venue、benchmark 与训练口径需要来源页复核
采用广泛只是 adoption prior;编译式 prompt 优化不自动等于自进化闭环
技能库与开放式探索是证据锚点;具体数字 claim 需要回到 benchmark source
这一部分不是“多开几个角色”,而是看角色库、拓扑、共享状态、验证队列、handoff 协议和组织记忆是否会在独立反馈后更新,并且能留下 lineage、失败候选和回滚路径。
agent 节点、通信边和路由概率会随任务反馈更新
worktree、shared state、grader、heartbeat 和 archive 形成组织级闭环
schedules、delegation、memory、provider routing 和工具权限进入运行时
shared knowledge graph、tension links、challenge votes 代替中心 orchestrator
Self Evolve 不只是索引。当前生成索引记录了 686 个 raw GitHub captures、300 个 analyzed project/model-card reports、98 个 strict evolution repos、204 个 broad evolution-related repos 和 491 个 public project reports。
这些数字只说明证据覆盖,不自动等于结论可信。高置信结论必须能回到论文、项目报告、benchmark 或 raw index;缺口继续标为待复核。
Total stars = historical adoption prior. Star growth = current momentum pilot. Value LSH = heuristic triage, not final judgment.
用自然语言描述目标和历史分数,让 LLM 基于反馈提出新候选,是通用“LLM 即优化器”模板。
将数据检索、预处理、建模、评估和部署拆成专用 Agent,最接近产品化 Self Evolve 工作流。
把 Claude Code dynamic workflows 放回 Self Evolve 主题:它不是普通多 Agent,而是让任务组织、验证队列、并行子代理和安全边界一起变成可审计的 Agent-Swarm Evolve。
把 Anthropic 2026 年 5 月的 Opus 4.8、Dynamic Workflows、Stainless 收购、Claude containment 和 Series H 融资放回 AI Agent 自进化主题:模型竞争正在变成 AgentOps 基础设施竞争。
从英文论文第六章拆解主流 Agent 框架:它们提供运行时、角色、对话、流程、prompt 编译或状态图,但自进化需要额外的评估、记忆、更新和治理层。