OpenEvolve
AlphaEvolve 开源复现,学术驱动。增长虽慢但 fork 有效性较强(大量实际使用),issue 讨论有深度;适合优先复核。
这页只回答热度从哪里来、是否异常、哪些项目需要复核;它不是项目能力、代码质量或学术价值排名。
覆盖 12 个核心项目,4 组对比分析;严肃判断仍要回到 benchmark、报告、失败样本和原始仓库。
基于 5 维度加权线索:Star 活跃度(20%) + 贡献者多样性(20%) + Fork 有效性(20%) + Issue 有效性(20%) + PR 合并率(20%)。分数只用于发现异常和选择复核顺序。
| 项目 | Stars | 分诊分 | Star 活跃 | 贡献多样性 | Fork 有效性 | Issue 有效性 | PR 合并 | 增长模式 |
|---|---|---|---|---|---|---|---|---|
| OpenEvolve algorithmicsuperintelligence/openevolve | 6,358 | 74 | 82 | 72 | 55 | 78 | 75 | organic |
| DSPy stanfordnlp/dspy | 25,000 | 73 | 80 | 72 | 52 | 75 | 78 | organic |
| SWE-Agent princeton-nlp/SWE-agent | 15,000 | 70 | 78 | 65 | 48 | 72 | 72 | organic |
| OpenHands All-Hands-AI/OpenHands | 55,000 | 68 | 75 | 70 | 45 | 65 | 68 | organic |
| LangGraph langchain-ai/langgraph | 20,000 | 67 | 76 | 70 | 45 | 68 | 72 | steady |
| AutoGen microsoft/autogen | 50,000 | 66 | 68 | 75 | 42 | 60 | 70 | organic |
| CrewAI crewAIInc/crewAI | 30,000 | 62 | 72 | 60 | 40 | 62 | 58 | steady |
| FunSearch google-deepmind/funsearch | 1,500 | 62 | 45 | 82 | 30 | 70 | 80 | organic |
| Reflexion noahshinn/reflexion | 3,158 | 58 | 55 | 60 | 38 | 65 | 60 | steady |
| MetaGPT FoundationAgents/MetaGPT | 50,000 | 56 | 58 | 68 | 35 | 55 | 65 | |
| Devika stitionai/devika | 22,000 | 30 | 35 | 50 | 12 | 30 | 38 | suspicious |
| AutoGPT Significant-Gravitas/AutoGPT | 175,000 | 28 | 32 | 55 | 8 | 25 | 42 |
AlphaEvolve 开源复现,学术驱动。增长虽慢但 fork 有效性较强(大量实际使用),issue 讨论有深度;适合优先复核。
斯坦福 NLP 声明式编程范式创新。增长曲线最健康之一。SIMBA 自我反思优化器是实质贡献。学术+工程双高。
Princeton NLP 出品,ICLR 2025 Oral。ACI 设计有创新。SWE-bench SOTA 背书。增长健康,学术驱动。
原 OpenDevin,学术+社区双驱动。ICLR 接收论文增加了可信度。沙箱环境设计实用。增长曲线平滑健康。
LangChain 生态核心,Pregel 引擎架构扎实。受益于 LangChain 品牌溢出效应,但本身有技术深度。
微软品牌背书,学术渊源(Penn State + 微软研究院)。Actor 模型架构严谨。Magentic-One 是实质研究贡献。增长健康。
雷达只展示 adoption/maintenance proxy,不代表代码质量、产品质量或学术价值。
| 项目 | Stars | Forks | 贡献者 | Star/Contrib | 代码维护线索 | 社区 | 文档 | 营销度 | 类型 |
|---|---|---|---|---|---|---|---|---|---|
| AutoGPT | 175,000 | 45,000 | 820 | 213 | ●●●●●○○○○○ | ●●●●○○○○○○ | ●●●●●●○○○○ | high | community |
| OpenHands | 55,000 | 6,500 | 380 | 145 | ●●●●●●●●○○ | ●●●●●●●●●○ | ●●●●●●●●○○ | low | community |
| MetaGPT | 50,000 | 6,000 | 350 | 143 | ●●●●●●●○○○ | ●●●●●●●○○○ | ●●●●●●●●○○ | medium | chinese-team |
| AutoGen | 50,000 | 6,000 | 420 | 119 | ●●●●●●●●○○ | ●●●●●●●●○○ | ●●●●●●●●●○ | low | big-tech |
| CrewAI | 30,000 | 4,000 | 280 | 107 | ●●●●●●●○○○ | ●●●●●●●●○○ | ●●●●●●●●○○ | medium | startup |
| DSPy | 25,000 | 2,000 | 180 | 139 | ●●●●●●●●●○ | ●●●●●●●○○○ | ●●●●●●●●●○ | low | academic |
| Devika | 22,000 | 3,000 | 120 | 183 | ●●●●○○○○○○ | ●●●○○○○○○○ | ●●●●●○○○○○ | high | startup |
| LangGraph | 20,000 | 2,500 | 210 | 95 | ●●●●●●●●○○ | ●●●●●●●●○○ | ●●●●●●●●●○ | medium | startup |
| SWE-Agent | 15,000 | 1,500 | 95 | 158 | ●●●●●●●●○○ | ●●●●●●●○○○ | ●●●●●●●○○○ | low | academic |
| CAMEL-AI | 12,000 | 1,300 | 150 | 80 | ●●●●●●●○○○ | ●●●●●●●○○○ | ●●●●●●●○○○ | low | academic |
| OpenEvolve | 6,358 | 1,018 | 55 | 116 | ●●●●●●●●○○ | ●●●●●●●○○○ | ●●●●●●●○○○ | low | community |
| FunSearch | 1,500 | 130 | 25 | 60 | ●●●●●●●●●○ | ●●●●●○○○○○ | ●●●●●●●●○○ | low | deepmind |
AutoGPT Star 数最高但传播异常也最明显;MetaGPT 兼具论文与商业传播线索;CrewAI 社区活跃线索较强。三者代表 Agent 框架的三种增长范式。
DeepMind 项目 Star 偏低但研究证据较强。开源社区项目(OpenHands, OpenEvolve)在活跃度和实用信号上可能超过大厂项目。品牌背书 ≠ 社区活力。
中国团队项目(MetaGPT, AgentVerse)依赖微信/微博传播,初期增速快但国际化受限。海外项目更依赖 HN/Reddit 自然传播。增长模式差异明显但各有优势。
学术项目增长慢但维护线索可能更稳。营销驱动项目爆发快但也可能快速衰减(Devika:20K stars → 3个月后几乎停更)。论文引用量和维护证据应与 Star 一起复核。
★ 0
★ 1,200 (+1,200)
★ 15,000 (+13,800)
★ 38,000 (+23,000)
★ 50,000 (+12,000)
★ 70,000 (+20,000)
★ 90,000 (+20,000)
★ 130,000 (+40,000)
★ 155,000 (+25,000)
★ 170,000 (+15,000)
★ 0
★ 3,000 (+3,000)
★ 12,000 (+9,000)
★ 18,000 (+6,000)
★ 25,000 (+7,000)
★ 32,000 (+7,000)
★ 42,000 (+10,000)
★ 48,000 (+6,000)
★ 0
★ 2,000 (+2,000)
★ 5,000 (+3,000)
★ 10,000 (+5,000)
★ 18,000 (+8,000)
★ 25,000 (+7,000)
★ 30,000 (+5,000)
★ 0
★ 5,000 (+5,000)
★ 12,000 (+7,000)
★ 16,000 (+4,000)
★ 20,000 (+4,000)
★ 21,500 (+1,500)
★ 22,000 (+500)
flowchart LR
A[GitHub 创建] --> B[Twitter/X 首发]
B --> C{"是否有 KOL 转发?"}
C -->|有| D[HN Front Page]
C -->|无| E[缓慢自然增长]
D --> F[Reddit 热帖]
F --> G[YouTube 教程]
G --> H[中文媒体翻译]
H --> I[Star 爆发]
E --> J[学术引用]
J --> K[长期稳步增长]
I --> L[高 Star 待复核]
K --> M[低 Star 仍可能有研究价值]
style L fill:#ef4444,stroke:#ef4444,color:#fff
style M fill:#10b981,stroke:#10b981,color:#fff graph TD
subgraph 炒作驱动
A1[AutoGPT 175K] --> A2[Devika 22K]
A1 ---|3天→50K| A3[爆发式增长]
A2 ---|5天→20K| A3
A3 --> A4["低 Fork 有效性 / 低 Issue 有效性 / Stars/Contrib > 150"]
end
subgraph 稳健增长
B1[CrewAI 30K] --> B2[AutoGen 50K]
B1 ---|30天→1K| B3[自然增长]
B2 ---|21天→1K| B3
B3 --> B4["高社区健康度 / 高 PR 合并率 / Stars/Contrib < 120"]
end
subgraph 学术驱动
C1[DSPy 25K] --> C2[SWE-Agent 15K]
C1 ---|90天→1K| C3[论文驱动增长]
C2 ---|30天→1K| C3
C3 --> C4["较强代码维护线索 / 较强 Issue 有效性 / Stars/Contrib < 160"]
end
style A3 fill:#ef444480,stroke:#ef4444
style B3 fill:#f59e0b80,stroke:#f59e0b
style C3 fill:#10b98180,stroke:#10b981 这个评分草案没有经过外部校准,不应作为项目质量、代码质量或学术价值判断;它只帮助发现传播异常和下一步复核顺序。
| 维度 | 权重 | 数据来源 | 说明 |
|---|---|---|---|
| Star 活跃度 | 20% | GitHub API | 90天内活跃 stargazer 占比 |
| 贡献者多样性 | 20% | GitHub API | Gini 系数反转,避免单人/单组织垄断 |
| Fork 有效性 | 20% | GitHub API | 有 commit 的 fork 占比(排除空 fork) |
| Issue 有效性 | 20% | GitHub API + NLP | 非灌水/非模板 issue 占比 |
| PR 合并率 | 20% | GitHub API | merged / total PRs 比例 |
| 指标 | 绿色 (< 50) | 黄色 (50-150) | 红色 (> 150) |
|---|---|---|---|
| Stars/Contributor | 健康 | 可能偏高 | 炒作嫌疑 |
| 0→1K 天数 | > 30 天 | 7-30 天 | < 7 天 |
| Fork 有效性 | > 40% | 20-40% | < 20% |
| Issue 有效性 | > 60% | 40-60% | < 40% |
声明:本分析基于公开 GitHub 数据估算,评分模型为启发式复核用途,不代表对任何项目的价值判断。 Star 数是可见性指标而非质量指标。建议研究者同时参考论文引用量、代码实际使用量、benchmark、失败样本和社区讨论深度。 本报告将作为 arXiv 论文「Self Evolving AI: A Survey」的补充材料。