数据研究报告

GitHub Star 传播与异常信号分析

这页只回答热度从哪里来、是否异常、哪些项目需要复核;它不是项目能力、代码质量或学术价值排名。

覆盖 12 个核心项目,4 组对比分析;严肃判断仍要回到 benchmark、报告、失败样本和原始仓库。

复核线索

Visibility Signal Summary

需要复核的信号

  • Star 数只是可见性信号:高 Star 项目和低 Star 项目都需要回到 benchmark、代码维护、报告和失败样本复核。
  • 爆发式增长需要解释来源:短时间大幅增长通常应检查传播链、fork 有效性、issue 有效性和贡献者结构。
  • 论文驱动项目可能增长较慢:DSPy、SWE-Agent 等项目的可见性节奏不同,不能用总 Star 直接判断研究价值。
  • Me-too 项目需要额外复核:借热点增长的项目要看后续维护、真实使用和 issue/PR 活动是否持续。
  • Stars/Contributor Ratio 只是启发式异常线索:超过阈值意味着需要复核,不等于“炒作检测器”。

启发式信号

  • Star 活跃度线索:过去 90 天内有活动的 stargazer 占比
  • 贡献者多样性:Gini 系数反转,top 10 贡献者占比越低越好
  • Fork 有效性:有实际 commit/push 的 fork 占比
  • Issue 有效性:非灌水/非模板 issue 占比
  • PR 合并率:merged PRs / total PRs
  • Stars/Contributor Ratio:每个贡献者对应的 star 数(偏高=需要复核)
Star signal queue

传播信号复核队列

基于 5 维度加权线索:Star 活跃度(20%) + 贡献者多样性(20%) + Fork 有效性(20%) + Issue 有效性(20%) + PR 合并率(20%)。分数只用于发现异常和选择复核顺序。

项目 Stars 分诊分 Star 活跃 贡献多样性 Fork 有效性 Issue 有效性 PR 合并 增长模式
OpenEvolve
algorithmicsuperintelligence/openevolve
6,358 74 82 72 55 78 75 organic
DSPy
stanfordnlp/dspy
25,000 73 80 72 52 75 78 organic
SWE-Agent
princeton-nlp/SWE-agent
15,000 70 78 65 48 72 72 organic
OpenHands
All-Hands-AI/OpenHands
55,000 68 75 70 45 65 68 organic
LangGraph
langchain-ai/langgraph
20,000 67 76 70 45 68 72 steady
AutoGen
microsoft/autogen
50,000 66 68 75 42 60 70 organic
CrewAI
crewAIInc/crewAI
30,000 62 72 60 40 62 58 steady
FunSearch
google-deepmind/funsearch
1,500 62 45 82 30 70 80 organic
Reflexion
noahshinn/reflexion
3,158 58 55 60 38 65 60 steady
MetaGPT
FoundationAgents/MetaGPT
50,000 56 58 68 35 55 65 viral
Devika
stitionai/devika
22,000 30 35 50 12 30 38 suspicious
AutoGPT
Significant-Gravitas/AutoGPT
175,000 28 32 55 8 25 42 viral
organic

OpenEvolve

74

AlphaEvolve 开源复现,学术驱动。增长虽慢但 fork 有效性较强(大量实际使用),issue 讨论有深度;适合优先复核。

★ 6,358 未达 10K
organic

DSPy

73

斯坦福 NLP 声明式编程范式创新。增长曲线最健康之一。SIMBA 自我反思优化器是实质贡献。学术+工程双高。

★ 25,000 1K→10K: 180天
organic

SWE-Agent

70

Princeton NLP 出品,ICLR 2025 Oral。ACI 设计有创新。SWE-bench SOTA 背书。增长健康,学术驱动。

★ 15,000 1K→10K: 90天
organic

OpenHands

68

原 OpenDevin,学术+社区双驱动。ICLR 接收论文增加了可信度。沙箱环境设计实用。增长曲线平滑健康。

★ 55,000 1K→10K: 90天
steady

LangGraph

67

LangChain 生态核心,Pregel 引擎架构扎实。受益于 LangChain 品牌溢出效应,但本身有技术深度。

★ 20,000 1K→10K: 120天
organic

AutoGen

66

微软品牌背书,学术渊源(Penn State + 微软研究院)。Actor 模型架构严谨。Magentic-One 是实质研究贡献。增长健康。

★ 50,000 1K→10K: 60天
Visibility signal radar

传播信号雷达

雷达只展示 adoption/maintenance proxy,不代表代码质量、产品质量或学术价值。

AutoGPT (28)

活跃
32
多样性
55
Fork
8
Issue
25
PR
42

MetaGPT (56)

活跃
58
多样性
68
Fork
35
Issue
55
PR
65

CrewAI (62)

活跃
72
多样性
60
Fork
40
Issue
62
PR
58

DSPy (73)

活跃
80
多样性
72
Fork
52
Issue
75
PR
78

OpenEvolve (74)

活跃
82
多样性
72
Fork
55
Issue
78
PR
75

Devika (30)

活跃
35
多样性
50
Fork
12
Issue
30
PR
38
竞品对比矩阵

横向对比

项目 Stars Forks 贡献者 Star/Contrib 代码维护线索 社区 文档 营销度 类型
AutoGPT 175,000 45,000 820 213 ●●●●●○○○○○ ●●●●○○○○○○ ●●●●●●○○○○ high community
OpenHands 55,000 6,500 380 145 ●●●●●●●●○○ ●●●●●●●●●○ ●●●●●●●●○○ low community
MetaGPT 50,000 6,000 350 143 ●●●●●●●○○○ ●●●●●●●○○○ ●●●●●●●●○○ medium chinese-team
AutoGen 50,000 6,000 420 119 ●●●●●●●●○○ ●●●●●●●●○○ ●●●●●●●●●○ low big-tech
CrewAI 30,000 4,000 280 107 ●●●●●●●○○○ ●●●●●●●●○○ ●●●●●●●●○○ medium startup
DSPy 25,000 2,000 180 139 ●●●●●●●●●○ ●●●●●●●○○○ ●●●●●●●●●○ low academic
Devika 22,000 3,000 120 183 ●●●●○○○○○○ ●●●○○○○○○○ ●●●●●○○○○○ high startup
LangGraph 20,000 2,500 210 95 ●●●●●●●●○○ ●●●●●●●●○○ ●●●●●●●●●○ medium startup
SWE-Agent 15,000 1,500 95 158 ●●●●●●●●○○ ●●●●●●●○○○ ●●●●●●●○○○ low academic
CAMEL-AI 12,000 1,300 150 80 ●●●●●●●○○○ ●●●●●●●○○○ ●●●●●●●○○○ low academic
OpenEvolve 6,358 1,018 55 116 ●●●●●●●●○○ ●●●●●●●○○○ ●●●●●●●○○○ low community
FunSearch 1,500 130 25 60 ●●●●●●●●●○ ●●●●●○○○○○ ●●●●●●●●○○ low deepmind
分组对比

四维对比分析

AutoGPT vs MetaGPT vs CrewAI

三大 Agent 框架横向对比

AutoGPT Star 数最高但传播异常也最明显;MetaGPT 兼具论文与商业传播线索;CrewAI 社区活跃线索较强。三者代表 Agent 框架的三种增长范式。

平均评分: 48.7 Star/Contrib: 154 代码维护线索: 6.3/10
DeepMind vs 开源社区

品牌加持 vs 草根力量

DeepMind 项目 Star 偏低但研究证据较强。开源社区项目(OpenHands, OpenEvolve)在活跃度和实用信号上可能超过大厂项目。品牌背书 ≠ 社区活力。

平均评分: 65.5 Star/Contrib: 105 代码维护线索: 8.5/10
中国团队 vs 海外团队

地域/文化驱动的增长差异

中国团队项目(MetaGPT, AgentVerse)依赖微信/微博传播,初期增速快但国际化受限。海外项目更依赖 HN/Reddit 自然传播。增长模式差异明显但各有优势。

平均评分: 47.5 Star/Contrib: 128 代码维护线索: 6.5/10
学术驱动 vs 营销驱动

论文背书 vs KOL 传播

学术项目增长慢但维护线索可能更稳。营销驱动项目爆发快但也可能快速衰减(Devika:20K stars → 3个月后几乎停更)。论文引用量和维护证据应与 Star 一起复核。

平均评分: 49.8 Star/Contrib: 157 代码维护线索: 6.8/10
传播链

Star 增长时间轴

AutoGPT

2023-03-30
GitHub 项目创建

★ 0

2023-03-31
Twitter/X @svblica 首次分享演示视频

★ 1,200 (+1,200)

2023-04-01
Twitter/X Elon Musk 点赞转发

★ 15,000 (+13,800)

2023-04-02
HackerNews 登顶 HN Front Page

★ 38,000 (+23,000)

2023-04-02
Reddit r/artificial + r/singularity 热帖

★ 50,000 (+12,000)

2023-04-03
YouTube 多个 KOL 制作演示视频

★ 70,000 (+20,000)

2023-04-04
WeChat/微博 中文科技媒体批量报道

★ 90,000 (+20,000)

2023-04-10
GitHub Trending #1 连续 14 天

★ 130,000 (+40,000)

2023-05-01
Twitter/X 增长放缓,讨论转向批评

★ 155,000 (+25,000)

2024-01-01
GitHub 稳定在 175K,日均增长 <50

★ 170,000 (+15,000)

炒作信号

  • 3天内从0→50K stars,非自然增速
  • 大量 "show HN" 式 KOL 引流
  • 中文媒体跟风翻译报道
  • 90%+ star 用户无后续 GitHub 活动
  • Issues 中大量重复/模板式提问
  • Stars/contributor ratio = 213(远超正常范围 50-100)

自发信号

  • 项目有原创 TAO 循环概念
  • 后续确实建立了完整 Agent 平台
  • 820+ 贡献者中有核心维护团队
  • Docker + React 前端有实质工程

MetaGPT

2023-06-01
GitHub 项目创建

★ 0

2023-06-15
arXiv 论文发布 "MetaGPT: Meta Programming for Multi-Agent"

★ 3,000 (+3,000)

2023-06-20
Twitter/X 多语言 Agent 框架引起关注

★ 12,000 (+9,000)

2023-06-22
HackerNews HN 讨论帖

★ 18,000 (+6,000)

2023-06-25
WeChat 中文 AI 圈大规模传播

★ 25,000 (+7,000)

2023-07-01
GitHub Trending #1 (Python)

★ 32,000 (+7,000)

2024-01-01
ICLR AFlow Oral 论文

★ 42,000 (+10,000)

2025-01-01
GitHub SELA + AFlow 子项目上线

★ 48,000 (+6,000)

炒作信号

  • 中文 AI 媒体集中报道
  • Stars/contributor ratio = 143(偏高)
  • 早期增长依赖论文+媒体组合传播

自发信号

  • 有 ICLR Oral 论文支撑
  • SOP(Team) 理念有学术创新
  • SELA (MCTS+LLM) 和 AFlow 是实质研究
  • 350+ 贡献者,国际化程度高

CrewAI

2023-10-01
GitHub 项目创建

★ 0

2023-10-15
Twitter/X João Moura 正式发布

★ 2,000 (+2,000)

2023-11-01
LinkedIn 企业 AI 社区讨论

★ 5,000 (+3,000)

2023-12-01
YouTube 教程系列获关注

★ 10,000 (+5,000)

2024-03-01
GitHub Crew+Flow 双架构发布

★ 18,000 (+8,000)

2024-09-01
Twitter/X 100K 认证开发者里程碑

★ 25,000 (+7,000)

2025-01-01
GitHub 稳定增长

★ 30,000 (+5,000)

炒作信号

  • 100K 认证开发者数字可能含水分
  • 早期依赖 LinkedIn 传播(偏营销渠道)

自发信号

  • 零依赖设计降低了真实使用门槛
  • 从 0→10K 用了 60 天(非爆发式)
  • Stars/contributor ratio = 107(健康范围)
  • 连续 18 个月保持高 release cadence

Devika

2024-03-01
GitHub 项目创建

★ 0

2024-03-02
Twitter/X "Open Source Devin Alternative" 话题引爆

★ 5,000 (+5,000)

2024-03-02
HackerNews Devin 对比帖引发讨论

★ 12,000 (+7,000)

2024-03-03
Reddit r/LocalLLaMA 热帖

★ 16,000 (+4,000)

2024-03-05
GitHub Trending #1

★ 20,000 (+4,000)

2024-06-01
GitHub 活跃度急剧下降

★ 21,500 (+1,500)

2025-01-01
GitHub 几乎停止维护

★ 22,000 (+500)

炒作信号

  • 5天内从0→20K stars,纯蹭 Devin 热度
  • Stars/contributor ratio = 183(极高)
  • 3个月后活跃度几乎归零
  • issue 有效性极低,大量 "when will you add X"
  • PR 合并率仅 38%
  • 典型 "Me-too" 项目——赶上热潮但缺乏持续投入

自发信号

  • 多 Agent 流水线设计有一定工程价值
  • 8+ LLM 后端支持有实用性
可视化

传播链流程图

flowchart LR
    A[GitHub 创建] --> B[Twitter/X 首发]
    B --> C{"是否有 KOL 转发?"}
    C -->|有| D[HN Front Page]
    C -->|无| E[缓慢自然增长]
    D --> F[Reddit 热帖]
    F --> G[YouTube 教程]
    G --> H[中文媒体翻译]
    H --> I[Star 爆发]
    E --> J[学术引用]
    J --> K[长期稳步增长]
    I --> L[高 Star 待复核]
    K --> M[低 Star 仍可能有研究价值]

    style L fill:#ef4444,stroke:#ef4444,color:#fff
    style M fill:#10b981,stroke:#10b981,color:#fff
graph TD
    subgraph 炒作驱动
        A1[AutoGPT 175K] --> A2[Devika 22K]
        A1 ---|3天→50K| A3[爆发式增长]
        A2 ---|5天→20K| A3
        A3 --> A4["低 Fork 有效性 / 低 Issue 有效性 / Stars/Contrib > 150"]
    end
    subgraph 稳健增长
        B1[CrewAI 30K] --> B2[AutoGen 50K]
        B1 ---|30天→1K| B3[自然增长]
        B2 ---|21天→1K| B3
        B3 --> B4["高社区健康度 / 高 PR 合并率 / Stars/Contrib < 120"]
    end
    subgraph 学术驱动
        C1[DSPy 25K] --> C2[SWE-Agent 15K]
        C1 ---|90天→1K| C3[论文驱动增长]
        C2 ---|30天→1K| C3
        C3 --> C4["较强代码维护线索 / 较强 Issue 有效性 / Stars/Contrib < 160"]
    end

    style A3 fill:#ef444480,stroke:#ef4444
    style B3 fill:#f59e0b80,stroke:#f59e0b
    style C3 fill:#10b98180,stroke:#10b981
方法论

Star 传播信号评分草案

这个评分草案没有经过外部校准,不应作为项目质量、代码质量或学术价值判断;它只帮助发现传播异常和下一步复核顺序。

评分维度与权重

维度权重数据来源说明
Star 活跃度20%GitHub API90天内活跃 stargazer 占比
贡献者多样性20%GitHub APIGini 系数反转,避免单人/单组织垄断
Fork 有效性20%GitHub API有 commit 的 fork 占比(排除空 fork)
Issue 有效性20%GitHub API + NLP非灌水/非模板 issue 占比
PR 合并率20%GitHub APImerged / total PRs 比例

炒作检测阈值

指标绿色 (< 50)黄色 (50-150)红色 (> 150)
Stars/Contributor健康可能偏高炒作嫌疑
0→1K 天数> 30 天7-30 天< 7 天
Fork 有效性> 40%20-40%< 20%
Issue 有效性> 60%40-60%< 40%

声明:本分析基于公开 GitHub 数据估算,评分模型为启发式复核用途,不代表对任何项目的价值判断。 Star 数是可见性指标而非质量指标。建议研究者同时参考论文引用量、代码实际使用量、benchmark、失败样本和社区讨论深度。 本报告将作为 arXiv 论文「Self Evolving AI: A Survey」的补充材料。