AgentPulse:用于评估部署中AI智能体的连续多信号框架
AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment
摘要
静态基准衡量的是AI智能体在固定时点能做什么,却无法衡量它们在部署中如何被采用、维护与体验。我们提出AgentPulse,一个持续评估框架,它从GitHub、软件包注册表、IDE市场、社交平台和基准排行榜的18个实时信号中聚合出四个因子(基准性能、采用信号、社区情绪与生态系统健康度),对横跨10个工作负载类别的50个智能体打分。三项分析为该框架提供了依据。四个因子捕获的信息大体互补(n=50;$ρ_{\max}=0.61$为Adoption-Ecosystem,其余均$|ρ| \leq 0.37$)。一项控制循环性的检验(n=35)显示,不含任何GitHub衍生信号的“基准+情绪”子复合指标,能预测它并未聚合的外部采用代理指标:GitHub星数($ρ_s=0.52$,$p<0.01$)与Stack Overflow问题量($ρ_s=0.49$,$p<0.01$);VS Code安装量($ρ_s=0.44$,$p<0.05$)仅作说明性报告,因为35个智能体中只有11个安装量非零。在有公开SWE-bench分数的n=11子集上,综合排名与仅基准排名几乎不相关($ρ_s=0.25$;11个智能体中9个位次变动至少2名),其成因是该子集内闭源高能力智能体之间强烈的采用-能力负相关。这正是我们把框架的有效性主张建立在更广的n=35检验而非SWE-bench重合部分之上的原因。AgentPulse揭示了基准所缺失的部署信号;它是一种方法论,而不是真值排名。框架、全部采集信号、评分输出与评估工具(evaluation harness)均以CC BY 4.0发布。
