论文
AgentCompass:智能体能力的统一评估基础设施
AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
摘要
随着大语言模型(LLM)演化为自主智能体,对统一评估基础设施的需求变得关键。但当前评估管线高度碎片化且紧耦合——妨碍可复现性并造成冗余工程。为此我们提出AgentCompass:一个开源、轻量、可扩展的LLM智能体评估基础设施。AgentCompass把评估过程组织在三个独立组件周围——基准、治控与环境——从而支持灵活配置而无需重新实现复杂执行逻辑。此外它具备容错的异步运行时与全面的轨迹分析工具,透明诊断奖励黑客等细微失败模式。原生支持跨五个能力维度的20多个基准,AgentCompass为社区提供可扩展、可复现的基础设施以推进智能体研究。
