论文
StartupBench:在经市场验证的端到端工作流上评测通用智能体
StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
摘要
大语言模型(LLM)与智能体的最新进展显著提升了 AI 系统执行复杂任务的能力。但现有基准大多依赖研究者自选的任务,因此这种进步能否延伸到真实用户实际要求 AI 完成的工作仍不确定。我们提出 StartupBench,一个以经市场验证的 AI 初创产品为基础的端到端智能体基准。我们不从对有用智能体能力的预设假设出发定义任务,而是系统研究已被证实具有采用度的 AI 产品及其产品工作流与用户,以识别 AI 已建立实际需求的真实任务,覆盖多样的专业领域。我们将这些工作流转化为完整的面向交付物的任务,并用捕捉其复杂要求的细粒度评分细则评估。在统一智能体框架下评估的代表性模型中,即便最强的模型也仅成功完成 StartupBench 约 30% 的任务,尽管其在许多任务上取得大量部分进展。进一步分析发现,复杂指令遵循与领域专长等是失败的主要来源。我们的结果表明,许多经市场验证的工作流仍超出当前通用智能体的可靠能力范围,从而确立 StartupBench 作为衡量真实用户任务端到端完成进展的经验标尺。
