论文

$\texttt{YC-Bench}$:对人工智能代理进行长期规划和一致执行的基准测试

$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution

智能体系统Agent任务评测

摘要

随着 LLM 智能体处理日益复杂的任务,一个关键问题是他们是否能够长期保持战略一致性:在不确定性下进行规划,从延迟的反馈中学习,并在早期错误复合时进行调整。我们引入了$\texttt{YC-Bench}$,这是一个基准测试,它通过让代理在一年的时间内运行数百轮的模拟启动来评估这些功能。代理必须在部分可观察的环境中管理员工、选择任务合同并保持盈利能力,在这种环境中,敌对的客户和不断增长的工资会给糟糕的决策带来复杂的后果。我们评估了 12 个模型,包括专有模型和开源模型,每个模型有 3 个种子。只有三个模型持续超过 20 万美元的起始资金,其中 Claude Opus 4.6 的平均最终资金最高,为 127 万美元,其次是 GLM-5,为 121 万美元,推理成本低 11 倍。 Scratchpad 的使用是跨上下文截断保存信息的唯一机制,是成功的最强预测因素,而对抗性客户端检测是主要的失败模式,占破产的 47\%$ 美元。我们的分析表明,前沿模型仍然会因过度并行化等不同的故障模式而失败,这表明了长期性能的能力差距。 $\texttt{YC-Bench}$ 是开源的、可复制的、可配置的。