论文

ASTRA-bench:在个人用户情境下评估工具使用智能体的推理与行动规划

ASTRA-bench: Evaluating Tool-Use Agent Reasoning and Action Planning with Personal User Context

智能体系统Agent任务评测

摘要

下一代 AI 必须管理海量个人数据、多样化工具和多步推理,但大多数基准仍然无情境且只有单轮。我们提出 ASTRA-bench(Assistant Skills in Tool-use, Reasoning & Action-planning),一个独特地将随时间演化的个人情境、交互式工具箱和复杂用户意图统一起来的基准。我们的事件驱动流程生成覆盖四位主人公的 2,413 个场景,以纵向生活事件为基础,并按指涉、功能和信息复杂度标注。对最先进模型(如 Claude-4.5-Opus、DeepSeek-V3.2)的评估显示,其在高复杂度条件下性能显著下降,其中参数生成(argument generation)成为主要瓶颈。这些发现暴露了当前智能体在凌乱的个人情境中落实推理并编排可靠多步计划能力上的关键局限。我们随完整执行环境和评估脚本一起发布 ASTRA-bench,为开发真正情境感知的 AI 助手提供诊断测试平台。

ASTRA-bench:在个人用户情境下评估工具使用智能体的推理与行动规划
图2:来自我们生成工作流的一个事件(Event)及其投影产物(Projected Artifacts)的示例