论文

$\pi$-Bench:评估长期工作流程中的主动个人助理座席

$\pi$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

个人助理智能体(如OpenClaw)的兴起,凸显了大语言模型在支持用户日常生活与工作方面日益增长的潜力。这些场景中的一个核心挑战是主动式协助,因为用户常以欠明确的请求开场,并对重要需求、约束或偏好避而不谈。然而,现有基准很少评估智能体能否在这些隐含意图被明确说出之前识别并对其采取行动,尤其是在用户需求逐渐浮现的持续多轮交互中。为填补这一空白,我们提出π-Bench,一个主动式协助基准,包含覆盖5个领域特定用户画像的100个多轮任务。通过纳入隐含用户意图、任务间依赖与跨会话连续性,π-Bench评估智能体在长交互中预判并满足用户需求的能力,在更贴近真实使用的长程轨迹中联合衡量主动性与任务完成度。实验表明:(1)主动式协助依然困难;(2)任务完成与主动性之间存在清晰区分;(3)先前交互对后续任务中主动意图的解析具有价值。

π-Bench:评估长程工作流中的主动式个人助理智能体:论文配图
图1:π-Bench总览:评测主动式个人助理在模糊指令下提问澄清能力的基准设定。