论文

Claw-Anything:评测对用户数字世界拥有更广访问权限的常驻个人助理

Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World

智能体系统Agent任务评测长程任务评测

摘要

大语言模型智能体日益被设想为可访问用户数字世界中任何相关内容的常驻个人助理。然而当前系统只在该世界的狭窄切片上运行,限制了情境敏感推理与有效辅助。现有基准同样只提供部分用户状态,因此无法刻画这种宽广常驻设定下的性能。为填补这一空白,我们提出Claw-Anything,一个沿三个维度扩展智能体上下文的基准:长时程活动历史、相互依赖的后端服务,以及跨多设备的GUI与CLI整合交互。为实例化这一设定,我们通过多轮事件注入模拟数月的用户活动,产生复杂的世界状态和真实噪声,包括无关事件与冲突信号。智能体必须在丰富的上下文环境中推理,同时对这类噪声保持鲁棒。这一扩展范围也使主动辅助的评估成为可能,要求智能体预判用户需求并及时给出建议。实验显示GPT-5.5仅取得34.5%的pass@1,大幅低于以往基准,凸显了当前智能体能力与常驻个人助理需求之间的差距。随基准一同发布的还有一个自动化数据生成流水线,可产出2,000个训练环境并将基础模型提升23.7%,展示了可扩展数据基础设施的效用。

Claw-Anything:评测对用户数字世界拥有更广访问权限的常驻个人助理:论文配图
图 1:Claw-Anything 概述及其经验价值。左:Claw-Anything 为永远在线的个人助理提供了更广泛的访问用户数字世界的权限,涵盖服务、设备和长期事件流,从而扩大了它可以完成的任务范围。右图:在我们的数据管道的支持下,我们的模型在开放权重模型中实现了最佳 pass@1。黄色区域代表闭源模型,横轴不对应模型大小。