论文
ClawArena:不断变化的信息环境中的人工智能代理基准测试
ClawArena: Benchmarking AI Agents in Evolving Information Environments
摘要
作为持久助手部署的人工智能代理必须随着信息环境的发展保持正确的信念。在实践中,证据分散在不同的来源中,这些来源常常相互矛盾,新的信息可能会使早期的结论无效,并且用户偏好是通过更正而不是明确的指示来体现的。现有的基准在很大程度上假设静态的、单一权限的设置,并且不评估代理是否能够跟上这种复杂性。我们推出了 ClawArena,这是一个在不断变化的信息环境中评估人工智能代理的基准。每个场景都维护一个完整的隐藏 真值,同时仅将代理暴露于跨多通道会话、工作区文件和分阶段更新的嘈杂、部分且有时相互矛盾的跟踪。评估围绕三个耦合的挑战进行:多源冲突推理、动态信念修正和隐性个性化,它们的相互作用产生了 14 类问题分类。两种问题格式,多项选择(集合选择)和基于 shell 的可执行检查,测试推理和工作空间基础。 ClawArena 包含 12 个多回合场景,跨越 337 轮评估,进行 45 次动态更新,跨五个代理框架和来自专有、社区可访问和自托管来源的 18 种语言模型进行评估。实验表明,模型能力在模型中占 29 分的分数范围,而框架设计则占到了 24 分的范围,MetaClaw 的技能叠加可靠地提高了分数而不降低准确性,并且信念修正难度由更新设计策略而不是更新量决定。代码可在 https://github.com/aiming-lab/ClawArena 获取。