论文
ClawMark:多回合、多天、多模式同事代理的现实世界基准
ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
摘要
语言模型代理越来越多地被用作持久的同事,在多个工作日为用户提供帮助。在此类工作流程中,周围环境可能会独立于代理而发生变化:新电子邮件到达、日历条目发生变化、知识库记录更新,并且证据会出现在图像、扫描的 PDF、音频、视频和电子表格中。现有的基准测试没有充分评估此设置,因为它们通常在单个静态片段中运行并且很大程度上仍然以文本为中心。我们引入了 \bench{},这是围绕多轮多日任务构建的同事代理的基准、一个状态在轮次之间变化的有状态沙盒服务环境以及基于规则的验证。当前版本包含跨 13 个专业场景的 100 个任务,针对 5 个有状态沙盒服务(文件系统、电子邮件、日历、知识库、电子表格)执行,并由 1537 个确定性 Python 检查器对执行后服务状态进行评分;评分期间不会调用 LLM-as-judge。我们对七个前沿代理系统进行了基准测试。最强的模型达到了 75.8 的加权分数,但最好的严格任务成功率仅为 20.0\%,这表明部分进度很常见,而完整的端到端工作流完成仍然很少见。轮次分析表明,第一次外源环境更新后性能下降,突出表明适应不断变化的状态是一个关键的开放挑战。我们发布了基准、评估工具和构建管道,以支持可重复的同事-代理评估。