论文
LiveClawBench:在复杂的现实世界助理任务上对 LLM 代理进行基准测试
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
摘要
OpenClaw 风格的个人助理将 LLM 代理从孤立的工具使用扩展到开放式、有状态和个性化的软件环境。评估这些助手从根本上来说是一个保真度问题:基准测试必须忠实于真实助手任务的分布以及这些任务展开的环境的执行语义。现有的基准通常会在一个维度或另一个维度上失去保真度。它们的任务分布是由易于隔离、模拟和验证的内容决定的,低估了现实世界的困难,例如跨服务依赖、污染状态、隐式意图和运行时更改。他们的环境要么是实时的,但难以重现,要么是可重现的,但简化为端点级存根,以删除会话、工件、状态转换和下游副作用。我们推出了 LiveClawBench,这是一个围绕这种双保真度要求设计的基准测试。 LiveClawBench 将用于难度驱动任务构建的三轴复杂性框架与保留状态执行语义的可重现的全栈模拟应用程序相结合。 LiveClawBench 拥有跨 10 个领域的 134 个可执行案例和 22 个模拟服务,支持对现实代理任务进行受控、可扩展和因子级诊断评估。我们发布了基准测试资源:(1)Benchmark:https://github.com/Mosi-AI/LiveClawBench; (2)排行榜:https://mosi-ai.github.io/LiveClawBench/leaderboard/; (3)轨迹:https://huggingface.co/datasets/Mosi-AI/LiveClawbench-trajectories