论文

DAREBench:面向部署的可靠Agent模型评测

DAREBench: Deployment-Aware and Reliable Evaluation of Models as Agents

智能体系统Agent任务评测

摘要

随着大型语言模型从问答系统发展为通用智能体,评估必须超越静态答案的正确性,以评估多模态感知、多步骤执行、工具使用和工件交付。然而,现有的基准通常与特定的任务类型、执行环境或评分协议相关,限制了它们的可比性、可解释性和部署决策的可靠性。我们推出了 DAREBench(模型作为智能体的部署感知和可靠评估),这是一个旨在捕获工作负载变化并支持可靠的智能体评估的基准。 DAREBench 构建在共享的 OpenClaw 执行环境上,将从 22 个源基准中选择和改编的 233 个任务组织成由输入模式和执行形式定义的 2×3 美元工作负载矩阵,并在基于合同的统一协议和基于证据的评分审核下对其进行评估。我们评估了 7,587 个模型中的 23 个商业 API 模型和 12 个本地部署的开放权重模型——任务运行、报告准确性和Token消耗以及 API 模型的参考成本。结果表明,没有一个模型能够主导所有工作负载组,文本和多模态任务表现出不同的准确性——成本权衡,本地开放权重模型在多个组中具有竞争力,但总体上仍落后于前沿商业模型。这些发现表明,智能体部署和模型选择应考虑工作负载配置文件、部署模式和准确性 - 成本权衡,而不是依赖于单一的总体分数。

DAREBench:面向部署的可靠Agent模型评测:论文配图
图 1:(a) 文本和 (b) 多模态任务模型的准确性与成本权衡。标签显示每个任务的平均标记;成本使用对数标度。虚线标记帕累托边界:(a) 中的 MiMo-V2.5、MiMo-V2.5-Pro 和 GPT-5.5,(b) 中的 MiMo-V2.5、GPT-5.4、Gemini-3.1-Pro 和 Claude-Opus-4.8。