论文

超越二元正确性:长期智能体对主观企业任务的尺度评估

Beyond Binary Correctness: Scaling Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks

智能体系统智能体互操作协议Agent任务评测MCP长程任务评测

摘要

大语言模型在数学、编程等客观可验证任务上表现出色,这类任务的评估可归结为单元测试或单一正确答案。相比之下,现实中的企业工作往往是主观且依赖情境的:成败取决于组织目标、用户意图,以及在长程多工具工作流中产出的中间成果的质量。我们提出 LH-Bench,一种三支柱评估设计,超越二元正确性,对主观企业任务上的自主长程执行进行评分。三大支柱是:(i) 以专家为依据的评分量表,为 LLM 评审提供对主观工作打分所需的领域上下文;(ii) 精心整理的标准答案成果(ground-truth artifacts),支持逐步奖励信号(如内容任务的章节级标注);(iii) 用于收敛验证的成对人类偏好评估。我们表明,领域专家撰写的量表比 LLM 撰写的量表提供可靠得多的评估信号(kappa = 0.60 对 0.46),且人类偏好判断确认了同样的头部区分度(p < 0.05),证明以专家为依据的评估可以在不牺牲可靠性的前提下扩展。我们公开发布数据集,并报告两个环境上的结果:Figma 转代码(通过 MCP 调用 Figma API 的 33 个真实 .fig 任务)和程序化内容(在一个日活 30+ 用户的课程平台上,41 门课程共 183 个单独评估的章节)。

LH-Bench:面向主观企业任务的长程智能体技能锚定评估:论文配图
图 2. 用于编程内容的 SME 注释界面。左:资料室中的源文档。中心:行号文档查看器,具有可折叠部分和突出显示引用交互。右:带有附加源跨度和全局设计注释的章节定义。