论文

为多轮业务Agent设计可靠的LLM评审衡量系统

Designing Reliable LLM-as-a-Judge Measurement Systems for Multi-Turn Business Agents

模型评测评测方法与指标

摘要

许多LLM作为评审的评估在固定的任务定义下对固定的输出进行评分。相反,生产多轮业务Agent需要一个维护的测量系统:正确性取决于特定于业务的事实和程序,结果会在轮次中出现,失败必须归因于Agent能力或业务知识缺失,然后才能采取行动。我们提出了一种涵盖评估规范、模块化LLM评审、保留意图的用户模拟和人机参与治理的综合方法。该规范定义了对话级最终状态和可操作的故障所有权。原子评审共享版本化证据并提供明确的聚合图。模拟器仅在任务保存和稳定性检查后发布。独立的人工审核评估测量保真度,更新分层参考集,并将分歧转至标签更正、指南修订或判断改进。生产研究表明,系统级保真度在重复审核中得到提高,人工审核员和自动评审在共享反馈循环下共同改进,并且他们的组合工作流程在报告的任务完成设置中具有最强的描述性性能。由于这些研究是观察性的,并且人类参考本身需要修改,因此这些研究结果证明了操作上的有用性,而不是因果或普遍的优越性。该贡献是一个实用框架,随着评估系统及其证据的发展,使多轮Agent测量变得可靠、可操作和可维护。