论文

在线Agent即裁判:面向交互智能体的情境生成评估

Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents

智能体系统Agent任务评测

摘要

评估 LLM 支持的交互式社交代理具有挑战性,因为社交相关行为不仅取决于孤立的输出,还取决于先前的交互、社会角色和下游行为。现有方法通常允许目标代理在环境中自由行动,然后对所得轨迹进行评分。然而,这种被动设置可能会错过只有在特定社会环境下才能观察到的功能;例如,如果没有出现分歧,冲突处理可能仍然未经检验。我们提出了在线代理作为法官,这是一种用于交互式社交代理的情境生成评估框架。在线代理作为法官部署一个现实世界中的评估代理,该代理通过环境的本机对话和动作协议与目标代理进行交互,主动引出与评估标准相关的情况。由此产生的轨迹为评估即时反应和后续行为提供了证据。在具有 32设计师编写的社会标准的生活模拟环境中,在线代理作为法官提高了标准覆盖范围和与人类标签的一致性,从而对被动方法无法观察到的行为产生更可靠的基于证据的评估。

在线Agent即裁判:面向交互智能体的情境生成评估:论文配图
图1:作为评估目标的生活模拟。 (a) 世界是一个拥有多个NPC的持久家园;重要的不是单一结果,而是目标代理(绿色)如何处理一系列小型社交情况。 (b) 每个代理在世界结构化协议上运行观察-计划-行动循环;在线法官与其中一位 NPC 参与同一循环。