论文

RPA-Check:动态大模型角色扮演Agent的多阶段自动评测框架

RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents

模型评测评测方法与指标

摘要

大语言模型(LLM)在交互系统中的快速普及,使动态、开放式角色扮演Agent(RPA)成为可能。然而,标准自然语言处理指标难以衡量角色遵循、逻辑一致性和长期叙事稳定性,因而此类Agent的评测仍然困难。本文提出RPA-Check,一个在复杂、约束密集环境中客观评估大模型角色扮演Agent的多阶段自动框架。方法包含四个步骤:一是定义评估维度,建立高层次定性行为标准;二是扩展要求,将其转换为细粒度布尔检查项;三是语义筛选,确保指标客观、无冗余,并可独立评估各Agent;四是采用大模型评审,通过思维链核验为Agent的角色忠实度评分。研究将框架应用于面向司法训练的严肃游戏LLM Court,测试了多个量化后的本地模型。五种法律场景的实验表明,该框架能识别模型规模、推理深度与运行稳定性之间的细微权衡。结果尤其发现,参数规模与程序一致性存在反向关系:经过适当指令微调的较小模型(8–9B),可能优于容易受到迎合用户偏差或谄媚倾向影响的大模型。RPA-Check为专业领域生成式Agent的后续评测提供了标准化、可复现的度量方法。