论文

TRACE Bench:任务驱动的角色扮演代理清单评估

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

模型评测评测方法与指标

摘要

角色扮演评估不应该只给出一个分数:它应该揭示哪些角色要求被测试了,哪些失败了,以及哪些对话证据支持了判断。我们提出了 TRACE Bench,一个任务驱动的代理检查表评估框架。它将每个角色配置文件离线分解为固定的清单,然后使用用户代理与目标角色扮演模型自然地对话,同时根据模型响应私下更新清单状态。因此,分数可以追溯到清单项目和支持对话轮次,而不是黑盒整体印象。对于覆盖率交叉验证,我们根据相同的角色派生清单审核了 MiniMax 角色扮演基准中发布的 M2 自由对话记录。发布的免费聊天记录仅覆盖了 73.74% 的关键角色描述点,而 TRACE Bench 在更少的轮次内达到了 99.91% 的覆盖率。鲁棒性实验显示在重复运行和用户代理替换下排名稳定。 TRACE Bench 报告了 26 个模型的总体排名以及功能细分和清单跟踪。它还支持闭环基准演化,提取在失败跟踪中被证明有效的验证方法,以便以后的评估可以更可靠地引出和检查观察到的故障模式。