论文
用于同伴代理评估的披露门控用户模拟
Disclosure-Gated User Simulation for Companion-Agent Evaluation
摘要
使用 大语言模型 来玩用户现在是可扩展评估的标准。它有一个反复诊断的失败:模拟用户过度合作,因此被测系统可以根据它提出的问题数量而不是让用户愿意说话来评分。我们通过披露门调节关于同伴智能体行为的信息来回答:它的状态是一个由五个有序门组成的梯子,合并到三个可观察的深度层上。我们指定、消除和审核它,并根据该规范训练用户模拟器。门控行为是从训练语料库的合成分支中学习的,而真实分支则提供人们如何说话和反应;训练后,模拟器不需要在运行时被告知每个项目位于哪个门后面。门是环境的承载组件:在已发布的同伴代理基准 (CompanionBench) 的英语语料库上,一旦训练不再说明每个项目位于哪个门后面,12 个受测试系统的最大排名位移就超过了在新种子下重新运行该环境所设置的噪声带,而每个系统的分数没有显示出可检测到的变化。我们规定了两个接受标准:排名必须保持顺序,并且绝对分数必须是规模稳定的。在我们检查的候选者中,只有一个通过了两项测试——我们发布的模拟器——并且其排行榜与基准测试的原始模拟器的相关性为 0.993。相比之下,当模拟器几乎没有改变排名时,提示前沿模型,同时将每个分数向上移动——任何单独检查排名的人都看不到这种变化。我们指定的环境是基准测试已经使用的环境。该出版物用大约四百字描述了该机制,我们提供了它所缺乏的内容:规范、消融、人体研究、阴性对照和下游敏感性分析。