论文

NashEval:按上下文与集体偏好评估LLM能力

Context-dependent agent evaluation with orthogonal equilibrium learning

模型评测评测方法与指标

摘要

许多应用要求在上下文信息——例如提示、任务或用户群体——条件下评估Agent。我们研究如何利用离线反馈完成这种上下文相关评估。现有评分模型,如Bradley-Terry,假设偏好存在传递排序;当人类判断异质时,这无法反映集体偏好。受社会选择理论启发,我们把评估表述为两个玩家之间的上下文博弈,各自选择Agent分布,争取获得比对手更多的集体偏好。纳什均衡的支撑集由此定义特定上下文中的获胜集合。但从离线日志学习特定上下文均衡十分困难,因为每个上下文只揭示部分Agent的人类反馈,朴素代入估计因此可能有偏。为应对这些挑战,我们提出NashEval,一个稳健上下文均衡学习的通用框架。NashEval先为描述博弈的上下文收益矩阵构建去偏估计,再以专门设计的正交损失学习从上下文到均衡的映射,无需为每个上下文单独求解博弈。理论上,收益矩阵背后干扰函数的估计误差,只通过高阶项影响学得均衡的风险,即可利用性。在多种实验中,NashEval提高均衡学习的鲁棒性,并在不同上下文中持续识别表现最好的Agent集合。