论文
OTROPE:大语言模型的基于最优传输的鲁棒离策略评估
OTROPE: Optimal Transport-based Robust Off-policy Evaluation for Large Language Models
摘要
大语言模型 (LLM) 的可靠评估对于其开发和部署至关重要,但通常成本高昂、存在风险且难以安全地在线执行。我们研究大语言模型的离政策评估,其中来自行为模型的有限人类标记数据用于评估较新的目标大语言模型。这种设置具有挑战性,因为标签稀缺,行为目标分布变化很常见,而且黑盒大语言模型通常无法获得响应可能性。我们提出了基于最佳传输的鲁棒off-policy评估(OTROPE),这是一种无似然评估,通过最佳传输在语义空间中执行分布校正,以将标记的行为策略样本与未标记的目标策略样本对齐。 OTROPE 将修正的人类标记残差与代理预测变量相结合,产生双重鲁棒式评估,无需行为策略建模或密度比估计。我们从理论上描述了基线评估器在 LLM 分布偏移下失败的原因,并在重新加权的行为分布或代理预测器收敛时建立 OTROPE 的一致性和收敛率。对综合和真实 LLM 评估任务的实验表明,OTROPE 始终优于基线,同时使较弱的 LLM 评估者的整体能够接近甚至有时超越较强的评估者。代码可在 https://github.com/LinerXiang/OTROPE. 获取