论文

LLM摊销非保单评估

Amortized Off-Policy Evaluation for LLMs

模型评测模型训练预训练评测方法与指标

摘要

准确的评估对于选择要部署的LLM至关重要,但在实时流量上测试候选人会使真实用户暴露于未经审查的模型。因此,团队根据已部署模型生成的数据离线评估候选人。这就是离策略评估(OPE),它面临两个分配转变:随着模型在训练后更新,其响应与记录的响应有所不同(策略转变),以及判断它所依据的奖励定义随着业务需求而变化(奖励转变)。经典的 OPE 方法不适合这种持续部署设置,因为它们是按任务定义的,并且需要从头开始拟合每个新记录的数据集或奖励定义。为了解决这个问题,我们提出了 PFN-OPE,这是一种先验数据拟合网络,可以在上下文老虎机任务的分布中分摊 OPE。我们对由多个奖励函数评分的 LLM 响应池构建的任务进行一次预训练,其中两种转变都发生。在测试时,它将记录的数据集和每个提示的一个采样目标响应映射到单个前向传递中的值估计, 没有每个任务的拟合。在采用 Qwen、Llama 和 Gemma 策略的 HelpSteer2 和 UltraFeedback 上,PFN-OPE 在奖励转移设置中的所有测试配置中实现的误差比最佳基线低 2.0 到 9.3 倍。