论文
日志的部分见证:混杂模型选择下语言模型生成的评估
The Partial Testimony of Logs: Evaluation of Language Model Generation under Confounded Model Choice
摘要
当模型选择混乱时,根据使用日志对语言模型进行离线评估会出现偏差:影响使用哪个模型的相同用户端因素也可能影响如何判断其输出,因此记录分数的原始比较混合了自选群体,而不是估计共同的兴趣量。小型随机实验可以通过推翻模型选择来打破这种偏差,但在实践中,此类实验很少且成本高昂。我们研究了一种三源设计,该设计结合了用于规模的大型混杂观察日志(OBS)、用于无混杂评分的小型随机实验(EXP)以及在缓存上下文上重放候选模型的离线模拟器(SIM)。我们的主要结果是一个识别定理,表明随机实验和模拟器足以恢复因果模型值;观察日志仅在之后输入,以减少估计误差,而不是使因果比较有效。在受控半合成验证和两个用于汇总和编码的实际任务缓存基准中评估六个估计器系列。没有一个家庭主宰每一个政权;相对绩效取决于公正 EXP 监督的数量以及目标奖励与 OBS 派生结构的吻合程度。