论文
自生成文本识别:LLM 评估中的质量启发式、跨任务转移和下游偏差
Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation
摘要
自生成文本识别(SGTR)——LLM 识别其自身输出的能力——对依赖 LLM 作为评估器或监控器的 AI 防护措施带来风险:LLM 可能会识别同一模型的其他副本的输出,并做出有偏见的判断或直接串通。先前的研究对于当前模型是否具有重要的 SGTR 功能得出了相互矛盾的结论。我们通过确定导致不同结果的关键实验设计选择(我们称之为操作化)来解释这些分歧。通过评估六种表示操作和四种任务域操作的 13-21 模型,我们发现准确性随评估格式(文本的成对评估与单独评估)、对话格式(在用户标签中呈现候选文本与助理标签)以及用于生成候选文本的任务域(例如,编码与摘要)的不同而有很大差异。我们证实了之前的观察结果,即质量启发式模型(将作者身份归因于他们认为更高质量的文本的模型)是一个主要的混淆因素。我们还发现,通过对一种操作进行监督的 微调 (SFT) 来提高模型的 SGTR 性能可以推广到其他操作,并且当模型在 AlpacaEval 框架中充当法官时,可以增加模型对其自身输出的偏好。我们的结果表明,尽管存在混淆,但一些模型具有实用的 SGTR 功能,并且在设计安全关键型人工智能应用程序时应监控和考虑 SGTR。