论文

抓到说谎者容易,清除诚实者很难:语言模型根据已验证的记录诊断损坏的奖励渠道

Easy to Catch a Liar, Hard to Clear an Honest One: Language Models Diagnosing a Corrupted Reward Channel from a Verified Record

模型评测模型行为与机制分析

摘要

从奖励中学习的代理必须相信任何报告这些奖励的内容。当报道突然发生变化时,要么世界变了,要么记者破产了。仅从报告来看,这些是无法区分的,强化学习理论表明,没有任何进一步的经验可以将它们区分开来。规定的逃逸是有关记者本身的更丰富的数据。我们询问一个冻结的语言模型是否会使用该数据,并准确地传递该数据。我们构建了一个双选项游戏,其中支付交换和撒谎的记者产生字节相同的历史。然后我们添加一条经过验证的记录:对一轮真实结果的独立检查,打印在记者对该轮的评论旁边。这一行就解决了这个问题。我们请来自两个家庭的三位大模特用一封信回答一个问题。记者到底是诚实的还是撒谎的?他们几乎完美地抓住了撒谎的记者。在我们尝试过的各种条件下都适用的 70B 级; 32B 型号采用一种措辞。他们清除诚实记者的频率要低得多,而且频率取决于不重要的事情。对轮数、信件和措辞进行平均后,在没有任何变化的情况下,72B 模型将诚实的记者称为骗子的概率为 38%,而在支出发生变化时,该模型的概率为 58%。来自第二个家庭的 70B 模特称诚实的记者为骗子,分别为 26% 和 48%。失败不是阅读失败,因为在没有任何改变的情况下,相同的模型得分为0.96到1.00,答案打印在提示中。哪个表面特征驱动它因家庭而异。对于 Qwen 型号,它是记录名称中的哪一个;对于 Llama 来说,它是代表“诚实”的字母。将记录添加到已经说明答案的提示中会使 Llama 不太可能给出该答案。我们在运行前对 58% 进行了预测:35%。失败的程度比我们预期的要大。