论文
按时间顺序:衡量语言模型表示过去的能力
Chronologic: Measuring Language Models' Ability to Represent the Past
摘要
语言模型是研究过去的有吸引力的工具。但为了相信模型提供的证据,研究人员需要知道它的反应是否符合所代表的时期。验证是具有挑战性的,因为这不是人们通常执行的任务,而且因为许多问题有多个正确答案。我们使用历史文本为 1831-1930 年英语语言环境的模型表示制定基准,依靠与多个基本事实和强干扰因素的成对比较,以适当分级的方式对最难的问题进行评分。我们发现生成性任务比判别性任务更难;事实上,推理模型通常可以识别它们自己生成的答案的弱点。虽然仅根据历史文本进行预训练的模型在通过答案可能性进行评估时处于领先地位,但它们无法与自由生成的商业模型竞争。我们测试的模型都还没有以完全有说服力的方式代表历史背景,但实现这一目标的进展是显而易见的。