论文

语言模型无法遵循扩展规则

Language models fail at extended rule following

模型评测模型行为与机制分析

摘要

大语言模型 非常有能力通过检索、重组和关注长上下文中的信息来回答难题。对于代理任务,需要额外的功能:在重复应用规则的同时保留精确的状态。我们发现跨语言模型不存在这种可靠性。为了进行演示,我们查询了 126 个主要模型变体,其任务是对一长串重复字符进行计数,我们发现它们都无法准确地计数超过依赖于模型、语法敏感的计数容量阈值。即使模型大小、推理时间计算和外部工具不断增加,失败也会突然出现并持续存在。机械探测表明,模型通常使用有限数量的内部状态来模拟计数,一旦这些状态耗尽就会失败。此外,这些状态是执行无法计数的复杂任务的基础。这些结果表明,自主代理需要全新的模型架构才能实现真正可靠的规则遵循能力。