论文

论即时条件语言模型作为通用学习者的局限性

On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners

模型评测模型能力评测

摘要

大语言模型 (LLM) 经常被描述为能够解决任意任务的通用求解器。我们认为,这种观点忽视了一个基本限制:语言是用于传达任务信息的压缩且容量有限的界面。将用户-系统交互建模为双层 \emph{cheap-talk} 游戏,我们分析潜在任务如何编码为提示并在对齐和安全约束下重新解释。我们引入了一种将任务推理与执行分离的概念分解,并推导了 PAC-Bayes 界限,将有限样本估计误差与不可约的结构限制区分开来。我们的第一个主要结果建立了一个 \emph{表达性底线}:语言充当容量有限的通信渠道,每当任务族的信息复杂性超过该通道的容量时,不同的任务就不可避免地变得难以区分,从而导致严格的正错误底线,无法通过单独的附加数据、优化或模型缩放来消除。然后,我们建立一个\emph{目标失准下限}:当对齐约束限制可接受的输出集时,用户理想分布可能位于可行类之外,从而引起不可约的失真。总之,这些结果得出了一个正式的否定结论:提示条件 LLM 并不是单独通过提示来解决通用问题,因为存在一些任务族,即使在无限数据状态下,也证明无法实现正确的行为。更广泛地说,我们的分析表明,基于提示的概括的局限性源于信息受限的沟通和一致性受限的目标。这表明自然语言之外的接口,包括多模式观察和外部存储器,可以通过增加系统可用的任务相关信息来减少固有的 LLM 限制。