论文
少样本示例诱导LLM使用上下文世界表征
Few-Shot Demonstrations Elicit the Use of In-Context World Representations in LLMs
摘要
大语言模型(LLM)作为智能体时,需要将观测到的数据纳入上下文,推断世界背后的潜在状态空间,并将其用于下游预测。然而先前工作表明,LLM 难以在图追踪任务上使用在上下文中学习到的表征——模型需要构建刻画数据生成过程的图的表征并将其用于后续预测。本文展示将任务扩展到少样本设定(每个示例来自不同世界,图拓扑相同或不同)后,4 个模型家族的 6 个模型的预测均得到提升。为理解这一改进,我们用线性探针在隐藏状态中定位编码图信息的低维世界表征。值得注意的是,少样本示例会重新定位世界表征并提高其预测用途:对每个模型,这些世界表征向与其原始子空间近乎正交的方向移动,且对这些表征的干预带来的性能损害大于对其他子空间的干预。与此一致,含不同世界观测的少样本示例提升了 ARC-AGI-1&2、网页智能体任务和黑白棋上的表现。我们的发现阐明了少样本示例在上下文世界建模中的作用与内部机制,更广泛地推进了对 LLM 智能体如何从上下文观测中学习的理解,并为其进一步改进提供启示。
