论文

少样本示例诱导LLM使用上下文世界表征

Few-Shot Demonstrations Elicit the Use of In-Context World Representations in LLMs

模型评测模型行为与机制分析

摘要

大语言模型(LLM)作为智能体时,需要将观测到的数据纳入上下文,推断世界背后的潜在状态空间,并将其用于下游预测。然而先前工作表明,LLM 难以在图追踪任务上使用在上下文中学习到的表征——模型需要构建刻画数据生成过程的图的表征并将其用于后续预测。本文展示将任务扩展到少样本设定(每个示例来自不同世界,图拓扑相同或不同)后,4 个模型家族的 6 个模型的预测均得到提升。为理解这一改进,我们用线性探针在隐藏状态中定位编码图信息的低维世界表征。值得注意的是,少样本示例会重新定位世界表征并提高其预测用途:对每个模型,这些世界表征向与其原始子空间近乎正交的方向移动,且对这些表征的干预带来的性能损害大于对其他子空间的干预。与此一致,含不同世界观测的少样本示例提升了 ARC-AGI-1&2、网页智能体任务和黑白棋上的表现。我们的发现阐明了少样本示例在上下文世界建模中的作用与内部机制,更广泛地推进了对 LLM 智能体如何从上下文观测中学习的理解,并为其进一步改进提供启示。

少样本示例诱导LLM使用上下文世界表征:论文配图
图 1:(a) 上下文世界建模的概念框架。向 LLM 提供在图拓扑上生成的随机游走(每个节点被赋予一种水果),并指示其向右移动两步。我们探查内部表示,以判断模型是否构建了潜在图。这些表示中可线性解码的子空间被称为世界表示。实际提示见图 11。本文将黄瓜视为水果。(b) LLM 学会在少量示例演示下利用世界表示。由随机游走、任务说明及答案组成的少量示例演示(来自拓扑相同但水果到节点分配不同的世界)能提升任务表现。相对于随机方向的干预,对世界表示子空间的干预在少样本设置下造成的性能下降大于零样本设置。结果来自 Qwen3-4B-Base 在 4×4 格子网格上的表现。(c) 少样本演示使世界表示发生偏移。随着示例数量增加,图表示沿表示子空间的正交方向偏移。左侧为节点隐状态的三维 PCA,右侧为测试集随机游走平均隐状态的二维 PCA。结果取自图 6。