论文

一个镜头,多个世界:一种用于世界模型解释的能力类型接口

One Lens, Many Worlds : A Capability-Typed Interface for World-Model Interpretability

模型评测模型行为与机制分析

摘要

世界模型现在建立在截然不同的计算基础上。 PlaNet 和 Dreamer 系列等潜在循环状态空间模型将观察结果压缩为循环状态;基于词元的模型(例如 IRIS)将观察结果量化为学习的密码本,并使用 Transformer 进行自回归预测;联合嵌入预测架构(例如 I-JEPA)在没有像素解码器的学习潜在空间中进行预测。应用于这些模型的可解释性方法,包括探测、激活修补、稀疏自动编码器和意外分析,共享一组通用的原语,但它们是为每个架构从头开始重新实现的,因为现有的钩子和缓存工具假定 Transformer 语言模型,没有操作、环境步骤或想象生成轨迹的概念。我们认为这种碎片化反映的是工具而不是模型,并且世界模型的共享结构是由小型类型化接口捕获的。我们提出了 WorldModelLens,一个围绕能力类型适配器组织的开源可解释性基础:每个模型都实现四种必需的方法(编码、转换、初始状态、样本),并通过显式的能力描述符声明一组可选头(解码、奖励、继续、策略、价值评估),因此强化学习和自监督世界模型是一流的,无需模仿对方。单个钩子和缓存层通过该接口公开时间索引的激活、想象生成轨迹和干预重播,从而允许每个分析被写入一次。