论文

发现语言模型中的潜在推理策略

Uncovering Latent Reasoning Strategies in Language Models

模型评测模型行为与机制分析

摘要

在推理任务上训练的语言模型 $p_θ(y \mid x)$ 学习通过多种不同的策略来解决问题,但这些策略是隐式的并纠缠在模型的响应分布中。我们研究将给定预训练语言模型的响应分布分解为结构化的、策略条件表示的问题。具体来说,我们学习一个潜在变量分解 $p_θ(y \mid x) \leadsto (r_φ(z \mid x), g_φ(y \mid x,z))$,其中路由器 $r$ 将每个输入映射到潜在策略 $z$ 上的分布,生成器 $g$ 生成基于该策略的响应。一个关键的挑战是,从基本模型初始化的生成器已经表示 $p_θ(y \mid x)$ 而不使用 $z$。因此,标准变分推理不会让模型有动力通过 $z$ 路由信息,并且可能会产生严重的后验崩溃。为了解决这个问题,我们提出了一个变分目标,该目标测量相对于基本模型响应损失的分数信息增益,并将重建压力集中在具有高基本模型意外性的标记上,鼓励 $z$ 编码与策略相关的响应变化。我们引入了多策略算法任务的基准,并表明该目标恢复了与不同参考策略一致的潜在代码,同时保留了基本模型的响应分布。