论文

评估和改进 LLM 自我建模

Evaluating and Improving LLM Self-Modeling

模型训练强化学习

摘要

我们研究自我建模:LLM 回答有关其自身行为的问题的能力。我们专注于可验证的行为问题,例如即时编辑是否会改变模型的最终答案。为了衡量这种能力,我们引入了一个测试不同类型的自我建模问题的基准。当前的模型显示出不平凡但有限的自我建模技能,并且在有关其自身行为的简单反事实问题上犯了系统性错误。为了提高自我建模技能,我们开发了一个可扩展的合成数据管道,用于生成自我建模训练数据,并表明强化学习可以提高三个开源模型系列的总体自我建模技能,并在一定程度上转移到保留任务上。然而,这些收获似乎并不始终构成内省:改进的自我建模可能不会来自对模型内部决策过程的特权访问。