论文
通过行为 微调 在语言模型中建模类似病理学的行为模式
Modeling Pathology-Like Behavioral Patterns in Language Models Through Behavioral Fine-Tuning
摘要
大语言模型 越来越多地用作模拟人类行为的计算工具。我们引入了一个行为归纳框架,通过 微调 修改结构化决策任务的模型策略:使用受适应不良行为模式(包括抑郁和偏执)启发的合成数据集,我们训练基于 Transformer 的语言模型,以在不同的上下文中一致地选择特定的动作类别。然后我们测试这种行为优化是否会产生生成分布的系统变化。在两种架构中,微调模型显示出下一个词元概率分布的稳定的、上下文一般的变化,包括在开放式语言任务中分配给负面和威胁相关解释的概率增加。这些影响超出了训练环境,并且可以在定性完成、心理测量式评估和定量分布指标(例如 Jensen-Shannon 散度)中检测到。诱导的行为特征也显示出部分特异性。针对不同行为模式优化的模型在评估探针中表现出分离的反应倾向,这表明结构化行为训练会产生差异化的政策层面的偏差,而不是一般的分布偏差。我们将这些发现解释为证据,表明 LLM 中一致的行为优化可以生成与改变的潜在先验一致的稳定的行为和分布模式,将动作选择和语言生成联系起来。更广泛地说,结果支持 LLM 作为基于策略的系统的观点,其中行为约束塑造了新兴的表征结构,突出了它们作为受控测试平台的潜力,用于研究认知计算模型中的行为、解释和生成语言之间的关系。