论文
倾向推断:LLM行为的环境影响因素
Propensity Inference: Environmental Contributors to LLM Behaviour
摘要
出于对未对齐AI系统失控风险的担忧,我们开发并应用了测量语言模型未经授权行为倾向的方法。我们贡献了三项方法学改进:分析环境因素变化对行为的影响、通过贝叶斯广义线性模型量化效应大小,以及采取明确措施防止循环分析。我们将该方法应用于测量12个环境因素(6个策略性、6个非策略性)的效应,进而衡量行为在多大程度上可由环境的策略性方面解释,这一问题与未对齐风险密切相关。跨越23个语言模型和11个评估环境,我们发现策略性与非策略性因素对行为解释的贡献大致相当,未发现随能力提升策略性因素影响变大或变小,并发现一些证据表明对目标冲突的敏感性存在增强趋势。最后,我们强调了未来倾向研究的一个关键方向:将AI决策的理论框架与认知模型发展为可实证检验的形式。
