论文

度量 大语言模型中的行为可移植性

Measuring Behavior Portability in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型日益被部署为自主决策者——但它们展现的行为映射在按构造收益等价的决策环境间——共享相同收益相关结构但表面呈现不同的环境——可能差异巨大。该敏感性使套件式评估脆弱——并提出行为可移植性的根本问题:在一个决策环境中学得的行为映射对保持相同底层激励结构的另一环境有多大信息量。我们引入形式化框架度量该性质。我们的协议在从一组源环境汇集的数据上拟合可解释行为模型——并在留出目标环境中评估其样本外预测性能——以直接在目标数据上训练的预言机为基准。可移植性经损失无关的度量量化——该度量对诱导的预测-动作映射在目标环境中的性能给出最坏情况界。在横跨七个经典经济决策问题的受控实验中——我们记录到显著且系统的可移植性损失——表明在一个决策环境中获得的LLM行为刻画不能被假定可靠迁移到结构等价的替代环境。

度量 大语言模型中的行为可移植性:论文配图
图 1:即时变化下损失不可知的分歧。传输的预测器引起的联合分布与保留目标环境中的目标训练基准之间的总变化距离,比较非 CoT、CoT 和 DeepSeek 数据可用的 DeepSeek-R1。 DeepSeek-R1 显示为绿色。值越大意味着在诱导的预测-动作对上定义的有界标准的最坏情况变化越大。