论文

认知立场灵活性探测:评估提示条件下的语域变化

Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

模型评测基准与评测资源

摘要

语言模型可能会被询问专家对有争议的主张有何看法,或者对主张本身有何看法。一个值得信赖的对话代理应该区分这两种请求,并以不同的认知语域做出回应:第一种情况是中立归因,第二种情况是立场表达。这种转变是否发生——以及它是否连贯地发生——并不能通过现有的准确性、指令遵循或安全性基准来直接评估。我们引入了 ESFP,这是一种行为基准,它将外部归因和自我归因提示之间的对比视为基本的衡量单位。 ESFP 由涵盖六个认知类别和五个措辞模板的 104 个精心控制的项目组成,并沿着四个互补维度评估模型响应:词汇自我归因、对角色框架的表征级响应、由 LLM 评审小组评估的句子级立场内容密度以及跨条件立场一致性。通过评估五家供应商的八种前沿模型,我们发现认知灵活性在很大程度上与一般模型能力正交:27B 开放权重模型与最强的专有系统相匹配,一个系列的旗舰模型表现不如其轻量版本,而推理优化模型并不始终表现出更高的灵活性。立场内容密度提供了最强的信号,而诸如“我认为”之类的表面词汇标记可能会发生很大变化,而表达的立场却没有相应的变化。我们提供逐题自助法置信区间、权重敏感性分析以及对综合得分解释限制的明确讨论。 ESFP 衡量模型在不断变化的归因条件下调整其认知立场的倾向,而不是一般的能力衡量标准。