论文

当角色失效时:LLM政治声明分析中倡导者角色忠实度的认知约束

When Roles Fail: Epistemic Constraints on Advocate Role Fidelity in LLM-Based Political Statement Analysis

模型评测评测方法与指标

摘要

民主话语分析系统日益依赖多智能体LLM流水线,其中不同的评估器模型被指派对抗性角色,以生成对政治声明的结构化、多视角评估。一个核心假设是模型会可靠地维持其被指派的角色。本文利用TRUST流水线首次对该假设进行了系统的实证检验。我们开发了一个认知立场分类器,不依赖表层词汇即可从推理文本中识别倡导者角色,并在60条政治声明(30条英文、30条德文)上用四个指标度量角色忠实度:Role Drift Index(RDI)、Expected Drift Distance(EDD)、Directional Drift Index(DDI)和Entropy-based Role Stability(ERS)。我们识别出两种失败模式——认知底线效应(事实核查结果构成一个绝对下界,低于它就无法维持合法化角色)与角色先验冲突(对事实明确无疑的声明,训练期知识会覆盖角色指令)——并将它们视为同一机制的体现:认知角色覆盖(Epistemic Role Override, ERO)。模型选择显著影响角色忠实度:Mistral Large比Claude Sonnet高28个百分点(67%对39%),且其失败模式在性质上不同——放弃角色而不发生极性反转——而Claude则是主动转向对立立场。角色忠实度对语言具有鲁棒性。事实核查提供方的选择并非普遍中性:Perplexity显著降低Claude在德语声明上的角色忠实度(Delta = -15pp,p = 0.007),而对Mistral没有影响。这些发现对多智能体LLM验证具有直接启示:一个未经角色忠实度测量就完成验证的系统,可能会系统性地歪曲其本应提供的认知多样性。