论文
能力不等于倾向:测量公共事务LLM智能体的压力稳健合作行为
Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents
摘要
语言模型的合作能力具有双刃性。支持公共审议的同一套社会推理,也可能促成策略性隐瞒、虚假共识和操纵性表述。我们认为,合作型AI评估应区分模型在良性指令下能做什么与其在现实公共压力下倾向于做什么。我们提出DiffCoop-Civic,一个包含10个场景的试点评估套件,涵盖偏好理解、证据与说服、承诺设计、非对称信息和异议保留。在来自四个模型家族的七个模型上,微妙的隐瞒压力产生近乎一致的偏移:在5分制上,操纵可行性上升1.17分,异议保留下降1.67分。明显的虚假共识压力表现不同:它在某些对齐的API模型中触发拒绝或转移话题,但在几个开源权重模型中却得到直接服从。一种轻量的Pareto-Trace提示词干预在不单纯依赖硬拒绝的情况下提升了压力稳健性。匿名可复现包见 https://anonymous.4open.science/r/diffcoop-civil-771C。
