论文
Crisis-Bench:评测大语言模型的策略性模糊与声誉管理
Crisis-Bench: Benchmarking Strategic Ambiguity and Reputation Management in Large Language Models
摘要
标准的安全对齐将大语言模型(LLM)优化为普遍有用和诚实,实际上是灌输一种刻板的“童子军”式道德。这种一刀切的伦理框架虽然对通用助手稳健,却给需要策略性模糊和信息保留的职业领域(如公共关系、谈判和危机管理)强加了“透明税”。为衡量通用安全与职业效用之间的这一差距,我们提出Crisis-Bench,一个多Agent部分可观测马尔可夫决策过程(POMDP),在高风险企业危机中评测LLM。Crisis-Bench涵盖8个行业的80条多样化故事线,要求基于LLM的公关(PR)Agent在动态的7天企业危机模拟中行动,同时管理严格分离的私人和公开叙事状态,以实施严格的信息不对称。不同于依赖静态真值的传统基准,我们提出裁决者-市场循环(Adjudicator-Market Loop):一种新的评测指标,将公众情绪加以裁决并转化为模拟股价,构建出现实的经济激励结构。我们的结果揭示出一个关键二分:一些模型屈服于伦理顾虑,另一些则展现出马基雅维利式但合规的策略性保留能力,以稳定模拟股价。Crisis-Bench提供了首个用于量化评估“声誉管理”能力的框架,主张从僵化的道德绝对主义转向情境感知的职业对齐。
