论文

Crisis-Bench:评测大语言模型的策略性模糊与声誉管理

Crisis-Bench: Benchmarking Strategic Ambiguity and Reputation Management in Large Language Models

智能体系统Agent任务评测

摘要

标准的安全对齐将大语言模型(LLM)优化为普遍有用和诚实,实际上是灌输一种刻板的“童子军”式道德。这种一刀切的伦理框架虽然对通用助手稳健,却给需要策略性模糊和信息保留的职业领域(如公共关系、谈判和危机管理)强加了“透明税”。为衡量通用安全与职业效用之间的这一差距,我们提出Crisis-Bench,一个多Agent部分可观测马尔可夫决策过程(POMDP),在高风险企业危机中评测LLM。Crisis-Bench涵盖8个行业的80条多样化故事线,要求基于LLM的公关(PR)Agent在动态的7天企业危机模拟中行动,同时管理严格分离的私人和公开叙事状态,以实施严格的信息不对称。不同于依赖静态真值的传统基准,我们提出裁决者-市场循环(Adjudicator-Market Loop):一种新的评测指标,将公众情绪加以裁决并转化为模拟股价,构建出现实的经济激励结构。我们的结果揭示出一个关键二分:一些模型屈服于伦理顾虑,另一些则展现出马基雅维利式但合规的策略性保留能力,以稳定模拟股价。Crisis-Bench提供了首个用于量化评估“声誉管理”能力的框架,主张从僵化的道德绝对主义转向情境感知的职业对齐。

Crisis-Bench:评测大语言模型的策略性模糊与声誉管理 配图
图 1:Crisis-Bench 工作流。路由器(Router)选择一个事件,该事件更新私有(K_priv)与公共(K_pub)知识库。公关智能体(PR Agent)对这些事件作出响应,裁决者(Adjudicator)的分数驱动模拟股价,智能体必须稳定该股价以实现股东价值最大化。