论文
Workerville:从组织关系评测Agent反生产行为
Workerville: Towards an Organizational Behavior Account of Agent Safety
摘要
基于 LLM 的代理现在不断地与其环境进行交互,并受到用户指令、同伴消息和长期记忆等组织渠道的影响。现有的安全研究已经检验了这些影响,但主要是作为单独的药物成分。这些因素如何从统一的角度共同塑造Agent的安全行为仍然无法衡量。为了弥合这一差距,我们提倡将组织行为(OB)作为研究高级智能体安全性的框架,围绕智能体运行的关系结构重新组织研究对象、理论基础和实验设计。我们提出了反生产力工作行为 (CWB) 的第一个系统形式化,这是 OB 的一个规范的安全相关子领域,即 Agentic 反生产力行为 (ACB)。 ACB 指定了三个组织前提(纵向主管关系、横向同事规范和内部认知结构),并将它们映射到三个适得其反的结果维度(未经授权的披露、破坏性操作和生产偏差)。到 为了实施 ACB,我们引入了 Workerville,这是一个受控基准,可在共享任务上操纵组织条件,将 16 种组织配置应用于 210 项任务,产生 3,360 个挑战,并由经过人工验证的 Agentic 法官进行评估。对6个前沿LLM进行基准测试,我们发现(I)负面组织前因组合在一起时表现出非单调放大,未经授权的披露率从没有负面前因的16.5%上升到2岁以下的60.1%,并回落到3岁以下的50.3%; (II) 代理重现人类 CWB 研究预测的典型行为模式; (III)这些结果将OB建立为药物安全研究的系统框架,指向新的研究议程。