论文
我们可以看到的谎言:VLM 代理在具体社会互动中的联合言语和非言语欺骗
Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions
摘要
LLM 和 VLM 代理的战略欺骗已成为人工智能协调和安全的中心问题。社交演绎游戏(每个玩家都扮演一个隐藏的角色并与其他人交流以推断身份)作为规范的测试平台,特别是在多智能体环境中。然而,现有的测试平台是纯文本的,并且在单个固定代理配置上运行,缺少被欺骗分类法视为核心的非语言感觉运动通道,并且使得观察到的行为是否反映了底层模型或周围的工具变得模糊不清。我们推出了 MineAmongUs,这是一个 3D 多模式“Among Us”沙盒,冒名顶替者必须通过联合言语和非言语行动来欺骗船员。我们还提出了 ARIA,一种可配置的 VLM 代理工具,它公开了五个认知组件消融轴;以及基于欺骗分类法的原子和弧级注释方案,并由 LLM-as-a-Judge 大规模操作,达成接近人类的原子标记协议。实证结果表明,VLM 代理通过言语和非言语联合欺骗来追求冒名顶替者的胜利,其中非言语渠道成为跨Harness消融和跨 VLM 评估中更具决定性的获胜贡献者。总而言之,我们的工作为体现 VLM 代理对齐研究开辟了一条新途径。