论文

QUACK:质疑、理解和审核多模态社会演绎代理中的交流知识

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

智能体系统Agent任务评测

摘要

社交演绎游戏已成为 大语言模型 (LLM) 智能体中探索推理、欺骗、协调和信念建模的流行测试平台。然而,大多数环境仅根据胜率等游戏结果进行评分,并且很大程度上仍然是纯文本交互,这使得很难判断代理的语言是否真正基于其感知和行为,或识别其行为背后的失败模式。为了解决这一差距,我们引入了 QUACK,这是一个开源环境和评估框架,用于审核代理语言在多模态社会推理中的基础。 QUACK 从三个层面评估智能体:游戏结果、行为轨迹和话语层面的一致性。其核心声明验证管道根据引擎日志重建每个代理的 真值 轨迹,并检查针对它的每个讨论声明,自动标记空间幻觉、不受支持的指控、欺骗崩溃和语言动作不一致。在同质和跨模型对抗环境中评估三个前沿 VLM,我们发现即使是最强大的代理也会产生 15.1% 的可验证空间主张的幻觉,并且 11.5% 的指控完全没有根据。我们在 https://github.com/AAAAA-Academia-Attractions/QUACK 中发布了完整的引擎、评估框架、工具包和日志。