论文

ToMAS:基于多代理 LLM 失败的试点失败心理理论基准

ToMAS: A Pilot Failure-Grounded Theory-of-Mind Benchmark from Multi-Agent LLM Failures

模型评测基准与评测资源

摘要

即使通信成功,基于 LLM 的多代理系统也可能会失败,因为代理无法正确跟踪其同伴的角色、知识或意图。我们研究这种在 MAST-Data 中标记为 FC2 的智能体间错位案例是否可以转换为功能性合作伙伴状态推理项。 ToMAS 将四个显式可转换标准应用于诊断的执行跟踪。对 242 个合格的非 AG2 训练轨迹进行完整转换,产生了 39 个 CLEAN 项目。在 18 条迹线可靠性试验中,两名注释者达到了 94.4% 的原始一致性,Cohen 的 kappa = 0.92。然后,我们在 Qwen2.5-1.5B 的小规模 GRPO 可行性实验中使用转换后的物品作为二元奖励。在 28 项保留的 Magentic GAIA 诊断中,每个评估的条件都超过了 28 项中相同 2 项的 ROUGE-L 阈值。事后适配器检查显示了原因:在使用的学习率下,LoRA 更新在数值上仍然可以忽略不计(最大绝对增量 W 约为 7e-6),因此所有条件都与未经训练的检查点相同地解码。因此,该实验并未显示出训练效果,也无法建立训练效果;它报告了一个可执行的流程以及任何结论性研究都必须解决的两个限制:训练和评估项目之间的来源差距以及词汇重叠评分。 ToMAS 提供了一个初步的规则和管道,用于将诊断出的协调失败转换为可训练的合作伙伴状态推理项目,并确定了结论性匹配域评估的要求。