论文

LLM 有多心中有数?在文本游戏环境中评估多步演绎推理

How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment

智能体系统Agent任务评测

摘要

事实表明,推断“凶手是谁”对 LLM 智能体颇具挑战。本文将经典桌面游戏 Clue 改造为基于文本的多智能体版本,作为评估多步演绎推理的规则化试验台,使用来自 GPT-4o-mini 与 Gemini-2.5-Flash 的六个智能体。我们进一步研究在结构化逻辑谜题上微调能否迁移为游戏中推理与对局表现的提升。在 18 局模拟对局中,智能体仅取得四次正确获胜,表明其难以在一整局游戏中保持一致的演绎推理。此外,我们发现微调并不能可靠地提升表现,某些情况下似乎只是增加了推理量而未提高推理精度。

LLM 有多心中有数?在文本游戏环境中评估多步演绎推理:论文配图
图 1:说明玩家 1 回合的线索游戏图。在这个例子中,玩家 1 提出了一个建议(怀特夫人、厨房、绳索),而玩家 2 没有任何与该建议匹配的牌,因此它转移到玩家 3。由于玩家 3 有一张匹配的牌,他(仅)向玩家 1 显示了它。然后,玩家 1 可以排除“绳索”作为正确武器,玩家 2、4、5 和 6 知道玩家 3 必须拥有怀特夫人、厨房或绳索。