论文
LLM 有多心中有数?在文本游戏环境中评估多步演绎推理
How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment
摘要
事实表明,推断“凶手是谁”对 LLM 智能体颇具挑战。本文将经典桌面游戏 Clue 改造为基于文本的多智能体版本,作为评估多步演绎推理的规则化试验台,使用来自 GPT-4o-mini 与 Gemini-2.5-Flash 的六个智能体。我们进一步研究在结构化逻辑谜题上微调能否迁移为游戏中推理与对局表现的提升。在 18 局模拟对局中,智能体仅取得四次正确获胜,表明其难以在一整局游戏中保持一致的演绎推理。此外,我们发现微调并不能可靠地提升表现,某些情况下似乎只是增加了推理量而未提高推理精度。
