论文
借助工具增强演绎推理,让大模型玩懂Clue
Clueing up LLMs with Tool-Augmented Deductive Reasoning
摘要
尽管大语言模型取得进展,在长交互中保持逻辑一致的演绎推理仍具挑战。需要跨多个推理步骤整合证据、与先前推断保持一致并在新约束下更新信念的任务,能暴露现有模型局限,也为评估推理增强提供试验场。本文实现经典桌游Clue的文字多智能体版本,用于评估多步智能体演绎推理。智能体须从连续观察推断隐藏信息,跨轮保持一致,并针对不断变化的逻辑约束推理。我们以GPT-4o-mini和Gemini-2.5-Flash实例化六个玩家,每个模型家族三个智能体,通过重复游戏建立基线。随后引入工具增强方法,用结构化可能性矩阵将生成推理日志中的隐式游戏状态转换为剩余可能性的显式表示。矩阵编码跨多轮记忆和演绎约束,把这些任务从智能体卸载出去。我们将该方法与基线比较,以评估工具增强如何在战略推理环境中支持自主智能体的推理质量与任务成功。
