论文
TopoBench:在困难拓扑推理上评测LLM
TopoBench: Benchmarking LLMs on Hard Topological Reasoning
摘要
求解拓扑网格谜题需要对连通性、环路闭合、区域对称性等全局空间不变量进行推理,即便对最强大的大语言模型(LLM)而言也依然困难。为了在受控设置下研究这些能力,我们提出TopoBench,一个涵盖三大难度、六个谜题族的基准。我们在TopoBench上评测强推理LLM,发现即便是前沿模型也只能解出不到四分之一的困难实例,其中两个谜题族几乎无人解出。为探究这些失败究竟源于推理能力局限,还是源于提取与维持空间约束的困难,我们用一套错误分类法标注了750条思维链轨迹,归纳出四种候选因果失效模式,再通过模拟每种错误类型的定向干预加以检验。这些干预表明,过早下结论与约束遗忘等错误模式会直接影响解题能力,而反复推理则是搜索的良性副效应。最后,我们研究提示引导、单元格对齐的网格表示与基于工具的约束检查等缓解策略,发现瓶颈在于从空间表示中提取约束,而非在其上进行推理。代码与数据见 github.com/mayug/topobench-benchmark。
