论文

TsuGO:用围棋死活题探测LLM推理中的搜索效率

TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

模型评测基准与评测资源

摘要

LLM推理评估正从最终答案准确率转向过程级评估,但现有方法仍无法捕捉模型如何规划推理路径与分配推理资源——即它们如何组织搜索。以往过程级方法关注思维链(CoT)的连贯性与冗余性,且多数基准任务只有单一目标、可由推导与工具使用等静态能力求解,使搜索组织未被测量。我们提出TsuGO,一个通过围棋死活题评估LLM推理中搜索效率的过程级推理基准。这类问题提供封闭且可验证的解空间,并具有内在对抗结构,使候选生成、应手检验、分支比较与回溯成为推理的必要环节,而非偶然的轨迹模式。通过约束解空间,TsuGO将领域知识与搜索组织解耦,把CoT解析为结构化搜索树,并报告搜索效率(Search Efficiency)、token效率(Token Efficiency)及其他诊断指标与可视化。实验表明,当前LLM远未达到稳定的死活题求解:更强模型靠更早找到正确候选并在高产分支上持续投入而成功,但多数模型的行为仍更接近无引导搜索算法,而非神经引导的KataGo。更长的CoT或更高的token效率未必意味着更好的搜索。我们的结果指出,搜索组织与推理资源分配是LLM推理评估中缺失的维度。

TsuGO:用围棋死活题探测LLM推理中的搜索效率:论文配图
图1:TsuGO 揭示了基于答案和 token 效率的评估所隐藏的搜索组织方式。