论文

棋盘上的幻觉:LLM 国际象棋解说的工具增强评估

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

模型评测评测方法与指标

摘要

国际象棋等领域的超人游戏引擎使专家级评估变得容易,但它们在没有自然语言解释的情况下传达了真实的信息,而自然语言解释使此类专业知识对专家和非专家都具有教育意义。 大语言模型 原则上可以弥补这一差距,但由于特定领域知识有限,它们经常产生幻觉,并且基于标准参考或 LLM 作为法官的框架无法可靠地检测到这些错误。在这项工作中,我们提出了 ACT-Eval,这是一个评估框架,它将国际象棋评论分解为原子声明,并将它们路由到引擎支持的工具和专家注释的标准参考,以评估事实正确性、概念覆盖范围和棋步质量判断。我们发布了 325 个位置移动对的基准,涵盖教学、锦标赛和关键位置,其中包括 125 个经过专家验证的金原子位置和五级错误分类法。通过评估领先的专有模型和开放权重模型,我们发现事实幻觉在国际象棋评论中仍然普遍存在:没有工具的 GPT-5.4 在 22.0% 的情况下会产生不正确的子声明,而较小的开放权重模型则超过 40%。尽管工具增强极大地提高了事实正确性和移动质量评估,但专家战略和战术思想的覆盖范围在所有模型中仍然有限。人类校准表明,ACT-Eval 的事实判断落在人际一致性的观察范围内,而其覆盖率得分与人类对战略完整性的评估密切相关。