论文

ClassicLogic:用于评估组合概括的经典益智游戏的知识驱动基准

ClassicLogic: A Knowledge-Driven Benchmark of Classic Puzzle Games for Evaluating Compositional Generalization

模型评测基准与评测资源

摘要

组合泛化,即理解和产生已知组件的新颖组合的能力,仍然是现代人工智能的基本挑战。虽然存在的基准很少,但许多基准都专注于语言任务,缺乏复杂、明确的组成结构。我们引入了 ClassicLogic,这是一个新的基准套件,旨在评估智能体学习和制定解决问题策略的能力。该基准测试由四个经典逻辑谜题组成:Sudoku、KenKen、Kakuro 和 Futoshiki。其核心创新是每个游戏都有一个分层的、明确的知识库,其中复杂的解决策略被正式定义为更简单的基础策略的组合。这种结构允许对智能体的推理能力进行细粒度的评估,从学习基本规则到应用多步骤组合策略来解决难度不断增加、经过数学验证的难题。该开源基准测试为推进神经符号和其他先进人工智能推理系统提供了一个具有挑战性的新测试平台。