论文
HyperLogic:一个硬性的、前向编写的中文逻辑推理基准,具有执行衍生的答案
HyperLogic: A Hard, Forward-Authored Chinese Logical Reasoning Benchmark with Execution-Derived Answers
摘要
现有的逻辑基准主要衡量模型直接回答推理问题的能力。可扩展的基准通常从形式结构生成文本,这使得答案易于计算,但在编写问题之前修复了形式化。正向构造保留了寻找忠实形式化的挑战,但使难度和答案可靠性更难以控制。我们引入了 HyperLogic,这是一种将问题编写与答案生成分开的正向构建管道。多智能体工作流程强化了本科生创作的中文种子,但没有解决它们;来自不同模型系列的两个代理独立地将每个成品转换为可执行的有限域模型;它们的编码和求解器得出的答案在人类专家的监督下进行分层的、代理辅助的裁决。 HyperLogic-Base 包含 195 个项目和 922 个子问题,在严格项目准确率 (44.6-77.6%) 方面将 7 个前沿模型分开 33.0 个百分点。 HyperLogic-Hard 包含 100 个具有更大耦合搜索空间的项目,在这些项目上,没有模型的直接回答准确率超过 16%。我们还使用 Hard 来评估代理使用工具形式化和解决问题的能力,将单独的代码沙箱与包含我们的逻辑建模库的代码沙箱进行比较。沙盒将每个模型提高了 16.7-40.1 点;添加库有助于五个模型,但会损害两个模型。这些结果凸显了即使使用工具访问也难以忠实地形式化。