论文

ArgGYM:结构化可废止推理的程序化、引擎验证基准

ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

模型评测模型训练强化学习基准与评测资源RLVR

摘要

大语言模型推理的最新进展是由具有自动可验证奖励的基准和强化学习环境推动的,特别是在数学、代码和形式逻辑方面。这些设置使模型的准确性更容易评估和优化,但目前尚不清楚固定问题规范和稳定评估标准下的成功能在多大程度上转移到此类领域之外的推理。现实世界的推理通常是在不完整和可修改的信息下进行的:结论可能会被暂时支持,被反证据推翻,被进一步的论证恢复,或者在出现更强有力的理由时被修改。这种推理通常被称为可废止推理。我们引入了 ArgGYM,这是一种用于结构化可废止推理的程序基准和 RLVR 兼容的训练环境。 ArgGYM 将此推理分解为 12 个任务,并在符号论证引擎中根据特定任务进行评分,该引擎计算用于评估模型输出的形式状态。它包括跨 15 种课程配置的 1,440 个经过验证的实例的冻结基准、两种参数偏好排序(最弱链接和最后链接)和两种集合排序(精英和民主),而相同的生成器和验证器可以生成用于评估的新实例,从而减少对静态测试集和可验证奖励训练的依赖。在冻结基准上,前沿模型和开放权重模型显示出截然不同的推理概况:它们可以在不解决完整任务的情况下恢复结构化答案的大部分,并且在具有更长依赖性和更多交互结构的后续课程配置中,性能会下降。我们发布了用于可重复评估和 RLVR 训练的基准、生成器和验证器。