论文

通过难度控制和动态测试生成的 LRM 时间推理基准框架

A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation

模型评测基准与评测资源

摘要

定义推理边界并确保大型推理模型(LRM)的可靠性仍然是一个严峻的挑战。当前的基准主要依赖于容易受到数据污染的静态数据集或缺乏细粒度难度控制的合成任务。此外,标准的基于结果的评估常常通过忽略推理过程来掩盖推理缺陷。为了解决这些限制,我们引入了 TRACE,这是一个测试框架,通过艾伦的区间代数将时间推理建模为约束满足问题。这种方法可以精确调节逻辑复杂性,并结合基于跟踪的验证 Oracle 来验证推理 忠实性。使用这个框架,我们构建了 TRACEBench,这是一个广泛的基准测试,包含 1,200 个跨分级难度级别的综合测试实例。我们使用 TRACE 在 TRACEBench 上评估八种广泛使用的 LRM。结果证实了模型性能与我们的难度指标之间存在很强的负相关性(Pearson 的 r 约为 -0.96),验证了我们的难度控制机制的有效性。此外,我们基于轨迹的分析揭示了推理有效性和最终答案之间的显着差异,揭示了中型模型中大约 28% 的高虚假猜测率。此外,我们还诊断与规模相关的故障模式,范围从小型模型中的退化循环到高级架构中的推理爆炸。因此,TRACE 提供了一个强大的自动化平台,用于对 LRM 的真实时间推理能力进行基准测试。