论文

从0阶选择到2阶判断:组合强化暴露前沿组合失败 LLM

From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs

模型评测基准与评测资源

摘要

多项选择推理基准面临双重挑战:先进模型导致的快速饱和和破坏静态评估的数据污染。临时强化方法(释义、扰动)试图增加难度,但为了表面复杂性而牺牲了逻辑有效性,无法挑战高级推理模型。我们提出了 LogiHard,一个正式的框架,可以确定性地将 0 阶选择转换为 2 阶逻辑判断,这显着增加了思维开销和推理步骤。该框架集成了用于计算机自适应测试 (CAT) 的项目响应理论 (IRT),可通过比静态基准测试更少的问题实现精确的难度控制。我们实例化了 LogiHard-2k,这是一个逻辑推理数据集,通过对模型思维轨迹的 9 维分析对高风险试题进行认知排名,然后对高难度项目进行组合变换。对 12 个最先进模型的评估表明,组合强化问题的准确度下降了 31% 到 56%。 LLM 遭受多选失败和提前退出偏差的困扰,这是人类测试者所不具备的。零样本传输到 MMLU 的准确性下降了 47%(89.84% 到 42.86%),通过可证明的有效性保留确认了跨领域的适用性。一致的总体退化与领域无关,不是源于知识缺陷,而是源于组合推理差距,反映了训练引起的完整性验证缺陷。