论文
Ask-E:校准问题生成环境
Ask-E: An Environment for Calibrated Question Generation
摘要
今天,我们通过训练和评估模型的能力前沿问题来改进模型。创建此类问题本身就是一项艰巨的任务,需要能够探索模型限制并推广到现有问题分布之外。它还意味着将问题置于精确的难度级别,这需要了解如何解决这些问题。简而言之,生成针对模型当前前沿进行校准的问题需要超越该前沿的能力,随着模型的改进,这种约束越来越繁重。我们的主要见解是,我们可以利用这一约束来发挥我们的优势:能够生成针对给定边界一致校准的问题的模型必须拥有超越该边界的能力。因此,我们提出了 Ask-E,这是一个环境,可以对模型在给定技能水平上编写问题而不是回答问题的能力进行基准测试和训练。具体来说,我们将目标技能水平定义为受两种现有语言模型的能力限制的范围。如果两个模型中的一个能够解决生成的问题,将其精确地置于目标范围内并区分这些模型的能力,则成功校准生成的问题。 Ask-E 既可以作为基准,也可以作为训练环境,其中模型会生成针对各种技能水平进行校准的问题。我们发现,即使是前沿模型在基准上的校准也低于 50%,为衡量未来的进展留下了巨大的空间。我们还表明,即使没有新的数学数据、没有与更强大的模型交互、也没有基于正确性的奖励,在这种环境下的训练也会导致许多下游数学基准的改进。