论文

PyINE:通过代码执行进行可扩展的启发和监督的框架

PyINE: A Framework for Scalable Elicitation and Oversight via Code Execution

模型评测基准与评测资源

摘要

推理模型仍然能够解决任务,同时仍然默认使用更便宜但具有误导性的捷径。这就产生了一个中心监督问题:当模型给出看似合理但不完整的推理的答案时,监督者能否确定该输出是否应该被信任?为了研究这个问题,我们引入了 PyINE,这是一个使用经过检测的 Python 程序作为可验证的执行基础来进行可扩展的启发和监督的框架。在 PyINE 中,程序定义任务环境,执行跟踪为结果和中间事实提供权威标签,并且可以机械地生成任务变体,而不是通过静态的人工注释。我们在 PyINE-v1 中实例化了该框架,这是第一个版本,由近一百万个确定性执行跟踪和超过 500,000 个匹配的LLM生成的用于反事实评估的代码变体构建。我们使用标准强化学习以及针对不同线索任务的可验证奖励,训练了一种捷径跟踪模型,该模型在预测执行结果方面得到了显着改进,同时在误导性的面向人类的线索与程序实现的行为发生冲突时仍然会出现系统错误。然后,我们评估激活探针、训练的文本分类器、提示法官和作为该模型监督者的轻量级辩论协议。我们发现,在数据集级别汇集的性能可以隐藏最重要的故障的弱覆盖范围:廉价的学习监督者经常会错过罕见的捷径驱动的错误,而更强的基于模型的检查更加平衡,但成本更高,也更难以转化为可靠的阈值决策。 PyINE-v1 将这种故障模式覆盖问题转变为可重用的实验设置,用于开发可验证、故障模式感知且成本敏感的监督方法。