论文

CalibForge:用于扩展可学习终端任务的对抗性求解器校准

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

模型训练合成数据

摘要

训练终端代理需要可执行且可验证的任务,这些任务不仅是可解决的,而且对学习具有适当的挑战性。可执行验证确定了可行性,但并未揭示任务相对于给定求解器设置的行为方式。在本文中,我们提出了 CalibForge,这是一种自主终端任务综合系统,它使用经过验证的求解器行为通过对抗性求解器校准来修改候选任务。多解算器校准的目标是异构解算器池中的不一致,而对比解算器校准的目标是指定的强通过/弱失败关系;两者都操作了一个与求解器相关的可学习区域,该区域以已证明的可解性为基础。使用 CalibForge,我们构建了 5,431 个校准的终端任务。我们的消融表明,这两种策略比单独编写和验证或普通的单求解器反馈产生更有效的监督。在完整集合上训练的模型在 Terminal-Bench 2.0 上达到了 32.58% 和 47.57%。与相应基础模型相比,最大的改进在 Terminal-Bench 2.0 上达到 24.71 个百分点,在 SWE-bench Pro 上达到 27.68 个百分点,在 Doc2Repo 上达到 30.04 个百分点。总之,这些结果支持将求解器相关的可学习性作为构建有效且可转移的代理训练数据的实际目标。