论文
科学领域终端环境的自监督扩展
Self-Supervised Scaling of Terminal Environments for Scientific Domains
摘要
终端智能体日益部署到软件工程之外的科学及其他专业领域。构建训练环境需要可执行的参照行为和区分语义正确与表面合理的领域验证器;为每个任务编写这些组件需反复工程并限制复用。我们提出软件在环重构(SWR),一个自监督框架:从既有软件工作流(把结构化输入映射到输出的可执行程序)获取参照输出与验证目标。对每个工作流执行多个输入配置,把用例分为公开观测与隐藏评估;给定指令、输入模式与公开输入-输出观测,智能体在无法访问源工作流的情况下构建可编辑程序,候选在隐藏配置上对照工作流输出评估。分层验证器组合领域语义比较、结构有效性与反捷径检查,公开反馈支持迭代修订。该构造无需为每个任务编写参照解即可纳入更多工作流与配置。我们以跨六域的500个工作流与46个软件族实例化SWR:每任务三次尝试中Qwen3.8-Max解决838个任务、产出1422条验证轨迹,过采样为3000条仅重构训练样本。Qwen3.8-27B的监督微调使Terminal-Bench 2平均性能从47.94%提升到53.56%(三种子),并在全部四项报告评估中于四个匹配token语料对照中均值最高。结果表明既有科学软件可为终端智能体提供可扩展、行为验证的监督。