论文

FACET:在终端任务合成中保留源意图与可执行状态

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

模型训练合成数据

摘要

训练终端(terminal)智能体需要可扩展的可执行监督,而合成高质量终端任务仍然困难。每个任务耦合了一条指令、一个初始化环境、一个参考解和一个可执行验证器;如果这些工件在不一致的假设下生成,任务可能不可解或被错误评估。同时,多阶段合成可能丢弃原始来源中编码的目标、依赖、状态转移和过程性约束。我们提出FACET(Fine-grained Agentic Construction of Executable Tasks),一个同时解决信息保留与跨工件一致性的框架。FACET将相关智能体技能重建为连贯且信息丰富的场景,在生成最终任务工件之前先实现并修复执行环境。由此得到的容器状态作为指令、解与验证器的共享依据,而基于执行的验证和针对性修复可以在不重新生成有效组件的情况下纠正特定工件的失败。FACET生成带有密集可执行检查的复杂终端任务,从这些任务收集的成功轨迹提供了有效且数据高效的监督。在多个规模上微调模型持续提升Terminal-Bench 2.1性能,同时对替代生成方案的分析支持了环境依据式构建对任务有效性与解-验证器对齐的重要性。这些结果确立了源意图保留与共享可执行状态依据作为可扩展终端任务合成的关键原则。

FACET:在终端任务合成中保留源意图与可执行状态:论文配图
图1:FACET概览。阶段1收集技能并构建情景-技能库。阶段2理解所选技能,探索并恢复一个联合情景,将其扩展为完整表示,并构建对齐的解答与指令参考。阶段3在生成最终任务产物之前构建并验证环境,对失败的构建和测试设有有界修复循环。