论文

终端智能体训练的数据生成与验证挑战

When Terminal-Agent Training Stalls: Demystifying Data Generation and Verification Challenge

智能体系统Agent任务评测长程任务评测

摘要

用Claude Opus这类前沿模型作为元智能体为RL训练生成终端任务与验证器已日益普遍。但可运行的Docker镜像与可执行测试套件并不保证终端智能体训练的端到端管道忠实。我们提出针对这一缺口的元智能体管道,诊断三类失败:基准无效、Harness脆弱与奖励错位。提示重设计与上下文扩展使基线可解性提升5.6倍,但9B模型在Claude Opus生成任务上20步内平均pass@2饱和于81.3%;加入困难任务后平均pass@2降至20.6%而训练配置不变,有力证明可解性带是模型特异的。这些发现表明元智能体可靠性需要把可解性带校准、验证器审计与基础设施误差核算作为一等评估标准,而非事后诊断。