论文
ROME:以开放训练生态与交互片段信用分配训练Agent
Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem
摘要
Agentic构建要求LLM在真实环境中多轮采取行动、观察结果并迭代改进产物,但开源社区仍缺乏有原则的端到端Agent开发生态。本文提出Agentic Learning Ecosystem(ALE),用于优化Agent LLM的生产管线。ALE由三个部分组成:负责权重优化的后训练框架ROLL、负责轨迹生成的沙箱环境管理器ROCK,以及用于高效上下文工程的Agent框架iFlow CLI。作者发布基于ALE、以百万余条轨迹训练的开源Agent模型ROME。方法包括合成复杂行为的数据组合协议,以及交互式策略对齐算法Interaction-based Policy Alignment(IPA);IPA按语义交互片段而非单个Token分配信用,以改善长程训练稳定性。作者在结构化环境中评估ROME,并提出扩大规模、加强污染控制的Terminal Bench Pro。ROME在SWE-bench Verified、Terminal Bench等基准中取得较好表现,支持ALE基础设施的有效性。
