论文
从Bittensor竞技环境的ShoppingBench执行轨迹蒸馏购物Agent
Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces
摘要
小模型Agent后训练的瓶颈更多在于训练所需的执行轨迹,而非算法本身。RLVR、组相对强化学习与拒绝采样后再进行监督微调都需要带逐轨迹监督的多轮执行记录。现有来源各有不足:前沿模型合成的数据继承生成模型的偏差、难以覆盖长尾;未经筛选的生产日志缺少评判,还混有走捷径的行为。研究提出利用激励一致的Agent竞技环境生成轨迹,并在Bittensor的ORO Subnet 15(SN15)上演示,该环境部署了ShoppingBench智能体电商基准。竞赛机制、LLM推理评判器与按泄漏簇隔离的轮换题集,使语料具有激励一致的多样性、逐轨迹评判与防记忆泄漏的留出评测。结构质量过滤器保留模型自己发出工具调用的Agent轨迹,剔除模型只在固定搜索循环上分类或叙述的子任务轨迹,再按已发表的ShoppingBench先SFT后GRPO流程对Qwen3-4B进行后训练。在按泄漏簇隔离、采用严格生产评分口径的留出集上,任务成功率由已发表基线的18.0%提高到42.7%,与合成数据仅SFT基线43.6%的差异约在一道题带来的波动范围内,所用数据只占子网单日输出的一小部分。监督训练后的pass@8与pass@1分别为53.3%和34.8%;使用逐步骤教师参考的Dr. GRPO奖励,将多次尝试的潜力转化为执行过程改善。研究认为,利用大量子任务轨迹是进一步接近48.7%的SFT+GRPO基线的重要途径,并发布过滤器、语料划分与竞技环境机制。