技术实践

蚂蚁ASystem团队以AReno在DGX Spark完成轻量模型Agentic RL后训练实验

模型训练强化学习Agentic RL

概述

蚂蚁百灵开源的Ling-3.0-tiny总参数7.9B、推理激活仅1.3B,此前已能在DGX Spark等本地设备上运行;蚂蚁ASystem团队进一步验证它能否在本地训起来。他们用自研开源工具AReno在DGX Spark上做了一次井字棋Agentic RL后训练实验:选井字棋作为最小可验证任务,模型通过choose_square工具调用落子,reward区分非法动作(-1.0)、参数不可解析或选已占用格子(-1.0)、立即获胜(1.0)、最优动作(0.8)与合法非最优(0.0);训练数据为固定随机种子生成的中间局面,保证可复现。用GSPO算法训练400个step后,平均奖励从约-0.5升到0.4左右,response_len降至约850 tokens,回到同一交互环境复测确认工具调用与动作选择更稳定。团队提供Docker教程供复现,并称该路径可迁移到工具调用修复、结构化抽取、流程Agent等任务。需要说明的是,这是单机单任务的实验验证,结果为团队自报,井字棋与真实业务任务在复杂度上差距较大,迁移时需重新设计任务环境与反馈信号。