论文
可验证的隐式动力学推演:从已求解机制生成Agent强化学习环境
Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms
摘要
语言模型Agent越来越多地面对状态持续演化、决策相互依赖、结果延迟到来的长时程任务。扩展其训练需要多样化的Agent环境、可靠的结果信号以及低扩展成本。现有生成流程通常先构建环境,再定义其结果规则或标注其轨迹,导致动力学与评测需要事后对齐。VHD-Play反转了这一依赖顺序:先采样并求解一个数学模型,再由基于语料库的setter将其决策过程呈现为有状态工具。可执行的动力学与轨迹评分参考均继承自同一个已求解模型。该流水线以每个环境几美分的成本生成了3300个多样化的Agent环境。在三个环境家族上训练Qwen3.6-35B-A3B,使其在五个家族诊断集上的平均Agent得分从0.204提升至0.815。收益同样出现在三个训练家族与八个未见机制家族的留出实例上,并进一步超越所生成的底座,扩展到通用函数调用、旅行规划和365天电子商务等外部基准。在E-Commerce Bench上,训练后的checkpoint在每次运行中都未破产,并超过了Qwen3.7-Max。我们比较了书面呈现的问题与揭示或隐藏参数的有状态版本,结果表明大部分可学习的差距在于有状态交互而非底层问题求解。冻结的35B setter可实现更大的环境,且随着机制规模与时程增长,规模匹配的训练仍保留收益,显示了演化式训练底座的潜力。