论文

LOGIGEN:逻辑驱动的可验证Agentic任务生成

LOGIGEN: Logic-Driven Generation of Verifiable Agentic Tasks

模型训练强化学习合成数据Agentic RL

摘要

大语言模型(LLM)从静态指令跟随者向自主智能体演进,需要在复杂的有状态环境中运行以达成精确的状态转移目标。然而,这一范式受制于数据稀缺,因为现有的以工具为中心的逆向合成流水线无法捕捉真实应用的严密逻辑。我们提出LOGIGEN,一个逻辑驱动框架,基于三大支柱合成可验证训练数据:硬编译策略锚定(Hard-Compiled Policy Grounding)、逻辑驱动前向合成(Logic-Driven Forward Synthesis)与确定性状态验证(Deterministic State Verification)。具体采用三智能体编排:Architect把自然语言策略编译为数据库约束以强制硬规则;Set Designer初始化边界相邻状态以触发关键策略冲突;Explorer在该环境中搜索以发现因果解路径。该框架产出一个覆盖8个领域、20,000个复杂任务的数据集,其有效性通过检查精确状态等价得到严格保证。此外,我们提出基于验证的训练协议:在可验证轨迹上做监督微调(SFT)以确立对硬编译策略的遵循,再由稠密状态奖励引导的强化学习(RL)精炼长时程目标达成。在τ²-Bench上,LOGIGEN-32B(RL)取得79.5%的成功率,大幅超越基座模型(40.7%)。这些结果表明,逻辑驱动合成结合基于验证的训练可有效构建下一代智能体所需的因果有效轨迹。