论文
TRACE:用合成奖励训练因果探索推理Agent
TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards
摘要
具有可验证奖励的强化学习(RLVR)在数学和代码等领域具有先进的语言模型推理,这些领域的客观答案检查起来并不昂贵。对复杂数据的诊断推理缺乏这种优势:确定异常的真正原因通常需要昂贵的专家调查,并且事后可能仍然含糊不清。我们询问是否可以设计这种验证的不对称性。我们对干预进行采样,将其注入受控模拟器,并生成它将产生的观察结果。隐藏的干预提供了预言机标签和客观奖励,而智能体仍然必须调查嘈杂、混乱和分布式的证据。我们在 TRACE 中实例化了这种方法,TRACE 是一个数字广告诊断环境,具有 12 个根本原因和细粒度的细分归因。智能体使用 Python 和 SQL 调查每个事件,并且必须确定根本原因以及(如果适用)受影响的段分配。在保留的 235 集测试集上,最强的提示基线 Claude Opus 5 达到 0.686 FullAttr@1。监督微调将 Qwen3.5-35B-A3B 从 0.159 提高到 0.637,随后综合奖励的 RL 达到 0.757,优于所有评估的提示基线,包括前沿闭源模型和提示 Qwen3.5-122B-A10B 模型。与提示的 35B 基础相比,生成的策略使用的工具调用也少得多。这些结果证明,获得可扩展的、客观的训练信号可能是比单独的模型规模更重要的约束。更广泛地说,基于模拟的验证可以使原本模糊的诊断推理任务适合可扩展的强化学习。