论文
WRIT:面向多轮用户代理的写读密集型轨迹综合
WRIT: Write-Read Intensive Trajectory Synthesis for Multi-Turn User-Facing Agents
摘要
多轮面向用户的代理必须从不完整的请求中推断用户意图,通过对话和工具收集缺失的信息,并执行有效的操作。训练轨迹将这个过程记录为用户消息、代理响应、工具调用等的交错序列。合成足够复杂的轨迹已成为训练代理的中心途径:现有管道通常通过将多个用户请求组合成更长的任务来增加难度,产生训练顺序执行的写入密集型轨迹。我们认为,当代理必须在其参数变得可识别之前收集和比较大量的读取工具证据时,单个写入决策本身就很困难,这是仅靠写入密集型数据无法解决的挑战。在这种见解的指导下,我们提出了 WRIT (\uline{W}rite-\uline{R}ead \uline{I}intense \uline{T}rajectory Synthesis),这是一种沿着两个复杂性轴合成多轮智能体训练轨迹的管道:任务中的写入决策数量和每个决策的证据负担。 WRIT 首先生成写密集型任务和读密集型任务。然后,它使用户行为指令多样化,以反映现实的对话变化,最后在可执行环境中模拟代理与用户的交互,以生成完整的训练轨迹。生成的数据不仅可以训练智能体执行更长的任务,还可以在高信息负载下做出稳健、基于证据的决策。仅使用 2K 条合成轨迹,在 WRIT 上训练的 4B 模型在 $τ^2$-bench 上的表现优于 GPT-5.1 no-think,并且大大减少了推理时间词元的使用,表明紧凑的 SFT 数据可以将部分昂贵的测试时间推理转换为高效的代理行为。