论文

IntentRL:通过强化学习训练开放式深度研究中的主动用户意图智能体

IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning

模型训练强化学习Agentic RL

摘要

深度研究(DR)智能体通过自主检索并综合大规模网页语料中的证据、将其写成长篇报告,把大语言模型(LLM)扩展到参数化知识之外,开启了一种长时程 Agentic 范式。然而,与实时对话助手不同,DR 计算开销大且耗时长,由此产生自主性-交互困境:对含糊的用户查询保持高自主性,往往导致执行拖沓且结果不令人满意。为解决这一问题,我们提出 IntentRL,一个训练主动智能体在启动长时程研究之前澄清用户潜在意图的框架。为克服开放式研究数据的稀缺,我们引入一条可扩展的流水线,通过由浅入深的意图细化图把少量种子样本扩展为高质量对话轮次。我们进一步采用两阶段强化学习(RL)策略:阶段 I 在离线对话上执行 RL,以高效学习通用的用户交互行为;阶段 II 利用训练好的智能体与用户模拟器进行在线 rollout,加强对多样化用户反馈的适应。大量实验表明,IntentRL 显著提升了意图命中率与下游任务性能,优于闭源 DR 智能体内置的澄清模块以及主动式 LLM 基线。

IntentRL:通过强化学习训练开放式深度研究中的主动用户意图智能体
图3:在 DeepResearch Bench 上,不同澄清轮数下的澄清质量(%)与报告整体性能。