论文
DRACULA:寻找用户希望深度研究代理执行的操作
DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute
摘要
科学深度研究 (DR) 代理通过将研究论文合成为多部分报告来回答用户查询。用户反馈可以提高其实用性,但现有协议仅对最终报告进行评分,因此很难研究和了解 DR 代理应采取哪些中间操作来改进报告。我们收集 DRACULA,这是第一个包含用户对 DR 中间操作反馈的数据集。在五周的时间里,19 位 CS 专家研究人员向 DR 系统提出问题,提出行动建议(例如,“添加有关数据集的部分”)。我们的用户选择他们喜欢的操作,然后判断输出报告是否成功应用了他们的选择,产生 8,103 个操作偏好和 5,230 个执行判断。在确认 DR 代理可以执行 DRACULA 的动作后,我们通过模拟研究用户首选动作的可预测性——LLM 预测用户选择的动作的效果如何——这是学习生成有用动作的一步。我们发现:(1)LLM 法官最初很难预测动作选择,但在使用用户的完整选择历史记录而不是自我报告或推断的用户上下文信号时改进最多; (2) 用户对同一查询的选择因未阐明的目标、瓶颈模拟和让用户引导报告的激励可供性而不同; (3)我们的模拟结果为在线干预提供信息,该干预根据用户过去的交互生成新的动作,这是用户在后续研究中最常选择的。总的来说,虽然工作广泛地研究执行,《德古拉》揭示了一个关键的挑战是决定首先执行哪些行动。我们开源 DRACULA 的研究设计、用户反馈和模拟任务,以促进未来针对长视野智能体的行动反馈工作。