论文

SPADER:逐步的同行优势与多答案问答的多样性意识探索奖励

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

模型训练强化学习

摘要

大语言模型 越来越多地被部署为工具增强代理,以获取参数知识之外的信息。虽然最近的工作改进了长期工具使用推理,但大多数方法都侧重于具有单一正确答案的任务。相比之下,许多现实世界的查询需要发现一组全面的有效答案,这种设置称为多答案 QA。这种设置提出了两个挑战:在长搜索轨迹上进行细粒度的贡献分配,以及在简单的高频实体之外进行持续探索的奖励调整。我们提出了 SPADER,一种用于多答案 QA 中长期工具使用的强化学习框架。 SPADER 包括逐步同行优势 (SPA),这是一种无批评的步进级贡献分配机制,可通过决策步骤调整并行轨迹,并估计同行回报的优势。它还包括具有多样性意识的探索奖励,通过增加稀有发现的权重并减少冗余发现的权重来促进长尾实体的发现。 QAMPARI、Mintaka、WebQSP 和 QUEST 上的实验表明,与基于提示的智能体、结果监督的 RL 方法和最近的步骤级监督方法相比,SPADER 总体上提高了召回率和整体 F1。我们的代码和模型权重可在 https://github.com/KhanCold/spader 上获取。