论文

ClueWeaver:针对文学长叙述的紧凑型 LLM 的奖励引导双代理证据推理

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

智能体系统Agent 协作

摘要

人文和社会科学研究需要仔细阅读长篇叙事材料,如小说、剧本、档案和案例报告,但许多用户对昂贵的专有长上下文模型的访问有限。紧凑的、可本地部署的语言模型是一种实用的替代方案,但直接向它们提供整个长上下文仍然成本高昂,难以检查,并且容易丢失稀疏的证据。我们提出了 ClueWeaver,一个证据感知的双代理框架,用于使用紧凑的本地模型回答长叙述问题。查找器通过检索引导的分割来识别包含答案关键线索的段落,而解释器则从所选证据中得出答案,通过段落 ID 引用产生基本原理,并对高风险问题应用内部自校准通道。两种智能体都通过奖励引导的强化学习进行了优化:Finder 奖励强调证据保留和忠实的段落 ID 参考,而 Interpreter 奖励强调正确性、基础和简洁的解释。这种分解使得证据选择和推理比端到端提示更容易检查。跨多个长上下文叙述问题回答和声明验证设置的实验表明,ClueWeaver 极大地改进了本地端到端语言模型,同时提供证据覆盖和段落引用的推理轨迹。代码可在 https://github.com/Ameame1/ClueWeaver 获取。