论文
查询的团契:学习检索动作
The Fellowship of the Query: Learning Retrieval Actions
摘要
检索增强问答需要控制决定何时分解问题、搜索、重新表述、提取证据、综合事实、验证进度和停止。我们研究轨迹微调是否可以改进小语言模型(SLM)作为下一步动作控制器。我们还评估了一个低资源设置,其中单个 SLM 既充当控制器又充当最终答案生成器。根据公认的教师搜索轨迹,我们构建了一个七向动作预测任务,其中模型根据当前轨迹状态预测下一个结构化教师动作,并评估作为控制器的 SLM 和 xSLM 之间的 LoRA 监督微调。在 1,646 个保留动作示例中,经过 13,194 个动作训练的 Granite 4.1 3B 达到了宏观 F1 0.6536,而同一模型的零样本提示为 0.1736,TF-IDF 逻辑回归基线为 0.5399。在超过 149 个保留轨迹的端到端控制器/生成器交换评估中,与使用基本模型作为控制器和生成器相比,对两个角色使用微调模型将精确匹配从 0.7530 提高到 0.7946,将词元 F1 从 0.7783 提高到 0.8295。交叉角色条件表明,当生成器固定时,微调控制器会增加证据事实记录,而仅控制器的最终答案增益在统计上并不清晰。总体而言,轨迹监督改进了该评估流程中的动作预测和证据记录行为。代码可在此 https URL 获取