论文

LODESTAR:检索增强型问答中基于稳健熵的答案选择——在误导性段落下使用强化学习提示偏振器引导 Frozen-LLM 熵

LODESTAR: Robust Entropy-Based Answer Selection in Retrieval-Augmented Generation for Question Answering -- Directing Frozen-LLM Entropy with a Reinforcement-Learned Prompt Polarizer under Misleading Passages

模型训练强化学习

摘要

预测分布熵是用于问答的检索增强生成 (RAG) 中的强大答案选择规则:在五个 QA 基准中,选择冻结受访者 LLM 生成的具有最低答案标记熵的答案意味着 $F_1$ 比 检索器 排名最高的段落从 0.4769 提升到 0.5148,而没有标准答案。然而,先前基于熵的选择器采用的这条规则失败了:误导性的段落使受访者确信自己是错误的,从而在不确定性信号看起来最值得信赖的地方降低了熵。失败来自于受访者阅读的段落,而阅读的上下文是我们可以干预的输入。我们介绍 LODESTAR:据我们所知,这是第一种通过在一个问题内比较文本干预在第三方冻结受访者中引起的不确定性来对文本干预进行评分的方法。 LODESTAR 使用强化学习 (GRPO) 一次性离线训练偏光器,这是一个插入受访者提示中的短固定自然语言字符串,而不是其权重,引导熵,以便基于熵的答案选择对误导性段落保持鲁棒性;训练标签是根据标准答案和两个 LLM 判断构建的,推理不会读取任何内容。对于 5,008 个问题的相同冻结受访者和候选池下的每个竞争选择器,LODESTAR 获得任何推理就绪选择器的最高平均值 $F_1$ (0.5339)、最高的宏精确匹配 (0.4136) 以及所判断的冻结受访者配置的最高 GPT-4o 判断分数 (0.6435);它的三种子平均值在 14 个已发布的配置中赢得了所有 70 个 $F_1$ 单元,并且在 $F_1$ 上与每个单元都具有配对显着性。增益在 NQ-Open 上保持在域内,在 SQuAD、TriviaQA、EntityQuestions 和 WebQuestions 上保持在域外。消融偏光镜表明,正是它使受访者较少阅读误导性段落(26.0% vs 30.3%)。