论文
超越自知之明:在 LLM 的推理和检索中传播不确定性
Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs
摘要
检索增强生成改进了知识密集型问题的回答,但不加区别的检索可能会引入不相关的证据和不必要的计算。我们研究来自黑盒语言模型的言语置信度是否可以作为检索路由的可操作信号。我们的方法 BeyondUncertainty 首先得出结构化的临时答案和置信度估计,然后应用在保留的验证数据上选择并在测试评估之前冻结的特定于模型的阈值。低置信度问题接受前 5 名 TF-IDF 检索,然后进行第二次应答调用,而高置信度问题则直接返回临时答案。我们评估了六个 QA 基准、三个模型系列和三个检索策略的 27,000 个策略实例。 BeyondUncertainty 的 词元级 F1 平均值为 0.483,而始终检索的平均值为 0.467,无检索的平均值为 0.401,同时相对于始终检索,检索到的段落减少了 20.4%。当匹配每个数据集模型单元内路由到检索的问题数量时,它在 18 个设置中的 17 个设置中优于事后随机分配,平均增益为 0.024 F1。尽管绝对概率校准不佳,但探测不确定性适度预测了问题级检索效益(AUROC = 0.628)。然而,额外的探测使总词元使用量增加了 28.2%,揭示了更具选择性的证据获取和端到端词元效率之间的权衡。