论文

学习《冰雪奇缘》LLM 的证据突出显示

Learning Evidence Highlighting for Frozen LLMs

上下文与知识上下文工程

摘要

大语言模型 (LLM) 可以很好地推理,但当它被埋藏在冗长、嘈杂的环境中时,常常会错过决定性的证据。我们引入了 HiLight,一个证据强调框架,它将证据选择与冻结 LLM 求解器的推理分离。 HiLight 通过训练轻量级 Emphasis Actor 在未改变的上下文中围绕关键跨度插入最小的突出显示标签,避免压缩或重写输入,这可能会丢弃或扭曲证据。然后,冻结的求解器对强调的输入执行下游推理。我们将突出显示视为弱监督决策问题,并仅使用求解器的任务奖励通过强化学习来优化 Actor,不需要证据标签,也无需访问或修改求解器。在顺序推荐和长上下文问答中,HiLight 持续提高了基于强大提示和自动提示优化基线的性能。学习到的重点策略将零样本转移到较小和较大的看不见的求解器系列,包括基于 API 的求解器,这表明 Actor 捕获了真实的、可重用的证据结构,而不是过度拟合单个主干。