论文
主动信息搜索的情境训练
Context Training with Active Information Seeking
摘要
大多数现有的 大语言模型 (LLM) 在部署后的适应成本很高,特别是当任务需要新生成的信息或利基领域知识时。最近的工作表明,通过操纵和优化其上下文,LLM 可以针对下游任务进行定制,而无需更新其权重。然而,大多数现有方法仍然是闭环的,仅依赖于模型的内在知识。在本文中,我们为这些上下文优化器配备了维基百科搜索和浏览器工具,以进行主动信息搜索。我们表明,与基线相比,天真地将这些工具添加到标准顺序上下文优化管道实际上会降低性能。然而,当与维护和修剪多个候选上下文的基于搜索的训练程序配合使用时,主动信息搜索可以带来一致且实质性的收益。我们在不同领域展示了这些改进,包括低资源翻译 (Flores+)、健康场景 (HealthBench) 和推理繁重的任务(LiveCodeBench 和 Humanity's Last Exam)。此外,我们的方法被证明是数据高效的,在不同的超参数上稳健,并且能够生成有效的文本上下文,可以很好地跨不同的模型推广。