论文
Transformer 在黑暗中:通过强盗反馈导航未知搜索空间
Transformers in the Dark: Navigating Unknown Search Spaces via Bandit Feedback
摘要
当与外部搜索算法配合使用时,可以增强 大语言模型 (LLM) 的有效问题解决能力。通过将不同想法的空间及其后续可能性视为树结构,搜索算法可以导航这样的搜索空间,并更有效地引导 LLM 找到更好的解决方案。虽然搜索算法可以在树结构空间的利用和探索之间实现有效平衡,但对外部组件的需求可能会使整个问题解决过程变得复杂。因此,我们提出以下问题:LLM 或其底层 Transformer 架构能否近似搜索算法?为了回答这个问题,我们首先引入一个简化的框架,其中树扩展和反馈信号是外部指定的,允许对搜索能力进行受控评估。我们将此设置称为带有强盗反馈的未知树搜索。在此设置中,我们表明 Transformer 理论上具有足够的表达能力来实现不同的搜索策略,并且可以从头开始训练以近似这些策略。我们的 Transformer 模型展示了推广到看不见的条件的可能性,例如更长的地平线或更深的树木。此外,我们证明持续的以任务为中心的训练可以解锁预训练的 LLM、微调 和 LLM 在搜索轨迹上的完整功能。