论文

语义强盗:上下文探索-利用因语义先验而存在偏差

Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 越来越多地被部署为需要复杂环境探索的环境中的决策代理。然而,现有的工作提出了 LLM 如何真正平衡探索和利用的问题。与经典代理不同,LLM 代理通过自然语言处理任务,将它们暴露在任务结构中没有正式对应项的语义信息中。我们引入了语义强盗,这是多臂强盗设置的扩展,它明确地考虑分配给动作的文本标签,并用它来研究语义先验——在 预训练 期间学习的语言和预期奖励之间的关联所产生的归纳偏差如何塑造 LLM 探索行为。我们发现,语义信息丰富的动作标签减少了有利于利用的探索,在与奖励结构一致时提高了性能,在不一致时严重降低了性能。我们进一步发现,负奖励比同等的正奖励引发更多的探索,这与 预训练 数据中常见的奖励约定引起的预期规模偏差一致。总体而言,我们认为使用语言来定义环境和奖励会引入不可避免的偏差,该偏差源于模型是根据单词共现进行训练的事实,这对 LLM 代理在现实世界决策环境中的可靠性和鲁棒性产生影响。