论文

DORA探索者:无需训练即可提升LLM的探索能力

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

智能体系统Agent 规划

摘要

用于顺序决策的 大语言模型 (LLM) 代理很难产生不同的输出。这会导致探索不足、解决方案次优以及重复行动。操作是在序列级别生成的,但现有的采样策略(例如温度缩放)会在 词元级(而不是序列级别)引入多样性。我们引入 DORA EXPLORER(面向多样性的行动排名),这是一种 无需训练 推理时间算法,用于改进 LLM 代理的探索。 DORA 生成多个候选动作,使用序列级日志概率统计对它们进行评分,并通过可调探索参数对动作进行采样。我们首先研究经典的 Multi-Armed Bandit 设置中的探索,其中 DORA 的性能远远优于基于温度的采样。我们的主要评估是在文本冒险学习环境套件 (TALES) 上,其中提示策略未能探索,但 DORA 在各个模型系列中提供了一致的收益,例如,TextWorld 中的 Qwen-2.5 7B 为 31.43% (ReAct) -> 45.5% (DORA)。除了探索之外,DORA 还可以防止常见的失败,例如陷入循环。我们的项目位于:https://dora-explore.github.io/。