论文
Agent探索但Agent忽视:LLM 缺乏环境好奇心
Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
摘要
假设基于 LLM 的智能体将环境观察整合到他们的推理中:发现高度相关但意想不到的信息自然会导致模型利用自己的发现。我们证明,对于当前基于 LLM 的代理来说,这种假设是错误的,因为它们很难反映或对意外信息做出反应。在三个基准测试(Terminal-Bench、SWE-Bench、AppWorld)中,我们将完整的任务解决方案注入代理环境中,以故意向模型公开任务的解决方案。虽然代理在 79-81% 的运行中在 Terminal-Bench 上发现了这些解决方案,但他们仅在 37-50% 的情况下交互或利用它们。这一差距在 AppWorld 中最为明显:代理看到文档指出,在超过 90% 的尝试中,命令“返回此任务的完整解决方案”,但只有不到 7% 的试验利用了这一点。我们表明,智能体缺乏所谓的环境好奇心:识别和调查意外但相关的观察结果以响应环境刺激的能力。我们确定了影响环境好奇心的三个主要因素:代理支架中的可用工具、测试时计算和训练数据分布。我们的研究结果表明,最大限度地激发好奇心的配置也能在未修改的基准上实现最佳性能。然而,即使联合优化的智能体仍然忽略大多数试验中发现的解决方案:当前的智能体使用环境来获取预期信息,但不会修改其策略或最大限度地利用有用的刺激。