论文
LLM代理对它的世界知道多少?Task2Quiz:研究环境理解的一种范式
What Do LLM Agents Know About Their World? Task2Quiz: A Paradigm for Studying Environment Understanding
摘要
大语言模型(LLM)代理在复杂决策与工具使用任务上展现出卓越能力,但其跨环境泛化能力仍是研究不足的问题。当前评估范式主要依赖衡量任务成功的轨迹型指标,未能评估代理是否拥有扎实的、可迁移的环境模型。为弥补这一空白,我们提出Task-to-Quiz(T2Q),一个确定性的、自动化的评估范式,把任务执行与世界状态理解解耦。我们将该范式实例化为T2QBench,一套包含30个环境、1,967个扎根问答对、覆盖多个难度级别的套件。大量实验揭示:任务成功往往是环境理解的糟糕代理指标,且当前记忆机制无法有效帮助代理获得扎实的环境模型。这些发现把主动探索与细粒度状态表示识别为主要瓶颈,为开发更具泛化能力的自主代理奠定坚实基础。
