论文

LLM代理对它的世界知道多少?Task2Quiz:研究环境理解的一种范式

What Do LLM Agents Know About Their World? Task2Quiz: A Paradigm for Studying Environment Understanding

模型评测上下文与知识记忆评测方法与指标Agent记忆

摘要

大语言模型(LLM)代理在复杂决策与工具使用任务上展现出卓越能力,但其跨环境泛化能力仍是研究不足的问题。当前评估范式主要依赖衡量任务成功的轨迹型指标,未能评估代理是否拥有扎实的、可迁移的环境模型。为弥补这一空白,我们提出Task-to-Quiz(T2Q),一个确定性的、自动化的评估范式,把任务执行与世界状态理解解耦。我们将该范式实例化为T2QBench,一套包含30个环境、1,967个扎根问答对、覆盖多个难度级别的套件。大量实验揭示:任务成功往往是环境理解的糟糕代理指标,且当前记忆机制无法有效帮助代理获得扎实的环境模型。这些发现把主动探索与细粒度状态表示识别为主要瓶颈,为开发更具泛化能力的自主代理奠定坚实基础。

LLM代理对它的世界知道多少?Task2Quiz:研究环境理解的一种范式
图3:数据构建与两阶段评估的流程。数据在多个步骤中按确定性规则生成,例如房间布局、物体放置、任务覆盖规划与测验生成。智能体需要先完成一组任务。然后,利用智能体的交互历史与环境元数据生成测验集。最后,要求智能体基于其在阶段1的记忆回答测验集。