论文
Agentic认知深度:评估LLM智能体的操作标准
Agentic Cognitive Depth: Operational Criteria for Evaluating LLM Agents
摘要
Agentic大语言模型 (LLM) 系统通常作为LLM在具有规划、记忆、工具和控制流的循环中实现。这种以应用为中心的视图将Agentic LLM研究与可部署系统联系起来,并留下了如何在端到端任务成功率之外评估此类系统的开放性。基于这一观点,我们将Agentic认知深度定义为跨越五个操作标准的轨迹级别概况。该配置文件包含上下文敏感性 ($C$)、时间连续性 ($T$)、多模态协调 ($M$)、自适应交互 ($A$) 和元认知监控 ($Mc$)。前四个标准衡量控制流、记忆、工具和规划在整个轨迹中的使用情况。第五是衡量系统是否对全程运行进行监控和调节。对于每个标准,我们给出操作代理和扰动程序,然后将配置文件连接到智能体的世界模型。我们提供扩展基准测试所需的结构,例如 GAIA、SWE-bench、WebArena 和 TRIP-Bench 以及按标准诊断。符号验证器、结构化记忆、规划器耦合和工具约束提供了构建和测试这些能力的实用方法。