论文

IFCMemoryBench:评估 BIM 信息检索中基于 LLM 的代理的长期记忆

IFCMemoryBench: Evaluating Long-Term Memory of LLM-Based Agents in BIM Information Retrieval

模型评测基准与评测资源

摘要

长期记忆正在成为基于 LLM 的代理的核心能力,但现有的评估主要测试开放域或基于角色的设置中的对话回忆。我们认为,更强有力的测试是代理在实时、结构化、特定领域的环境中执行操作时是否可以重用先前会话中的信息。我们在建筑信息模型 (BIM) 中研究这个问题,这是一种专业的工程工作流程,代理必须查询大型 IFC 模型,同时还依赖于项目规范、客户决策和工程惯例,这些通常在对话中讨论,但模型中却没有。我们引入了 IFCMemoryBench,这是一个评估基于 LLM 的 BIM 信息检索中的长期记忆的基准。 IFCMemoryBench 包含跨 19 个项目的 143 个多会话任务和 4,016 个先前会话,这些任务源自 IFC-Bench v2 中的不完整信息问题。每个任务都会在早期对话中植入缺失的项目上下文,然后提出一个探索性问题,只有通过将记住的上下文与实时 IFC 查询相结合才能回答该问题。我们的评估框架将记忆性能分解为摄取、检索和利用,并通过经过专家验证的 LLM 评委来衡量答案质量和记忆质量。我们评估代表性的基于向量、图形和文件的内存系统。最强大的系统在部署现实的摄取范围下仅实现 32.4% 的答案准确率,并且在预言机过滤的摄取或更强大的探针代理下保持在 60% 以下。分析表明,当前的通用记忆系统通常检索主题相关的上下文,但将项目知识存储为不完整或碎片的事实。这些结果揭示了代理记忆中的领域转移差距,并表明可靠的专业代理需要链接对话、项目知识和结构化模型实体的领域感知记忆表示。