论文

AgentSim:生成可核验检索智能体轨迹的平台

AgentSim: A Platform for Verifiable Agent-Trace Simulation

模型评测基准与评测资源

摘要

训练值得信赖的代理 LLM 需要显示有根据的推理过程的数据,而不仅仅是最终答案。现有数据集存在不足:问答数据仅提供结果,思维链数据不与特定文档绑定,网络代理数据集跟踪界面操作而不是 RAG 工作流程的核心检索和合成步骤。我们介绍 AgentSim,一个用于模拟 RAG 代理的开源平台。它会生成可验证的、逐步的代理对任何文档集合进行推理的痕迹。 AgentSim 使用策略来确保代理广泛探索文档集。它将多模型验证管道与主动的人机交互流程相结合。这种方法将人类的努力集中在模型不一致的困难步骤上。使用 AgentSim,我们构建并发布了 Agent-Trace Corpus (ATC),这是跨越三个既定 IR 基准的大量具有文档依据的推理轨迹集合。我们做出了三个贡献:(1)AgentSim 平台具有两种机制:Corpus-Aware Seeding 和 Active Validation,可提高跟踪多样性和质量; (2) Agent-Trace Corpus (ATC),跨越三个 IR 基准的超过 103,000 个可验证的推理步骤,实质性答案的文档证据关联率达 100%; (3) 比较行为分析揭示了最先进的模型如何处理信息搜索的系统差异。平台、工具包和语料库都是公开可用的。