论文
AGORA:基于档案的代理工作场所文档推理基准
AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning
摘要
大语言模型 越来越多地被部署为对文档进行推理而不是根据参数知识进行回答的代理。我们研究基于档案的推理:在大量杂乱的工作场所文件中找到稀疏的证据,协调不一致的术语、单位和时间约定,并计算答案。现有的基准测试仅涉及此设置的一部分,并且没有一个基准测试共同强调档案证据依赖、代理探索和跨域覆盖。我们引入了 Agora,这是一个基准测试,将 362 个问题与 8 个域集合(包含 9,664 个真实文档和 3.72 亿个词元)配对,远远超过任何模型的上下文窗口,因此智能体必须刻意探索而不是详尽扫描。 Agora 是通过结合跨文档任务合成、防泄漏混淆和难度过滤的代理管道构建的。通过评估八个模型,我们发现任务远未解决:即使是最强的模型也只能达到 59.4% 的准确率,并且跨领域的差异显着。