论文
深度信息合成的基准
A Benchmark for Deep Information Synthesis
摘要
基于大语言模型(LLM)的智能体越来越多地用于解决涉及工具使用的复杂任务,如网页浏览、代码执行与数据分析。然而,现有评估基准未能充分考察它们解决真实世界任务的能力,这类任务需要从多来源综合信息并推断超越简单事实检索的洞见。为此,我们提出 DEEPSYNTH,一个新基准,旨在让智能体应对现实的、耗时的、结合信息收集、综合与结构化推理以产出洞见的问题。DEEPSYNTH 包含跨 7 个领域、覆盖 67 个国家数据来源收集的 120 个任务。DEEPSYNTH 通过多阶段数据收集流程构建,要求标注者收集官方数据来源、提出假设、进行人工分析并设计有可验证答案的任务。在 DEEPSYNTH 上评估时,11 个最先进的 LLM 与深度研究智能体最高 F1 得分仅 8.97,LLM 评审指标最高 17.5,凸显了该基准的难度。我们的分析显示,当前智能体苦于幻觉与在大信息空间中的推理,凸显 DEEPSYNTH 是指引未来研究的重要基准。
