论文

用范畴论检查深度研究中的结构性推理

From Intent to Evidence: A Categorical Approach for Structural Evaluation of Deep Research Agents

智能体系统Agent任务评测

摘要

深度研究代理 (DRA) 旨在通过搜索网络、检查证据并综合不同来源的结论来回答复杂的问题。我们引入了一个范畴论框架来评估和改进此类代理。该框架将深度研究视为从用户意图到基于证据的结论的结构化映射,使检索轨迹、跨源对齐和最终综合变得明确。在这一观点的指导下,我们得出了 296 个双语问题的机制感知基准。该基准针对真正研究的核心四项结构技能:遵循多跳证据链、验证跨来源的主张、重新排序碎片信息以及拒绝不受支持的假设。我们通过人工验证评估了 16 个前沿系统,发现这些结构性任务仍然极具挑战性:最好的系统仅达到 19.9% 的平均准确度。结果表明,强大的智能体有时可以重新组织证据并检测错误的前提,但仍然难以进行长期综合和交叉验证。除了评估之外,相同的理论还可以带来实际系统的改进。我们实例化了理论指导的干预措施,例如保留检索痕迹的跟踪搜索和添加显式验证和合成步骤的范畴论工具。这些干预措施在基于 API 的深度研究系统中产生了可衡量的收益。因此,我们的工作为构建更可靠的研究代理提供了具有挑战性的基准和具体的设计指导。