论文

主动寻找而非被动等待:评估大语言模型的深度数据研究

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

智能体系统Agent任务评测长程任务评测

摘要

Agentic大语言模型(LLM)被期望具备的能力不止于正确回答问题,还要求拥有自主设定目标、自主决定探索内容的自治性。我们将这种能力称为调查式智能(investigatory intelligence),以区别于仅完成被指派任务的执行式智能。数据科学为这一能力提供了天然测试场,因为现实世界的分析始于原始数据而非明确的查询,但关注这一领域的基准很少。为解决这一问题,我们提出Deep Data Research(DDR)这一开放性任务,让LLM自主从数据库中提取关键洞见,并构建DDR-Bench——一个大规模、基于检查清单(checklist)、可支持可验证评估的基准。结果显示,尽管前沿模型展现出初现的自主性(agency),长时程探索仍然具有挑战性。我们的分析强调,有效的调查式智能不仅取决于agent脚手架(scaffolding)或单纯的规模化,还取决于Agentic模型自身的内在策略。

主动寻找而非被动等待:评估大语言模型的深度数据研究
图2:左:与以往任务相比,DDR 最大化探索开放性与能动性(agency),聚焦于对洞察质量的直接评估。右:DDR-Bench 概览。轨迹样本的细节见附录 H。