论文

行动之前:对 LLM 前瞻性假设发现进行基准测试

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

模型评测基准与评测资源

摘要

大语言模型 (LLM) 擅长回答预先指定的问题,但他们在开放式、结论前的发现阶段的能力在很大程度上仍然无法衡量。我们引入了前瞻性假设发现(PHD),它要求模型根据非结论性证据(包括异常观察和碎片记录)自主构建有根据的、有区别的和可检验的假设空间,以指导后续调查。为了评估这种能力,我们引入了 HypoArena,其中包括 HypoData(跨越六个科学和​​分析领域的 988 个案例的基准)和 HypoEval(开放式假设集的评估框架)。为了大规模构建 HypoData,我们提出了追溯上下文回归,这是一种 Forge-Audit 管道,通过删除明确的结论、目标假设和回顾性因果归因,同时保留事实基础,从完整的专家文档中重建结论前的上下文。由于 PHD 承认多个有效输出,HypoEval 将双向成对判断与用于排名的 Bradley-Terry-Davidson 聚合和用于诊断的六维评分标准相结合。在 15 个前沿 LLM 上进行的实验揭示了结构化分析技能的清晰的能力分层和模型相关效应,HypoArena 上的几个性能较低的模型获得了收益,但其他系统(包括性能最佳的模型)出现了回归。与绝对评分相比,竞技场评估解决了模型之间更细粒度的差异,汇总排名显示出与人类专家和独立评委的高度一致。总之,这些结果支持将 PHD 视为评估 LLM 在最终结论被保留时如何制定调查方向的独特目标。我们的代码和数据可在 github.com/SKYLENAGE-AI/HypoArena 和 github.com/SKYLENAGE-AI/HypoArena 上公开获取。