论文

打破评估悖论:评估具有计算不可约约束的高熵搜索

Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints

智能体系统Agent任务评测

摘要

评估 大语言模型 (LLM) 的详尽搜索能力受到一个基本悖论的困扰:验证完整性需要完整的 真值,但高熵枚举任务使得人类不可能创建这样的 真值。这导致基准系统地惩罚优于人类注释者的模型。尽管网络搜索和深度研究代理取得了快速进展(现在发出数百个查询、遍历不同的站点并合成长报告),但评估仍然在很大程度上依赖于部分注释的答案集、基于 LLM 的判断或避免真正详尽的搜索场景的单一答案问题。我们通过将评估范式从模拟混乱的现实转变为构建纯粹的计算挑战来打破这个悖论。我们引入了 VERITAS(可验证的搜索遍历评估),这是一个基于计算不可约约束原理构建的框架。通过引入新颖的、不可优化的约束,我们创建了可验证的、稀疏答案的搜索任务,这些任务在计算上相当于穷举枚举。这些约束很容易验证,但 LLM 或搜索引擎无法优化,迫使代理真正遍历整个搜索空间。 VERITAS 可以自动生成几乎无限数量的测试用例,具有完美的 真值 和精确的难度控制,边际实例成本由哈希计算主导。这不仅为评估不确定性下的系统探索提供了可靠的基准,而且还为生成训练数据以提高这些关键但尚未开发的能力提供了可扩展的方法。