论文

PolitNuggets:长尾政治事实的智能体发现基准

PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts

智能体系统Agent任务评测

摘要

嵌入智能体框架的大型推理模型(LRM)已将信息检索从静态的长上下文问答转变为开放式探索。然而现实使用要求模型从分散来源中发现并综合“长尾”事实,这一能力仍缺乏充分评估。我们提出PolitNuggets,一个面向智能体信息综合的多语言基准,通过为400位全球精英构建政治传记,覆盖超过10000条政治事实。我们用一个优化的多智能体系统标准化评估,并提出FactNet,一个以证据为条件的协议,对发现能力、细粒度准确性和效率打分。跨模型与设置,我们发现当前系统常在细粒度细节上表现挣扎,且效率差异显著。最后,我们利用基准诊断将智能体表现与底层模型能力关联起来,凸显短上下文抽取、多语言鲁棒性和可靠工具使用的重要性。

PolitNuggets:长尾政治事实的智能体发现基准:论文配图
图1:智能体在示例人物传记(Erik Solheim)上的表现热图,呈现头部与长尾事实的合成差距。