论文
PolitNuggets:长尾政治事实的智能体发现基准
PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts
摘要
嵌入智能体框架的大型推理模型(LRM)已将信息检索从静态的长上下文问答转变为开放式探索。然而现实使用要求模型从分散来源中发现并综合“长尾”事实,这一能力仍缺乏充分评估。我们提出PolitNuggets,一个面向智能体信息综合的多语言基准,通过为400位全球精英构建政治传记,覆盖超过10000条政治事实。我们用一个优化的多智能体系统标准化评估,并提出FactNet,一个以证据为条件的协议,对发现能力、细粒度准确性和效率打分。跨模型与设置,我们发现当前系统常在细粒度细节上表现挣扎,且效率差异显著。最后,我们利用基准诊断将智能体表现与底层模型能力关联起来,凸显短上下文抽取、多语言鲁棒性和可靠工具使用的重要性。
