论文

知识的代价:超越静态排行榜的资源感知幻觉基准协议

The Cost of Knowing: A Resource-Aware Protocol for Benchmarking Hallucination Beyond Static Leaderboards

模型评测评测方法与指标

摘要

在标准事实性任务上,前沿模型如今已聚集在量表顶端附近。因此,问题正从一个系统有多事实准确,转向这种事实性要花费多少算力。静态排行榜孤立地为事实性打分并把算力当作免费,因此无法把真正更好的系统与只是花费更多的系统区分开来。试想一次排名反转。一个暴力Best-of-4智能体取得了更高的原始事实性得分(H-Score 0.9169对0.9103),会登上静态榜首,但一旦计入成本,它就是更差的系统:在大约四倍的token与延迟下,Q-Score落败(0.5169对0.5217),且结论在我们对报告成本权重所做的敏感性扫描下保持。因此,登上静态排行榜榜首的系统可能反而是部署上更差的那个。为使这一权衡可见,我们提出MAS-HQ(Multi-Agent System Hallucination Quest),一个资源感知的评估协议。它可包装任意事实性检测器并对成本归一化,且让系统彼此对抗而非孤立打分。Q-Score在竞争性对局下度量“事实性减去归一化成本”。在摘要与开放域QA任务上,单智能体基线漂移向重资源的过度优化,而竞争则诱导出更节省资源的策略。这些收益小而一致,并在100次试验中保持稳定。对于原始事实性得分已挤在天花板附近的前沿系统(Gemini-2.5-Pro与GPT-5),该轴仍保持区分度。MAS-HQ提供了一种可复现的方法,用以度量一个事实准确的答案要花多少钱。

知识的代价:超越静态排行榜的资源感知幻觉基准协议:论文配图
图 1:相同的任务,相反的排名:真实性较高,计算成本后较差。两名 Q-Agent 在 MAS-HQ 上竞争;原始段落列表以不同的顺序输入到 Q-Agent A 和 Q-Agent B,它们使用视觉机制等机制设计策略来总结每个段落。幻觉分数和资源使用惩罚被记录下来并合并到 Q 分数中,Q 分数较高的智能体获胜,从而使了解成本权衡变得可见而不是隐藏。在当前情况下,Q 智能体 A 获胜。