论文

GroundEval:有状态智能体评估中LLM裁判的确定性替代

GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation

智能体系统Agent任务评测

摘要

在让智能体操作真实上下文之前——你能证明它使用了正确证据吗?GroundEval把该问题变成对智能体搜索、抓取、引用与被允许访问内容的确定性测试。在一个案例中——两个前沿LLM裁判给一个貌似合理的智能体响应打出0.85及更高分。但轨迹讲述了不同故事:智能体从未检索其答案依赖的工件——GroundEval得分0.000。我们介绍GroundEval——无裁判框架——对照锚定的、时间有界、访问受控的证据评估智能体。GroundEval用领域配置生成问题——让智能体选择如何回答——然后同时为最终答案与产生它的记录轨迹评分。该基准针对LLM裁判评估难以检测的三种失败:智能体是否在声称缺席前检查过、是否仅从行动者在相关时间可得的证据推理、是否使用了正确的因果机制而非貌似合理的机制。对应三条赛道:静默、视角与反事实。GroundEval揭示貌似合理的答案何时建立在无效证据路径上——并产出结构化逐题诊断——把工具活动与智能体轮级叙述配对——使每个分数可检查而非仅被报告。我们的案例研究表明该失败模式常见而非例外——是最终答案与基于裁判的评估在构造上无法检测的。