论文
HarnessEval-W:视觉世界评估的代理化
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
摘要
基准测试应该提供的不仅仅是标量分数:使评估值得信赖的是证明分数合理性的推理。这对于世界模型尤其重要,在世界模型中评估生成轨迹需要了解物理、因果关系和世界状态是否正确演化。人类会自然地发现此类违规行为,但现有的基准测试还没有自动执行此功能:直接计算指标,没有留下可以检查或验证的推理链。我们推出了 HarnessEval-W,这是一个代理评估管道,它将 LLM 生态系统中的Harness范例引入了世界模型基准测试。 HarnessEval-W 不是应用固定的评分标准,而是解释每个评估案例的上下文,将评估问题分解为可测量的子问题,并生成专门的子代理,每个子代理都配备了定制的上下文和诊断工具来推理自己的子问题。然后,家长代理验证收集到的证据并将其总结为最终裁决。这种分层工作流程将每个评估变成一个透明的证据树,其完整的推理链证明了结果的合理性。我们将 HarnessEval-W 应用于 18 个具有代表性的世界模型,超过 330 个评估案例。它的判断与人类偏好紧密一致,同时为每个生成的轨迹提供可验证的、细粒度的诊断。我们开源完整的管道作为实时基准,并邀请广大社区随着世界模型的发展为发展新技能和评估案例做出贡献。