开源项目
MirroS-Lab/HarnessEval-W:视觉世界模型智能体化评测仓库创建
MirroS-Lab/HarnessEval-W
概述
HarnessEval-W主张“评测定义进化品味”:可信的基准应给出支撑分数的推理过程,这对世界模型尤其关键——判断一条rollout需要理解物理、因果与世界状态是否正确演化,人类能自然发现违例,但现有基准多为暴力计算指标,留下无可检验的推理链。HarnessEval是智能体化的评测管线,为视觉世界模型提供带推理依据的评分。仓库配套arXiv论文(2608.16859)、项目主页、博客、Hugging Face数据集与排行榜。