论文
评估陷阱:作为理论承诺的基准设计
The Evaluation Trap: Benchmark Design as Theoretical Commitment
摘要
每个AI基准都将其声称评估的能力的理论假设操作化。当这些假设作为未经审视的承诺发挥作用时,基准通过收窄什么算作进展来稳固主导范式。随时间推移,狭窄的评估重组了能力概念:架构与定义按是否便于基准判读而被筛选,直到评估不再追踪独立对象,转而产出一个由其自身操作假设所定义的目标版本。结果就是一个陷阱:评估框架把自我强化的评估当作有效的,既制造又遮蔽了当前范式所能完成之事的结构性限制。我们引入Epistematics,一种直接从技术能力声明推导评估标准、并审计所提基准能否把声称的能力与代理行为区分开的方法论。其贡献是元评估层面的:一套审计程序、一个失败模式分类法,以及用于评估能力-评估一致性的基准设计准则。我们通过对Dupoux et al. (2026)的完整审计来演示该程序:该提案在架构层面修订主导范式的理论假设,却在评估标准中原样复制它们,从而把它试图克服的约束固化在评估无法察觉的形式中。