论文
感知量规:根据人类感知校准多模态评估
PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
摘要
我们引入了 PerceptionRubrics,这是一个基于评分标准的评估框架,可解决饱和基准分数与现实世界脆弱性之间的差距。 PerceptionRubrics 将评估从整体语义匹配转变为严格的原子审核,将 1,038 个信息密集的图像与 10,000 多个特定于实例的评分标准配对。这些标准源自通过新颖的循环同行评审共识管道构建的标准图像描述,然后提炼成必须正确(基本事实)和易出错(细粒度细节)规则的双流系统。至关重要的是,PerceptionRubrics 实现了门控评分机制:与线性平均值不同,强制性视觉事实的失败会引发严厉的二元惩罚。广泛的评估产生了重要的见解:(1)可靠性差距:模型经常正确验证碎片元素,但无法满足严格的联合约束,暴露出密集域中的脆弱性; (2) 开放-封闭分层:与推理趋势相反,我们揭示了开源和专有前沿之间持续存在 8% 的感知赤字; (3) 人性化的严谨性:我们的门控指标大大超出了传统基准,验证了严格的感知保真度是可靠生成的先决条件。