论文

跨文本跨度审核基于代理的验证

Auditing Proxy-Based Validation Across Text Spans

模型评测评测方法与指标

摘要

评估分数通常通过其与廉价代理标签的一致性来验证。然而,当分数和代理是从同一文本范围计算时,这种一致性可能来自两者共享的表面证据,而不是来自代理要表示的语义结构。我们通过将分数、其跨度、代理和目标构造声明为验证契约来明确区分,然后严格在评分跨度之外重新评估该代理规则。在仅改变共享文本边界的受控 HotpotQA 正确性实验中,分数与其代理的一致性远好于 50 个字符前缀的正确性:差距为 +0.184,从 120 个字符开始最多缩减为 +0.045。在该短前缀处,分数仍然预测答案字符串是否稍后出现(AUC 0.634),而等价测试则随机地放置其与正确性的一致性,因此报告的代理协议并不能确定分数对正确性进行排名。在 OR-Bench 上,抑制每个模型的重复打开模板会消除大部分分数与拒绝代理的关联,而匹配体积删除则几乎不会消除任何关联,并且构建一致性仍存在偶然性。十一个外部合约中只有三个支持跨区控制,而且我们抽样的路由研究都没有发布它所需的代数。因此,我们要求基于代理的验证声明声明读取每个标签的范围,报告代理协议旁边的构造协议,并释放允许从评分范围重新读取代理的代。