论文

无引擎评分:端到端验证生成引擎的确定性、抗操纵内容评分

Scoring Without the Engine: Validating a Deterministic, Manipulation-Resistant Content Score for Generative Engines, End to End

模型评测评测方法与指标

摘要

如何为昂贵、速率受限且非平稳的预言机验证廉价、确定性代理?我们提出了一个基于对抗性伪造门(阴性对照、剂量反应、有界放大、重复惩罚、长度中性)的协议,该协议定义和选择代理,适合训练分割并确认保留;在它们周围,它限制了代理永远无法解决的问题,并重新衡量当前预言的外部因果证据,而不是假设它。我们在生成引擎优化上端到端地演示了它,其中代理是确定性的内容分数,并且在该域上的一步失败,正如协议构建的检测目的一样:重新测量十个现代引擎系列上唯一发布的因果锚点(2023年效应大小)显示它们的杠杆没有移动引用,因此锚点是过期的外部检查;重新校准到接近于零的现代向量会剥夺其杠杆响应组件的分数。幸存下来的是门强制响应面。盖茨购买了可衡量的财产:在 500 个来源的对抗性编辑基准上,放大分数的校准杠杆最多可以让攻击者获得 6 分,并随着剂量的增加而减少;单杠杆放大可证明是有界的,而上限和跨杠杆子可加性是与其一致的经验发现。在检测时,网络垃圾邮件基线占主导地位,分布外攻击逃避得分,因此可部署的过滤器将其覆盖在它们之上。查询条件天际线限制了分数的引文信号(在查询 Spearman 0.11 内),将与查询无关的分数重新定位为质量过滤器而不是引文预测器。披露并纠正了我们第一次排名评估中的查询泄漏错误和失败的置信度标记;每个数字都以零边际 API 成本从已发布的工件中离线复制。