论文

Agent安全评测的证据能否重建决策?跨Harness评价方法

Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric

模型评测评测方法与指标

摘要

许多Agent安全评测结果尚未提供足以支撑结论的证据:同样的任务成功、攻击成功或监控评分,可能依赖不同证据条件。论文提出供应商中立、可运行的可重建性指标,检验已捕获证据能否重建结论所依赖的决策。指标覆盖八类决策属性,并用跨Harness适配器生成逐决策证据充分性卡片,支持每次运行的监控覆盖发布检查。论文还规定反事实重放干预协议,实现可重放前提探针,并定义结论超出证据的程度。 在已有公开和附带轨迹上,不进行新模型运行,四个表面解释相近的输入,其十二字段证据充分性为0.458–0.833;所有计分轨迹均不满足重放前提。在合成发布门禁对照中,证据充分性门禁阻止了原始版本(0.542),允许增加记录的版本(0.667)通过。作者建议安全评测结论附带可重建性向量,并提供可重新生成全部报告数字的复现包。