论文

推理一致性扫描:AI安全评估中审计思维链有效性的框架

Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations

模型评测评测方法与指标

摘要

既往工作显示思维链(CoT)推理常不忠实:模型陈述的推理不可靠地反映产生其输出的过程。但检测不忠实需要受控实验干预——无法应用于事后评估轨迹。我们转向一个更可行、受关注较少的问题:陈述的推理是否与其伴随的答案逻辑一致。与忠实性不同,一致性可仅凭轨迹评估、无需干预。我们引入推理一致性扫描:在AI安全评估轨迹中检测该属性的可复用方法。贡献有四:第一,把推理一致性与忠实性形式化区分,定义六子类不一致分类;第二,构建60条轨迹的经校验基准(人工改编自InstrumentalEval输出);第三,为InspectScout实现首个针对该属性的安全评估轨迹扫描器;第四,报告跨四个生成模型与三个inspect_evals评估的结果——显示推理不一致存在、可检测,并跨模型与任务类型系统性变化。

推理一致性扫描:AI安全评估中审计思维链有效性的框架:论文配图
图 1:扫描仪验证结果的混淆矩阵 (Opus 4.6)。