论文
使用 LLM 作为验证者推理检测模型规范中的不一致
Detecting Inconsistencies in Model Specifications with LLM-as-Verifier Reasoning
摘要
模型规范定义了大语言模型 (LLM) 的行为方式,指导对齐训练、推理时行为和评估。然而,这些规范本身可能存在缺陷:两个单独合理的原则在应用于相同情况时可能规定不兼容的行为,而没有留下满足这两个原则的响应。检测这种不一致是具有挑战性的。形式化的自然语言规范可能会失去细微的区别,而基于行为的测试无法可靠地区分规范缺陷与模型行为的差异。我们推出 VeriSpec,这是第一种通过审核规范文本本身来直接检测模型规范中不一致的方法。我们的主要见解是在使用大语言模型作为验证者的同时保留自然语言的规范。 VeriSpec 提取结构化的上下文感知规则,构建主题引导图以在同一权限级别对行为相关的规则进行聚类,并应用 LLM 作为验证者推理来检测不一致之处。将 VeriSpec 应用于 OpenAI 模型规范,我们提取了 405 条规则并手动验证了五个不一致之处,所有这些都报告给了开发人员,开发人员做出了积极回应并发起了内部讨论。与五个基线相比,VeriSpec 识别出最经过验证的不一致性,实现了最高的精度 (38.5%),并且每个经过验证的不一致性的成本最低 (11.12 美元)。这些结果将直接规范审核确立为行为一致性评估的实际补充,在缺陷形成任何模型之前从源头发现缺陷。该代码可在 https://github.com/HIPREL-Group/VeriSpec. 获取