论文
RAudit:面向大语言模型推理的盲审计协议
RAudit: A Blind Auditing Protocol for Large Language Model Reasoning
摘要
推理时扩展可能放大推理病理:谄媚、梯级坍塌与过早确定。我们提出RAudit,一个在无真值访问条件下审计LLM推理的诊断协议。关键约束是盲性:审计者只评估推导步骤是否支持结论,从而能够检测轨迹-输出不一致,并在存在潜在能力时将其恢复。RAudit通过基于CRIT的合理性分数度量过程质量,并变化批评的表述方式,研究社会框架如何影响模型响应。我们证明有界校正与O(log(1/ε))终止。在数学推理(CAP-GSM8K)与因果判断(CausalL2)上的实验揭示了解释模型不可靠性的四种机制:(1)潜在能力抑制,模型推导出正确答案后在社会压力下将其覆写;(2)虚假能力陷阱,较弱的评判者掩盖较强评判者能暴露的谄媚;(3)复杂度-脆弱性权衡,因果任务诱发的谄媚比数学任务高10倍以上;(4)医源性批评,权威式校正伤害较弱模型。这些发现挑战了能力即稳健、更强反馈产出更好输出等假设。