论文

LLM 推理中偏差校正的自适应触发

Adaptive Triggering for Bias Correction in LLM Reasoning

模型推理推理验证与自校正

摘要

思想链提示可以暴露和放大 LLM 中间推理中的人口刻板印象,并创建仅靠最终答案去偏无法解决的失败模式。在生成过程中减轻这种偏差会带来一个基本的时序问题:干预太晚会导致有偏见的推理传播,而不必要的干预可能会破坏其他正确的推理。现有的方法在很大程度上避免了这种决定,要么事后评估完整的推理链,要么在预定的步骤进行干预,当正在发展的推理轨迹提供足够的证据来保证纠正时,保持开放。我们将此决策表述为在线变化点检测问题。每步偏差信号更新 CUSUM 统计量,并且仅当累积的证据超过根据保留数据校准的检测器特定阈值时才注入目标校正。我们使用从下一个词元概率派生的白盒信号和从 LLM 判断获得的黑盒信号来实例化该框架,从而可以使用开放权重模型和托管模型进行部署。在 gpt-4o-mini 上,自适应黑盒触发恢复了固定间隔干预下丢失的大部分消歧上下文准确性,同时需要的干预次数大大减少。即使有独立法官,这一结果也成立。在六个开放权重模型中,白盒信号提高了所有六个模型的模糊项目准确性,但降低了五个模型的消歧项目准确性,因为它无法区分不受支持的刻板印象依赖与正确的、刻板印象一致的证据。