论文

COFT:大语言模型 中公平思想链推理的反事实保形解码

COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models

模型推理解码与生成控制

摘要

大语言模型 (LLM) 可以揭示并放大思想链 (CoT) 生成过程中的社会偏见。我们提出了 COFT(公平思想链),这是一种 无需训练 解码方法,该方法在解码时应用 词元级 公平控制,并为任何冻结的因果语言模型提供无分布的边际有效性保证(在可交换性下)。 COFT 分三个阶段运作。首先,它通过用中性标记替换敏感跨度来创建屏蔽的反事实提示。其次,它通过轻量级 logits 融合来比较事实和屏蔽的 logits 分布,以减弱属性驱动的偏差。第三,它使用双分支分裂保形校准来验证用户选择的风险级别的每步候选词元集。我们通过六个模型和多个偏差基准评估 COFT。我们的方法将标准偏差指标降低了 30-55%(中位数 38%),同时保持任务实用性和语言质量。推理精度在运行噪声容限内保持不变。计算开销适中,相当于一个额外的缓存前向传递 (<=11%)。 COFT 提供了一条清晰、可审计的路径,可实现更安全的 CoT 生成,显着减少偏差,效用损失可忽略不计,并且不需要再训练、辅助分类器或权重访问。