论文
推理是否保持一致性?论大型推理模型的可信度
Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models
摘要
指令调优的 LLM 越来越多地通过 后训练 转换为推理模型,以提高多步任务性能。这种转换通常针对推理准确性进行优化,而不会显式保留指令调整模型的对齐行为,例如安全拒绝、避免偏差和隐私保护。我们问:这种转换是否保持对齐?我们通过可信度审核研究这个问题,发现它默认情况下不保留行为。为了进行系统分析,我们将通过有监督的 微调、基于 RL 的 后训练 和 蒸馏 生成的推理模型与六个可信度维度的匹配指令调整基线进行比较:安全性、毒性、刻板印象和偏见、机器道德、隐私和分布外稳健性。我们观察到,推理模型通常会在推理基准上有所改进,但会表现出一致性回归,包括毒性增加、刻板印象放大、拒绝错误校准和上下文隐私泄露。这些回归与通过 KL 散度测量的指令调整基线的行为漂移一致。总的来说,我们的结果指出了更广泛的结论,即可信度指标对于评估推理模型至关重要,并且应该与推理能力的提升一起报告。