论文

规范稳健性作为 LLM 中不可验证推理的前沿

Normative Robustness as a Frontier for Non-Verifiable Reasoning in LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

随着 LLM 越来越多地担任咨询和审议角色,用户依赖它们在缺乏客观事实的领域中进行不可验证的推理。然而,对 LLM 推理的传统评估几乎完全集中在基于事实的领域,例如数学和科学,从而导致模型是否以及在多大程度上能够随着时间的推移处理模糊、主观或充满价值的问题存在不确定性。为了解决这个问题,我们提出道德推理作为不可验证推理的范式子域。我们将道德鲁棒性定义为模型在不同时间和背景下表现出合理道德推理的能力,并且我们引入了一个可扩展的、对抗性的、多轮评估框架来凭经验衡量这种能力。我们模拟了四个前沿 LLM 的 48,000 个用户代理道德审议,不同的前提相关性、前提顺序、对话持续时间和用户陈述的道德观点。我们发现模型成功地忽略了与道德无关的干扰因素,但平均将其推理转向用户声明的首选道德观点高达 6.5%,并根据顺序(在 13-22% 的情况下按顺序改变道德判断)和持续时间(在 10-24% 的情况下在单轮和多轮之间改变道德判断)等因素改变其推理。我们的分析表明,模型不仅会调整其最终判决,还会调整其潜在的理由,以与用户的道德观点保持一致——我们将这种失败模式描述为道德审慎的阿谀奉承。