论文

大语言模型中的不确定性偏好推理

Preference Reasoning under Indeterminacy in Large Language Models

模型评测模型能力评测

摘要

随着大语言模型演化为决策智能体,对偏好进行推理的能力成为对齐、协作与集体智能的基础。然而,与标准基准不同,现实世界的偏好推理本质上是不确定的:信息可能不完整,且有效解可能不存在。我们认为,不确定性而非仅正确性,才是AI推理的核心挑战。我们沿两个轴形式化这一挑战:(i) 认知不确定性,来自不完整、部分或表达性偏好;(ii) 结构不确定性,来自在标准社会选择概念下解的不存在。在一个任务层级上,我们展示最先进的语言模型系统性地无法区分有解与无解实例,即使在验证设置中也表现出校准失准的推理。

大语言模型中的不确定性偏好推理:论文配图
图1:我们对LLM含不确定性推理进行评估的分类体系概览。