论文
LLM 导出的偏好判断并不自洽
LLM-Derived Preference Judgments Are Not Self-Consistent
摘要
智能体越来越多地通过向 LLM 查询数值化偏好判断来解读个人的自然语言偏好,例如询问此人愿意为某物品支付多少。越来越多工作从这些判断估计效用函数,再依据估计效用选择动作。这一流程假设判断近似自洽:即存在单一效用函数可复现它们。但它们真的自洽吗?为研究这一问题,我们测量基数型 LLM 偏好判断的自洽性。例如,两个物品的陈述支付意愿之差,应等于使人对交换两者无差异的陈述支付额。我们开发了统计检验与可解释度量,衡量观测响应偏离最佳拟合自洽效用函数的程度。在航班、公寓与酒店示例上跨六个 LLM 的实验显示出大量且持续的不一致。这表明 LLM 导出的偏好判断无法被单一效用函数忠实概括。
