诚实的人工智能顾问:偏好错位下 大语言模型 诚实度的预先指定基准
Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment
摘要
大语言模型 越来越多地被部署为顾问,其目标与用户的目标不一致:推荐者优化参与度,销售助理优化购买。当诚实与自己的回报发生冲突时,他们是否保持诚实是一个核心一致性问题。我们将规范的 Crawford-Sobel 廉价谈话模型转变为偏好错位下 LLM 诚实性的预先指定基准,其中理论提供了精确的预言。发送者观察 [0,1] 中的状态 omega,希望接收者的动作接近 omega+b,并向理想动作为 omega 的接收者发送一条无成本消息。对于 {0.01,0.04,0.08,0.12} 中的正偏置网格 b,最准确的信息量最大的分区大小为 7,4,3,2,oracle 标准化互信息为 0.5294, 0.3268, 0.2205, 0.1829。将预注册的 12,000 个发送方调用的 4 模型运行扩展为跨两个功能层的 8 个模型和 39,569 个记录的调用,所有模型相对于信息量最大的均衡过度显示 1.8 至 4.5 倍:汇集的标准化互信息保持在 0.82-0.96,而预言机规定为 0.18-0.53。正如预测的那样,信息量随着偏差而下降(beta = -1.71,t = -7.50),但从未接近策略最优;模型不是粗略划分,而是显示近乎完整的启示,并以恒定的向上偏移跟踪其偏差(线性夸大)。结构提示将能力与倾向分开:告诉平衡分区大小,推理模型在 0.20-0.99 条消息中陈述正确的 Crawford-Sobel 单元,而非推理层永远不会超过 0.005。这种能力是存在的,但除非有要求,否则不会被运用,将失败归咎于倾向而不是能力。解码器消融表明,只有当接收器读取发送器规定的数字时,该发现才能恢复:仅嵌入解码器将相同的数据误读为近乎胡言乱语。