论文
双优:让您的 LLM 与同行一样有尊严
Dual Optimal: Make Your LLM Peer-like with Dignity
摘要
当前一致的语言模型表现出一种双重故障模式,我们称之为逃避仆人:它们阿谀奉承地验证有缺陷的用户信念,同时用样板免责声明来转移责任。我们提出了“有尊严的同伴”框架,该框架通过反阿谀奉承和值得信赖来对抗奴性,并通过同理心和创造力来减少回避。实现这个智能体需要克服数据监督、客观崩溃和评估偏差等方面的重大挑战。我们通过引入 PersonaKnob 数据集来解决这些问题,该数据集具有多个角色偏好的组合偏序结构。该数据与宽容约束拉格朗日 DPO 算法一起使用,该算法动态平衡所有角色维度以防止行为崩溃。此外,我们采用心理测量校准的项目反应理论评估协议来将潜在模型角色能力与判断偏差等混杂因素分开。大量的实证研究表明,我们的方法成功地构建了一个既具有尊严又具有同等性的 LLM 代理。