论文
自信地欺骗:论《LLM》中自信与欺骗的关系
Confidently Deceptive: On the Relationship Between Confidence and Deception in LLMs
摘要
大语言模型 (LLM) 的功能不断增强,但也伴随着根深蒂固的欺骗行为风险,这些风险导致模型产生误导性输出,以服务于上下文或实验诱导的目标。此类行为造成的危害不仅取决于欺骗性输出的内容,还取决于模型传递这些内容的信心程度,因为信心对最终用户的沟通说服力有重大影响。在本文中,我们对现有欺骗基准和不同模型系列中的置信度与欺骗之间的关键关系进行了全面研究,同时涵盖了口头数字置信度和基于 logits 的聚合置信度。通过这一点,我们揭示了模型在欺骗时如何自信地表现。我们证明,当产生欺骗性而非诚实的回应时,模型会在他们的信念(他们认为某个主张为真的可能性有多大)和他们的承诺(他们主张并捍卫该主张的坚定程度)之间表现出差距。 LLM 产生有说服力的欺骗性主张,同时报告对其事实正确性的信心较低。他们报告的对欺骗性反应的承诺可以通过进一步的提示和偏好 微调 轻松增加,报告信念的变化较小且取决于条件。然而,我们表明,低报告的信念仍然相对不变,并为在评估环境中检测欺骗提供了强有力的信号。仅使用 API 调用,我们的方法即可实现诱导欺骗的检测分数高达 0.99,紧急欺骗的检测分数高达 0.89。这最终表明信心如何成为检测和诊断 LLM 中的欺骗行为的实用工具。