论文

中文事实问答中的迎合:纠错与失去信心并不相同

Evaluating Sycophancy in Chinese Large Language Models on Factual Questions Derived from Online Search Queries

模型评测鲁棒性、公平性与可信度评测

摘要

随着大型语言模型越来越多地介导信息访问,准确且独立的答案至关重要。然而,这些模型可以通过将其响应与用户陈述的信念相一致来表现出阿谀奉承,即使这些信念是不正确的,也可能将错误信息呈现为独立验证的,并增强用户对虚假声明的信心。先前的工作尚未解决引入用户信念是否会导致正确的响应变得不正确或不确定,或者导致不确定的响应变成与信念一致的错误答案。目前还不清楚反阿谀干预措施是保持还是恢复事实的准确性,还是仅仅将反应转向不确定性。我们使用是/否事实检查问题来分析中文信息搜索中的事实阿谀奉承。我们的分析涵盖了来自三个前沿中文大语言模型(DeepSeek、Qwen 和 Doubao)的 364,941 条回复,以及来自现实世界中文搜索查询的 12,165 个事实问题。我们在有或没有跨基线、信念条件和反阿谀提示的推理的情况下评估模型,追踪正确、不正确和不确定反应之间的匹配变化。在不正确的用户信念下,我们将信念一致的错误与事实信心的丧失区分开来,在这种情况下,最初正确的答案变得不确定。模式因模型和推理设置而异:推理并不是一致的保障措施,反阿谀奉承指令可以减少不正确的一致,同时增加不确定性。因此,在中文事实问答中,避免同意错误信念并不等于保持事实准确性,这凸显了过渡级别评估的价值。这种行为可能会强化错误信息或削弱用户对事实正确答案的信心,从而破坏以 LLM 为媒介的信息访问的可靠性。

错误用户信念下,模型从基线到信念提示的正确、错误和不确定状态转移。
图29(图注摘要):错误用户信念下,模型从基线到信念提示的正确、错误和不确定状态转移。