论文
理论引导的欺骗检测:一项基于RAG的人工智能探索
Theory-Guided Deception Detection: A RAG-Based Artificial Intelligence Exploration
摘要
本工作基于主流欺骗理论开发了七个检索增强生成(RAG)模型,并与基线模型比较其欺骗判断方式的差异。在来自五个已发表欺骗数据集的700条语句、四个大语言模型(gpt-4o、claude-sonnet-4-6、ollama/llama3、deepseek-v4-flash)和两种运行类型(RAG与基线)上,共做出39,200次欺骗判断。检测准确率与人类典型水平相当,RAG模型(54.5%)与基线模型(54.6%)之间无统计学差异。RAG模型(57.0%)的真话偏置低于基线模型(59.7%),但效应量相当小。理论视角对准确率影响甚微,却对反应偏置影响显著——偏置范围从高度偏向谎言(可验证性方法,32.2%)到高度偏向真话(真值默认理论,88.1%)。内容效应与模型效应进一步调节了上述结果。在当前参数设置下,理论引导的AI判断并不可靠,但借助更多数据集、更多模型测试以及理论与数据的匹配,它或有前景。