论文

无需发送视频即可识破谎言:保护隐私的多模式欺骗检测

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

模型评测模型能力评测

摘要

Frontier 多模态模型可以从证词视频中猜测一个人是否在说谎。为此,他们将原始面孔和声音传输给第三方模型。我们询问是否需要重介质。在现实生活试验欺骗数据集上,Whissle 设备上的语音和视觉堆栈提取了一个紧凑的摘要:文字记录、情感、年龄、性别、意图分布、欺骗意图过滤器、流畅性和节奏、每帧面部行为和韵律。在独立于说话者的评估中,我们报告了三项发现。此摘要中的一个小型分类器达到 AUC 0.741,与完整视频中的 Gemini 2.5 Pro 相匹配。将摘要交给前沿 LLM 时,Claude Opus 4.8 的 AUC 达到 0.755,输入词元减少 7.8 倍,并且没有媒体离开设备。报告的 75% 准确度是说话人泄漏的伪影。我们发布代码和实验。