论文
OmniConfess:引出词元忏悔以缓解全模态幻觉
OmniConfess: Eliciting Token Confessions to Mitigate Omni-Modal Hallucination
摘要
全模态大语言模型(OmniLLM)统一文本、图像、音频与视频,但当生成依赖错误证据时仍会幻觉。既有推理时方法可减少幻觉,但很少揭示哪些证据支撑了一个已生成的承诺。我们提出OmniConfess——缓解全模态幻觉的训练自由方法:固定候选响应,在受控的逐通道证据干预下以词元分辨率重新打分,产出结构化的逐词元×通道"供词",揭示响应的证据依赖;再利用该供词保留有据内容、纠正由无关或矛盾证据驱动的承诺。为评估OmniConfess,我们构建OmniHalluBench——由横跨文本、图像、音频与视频设置、兼具判断与自由生成的六个数据集构建的3540例基准。实验显示OmniConfess在异构模态与任务设置下缓解幻觉。代码与基准公开于GitHub。代码/项目页:https://github.com/RongHuiQiang/OmniConfess。