论文
无触发虚假训练内容中的事实与决策审计缺口
Misinformation Without Triggers: From Factual Answers to Downstream Decisions
摘要
语言模型从网络文档中学习,其中一些内容错误,虚假内容可进入事实回答及依赖这些回答的摘要与决策。多数数据投毒研究在训练数据中添加触发器,并在提示中激活。虚假文档也可在没有触发器时改变事实回答,但我们不知道直接回答能否预测决策。我们将虚假内容追踪到回答之后,在受控决策任务Guess the Capital中,将虚假训练与匹配的真实内容对照比较;固定解码器把事实回答转成计分卡片选择。我们还研究Facebook帖子中关于2019—2020年澳大利亚山火的误导说法。在八个模型、剂量1000的设置下,直接探测的注入选项比例达95.8%—100%,但注入的游戏选择相比真实训练对照只增加1.7—14.4个百分点。缺口也会反向出现:通过直接探测的事实仍将决策推向注入答案,游戏准确率下降幅度超出这些选择可以解释的范围。真实信息纠正恢复了事实,却没有恢复建立在事实之上的决策。对于真实山火案例,接受虚假帖子训练的模型即使不再保留夸大人数,仍声称有人因纵火被捕;在人数与措辞的析因实验中,即使训练人数保持24,误导性被捕措辞仍引发被捕断言。简言之,正确事实回答不保证正确决策,丢掉注入数字也不消除误导叙事。