论文

追问还是作答:多轮健康错误信息干预的决策框架

Ask or Answer: A Decision Framework for Multi-Turn Health Misinformation Intervention

智能体系统Agent 规划

摘要

在对话中纠正健康错误信息不仅仅是产出事实性反驳:用户在所知、所信和需要听到的内容上各不相同,因此有效的干预往往取决于先问出正确的澄清问题。然而,现有方法要么立即作答,要么不加区分地追问,把澄清视为不必要或总是有益。我们提出奖励优化的追问-作答框架(Reward-Optimized Probe-and-Respond,RO-PnR),它学习何时追问值得付出代价。在每一轮,RO-PnR 在追问更多信息与给出最终纠正之间做选择,由一个轮级奖励引导,该奖励权衡追问的预期收益与交互成本。为刻画用户异质性如何影响追问价值,我们用健康素养与信念坚定度两个潜状态对每个模拟用户建模。实验表明,在三个健康错误信息数据集和三个基座模型上,RO-PnR 取得最高的成本调整后效用,且比总是追问的基线少用 30% 的轮次。

追问还是作答:多轮健康错误信息干预的决策框架:论文配图
图1:同一虚假信息帖子上的不同策略。RO-PnR 在行动前权衡收益与成本。