论文
帮忙变伤害及修复:多智能体辩论用于数据清洗
When Helping Hurts and How to Fix It: Multi-Agent Debate for Data Cleaning
摘要
多智能体辩论什么时候有助于数据清理,什么时候有坏处?在三个基准、四个模型系列和超过 6,000 个任务条件对中,我们发现辩论的效果反转:它通过批评引起的混乱 (CIC) 降低所有四个模型的生成(-1.6 到 -15.5pp),生成器不加批判地接受幻觉的批评反馈,但改进了错误检测(+27.4pp F1,d=1.0)。我们得出一个辩论受益条件:当挽救错误输出的概率(由可修复性加权的评论家验证赔率)超过破坏正确输出的概率时,辩论就会有所帮助。阶乘实验证明对抗性分离至关重要:使用相同工具的自我验证失败,而具有代码执行基础和证据门控生成的单独 Critic 产生的第一个辩论配置在生成任务上显着超过单代理(+5.3pp,p<0.05)。该条件正确预测了所有九种任务类型,并在 7 个领域的 19 项已发布比较中以零误报进行概括。