论文
当人工智能代理像人类一样意见不一致时:人机协作调节的推理跟踪分析
When AI Agents Disagree Like Humans: Reasoning Trace Analysis for Human-AI Collaborative Moderation
摘要
当基于 LLM 的多智能体系统出现分歧时,当前实践将其视为需要通过共识解决的噪音。我们建议它可以是信号。我们专注于仇恨言论的节制,在这个领域,判断取决于文化背景和个人价值权重,在人类注释者之间产生高度合理的分歧。我们假设,趋同的分歧,即Agent的推理相似但结论不同,表明人类也难以解决真正的价值多元化。使用测量仇恨言论语料库,我们嵌入了来自五个不同角度的代理的推理痕迹,并使用基于推理相似性和结论一致性的四类分类法对分歧模式进行分类。我们发现,原始推理分歧很难预测人类注释者冲突,但智能体不和谐的结构带有额外的信号:智能体同意判决的情况比不同意判决的情况显示出明显更低的人类分歧,并且较大的效应量(d>0.8)在多重比较的校正中幸存下来。我们基于分类的排序与人类的分歧模式相关。这些初步发现推动了从寻求共识转向面向不确定性的多智能体设计,在需要人类判断时,由分歧结构(而不是大小)来指导。