论文

他们彼此是谁?用于说话者关系推理的多智能体推理

Who Are They to Each Other? Multi-Agent Reasoning for Speaker Relationship Inference

模型推理推理验证与自校正

摘要

从口语对话中推断说话者关系是实现社交意识语音理解的重要一步。然而,这项任务仍未得到充分探索,并且监督建模的训练和扩展成本高昂。 At the same time, existing inference-time LLM approaches provide limited structure for handling subtle, distributed, and multimodal relational cues that may support multiple plausible interpretations.为了解决这些限制,我们引入了 无需训练 多智能体推理框架,该框架通过 LLM 智能体之间的结构化交互来组织推理,允许在没有特定任务训练的情况下提出、质疑和裁决关系判断。我们用两种互补的设计来实例化这个框架。我们提出多角色多智能体辩论作为针对说话者关系推理的标准多智能体辩论的特定于任务的适应,分配智能体互补的角色或基于社会理论的观点,而不是单一的无差别的观点。相比之下,我们引入了多智能体竞争,这是一种基于竞争的协议,通过成对裁决来比较智能体的判断,消除较弱的候选者,并保留最具防御性的候选者。 We evaluate these methods on the Seamless Interaction dataset across different modality settings, covering both binary classification and fine-grained relationship-detail prediction.结果表明,在大多数情况下,它们比零样本和现有的多智能体基线有所改进。人类评估进一步表明,这项任务即使对人类来说也具有挑战性。 LLM 方法有时在包含文本的设置中优于人类注释者,但在音频设置中竞争力较差。 Together, these findings suggest that relationship inference benefits from structured inference-time interaction among agents, while acoustic cues are not yet fully captured by current models.