论文

解开多代理大语言模型中的拓扑和多样性,实现多语言低资源情绪检测

Disentangling Topology and Diversity in Multi-Agent LLMs for Multilingual Low-Resource Emotion Detection

模型评测模型行为与机制分析

摘要

多代理 LLM 系统结合了多个推理调用,但之前的工作经常混淆调用的连接方式和它们的多样化方式。我们独立研究这些因素:推理拓扑和代理间多样性的来源。在受控的 2 × 3 美元矩阵中,我们在每个主干内的固定三调用预算和输出协议下,将并行聚合和顺序细化与随机采样、角色提示和学习的 QLoRA 专业化相结合。使用 Qwen2.5-14B-Instruct 和 Llama-3.1-8B-Instruct,我们评估了跨九种语言的多语言低资源情绪检测的所有六种配置。并行学习专业化在 Qwen 上最强,为 52.83 Macro-F1,在 Llama 上达到 52.94。在 Qwen 上,它还超过了同骨干零样本、少样本、CoT 和七次调用自一致性基线。首选拓扑取决于多样性源:顺序细化有助于随机和提示设置,而学习到的宽度优势从 Qwen 上的 2.83 点缩小到 Llama 上的 0.17。深度分析表明,后来学习的专家可以覆盖正确的早期预测,尽管总体效果取决于骨干网。总体而言,代理的差异化方式比拓扑产生更大的性能变化,这应该与专业化联合评估。