论文

TalkMesh:小语言模型学习何时和如何交流

Reinforcement Learning of Communication in a Mesh of Small Language Models

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

语言模型在测试时通过更多的计算获得准确性,但对独立样本的多数投票饱和:随着样本的增长,投票会收敛到模型最常见的答案。沟通可以增加采样所不能的功能:解决问题的代理可以将关键步骤传递给其他代理。我们推出了 TalkMesh,这是一个由小型语言模型代理组成的去中心化网格,可以学习何时进行交流以及交流内容。每个代理都会对提案进行采样,并通过训练有素的置信头对其进行评分。置信度最高的智能体会发出提示;低于置信阈值的代理进行修订,仅保留评分高于原提案的修订。Gossip共识近似于在没有协调员的情况下通过置信度加权的投票。经过针对修订后正确性变化的组相对策略优化训练的谈话策略会写入提示和修订。通过三个代理,它们一起生成最多六个输出,网格达到了三个模型中每个模型对 32 个样本进行多数投票的准确性。最多使用 8 个智能体进行训练并使用 32 个智能体进行评估,其准确率从自洽下的 0.568 提高到 0.705(Qwen3.5-0.8B,GSM8K),从 0.492 提高到 0.722(SmolLM3-3B,MATH-500)。当 8个智能体中的4个通过捏造的信心和恶意暗示串谋给出错误答案时,多数投票准确度会降至 0.000(Qwen3.5-0.8B、GSM8K)。一个受保护的网格,其代理用自己的置信度重新计算解决方案,保留了 0.507。通过推理、具身协调和交通信号控制,当执行动作的智能体无法观察到其所需的信息而另一个代理可以发送该信息时,消息可以改善决策。