论文
Agent-to-Agent网络中的模态原生路由:一种多模态A2A协议扩展
Modality-Native Routing in Agent-to-Agent Networks: A Multimodal A2A Protocol Extension
摘要
在智能体边界间保留多模态信号对准确的跨模态推理是必要的,但并不充分。我们表明,智能体间(Agent-to-Agent, A2A)网络中的模态原生路由相比文本瓶颈基线可将任务准确率提升20个百分点,但前提是下游推理智能体能够利用原生路由所保留的更丰富上下文。一项将基于LLM的推理替换为关键词匹配的消融实验完全消除了准确率差距(36% vs. 36%),由此确立一个双层要求:协议级路由必须与具备能力的智能体级推理相配合,收益才能实现。我们提出MMA2A,一个构建于A2A之上的架构层,它检查Agent Card能力声明,以原生模态路由语音、图像和文本部件。在CrossModal-CS——一个LLM后端相同、任务相同、仅路由路径不同的50任务受控基准——上,MMA2A达到52%的任务完成准确率,而文本瓶颈基线为32%($\Delta$TCA的95% bootstrap置信区间:[8, 32]个百分点;McNemar精确检验$p = 0.006$)。收益集中在依赖视觉的任务上:产品缺陷报告提升+38.5个百分点,视觉故障排查提升+16.7个百分点。这一准确率收益以原生多模态处理带来的$1.8\times$延迟代价为交换。这些结果表明,路由是多智能体系统中的一阶设计变量,因为它决定了下游推理可获得的信息。