论文

为何把疑虑留给自己?多智能体老虎机系统中的视觉不确定性交易

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems

智能体系统Agent 协作

摘要

视觉语言模型(VLM)支撑强大的多智能体系统,但其扩展在经济上不可持续:在信息不对称下协调异构智能体常使成本螺旋上升。现有范式(如Mixture-of-Agents和基于知识的路由器)依赖忽略成本并压缩不确定性结构的启发式代理,导致可证明的次优协调。我们提出Agora,一个将协调重构为不确定性去中心化市场的框架。Agora将认知不确定性形式化为结构化、可交易的资产(感知、语义、推理),并基于理性经济规则在智能体之间执行利润驱动的交易。一个扩展自Thompson Sampling的市场感知经纪人发起协作,并引导系统走向成本高效的均衡。在五个多模态基准(MMMU、MMBench、MathVision、InfoVQA、CC-OCR)上的实验显示,Agora优于强大的VLM和启发式多智能体策略,例如在MMMU上较最佳基线准确率提升8.5%,同时成本降低超过3倍。这些结果确立了基于市场的协调是构建经济上可行的多智能体视觉智能系统的原则性、可扩展范式。

为何把疑虑留给自己?多智能体老虎机系统中的视觉不确定性交易
图1:启发式协调与 Agora 的对比。与依赖有缺陷代理指标的启发式方法不同,Agora 为不确定性形成一个动态市场,其中涌现的价格使协调得以实现。