论文
Visual Para-Thinker++:用于视觉推理的单策略多代理框架
Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning
摘要
视觉推理需要整合分布在区域、属性和关系上的证据,使得单链推理容易出现早期感知承诺和幻觉。我们提出了 Visual Para-Thinker++,这是一种单策略多代理框架,其中一个共享 MLLM 策略被实例化为角色条件的主代理、工作代理和摘要代理。主代理以固定的分配模式分解任务; Worker Agent 在上下文隔离下并行推理;摘要代理协调完整的工人推理轨迹,而不是对最终标签进行多数投票。共享策略通过多代理能力注入和角色解耦多代理优化进行训练,将特定于角色的奖励和优势分配给相应的词元段,以减少协作角色之间的梯度冲突。本机推理引擎通过共享视觉前缀和 KV 缓存重用实现高效的多智能体轨迹采样。在 V*、CountBench、RefCOCO 系列和 HallusionBench 中,Visual Para-Thinker++ 始终优于单轨迹和推理时间并行基线,尤其是在幻觉敏感的视觉推理方面取得了显着的进步。