论文

FusionAgent:具有用于人类识别的动态模型选择的多模式代理

FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

智能体系统Agent 工具调用

摘要

模型融合是无约束场景下鲁棒识别的关键策略,因为不同的模型可以提供互补的优势。这对于全身人体识别尤其重要,其中面部、步态和体形等生物识别线索因样本而异,通常通过分数融合进行整合。然而,现有的评分融合策略通常是静态的,无论样本质量或模态可靠性如何,都会为每个测试样本调用所有模型。为了克服这些限制,我们提出了 \textbf{FusionAgent},这是一种新颖的代理框架,它利用多模态 大语言模型 (MLLM) 来执行动态的、特定于样本的模型选择。每个专家模型都被视为一个工具,通过具有基于度量的奖励的强化 微调 (RFT),代理学习自适应地确定每个测试输入的最佳模型组合。为了解决模型得分不一致和嵌入异质性的问题,我们引入了基于锚定的置信度 Top-k (ACT) 得分融合,它锚定在最置信的模型上,并以置信感知的方式集成互补预测。对多个全身生物识别基准的大量实验表明,FusionAgent 的性能显着优于 SoTA 方法,同时通过更少的模型调用实现更高的效率,强调了动态、可解释且稳健的模型融合在现实世界识别系统中的关键作用。项目页面:\href{https://fusionagent.github.io/}{FusionAgent}。