论文
IAPO:小型多模式代理工具使用的输入归因感知策略优化
IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents
摘要
本文研究了用于提高多模式小语言模型(SLM)代理的工具调用能力的强化学习(RL)方法。虽然现有的工作已经探索了各种奖励设计来提高代理工具调用能力,但这些方法面临着 SLM 训练的固有局限性,特别是在多模式场景下。首先,许多现有方法通过与某些 真值 或预定义格式的精确匹配来评估工具使用的正确性。然而,这种假设通常不适用于多模式任务,其中多个工具使用路径可能有效,并且带注释的工具轨迹通常不可用。其次,这种稀疏且脆弱的二元奖励对于如何改进底层决策过程几乎没有提供指导,这使得多模式 SLM 特别难以学习。为了解决这些问题,我们提出了输入归因感知策略优化 (IAPO),这是一种 RL 算法,用于通过将输入组件之间的模型归因与更强大的教师的归因相结合来改进多模式 SLM 中的工具使用。 Qwen2.5-VL-3B 上的实验表明,与现有的视觉工具使用工作相比,该方法通过帮助模型关注最相关的输入证据,在六个测试集中将视觉问答准确率平均提高了 3%。