论文

超越精确匹配:用于跨域 PCBA 视觉问答的任务感知 GRPO

Beyond Exact Match: Task-Aware GRPO for Cross-Domain PCBA Visual Question Answering

模型训练强化学习

摘要

在自动化印刷电路板组装 (PCBA) 检测中,标准引导的决策要求系统对细粒度的视觉线索、组件语义和制造知识进行联合推理。尽管大型视觉语言模型(VLM)提供了一个有希望的基础,但它们的部署受到标准衍生样本和现实世界生产线图像之间的领域转移以及跨越基于选择和数值计数任务的异构输出空间的阻碍。为了应对这些挑战,我们提出了一种用于跨域 PCBA 视觉问答的多模态推理框架。该框架将标准派生的、真实世界的和辅助 PCB 域数据转换为统一的指令格式,并构建与视觉证据、问题语义、候选选项和真实答案相一致的经过验证的推理轨迹。我们进一步引入任务感知组相对策略优化(GRPO),它通过集成基于选择的问题的多组件语义奖励、计数问题的距离感知奖励以及有效输出的辅助格式奖励,超越了精确匹配监督。在推理过程中,结合答案选项语义一致性校正、自一致性投票和多模型仲裁来提高预测的鲁棒性。所提出的系统在官方 PCBA Standard-to-Real Grand Challenge 排行榜上获得了 83.24 的总分,证明了任务感知奖励设计和跨域 PCBA 视觉问答的稳健推理的有效性。