论文

FAU 参加 ImageCLEF 2026 多模态推理鲁棒候选评分和简洁多语言视觉回答任务

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

模型推理解码与生成控制

摘要

我们展示了用于视觉多项选择问答 (Visual MCQ) 和视觉开放问答 (Visual OpenQA) 子任务的 ImageCLEF 2026 多模态推理系统。这项挑战需要对包含密集文本、图表、图表、表格、公式和单位的多语言教育和科学图像进行可靠推理,同时强制执行严格的答案格式。我们的主要发现是稳健的输出控制与模型选择同样重要。对于 Visual MCQ,我们用视觉语言模型 logits 的直接候选标签评分取代了脆弱的自由形式生成,然后通过分数融合和投票结合互补运行。对于 Visual OpenQA,我们使用图像增强、简洁的最终答案提示、确定性解码和有针对性的后处理来消除推理痕迹和格式化伪影。在没有特定任务的 模型训练 的情况下,我们的官方提交在 Visual MCQ 中以 0.7108 的准确率获得第三名,在 Visual OpenQA 中以 0.6488 COMET、0.1391 BLEU、0.2762 ROUGE L 和 0.2383 METEOR 获得第一名。结果凸显了推理工程的实用价值:仔细的评分、集成、提示和清理可以将强大的 VLM 转变为可靠的竞赛系统。