论文
CoExVQA:通过证据定位与解释链实现可核验文档视觉问答
Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions
摘要
文档视觉问答 (DocVQA) 需要视觉语言模型不仅能够推断出文档中的哪些信息与问题相关,还能推断出答案在页面上的位置。现有的 DocVQA 模型纠缠了与问题相关的证据和答案定位,并且很大程度上作为黑匣子运行,提供了有限的方法来验证预测如何依赖于视觉证据。我们提出了 CoExVQA,这是一个可自我解释的 DocVQA 框架,通过解释链设计提供有根据的推理过程。 CoExVQA 首先识别与问题相关的证据,然后显式定位答案区域,最后仅从已定位的证据区域解码答案。通过 CoExVQA 的解释链进行预测可以直接检查和验证跨模式的推理过程。经验结果表明,将解码限制为有根据的证据可以在 PFL-DocVQA 上实现 SotA 可解释的 DocVQA 性能,将 ANLS 比当前可解释的基线提高 12%,同时提供透明且可验证的预测。