论文

多媒体事件提取中的评估陷阱和挑战

Evaluation Pitfalls and Challenges in Multimedia Event Extraction

模型评测评测方法与指标

摘要

多媒体事件提取旨在跨多种模式(例如文本和图像)共同识别事件及其论点,以支持更全面的事件理解。虽然最近的工作报告了稳定和实质性的进展,但这些结果的可靠性和可比性关键取决于一致和严格的评估。在这项工作中,我们首次系统分析了多媒体事件提取中的评估陷阱,并确定了问题的三个主要来源:不一致的数据处理、不一致的任务假设和过于宽松的评估设置。我们通过严格评估框架下的一系列受控实验证明,较小的评估选择可能会导致较大的性能变化,并导致高估模型跨模式支持现实世界事件的能力。我们的研究结果强调了对可比评估标准的需求,并鼓励在多媒体事件提取中转向更严格的评估。