论文
VaseMuseum:古希腊陶器数字智能博物馆
VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
摘要
视觉语言模型 (VLM) 通过将 3D 数字化与自然语言文物探索联系起来,使交互式数字博物馆变得越来越可行。然而,在古希腊陶器等文化遗产领域,可靠的 VLM 援助受到两个挑战的限制。首先,开放式解释需要将细粒度的 2D/3D 视觉证据扎根于专门的策展知识中,但检索过程可能会引入薄弱的来源和无法验证的参考。其次,当可用证据不完整、有噪音或不明确时,VLM 通常会产生自信但不受支持的答案,而不是经过校准的不确定性。为了应对这些挑战,我们提出了 VaseMuseum,这是一个用于古希腊陶器智能数字博物馆的轻量级模块化多模式代理框架。 VaseMuseum 将交互式虚拟博物馆与 VaseAgent 相结合,通过多模态感知、3D 感知推理、外部知识检索和推理时间可靠性控制来支持 2D 图像和 3D 文物。具体来说,VaseAgent从权威网络和博物馆知识源检索证据,源级控制在生成之前选择多样化且可验证的证据。与此同时,响应级别的控制检查产生了针对证据池的主张,并在支持不足或相互冲突时鼓励中立、有证据限制的答案。此外,无需训练 GRPO 风格的选择机制有利于具有有效参考和校准置信度的响应,而无需更新 VLM 主干。真实数字博物馆模拟中的实验表明,与支持搜索的 VLM 基线相比,VaseMuseum 提高了引文有效性,减少了知识密集型查询的幻觉,并在模糊情况下生成更中立的答案。